b3.1概念⏱ 约 8 分钟
训练你的智能体:后训练 SFT→RL 概览
把"变强"刻进模型参数里——以及为什么 99% 的人其实用不到
🔎 最后验证 2026-06📚 来源:
为什么学这个
前面让小雅变强,我们从没碰过模型本身——靠提示、工具、记忆、自进化。这些性价比最高,绝大多数项目够用了。
但还有一条最彻底的路:直接训练模型,把能力刻进它的参数里。 这一节(硬核选修)讲清"后训练"到底在做什么、SFT 和 RL 的区别——以及一个关键判断:你到底需不需要它。(剧透:多数应用开发者用不到,但懂它能让你不被忽悠。)
大模型的一生:预训练 → 后训练
📚预训练
海量文本,学到通用语言能力

都看到这了,打个赏呗!
接下来 · b4.1
完整项目:手把手做「资料管家」
继续读下一节 →