← 返回目录
g5.1方法⏱ 约 6 分钟

模型怎么选:把 g0.3 的评测变成决策表

什么活配什么"大脑"——一张表用到毕业

🔎 最后验证 2026-08📚 来源:agency-orchestrator EVAL_FINDINGS.md(官方评测)、g0.3 数据的决策化落地🧰 Agency Orchestrator 桌面端
为什么学这个

g0.3 你看过那张诚实的评测表:弱模型组队更差、DeepSeek 档真香、强模型打平。当时它是"冷水";学到现在,你手里有流水线、有团队、有自建角色——是时候把那盆冷水酿成一张决策表了:什么活,配什么大脑,花多少钱。

G5 这一章解决"供应商面板里那排卡片到底怎么选"的全部问题,这一节先立总纲。

💡 打个比方

给团队配大脑像给车队配司机:送文件的短途(简单任务)不必请赛车手;跑长途货运(多步流水线)要请稳定的老司机(中档模型);真正的赛道日(顶尖难题)才上顶配。按活配人,才是车队老板;全上顶配,那是烧钱

总纲:一张决策表

你的活配什么为什么(g0.3 的数据)
多步流水线(一人公司/组队)DeepSeek 档(默认)甜区实证:3 胜 1 负,分工真提质
单兵简单活(改写/翻译/小结)DeepSeek 档,或你已有的任何会员单步任务,档位差距不明显,顺手为先
已有 Claude/GPT 顶配会员单兵直接用;组队也行但别期待分数飞跃强模型单次已近上限,组队价值在流程可复现
只有本地小模型⚠️ 只跑单兵,别组队弱模型组队 1 胜 3 负且三连败——交接放大误差
要过夜跑批量(G6 会讲)DeepSeek 档便宜且稳,批量成本可控

背不下来就记两句话:组队认准 DeepSeek 档;顶配留给单兵攻坚。

钱的账,顺手算清

用这几章的真实运行算给你看(DeepSeek 官方牌价按"输入低至几毛/百万 token"的量级,以官方页面为准):

运行token 量DeepSeek 档花费量级
单兵派活(g1.2 写笔记)约 1.7 万几分钱
五步流水线(g3.2 做产品)约 2.8 万一毛上下
六步投研(g3.4)约 3.3 万一毛多

结论:一人公司开一个月,全勤跑,花费大概率不到一杯奶茶——"成本"在这套玩法里,基本可以从担心清单上划掉;真正的成本是你读产出、做决策的时间。

换模型在哪换

「供应商」面板(g0.5 配过)随时可切:换一张卡片,下次运行就用新大脑。两个实用姿势:

  • 日常锁定一个默认(建议 DeepSeek 档),别来回换——同一大脑下,你才能积累"它大概什么水平"的手感;
  • 对重要产出做一次 A/B:同一条流水线、同一输入,换两个模型各跑一遍,对比产出(g1.2 学过的"同任务双跑",这次变量是模型)。

🔧 动手做:给你的三类活配好大脑(6 分钟)

  1. 写下你现在最常跑的三类活(比如:每周内容流水线 / 偶尔的单兵改稿 / 某条自定义流水线)。
  2. 逐条对照决策表配档位,并在「供应商」面板确认对应卡片可用。
  3. 挑你最重要的那类活做一次 A/B(盲选你更喜欢哪份,别先看署名):配了两家以上供应商的,同输入换模型各跑一遍;只配了 DeepSeek 一家的,做"单兵 vs 流水线"对比——同一个任务,直接问单个专家一遍、跑流水线一遍,亲手复现 g0.3 的结论,同样是合格的 A/B。
  4. 把结论写进你的提示词库笔记(g4.5):"XX 活,用 XX 档,因为____"。

做到这里你应该有:三类活各自的"御用大脑"清单,其中至少一条经过你自己的 A/B 验证——不是听课听来的,是你测出来的。

为什么:模型选择是这套玩法里少数"选错真的会变差" 的决定(g0.3 的弱模型教训)。一张决策表+一次亲手 A/B,让你以后换模型、见到新模型,都有自己的判断框架,而不是跟着热搜跑。

❓ 测验
朋友只有一台跑本地小模型的旧电脑,想跑「一人公司·做产品」流水线,你的建议是?
⚠️ 避坑警惕「新模型发布」引发的换脑冲动

每隔几周就有新模型刷屏"吊打一切"。冷静三问:它在我的活上测过吗?我的流水线换它跑过 A/B 吗?便宜还是贵了?——没做过 A/B 就全线切换,和听股评换仓没区别。你已经有 A/B 的手艺了,让数据替热搜做决定。

🤖 模型 A/B 的记录模板(存进你的笔记)
活:【哪类任务】|A 模型:【名字】产出感受:【一句话】|B 模型:【名字】产出感受:【一句话】|盲选胜者:【A/B】|决定:这类活以后用【】。日期:【】
✅ 小结

决策表一句话:组队认准 DeepSeek 档,顶配留给单兵攻坚,本地小模型别组队;一个月全勤不到一杯奶茶;重要的活自己 A/B。

下一节把"不花新钱"这条路走满:免 key 七条路逐一过——你已有的会员、免费额度,都能当团队的大脑。

下一节 → 免 key 七条路:不花新钱,把团队跑起来
🔎 来源与核验· 2 条,点开核对
本节每个关键论断都对应一个可追溯的来源 —— 这是本课程"靠谱、不过时"的底线。
「决策依据为官方评测:DeepSeek 档多智能体 3 胜 1 负,弱模型(8B 级)1 胜 3 负且败局三连,强模型≈打平」
📚 agency-orchestrator EVAL_FINDINGS.md✓ 已核验 2026-08
「文中 token 量为本课实测运行数据(g1.2 约 1.7 万/g3.2 约 2.8 万/g3.4 约 3.3 万);花费量级按 DeepSeek 官方牌价折算,具体以官方价格页当前为准」
📚 本地实测记录(2026-08)+ DeepSeek 开放平台价格页✓ 已核验 2026-08
智图软件的赞赏码
都看到这了,打个赏呗!
接下来 · g5.2
免 key 七条路:你已有的 AI,都能当团队的大脑
继续读下一节 →