AI 辅助研究的红线:研究参考 ≠ 交易信号
把"可回溯"做成体检:扫本课 65 份结论文档,证据块 100%、claim 含数字 89.2%——而第一版工具误报了 96%
AI 能极大加速研究,也能极大加速产出看起来很像结论的东西。
区别只有一条:每个结论能不能追回到一段可重跑的代码和一份原始输出。
把这条要求做成体检,扫本课自己的 65 份结论文档:
① 有证据块(Sources) 65 / 65 100.0%
② 每条 claim 都含具体数字 58 / 65 89.2%
③ 每条 source 指向代码/输出 56 / 65 86.2%
④ 每条 claim 都有 verified 日期 65 / 65 100.0%
⑤ 正文百分数被证据块覆盖 420 / 821 51.2%
而第一版工具给第 ③ 项打的分是 3.7%——96% 是误报。
原因是它把 source: "同上实测" 当成了"没指向代码"。这正是 p7.5 那条规矩的又一次应用:修工具,不是改数据。
论文的参考文献不保证结论正确。
但一篇没有参考文献的论文,连被同行评议的资格都没有。
可回溯性就是这个门槛:它不证明你对,它证明你可被检验。
一、把"可回溯"做成五项体检
| 检查什么 | 为什么 | |
|---|---|---|
| ① | 有没有证据块 | 没有证据的结论是意见 |
| ② | 每条 claim 里有没有具体数字 | 没有数字的"结论"通常是意见 |
| ③ | source 是否指向可重跑的代码与落盘输出 | 否则无法复现 |
| ④ | 有没有 verified 日期 | 数据会变,结论有保质期 |
| ⑤ | 正文里的百分数有没有被证据块覆盖 | 防止正文出现"没人举证过"的数 |
第 ⑤ 项不该追求 100%,而第一版的第 ③ 项是纯误报。
- 第 ③ 项:
source: "同上实测"是对上一条的合法引用。第一版没处理,通过率被压到 3.7%。修工具之后是 86.2% - 第 ⑤ 项:51.2% 的覆盖率里,未覆盖的大多是跨节引用(本节引用 p6.2 的 1.43 pp)。跨节引用本来就不该在本节重复举证
两件事合起来说明同一个道理:体检工具本身也需要被体检。
一个报出 96% 误报的工具,会让人直接不看它——这与 p7.5 那个"天天报 73 条红的 linter"是同一个失败模式。
二、它查的是形式,不是真伪
形式齐备不代表结论正确;但形式不齐备,结论连被检验的资格都没有。
它能挡住的是最常见的一类问题:说了一个数,但没人能重跑它。
它挡不住的:数字算对了但口径错了(P6 整章)、实验设计错了(p7.4 第一版)、样本选偏了(p6.3)。
🔧 动手做:给这门课自己做一次"可回溯体检"(5 分钟)
跑 python traceability_audit.py,让它扫本课自己的全部结论文档,检查每个结论能不能追回到可重跑的代码和原始输出。
你会看到(实测):65 份结论文档,证据块 65/65(100%)、每条 claim 含具体数字 58/65(89.2%)、source 指向代码或输出 56/65(86.2%)。而这个工具的第一版,因为没处理"同上实测"这类合法引用,把第三项误报成了 3.7%(96% 是误报)。
想明白:AI 能极大加速研究,也能极大加速产出看起来很像结论的东西。区别只有一条:每个结论能不能追回到一段可重跑的代码和一份原始输出。把这条要求做成体检,就能机械地挡住"说了一个数、但没人能重跑它"。而体检工具本身也需要被体检——形式齐备不代表结论正确,但形式不齐备,结论连被检验的资格都没有。
三、AI 辅助研究的四条红线
红线一:研究参考 ≠ 交易信号
这是本章最重要的一条,也是最容易被跨过的一条。
| AI 可以做 | AI 不可以做 |
|---|---|
| 把公告抽成字段(p7.2) | 告诉你买什么 |
| 解释一段回测结果为什么长这样 | 替你做仓位决定 |
| 帮你写校验代码、审查口径 | 生成"预测" |
| 指出你可能漏掉的检验 | 替代 p5.5 的滚动前推 |
分界线很清楚:AI 的输出是"待验证的输入",不是"可执行的结论"。
p7.3 已经用数据说明:日频涨跌预测的 AUC 约 0.5。
一个连专门训练的模型都做不到的事,通用语言模型不会做得更好——它只是表述得更自信。
红线二:不接受没有原始输出的数字
任何数字,必须能追到一份 stdout / csv / 图,而且那份输出必须能被重跑出来。
这条在 AI 协作下尤其重要:模型很擅长把一个数字写得像是算出来的。
本课的做法(可以直接抄):
每节 code/ 目录 ← 可重跑的脚本
每节 code/outputs/ ← 原始输出(stdout.txt / png / csv)
每节 <Sources> ← claim → source → verified 三元组
红线三:私有状态不进提示词
承接 p7.1 第 ⑧ 条:
公开文本可以送出去(公告、研报、新闻);持仓、规格书、参数、实盘记录不行。
红线四:模型输出必须落盘存证
记录模型名、版本、温度、提示词哈希、原始返回。
理由在 p5.9 已经实测过:同一条 yfinance 请求两次返回不同,就足以让 ERC 期末倍数在 3.38~3.95 之间漂。
而 LLM 的输出天然比数据源更不稳定。
四、幻觉防护:三层,从便宜到贵
| 层 | 做法 | 成本 | 出处 |
|---|---|---|---|
| 一 | 强制原文引用 + 字符串包含检查 | 零 | p7.2(实测拦下 3/3 幻觉) |
| 二 | Schema / 数值 / 交叉一致性校验 | 低 | p7.2 |
| 三 | 人工抽检 + 错误回灌成规则 | 高 | p7.2 / p4.10 |
先用便宜的。"用 LLM 检查 LLM"既贵又不可靠(p7.2)。
五、一句话总结 P7
AI 在量化里的位置,是把文字变成表格、把审查变成代码、把重复劳动变成流水线。
它不负责告诉你买什么,也不负责替你相信一个结论。
📌 免责:本课为技术教学,AI 辅助研究的产出一律视为待验证材料,不构成交易信号或投资建议。
P7 章完结。这一节四件事:
- 把"可回溯"做成五项体检,扫本课 65 份结论文档:证据块 100%、claim 含数字 89.2%、source 指向代码 86.2%、verified 日期 100%、正文百分数覆盖 51.2%(跨节引用不该重复举证,这一项不追求 100%)
- 第一版工具给第 ③ 项打 3.7% 分,96% 是误报——它把
source: "同上实测"当成了没指向代码。修工具,不是改数据;这与 p7.5 那个"天天报 73 条红的 linter"是同一个失败模式。体检工具本身也需要被体检 - 四条红线:①研究参考 ≠ 交易信号 ②不接受没有原始输出的数字 ③私有状态不进提示词(p7.1 第⑧条) ④模型输出必须落盘存证(模型名/版本/温度/提示词哈希/原始返回)
- 幻觉防护三层,先用便宜的:强制原文引用 + 字符串检查(零成本,实测拦下 3/3)→ Schema 与数值校验 → 人工抽检并回灌成规则
P7 六节回顾:模型选型 → 结构化抽取 → ML 预测涨跌 → 时序 CV 与泄漏 → 结对开发工作流 → 研究红线。
一条贯穿的线索:这一章没有一节是在讲"怎么让 AI 更聪明",全都在讲"怎么让 AI 的产出可被检验"。
下一章 P8 把前面所有东西装进一个系统:事件驱动架构 → FastAPI 服务 → 模拟撮合引擎 → 纸上交易闭环。而它有一条明确的边界——教到模拟撮合与纸上交易为止,不接真实券商下单通道。
🔎 来源与核验· 2 条,点开核对
