← 返回目录
p7.6动手⏱ 约 15 分钟

AI 辅助研究的红线:研究参考 ≠ 交易信号

把"可回溯"做成体检:扫本课 65 份结论文档,证据块 100%、claim 含数字 89.2%——而第一版工具误报了 96%

🔎 最后验证 2026-07📚 来源:对本课 65 份结论文档的可回溯性体检,2026-08-01 实测,输出见 code/outputs/stdout.txt🧰 Python 3.12.13(纯静态扫描,不联网)
为什么学这个

AI 能极大加速研究,也能极大加速产出看起来很像结论的东西

区别只有一条:每个结论能不能追回到一段可重跑的代码和一份原始输出。

把这条要求做成体检,扫本课自己的 65 份结论文档:

① 有证据块(Sources)              65 / 65    100.0%
② 每条 claim 都含具体数字          58 / 65     89.2%
③ 每条 source 指向代码/输出        56 / 65     86.2%
④ 每条 claim 都有 verified 日期    65 / 65    100.0%
⑤ 正文百分数被证据块覆盖         420 / 821    51.2%

而第一版工具给第 ③ 项打的分是 3.7%——96% 是误报。

原因是它把 source: "同上实测" 当成了"没指向代码"。这正是 p7.5 那条规矩的又一次应用:修工具,不是改数据。

💡 打个比方

论文的参考文献不保证结论正确。

但一篇没有参考文献的论文,连被同行评议的资格都没有。

可回溯性就是这个门槛:它不证明你对,它证明你可被检验。

一、把"可回溯"做成五项体检

检查什么为什么
有没有证据块没有证据的结论是意见
每条 claim 里有没有具体数字没有数字的"结论"通常是意见
source 是否指向可重跑的代码与落盘输出否则无法复现
有没有 verified 日期数据会变,结论有保质期
正文里的百分数有没有被证据块覆盖防止正文出现"没人举证过"的数
⚠️ 避坑

第 ⑤ 项不该追求 100%,而第一版的第 ③ 项是纯误报。

  • 第 ③ 项:source: "同上实测" 是对上一条的合法引用。第一版没处理,通过率被压到 3.7%。修工具之后是 86.2%
  • 第 ⑤ 项:51.2% 的覆盖率里,未覆盖的大多是跨节引用(本节引用 p6.2 的 1.43 pp)。跨节引用本来就不该在本节重复举证

两件事合起来说明同一个道理:体检工具本身也需要被体检。

一个报出 96% 误报的工具,会让人直接不看它——这与 p7.5 那个"天天报 73 条红的 linter"是同一个失败模式。

二、它查的是形式,不是真伪

形式齐备不代表结论正确;但形式不齐备,结论连被检验的资格都没有。

它能挡住的是最常见的一类问题:说了一个数,但没人能重跑它。

它挡不住的:数字算对了但口径错了(P6 整章)、实验设计错了(p7.4 第一版)、样本选偏了(p6.3)。

🔧 动手做:给这门课自己做一次"可回溯体检"(5 分钟)

python traceability_audit.py,让它扫本课自己的全部结论文档,检查每个结论能不能追回到可重跑的代码和原始输出。

你会看到(实测):65 份结论文档,证据块 65/65(100%)、每条 claim 含具体数字 58/65(89.2%)、source 指向代码或输出 56/65(86.2%)。而这个工具的第一版,因为没处理"同上实测"这类合法引用,把第三项误报成了 3.7%(96% 是误报)

想明白:AI 能极大加速研究,也能极大加速产出看起来很像结论的东西。区别只有一条:每个结论能不能追回到一段可重跑的代码和一份原始输出。把这条要求做成体检,就能机械地挡住"说了一个数、但没人能重跑它"。而体检工具本身也需要被体检——形式齐备不代表结论正确,但形式不齐备,结论连被检验的资格都没有。

三、AI 辅助研究的四条红线

红线一:研究参考 ≠ 交易信号

这是本章最重要的一条,也是最容易被跨过的一条。

AI 可以做AI 不可以做
把公告抽成字段(p7.2)告诉你买什么
解释一段回测结果为什么长这样替你做仓位决定
帮你写校验代码、审查口径生成"预测"
指出你可能漏掉的检验替代 p5.5 的滚动前推

分界线很清楚:AI 的输出是"待验证的输入",不是"可执行的结论"。

p7.3 已经用数据说明:日频涨跌预测的 AUC 约 0.5

一个连专门训练的模型都做不到的事,通用语言模型不会做得更好——它只是表述得更自信

红线二:不接受没有原始输出的数字

任何数字,必须能追到一份 stdout / csv / 图,而且那份输出必须能被重跑出来。

这条在 AI 协作下尤其重要:模型很擅长把一个数字写得像是算出来的。

本课的做法(可以直接抄):

每节 code/ 目录       ← 可重跑的脚本
每节 code/outputs/    ← 原始输出(stdout.txt / png / csv)
每节 <Sources>        ← claim → source → verified 三元组

红线三:私有状态不进提示词

承接 p7.1 第 ⑧ 条:

公开文本可以送出去(公告、研报、新闻);持仓、规格书、参数、实盘记录不行。

红线四:模型输出必须落盘存证

记录模型名、版本、温度、提示词哈希、原始返回

理由在 p5.9 已经实测过:同一条 yfinance 请求两次返回不同,就足以让 ERC 期末倍数在 3.38~3.95 之间漂。

而 LLM 的输出天然比数据源更不稳定。

四、幻觉防护:三层,从便宜到贵

做法成本出处
强制原文引用 + 字符串包含检查p7.2(实测拦下 3/3 幻觉)
Schema / 数值 / 交叉一致性校验p7.2
人工抽检 + 错误回灌成规则p7.2 / p4.10

先用便宜的。"用 LLM 检查 LLM"既贵又不可靠(p7.2)。

五、一句话总结 P7

AI 在量化里的位置,是把文字变成表格、把审查变成代码、把重复劳动变成流水线。

它不负责告诉你买什么,也不负责替你相信一个结论。

❓ 测验
你的可回溯性体检工具报告「大量文档的 source 未指向代码」,排查发现其中大部分是「同上实测」这种对上一条的合法引用。最该做什么?
✏️ 填空
AI 的输出是「待验证的 ___」,不是「可执行的结论」。

📌 免责:本课为技术教学,AI 辅助研究的产出一律视为待验证材料,不构成交易信号或投资建议

✅ 小结

P7 章完结。这一节四件事:

  1. 把"可回溯"做成五项体检,扫本课 65 份结论文档:证据块 100%、claim 含数字 89.2%、source 指向代码 86.2%、verified 日期 100%、正文百分数覆盖 51.2%(跨节引用不该重复举证,这一项不追求 100%)
  2. 第一版工具给第 ③ 项打 3.7% 分,96% 是误报——它把 source: "同上实测" 当成了没指向代码。修工具,不是改数据;这与 p7.5 那个"天天报 73 条红的 linter"是同一个失败模式。体检工具本身也需要被体检
  3. 四条红线:①研究参考 ≠ 交易信号 ②不接受没有原始输出的数字 ③私有状态不进提示词(p7.1 第⑧条) ④模型输出必须落盘存证(模型名/版本/温度/提示词哈希/原始返回)
  4. 幻觉防护三层,先用便宜的:强制原文引用 + 字符串检查(零成本,实测拦下 3/3)→ Schema 与数值校验 → 人工抽检并回灌成规则

P7 六节回顾:模型选型 → 结构化抽取 → ML 预测涨跌 → 时序 CV 与泄漏 → 结对开发工作流 → 研究红线。

一条贯穿的线索:这一章没有一节是在讲"怎么让 AI 更聪明",全都在讲"怎么让 AI 的产出可被检验"。

下一章 P8 把前面所有东西装进一个系统:事件驱动架构 → FastAPI 服务 → 模拟撮合引擎 → 纸上交易闭环。而它有一条明确的边界——教到模拟撮合与纸上交易为止,不接真实券商下单通道

下一节 → P8 量化系统工程化
🔎 来源与核验· 2 条,点开核对
本节每个关键论断都对应一个可追溯的来源 —— 这是本课程"靠谱、不过时"的底线。
「可回溯性体检(本课 65 份结论文档):有证据块 65/65(100.0%)、每条 claim 含具体数字 58/65(89.2%)、每条 source 指向代码或输出 56/65(86.2%)、每条 claim 有 verified 日期 65/65(100.0%)、正文百分数被证据块覆盖 420/821(51.2%)」
📚 本节 code/traceability_audit.py,2026-08-01 实测(纯静态扫描),输出见 code/outputs/stdout.txt✓ 已核验 2026-07
「第一版工具未处理「同上实测」这类对上一条 source 的合法引用,导致第 ③ 项通过率被误报为 3.7%(真实 86.2%),误报率约 96%」
📚 本节 code/traceability_audit.py(第一版误报 3.7% 的原因——未处理「同上实测」与未剥代码块——原样保留在代码注释 L32 与 L39-40 中)✓ 已核验 2026-07
体检查的是形式而非真伪:形式齐备不代表结论正确,但形式不齐备则结论无法被检验。第 ⑤ 项的未覆盖部分多为跨节引用,不应追求 100%。
智图软件的赞赏码
都看到这了,打个赏呗!
接下来 · p8.1
事件驱动架构:Gateway / Event / Adapter 三层
继续读下一节 →