p1.6动手⏱ 约 15 分钟
数据质量流水线
八项检查、三档结论,以及用脏数据验证每一道守卫
🔎 最后验证 2026-07📚 来源:八项检查与六种故障注入于 2026-07-31 在 ECS 实测(沪深300 2015-01-05~2026-07-29,2811 行),输出见 code/outputs/stdout.txt🧰 pandas 3.0.5、baostock、Python 3.12.13
为什么学这个
到这一节为止,我们已经数出了一堆坑:yfinance 少给 16 年、除权日的假跌幅、停牌占位、bdate_range 造出 209 个假交易日、append 重跑多出 7960 行。
现在的问题是:你不可能每次取数都记得检查这七八件事。
所以这一节把它们全部变成代码:八项检查、三档结论,数据进库之前先过体检,不合格的批次直接拒收。
以及,承接 p0.3 那条纪律——我会故意造六种脏数据,验证每一道守卫真的会响。一套从没抓到过东西的体检,和没有体检是一回事。
💡 打个比方
食品厂的金属探测器,每天开工前都要拿一块标准测试片过一遍机器,确认它会报警。
不是因为怀疑机器坏了,而是因为一台不会报警的探测器,和没有探测器,在流水线上是完全一样的——区别只在于前者让你更放心。
一、八项检查
| # | 检查 | 抓什么 | 来自哪一节 |
|---|---|---|---|
| C1 | 主键唯一 | 重复日期(append 重跑的后果) | p1.5 |
| C2 | 覆盖区间与行数 | 起点晚于要求、行数不足 |

都看到这了,打个赏呗!
接下来 · p1.7
PIT 数据与财报时点
继续读下一节 →