数据字典

口径 · 范围 · 以及我们没有的数据
这一页不讲我们数据有多全,讲的是口径对不对、边界在哪。 量化里绝大多数「回测很好、实盘不行」,根子不在算法,在于人算错了复权、用错了标的池、 或者拿了当时根本拿不到的数据。所以我们把这些先说清楚——包括我们没有的部分

价格与复权口径

01
默认 qfq · 读时复权
默认口径
前复权 qfq(研究与回测标准)。另支持 hfq 后复权与 raw 裸价。
复权方式
库里存裸价复权因子两列,读取时现算,不存复权后的价。
成交量 / 成交额
一律不复权。成交量单位为股,成交额单位为元。
股票代码
裸六位数字,不带交易所后缀(如 600519,非 600519.SH)。
前复权 qfq = 裸价 × adj_factor ÷ 该股最新一日的 adj_factor
后复权 hfq = 裸价 × adj_factor

由定义可知:最新一日的 qfq 恰好等于裸价,越往前推 qfq 越低于当时的裸价。 实测样例:000001 在 2010-01-04 的裸价为 23.71,前复权后为 6.326。

为什么强调「读时复权」。如果把复权后的价格直接存库,那么每次除权除息, 历史每一根 K 线都要重算一遍;只要有一次没重算干净,回测就会在分红日凭空多出一段收益。 存裸价 + 因子、读时现算,从结构上避免这个问题。

回测标的池

02
固定 30 只 · 非全 A
网站与客户端上的回测,跑的是固定 30 只蓝筹,不是全 A。 这是目前最需要你知道的一条边界。下面这 30 个代码是写死在引擎里的常量, 不随时间变化,也不是任何指数在历史各时点的真实成分股
池子构成
固定 30 只大市值蓝筹,全程不变(不做成分调整)。
幸存者偏差
存在,且已知。这 30 只是以今天的眼光挑出来的大公司; 它们能活到今天本身就是一种筛选。用它们回测,天然偏乐观。
能说明什么
适合做策略之间的相对比较——同一个池子、同一段时间,A 策略是否稳定优于 B。
不能说明什么
不能当作实盘部署的证据,也不能把这里的收益率外推到全市场。
600519000858600036601318600276 600900000333600030601012600887 000651600585601888002415600031 000001601166600104000002601398 600028002594300750000725601668 600050002304600048601628600009

数据范围与规模

03
数字均为一次性全量核验结果

下表是数据仓最近一次全量核验的结果,核验时间 2026-06-23。 日线每交易日夜间追加,因此当前实际覆盖日期会晚于表中末日; 我们不在这里写「实时」字样,因为这一页的数字不是活的。

项目数值(截至 2026-06-23 核验)说明
股票代码数5,786A 股,含已退市代码
日线行数13,991,014单表 daily_price
起始日2010-01-04更早的数据不提供
核验时末日2026-06-05此后每交易日夜间追加
频率日线无分钟线、无 tick
已知瑕疵,一并公开。同一次核验里,质量闸在 1,399 万行中标出约 1,300 行可疑: 2 行 OHLC 自身不自洽、127 行成交额与收盘价严重不匹配(疑单位或坏行)、 1,292 行前复权日收益超过 50%(绝大多数是长期停牌复牌后的跳空,少量是复权断层)。 换算下来约 99.99% 干净。我们选择把这个数写出来,而不是说「数据已清洗完毕」。

我们没有的数据

04
点名,不含糊

下面这些,策略端现在拿不到。如果某个策略思路依赖它们,那个思路在本平台上做不出来—— 与其让你写完才发现,不如现在就说:

  • 财务与基本面数据——point-in-time 财务表目前是空的,策略端取不到任何财报字段。
  • 行业分类——库内有表但未开放给策略端,做不了行业中性化、行业轮动。
  • 指数日线——暂不开放给策略端;回测里的基准用的是标的池等权组合,不是指数。
  • 指数成分股(时点)——仅有沪深300与中证500,且停留在 2024 年, 不足以支撑「按当时真实成分股选股」的回测。
  • 分钟线与 tick——完全没有。日内策略、高频策略在本平台无法回测。
  • 舆情、资金流、另类数据——没有。
这份清单本身就是一条研究结论。我们在免费数据上把十几套策略逐一验证过, 调参带来的增益在样本外基本消失。数据面窄是真实约束, 不是「以后补上就好」的待办——所以我们卖的是把过拟合挡在门外的方法, 不是「用我们的数据你能挖到 alpha」。