原文核心观点

作者真剑圣将量化投研分为三个阶段:因子工程→数据与回测工程→Harness工程(当前阶段)。核心论点是:AI能力越强,越需要外部约束系统来保证其产出可用。

文章提出了Harness六层架构:指令层、上下文层、工具层、边界层、反馈层、治理层,并通过三个案例(因子挖掘、组合优化、多智能体系统)展示了Harness在量化场景中的应用。

分析评价

说得对的地方

1. “300篇论文挖出20个因子,18个有问题”——这是真实的。

AI挖因子的最大风险不是找不到,是找到一堆看起来有效但经不起推敲的东西。过拟合、数据泄露、regime依赖——这些老问题被AI的执行速度放大了十倍。传统研究员一周挖5个因子,其中3个可能有问题;AI一晚上挖20个,18个有问题。比例没变,但绝对数量爆炸了。

2. 反馈层的设计思路——用量化已有的指标体系。

用IC、ICIR、分层收益、换手率这些量化研究员已经用了十几年的指标作为AI的反馈信号,这个思路很务实。量化领域确实不需要为AI发明新评估体系,直接复用就行。这也是作者说的"量化可能是AI智能体能最快跑出效果的专业领域之一"的原因——基础设施现成。

3. 边界层 > 指令层——约束比方向更重要。

告诉AI不能做什么(不用未来数据、不做全样本参数筛选)比告诉它做什么更关键。AI找因子的效率很高,但找"假因子"的效率同样高。每一条红线,都是真金白银换来的教训。

值得商榷的地方

1. 文章低估了regime问题的严重性。

作者提到了regime,但把它当成了"上下文层"的一个输入。实际上,regime切换是量化AI最致命的盲区。AI在单一regime下跑出来的因子,换regime可能同时坍塌。这不是Harness能解决的,这是市场本质的非平稳性。

2024年2月的微盘股危机就是典型案例——大量基于低波动因子的策略在同一时间集体失效。如果AI在2023年底挖出一批"低波动异常"因子,Harness再完善也无法预见这种结构性崩塌。

2. “最小四件套"在实践中维护成本不低。

AGENTS.md、init_backtest.sh、factor_calendar.json、research_log.md——听起来很美,但真正难的是把这些文件维护得准确、及时。人连自己的交易日志都懒得写,指望AI维护research_log?更现实的做法是:先让AI自动生成日志,人定期review,逐步建立信任后再提高自动化程度。

3. 多智能体系统的"权限分离"在实践中信息损耗大。

因子挖掘、组合优化、风控三个AI协同——理论上很美好,但信息在传递过程中必然有损耗。因子AI发现的细微逻辑,组合AI不一定能理解,风控AI更不可能。目前来看,单智能体+强约束的方案比多智能体协同更可靠。

关于Harness争论的翻译

文章提到了Boris Cherny和Addy Osmani关于Harness是否会随模型能力增强而消失的争论。作者的结论是:在量化领域,Harness的核心价值不是消除"理解债”,而是把理解债从一个人的脑子里搬到结构化的系统里。

这个判断基本正确。但我想补充一点:Harness本身也会成为一种技术债。 当市场环境变化时,之前设的约束可能变成枷锁。比如,如果AI模型突然能很好地理解财务报表附注中的隐含信息,但你的Harness限制它只能用日频量价数据——这个约束就从"保护"变成了"束缚"。

结论

这是一篇框架清晰、思路务实的文章。六层架构的划分有参考价值,三个案例也有实操性。扣分点主要在于:对regime问题的讨论不够深入,部分建议偏理想化。

评分:7.5/10

核心价值不在于六层架构本身,而在于它传递的一个理念:AI时代的量化研究,竞争壁垒从"谁的因子更聪明"变成了"谁的系统设计更完善"。 因子会被AI快速复制,但一个经过长期迭代、积累了大量红线和反馈的Harness系统,是很难被复制的。

对量化实践的启示

  1. 给因子分析流程加"红线检查"模块 — 检查因子是否使用了未来数据、是否在全样本内筛选最优参数。这层防护成本低、收益高。

  2. 因子状态追踪 — 记录每个因子的生命周期:假设→开发→回测→验证→上线→衰减。结构化存储,而不是散落在各种Excel和笔记里。

  3. regime标记 — 每次分析时自动标记当前市场regime(高波/低波、趋势/震荡),后续回看时能快速判断结论的适用范围。

  4. Prompt告诉AI去哪儿,Harness保证AI在正确的轨道上跑完全程。 但轨道本身也会过时。市场在变,Harness也得跟着变。没有一劳永逸的系统,只有持续迭代的纪律。