ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AI挖出的因子,怎样才值得信任?PandaAI提出VST新框架

AI挖出的因子,怎样才值得信任?PandaAI提出VST新框架 各位宽客Quant朋友们大家好。大语言模型LLM与多智能体Multi-Agent正在拓展量化研究的边界。从生成因子到分析回测越来越多的工作可以由 Agent 协作完成。但让几个智能体自由对话、修改报错并不意味着已经建立了一套可靠的研究流程。未来数据泄露、反馈链路不清、评估标准受到污染都可能让漂亮的回测结果在样本外失去说服力。对于量化研究结果要经得起检验产生结果的过程同样需要有据可查。PandaAI 团队提出的可验证结构化传输框架 VSTVerifiable Structured Transport正是从多智能体的通信层入手引入结构化协议、推测性执行与事务回滚Rollback探索如何让 AI 因子研究具备更清晰的交互记录、更独立的评估机制和可验证的推进过程。下面我们从研究动机、核心方法、样本外表现和实践启发四个方面解读这项工作。 一句话导读给多智能体量化研究装上“可验证的通信总线”PandaAI VST 以结构化交互和提交回滚机制改造研究流程在中证1000实验中经开发数据筛选的 Top-20 组合取得样本外夏普中位数 0.71、费前年化收益中位数 13.3%。Title: VST: Verifiable Structured Transport for Auditable Agent-to-Agent Alpha DiscoveryAuthors: Yuqi Li、Siyuan Liu、Bingjun LiuPanda AISource: https://arxiv.org/abs/2609.07065v1研究主题多智能体通信、推测性执行、可审计因子发现核心亮点Key Takeaways重构多智能体通信通过带有身份、路由和事务记录的结构化数据包为智能体协作建立明确契约让研究轨迹可追溯、可回放。独立样本外检验围绕中证1000CSI 1000设置 TrainValidTestHoldout 数据区间以独立 Holdout 检验研究结果组合筛选不使用 Holdout 数据。展现样本外抗衰减能力在本次包含自身的八种方法对比中VST 系统是唯一在因子层面同时保持正年化收益中位数与正夏普中位数的方法。一、研究背景与痛点Motivation多智能体因子研究的一种典型架构是“双循环演化”因子挖掘侧提出候选公式评估优化侧探索指标与组合配置再通过报告反馈推动下一轮迭代。VST 在这一已有架构上进一步改造智能体之间的通信机制。这类研究流水线面临两个关键问题1. 非结构化通信难以形成完整的审计链路。Agent 之间用自然语言传递指导、结果和反馈如果缺少统一的状态与因果记录一旦因子表现发生变化就很难准确追查是哪一轮反馈、哪一次调整引入了问题。2. 评估器污染可能让系统迎合自己的评价标准。如果预测器与评估器共享信息和进化机制预测器可能逐渐影响评估者的判断使系统更擅长获得高分却未必产生更可靠的研究结果。为此VST 将智能体交互封装为带版本、路由及事务归属的结构化数据包并限制预测信息进入评估端为后续验证和追溯建立基础。二、核心数据与方法论Data MethodologyVST 将数据库事务Transaction的提交回滚思想引入多智能体研究并通过推测性执行尝试减少反复往返的反馈周期。底层回测范围 中证1000CSI 1000。核心架构 1VST 三层通信协议每次 Agent 交互都被封装为三层结构 信封层Envelope 记录消息身份、接收方、路由与因果关系。 负载层Body 承载因子公式、参数、指导或分析报告等业务内容。溯源层Provenance 标记事务归属以及消息处于推测还是已提交状态。 这使系统能够明确每条消息的来路、去向和状态为研究轨迹的回放与审计提供依据。Figure 1 · 三层通信协议与确定性路由核心架构 2四层验证门Four-Level Validation Gate系统根据已确认的交互轨迹预测未来几轮挖掘智能体可能收到的累积指导再进行推测性执行。执行结果必须通过四层验证L1数据包合法性 检查格式与契约是否符合要求。L2跨循环一致性 检查因子挖掘与评估优化两侧的状态是否一致。L3盲态评估风险 由不接收预测信息的评估器分析真实执行结果。L4开发集实证质量 检查结果是否满足实证质量要求。 四层全部通过才提交整个事务任何一层未通过就回滚到此前确认的状态。预测因此成为一次待验证的研究尝试系统仍以真实执行与检验结果决定是否前进。Figure 3 · 四层验证与提交回滚核心架构 3技能库解耦Skill Separation预测器与评估器使用分离的技能演化机制预测器从提交和回滚结果中学习评估器基于真实执行结果更新评价规则。 配合通信层的可见性约束这项设计旨在避免预测器“教会”评估器迎合自己的预测在持续进化中保持评估独立性。三、实证与回测结果Empirical Results论文将 VST 系统与 Alpha101、遗传规划GP、DSO、AlphaGen 等七种基线进行比较。因子层面对比采用统一回测口径按挖掘顺序累计有效因子共同预算上限为500个。1. Holdout因子层面保持正收益在这一比较口径下VST 系统在独立 Holdout 区间的表现为 年化收益中位数5.9%。 夏普比率中位数0.346。 其余七种基线的对应中位数均为负。VST 系统在本次实验中展现了更好的样本外抗衰减能力这是研究结果中值得关注的亮点。原表关键列 · Holdout 中位数方法夏普年化收益Alpha101−0.396−7.8%GP−0.693−14.4%DSO/DSR−1.648−28.7%AlphaGen−0.006−0.1%AlphaMCTS−0.056−1.5%AlphaAgent−0.021−0.5%Alpha-GPT*−0.159−3.1%OURS (M4)0.3465.9%Table 2 · 同预算 Holdout 比较原表2. 头部组合表现Portfolio-Level研究在开发数据上对组合排序选取 Top-20再观察它们在未参与筛选的 Holdout 区间中的表现 夏普比率中位数0.71年化收益中位数13.3%正收益组合占比80%。 这一结果展示了系统结合开发数据筛选、形成有效组合的潜力。上述数据来自论文单次运行收益均为费前口径。原表关键列 · Holdout 中位数组合夏普年化收益dev-top 50.266.6%dev-top 100.4810.8%dev-top 200.7113.3%all 852−0.23−4.8%Table 3 · 开发集筛选组合的 Holdout 表现原表3. IC 与 Sharpe 的非对称性一个值得注意的现象是VST 系统的 Holdout IC信息系数中位数为 0.028低于部分基线但夏普、年化收益和 IR信息比率在比较中表现更好。 这一观察提示评价因子的研究价值需要同时考虑预测相关性、样本外收益与风险调整后的表现。单一 IC 指标不能完整反映因子进入组合后的效果样本外表现的保留程度同样重要。四、深度点评对 A 股与实盘研究的启发Quant Insight 落地价值将研究流程治理纳入系统设计13.3%的费前年化收益提供了直观的成果展示VST 的研究流程治理Research Pipeline Governance思路则具有更广泛的借鉴意义。 通过提交回滚CommitRollback与因果追踪机制量化团队可以逐步追查一个因子为何被保留一次推测为何被拒绝哪些反馈进入了后续研究。这让自动化研究在不断产生结果的同时积累可供复盘和审计的过程记录。⚠️ 局限与实践判断1. 费前收益仍需接受交易摩擦检验。论文报告的是Gross收益尚未纳入交易成本、滑点与换手约束。对于中证1000这样的中小盘股票范围交易摩擦可能明显侵蚀收益。13.3%的费前年化收益还需要经过成本与换手检验才能判断实际可用程度。2. 正绝对收益不等于跑赢指数。虽然因子层面的年化收益中位数为正但其相对中证1000基准的年化超额收益Excess Return中位数仍为2.8%。本次实验显示了系统相对其他方法的优势尚不能据此判断它在 Holdout 区间跑赢了基准。3. 组合筛选仍是重要环节。Top-20 组合的样本外夏普中位数为 0.71全部852个组合的对应中位数则为0.23。两者的差别说明候选生成、筛选和组合构建需要共同发挥作用不能把精选结果理解为全部候选的平均水平。此次筛选所用开发区间仍处于系统优化范围内筛选流程的稳健性还需要进一步检验。在官网查看完整论文对于正在用大模型或多智能体构建因子研究流程的团队VST 提供了具体的架构参考让通信有契约让推测有验证让失败可回滚让评估保持独立。 欢迎阅读论文原文了解三层通信协议、四层验证机制与完整实验结果。 本文基于 PandaAI 团队论文及作者解读整理。实验数据为研究回测结果不代表实盘表现不构成投资建议。
返回列表