论文研究 ·
研究评估测试时推理在LLM量化交易中的投入产出比
The Price of Thought: Does Test-Time Reasoning Pay in LLM Trading?
62进行中1 条arXiv cs.AI
AI 解读
AI 生成推荐理由帮助量化团队判断为LLM推理投入更高计算成本的实际价值。
研究显示LLM增加推理时长无法稳定提升股票交易的净投资回报
发生了什么
研究者针对DeepSeek、GPT、Gemini三大系列的代表性LLM开展对照实验,在严格固定信息输入、提示词、投资组合构建规则的前提下调整模型推理投入强度,测试覆盖全年美股市场,包含超80万次资产预测与多轮重复生成;结果显示所有模型都无法通过增加推理投入稳定提升扣除交易成本的投资组合净收益。
关键信息
- 测试覆盖模型
- DeepSeek、GPT、Gemini系列代表性LLM
- 测试范围
- 全年美股市场,覆盖三类输入条件
- 测试规模
- 超80万次资产预测、多轮模型重复生成
- 核心测试结论
- 增加推理投入无法稳定提升扣交易成本的组合净收益
- 特殊观测结果
- DeepSeek模型推理投入与交易表现呈非单调关系
背景
当前业界普遍认为LLM推理阶段的思考投入越高,模型决策质量越好,但过往评估多聚焦模型输出的准确率,很少结合实际交易成本核算真实经济收益,相关研究长期缺失。
为什么重要
对AI在金融领域的应用行业而言,该结论打破了"推理越强、收益越高"的固化认知,避免行业盲目为高推理成本买单;对开发者来说,部署LLM类金融应用前必须针对具体任务做成本收益校验;对普通投资者来说,后续这类AI工具的实际投资参考价值会经过更务实的验证。
后续看点
后续可关注不同垂直场景下LLM推理投入的实际价值验证,形成分场景的推理成本收益匹配标准。
由 AI 根据原文生成,可能有疏漏,以原文为准。