发表于 2026年3月10日
在 AGI 的三大支柱(语言智能、自然智能、社会智能)中,大语言模型(LLM)已经在语言智能上取得了显著的进展。然而,LLM 并非万能的通用解药。正如它无法直接让机器人学会后空翻、无法替代自动驾驶的物理世界模型(自然智能)一样,它也无法直接解决充满多主体动态博弈的社会问题(社会智能)。
金融市场是社会智能问题的一个典型代表,也正是这一局限性的清晰放大镜。
GPT-5 横扫了写作、编程、客服、设计——但它没有横扫金融。
按理说,金融市场每天产生的文本(新闻、研报、财报、社交情绪)已经足够喂饱任何一个大模型;在这个"语言能解决一切"的时代,最赚钱的金融决策却依然没有被通用大模型接管。
答案不在大模型不够强,而在它擅长的方向,和金融需要的方向,根本是两套不同的物理。用一个比喻把这件事框起来:
通用大模型(如 Claude/GPT)就像一个读遍了人类所有历史书的"顶级历史学家"和"股评家";金融市场则是一个每秒钟都在改变规则的"德州扑克多玩家牌桌"。历史学家上牌桌,是赢不了那些以此为生的职业牌手的。
你可能会立刻想到:那把 GPT 包上一层金融 Agent —— tool use、multi-agent 编排、Bloomberg 接口、外部记忆 —— 不就行了?这条路是对的,而且已经在发生。LLM + Agent 把金融的"知识工作"(研报摘要、新闻监控、客服问答、数据查询、文档处理)的成本拉到了趋零。
但金融真正难、真正赚钱、真正要承担风险的部分不在知识工作里。那部分是在博弈系统里做决策。以下四个维度,是为什么 LLM + Agent 也跨不过去这条边界:
很多人试图给大模型包上一层 Agent 外壳,让它扮演“虚拟巴菲特”,直接读取财报和新闻并输出买卖指令。这种试图用 GPT 直接读新闻炒股的做法,本质上就是机器人领域那条备受争议的 纯 VLA(视觉-语言-动作)路线——它们都是在做表面的“模式匹配”(看到利好就买),而没有真正理解背后的“系统动力学(Dynamics)”。
在金融这种随时发生反身性突变的绞肉机里,缺乏动力学理解的端到端(End-to-End)黑盒模式是极其危险的死局: 第一,复利容错率极低。大师的决策是复杂的综合反应,由于幻觉和非确定性,大模型最多只能复刻 80% 的直觉。在成千上万次博弈的复利函数下,80% 和 99.9% 的差异是毁灭性的。 第二,灾难性的不可归因。端到端 Agent 架构在出错时极难定位。一旦亏钱,你根本无法进行归因分析(Attribution)——你不知道它是哪句话读错了、还是对新闻过度反应了。一个无法通过白盒化剥离病灶(探针或因果)进行定点修复的系统,永远无法承载真实的重资产投资。
在物理世界里,苹果熟了就会掉下来,这个规律一万年不变,所以大模型能学得很好。写代码、写文章也是一样,代码和文字不会"反击"你,这叫"单机解题"。
但金融市场是一个极其残酷的"多人博弈"牌桌。你给 GPT 一篇刚出的『重磅行业扶持政策』或『某龙头公司并购重组』的新闻,它能像做阅读理解一样完美告诉你"这是大涨的利好"。但在真实的 A 股交易中,当所有散户都看到新闻准备买入时,资金可能早就提前潜伏了。开盘的那一刻,这个"利好"就变成了主力资金高开低走、砸盘套现的诱饵(也就是所谓的"利好出尽是利空")。
大模型是一个极度聪明的"单向思考者",它能完美理解最新的信息,却无法推演 "当这个信息发布后,牌桌上成千上万个带着不同筹码、不同心态的对手盘,会如何互相算计、踩踏,并最终形成价格" 的动态过程。
大模型本质上是一个超级“文字接龙”游戏,它是顶级的“文科生”。它知道“央行降准”或“印花税下调”这几个字后面,大概率跟着“A股大涨”,但它并不懂这背后的数学传导机制。
金融世界的核心不仅是文本(新闻、财报),更是海量、高频的时间序列数据(Time-series)、订单簿和复杂的数学定价模型。大模型擅长语义理解,但极度缺乏对高维连续数字的敏锐度。它算不出"降准50个基点对某只微盘股流动性溢价的非线性冲击",也算不出"龙头股跌停对整个产业链ETF的连锁反应"。
Tool use 让 LLM 变成的是"数字引擎的聊天前端",不是数字引擎本身。它一次能调一个工具拿一个数;但它不持续持有市场当下的数值状态(仓位拥挤度、风险溢价分布、跨资产相关性矩阵随每个 tick 在变)。"按需调用工具"和"住在数字市场里"是两件事。
让 GPT 写一首诗,如果有两句不押韵,你依然会觉得它是个天才。在内容创作领域,大模型基于概率生成的"幻觉"被称为"创造力"。
但在金融里,幻觉是另一种性质的错误:它不是判断错了一笔真实的交易,而是把一个根本不存在的事实当成事实来下注。 它会"记得"一次没发生过的并购、"引用"一份不存在的政策、"看到"两个资产之间根本没有的因果链——你看着信号操作,市场上根本没有这个信号背后的事实。杠杆一上,账户清零只是时间问题。
幻觉之所以无解,不仅因为它缺乏实时反馈,更因为大模型本身没有“先验知识的沉淀(记忆图谱)”以及“包含数十年历史的残酷沙盒(回测考场)”。没有经验记忆和回测考场约束的 AI,在金融博弈里永远是一个凭借本能胡乱挥舞大锤的巨婴。
通用模型最致命的盲点不是不够聪明,是它不活在金融世界里。
一次预训练动辄数千万美元、数月时间,权重一旦封装就是"过去某个时刻的世界图像"。但金融是博弈系统,规律每天都在被参与者的反应重写——权重冻结的工具,跟不上一个规律天天在变的世界。LLM 是为静态世界设计的,而金融需要的是为博弈世界设计的模型。
LLM 的盲区还有更深一层:价格发现是无数私有信息形成共识的动态平衡。大户的研判、机构的调仓时点、参与者的真实预期——这些私有状态永远不会出现在新闻和研报里,只在订单流里留下影子。
市场是私有信息唯一的解构点:当参与者基于秘密下单时,这个秘密的影子就被发布出来。智能本身不能取消私有性,但市场会把私有意图以可观测的影子形式部分披露。
LLM 处理的是公开语言——是私有状态已经过滤、加工后愿意公开的版本。它在这一层做到极致,也到不了影子那一层——而影子才是价格形成的本源。
这是 LLM 在金融上的天花板:不是聪明不够,是视野不在那一层。
既然单个大模型无法应对金融市场的复杂性,那么让多个大模型互相博弈呢?
近年来,基于 LLM 的多智能体社会仿真(如让多个 Agent 扮演不同角色进行投资辩论、模拟社交网络舆论演化)成为热门方向。然而,这种纯 LLM 的多智能体系统在金融领域存在致命盲区。
盲区一:达成的是“叙事共识”,而非“交易共识” 纯 LLM 多智能体系统(如某些开源群体智能预测引擎)本质上是在模拟“虚拟网友讨论市场”。它们通过语言交互,最终形成的是一种“叙事共识”(大家怎么说)。但在真实的金融市场中,决定价格的不是人们怎么说,而是人们怎么下单。真正的共识是“交易共识”——它必须通过订单簿的买卖盘压力、流动性消耗和真金白银的碰撞来验证。
盲区二:缺乏真实市场物理的约束 在纯 LLM 的沙盒中,Agent 的行为缺乏硬核的物理约束。它们不需要考虑资金体量、冲击成本、保证金要求或做市商的库存压力。它们是在“讨论”市场,而不是在“交易”市场。没有这些微观结构和流动性的约束,推演出的结果往往只是看似合理的“群体幻觉”。
传统量化投资(如高频交易、统计套利)虽然在因果推理上存在短板,但它们在处理高维数字、捕捉微观结构和执行硬核物理约束方面具有无可比拟的优势。
真实的金融世界模型(FWM),不是抛弃传统量化去搭建一个纯粹的 LLM 聊天室,而是将其重塑为融合了环境感知(Observe)、先验记忆(Recall)、关联推理(Think)与混合专家融合(MoE Act)的白盒化重型工业底座。学术界能够造出聪明的通用模型,但他们没有、也无法凭空捏造出一个包含几千种流动性硬约束、数十个专家模型和微观博弈规则的真实市场基座。这正是必须依靠传统量化壁垒的原因。
| 能力维度 | 传统量化模型 (如 GNN/高频) | 纯 LLM 多智能体 (如 社交仿真) | 金融世界模型 (FWM) |
|---|---|---|---|
| 微观结构约束 | 极强(订单簿、流动性) | 无(仅文本交互) | 强(基于真实市场物理) |
| 共识类型 | 交易共识(资金驱动) | 叙事共识(语言驱动) | 交易共识(逻辑与资金共振) |
| 因果推理 | 弱(基于统计相关性) | 中(基于文本逻辑) | 强(结构因果模型) |
| 情境推演 | 不支持 | 弱(缺乏数值基础) | 核心能力 |
如果通用大模型解决不了,纯 LLM 多智能体也解决不了——那金融市场到底需要一个什么样的 AI 系统?
它不会是另一颗更聪明的脑。它必须是一种完全不同形态的东西:一个能让模型住进去、被市场反复打分、把反身性当作核心建模对象、并能对"如果世界变了"做出可严格回答的系统。
这个东西需要一个名字,也需要一个清晰的定义。