< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

Falcon TST 2.0获世界权威测评第一名,推动时间序列基础模型从通用预测走向金融应用

蚂蚁国际日前正式发布自研时序AI预测大模型“鹰序TST”2.0版。

蚂蚁国际日前正式发布自研时序AI预测大模型“鹰序TST”(FalconTST,Time-Series Transformer)2.0版。“鹰序TST”2.0在全球权威基准测试中取得最优成绩(SOTA),平均绝对比例误差(MASE)降至0.666,超越多家全球顶尖科技公司的时间序列预测模型。该模型专为跨境支付外汇风险管理打造,并将拓展至电商供应链需求预测、航空运营管理等更多行业场景。

目前,巴克莱银行、花旗银行、德意志银行、渣打银行等大型金融机构已将“鹰序TST”2.0应用于现金流预测与外汇管理,提升流动性风险敞口的预测能力。“鹰序TST”2.0的预测准确率已稳定超过93%,具备向物流、航空、电商等金融以外行业拓展的应用能力。

2025年以来,Amazon Chronos-2、Google TimesFM 2.5、Salesforce Moirai 2.0和IBM FlowState相继把多变量、长上下文、概率预测、跨采样率适配等能力推向前台;与此同时,金融市场的低信噪比、机制切换、厚尾风险和跨市场联动,使通用榜单优势很难直接转化为稳定的金融预测收益。蚂蚁国际Falcon TST的演进具有代表性:2025年先在外汇敞口和资金管理中完成业务验证,2026年又以Falcon-2.0强化单变量预测效率,以Falcon-X补足异构多变量关系建模,Falcon TST 2.0是“通用时序基础能力+金融流程验证”的专用化尝试,持续迭代和稳定进步展现了蚂蚁国际在AI+金融领域的先锋力量。

一、金融时间序列正在检验通用基础模型的真实能力

通用时间序列基础模型已经具备明显的跨数据集迁移能力。Salesforce AI Research于2024年11月发布的GIFT-Eval基准覆盖28个数据集、超过14.4万条时间序列和1.77亿个测试数据点,并配套约2300亿个不与测试集重叠的预训练数据点。该基准推动行业从“一个数据集训练一个模型”转向“预训练一次、跨任务零样本预测”。Google TimesFM、Amazon Chronos、Salesforce Moirai等模型随后快速升级,核心目标已从单一预测精度扩展到跨频率、跨变量和不确定性输出。

金融市场对通用模型提出了更苛刻的检验。金融收益率通常具有低信噪比、厚尾、波动率聚集和机制切换等特征,日内行情、日度收盘、利率曲线和宏观数据还存在频率不一致、节假日错位和缺失值。曼彻斯特大学、伦敦大学学院等研究者2025年11月发布的大规模金融实证工作论文发现,直接使用现成预训练TSFM进行零样本预测和常规微调,整体效果较弱;在金融数据上重新预训练后,预测表现和经济收益明显改善。该结果说明,通用预训练提供了有价值的时间模式先验,但金融领域仍高度依赖训练分布与目标任务的匹配。

金融TSFM的价值应与“稳定产生交易收益”区分开来。2026年6月一项针对5只美国高流动性股票的独立研究比较TimeGPT、TimesFM 2.5、Moirai 2.0、Chronos和Chronos-2等模型,TSFM拿下10个任务中的8个最优结果,但相对随机游走基准的增益总体较小,只有少数任务通过显著性检验,且META的两个任务仍由本地监督训练的iTransformer胜出。金融机构因此更适合把TSFM视作可迁移的预测底座和开发效率工具,再通过领域数据、滚动回测和风险约束完成二次验证。

二、主流TSFM已转向多变量、长上下文和概率预测

Chronos-2把Amazon的技术路线从单变量预测推进到通用上下文学习。Amazon于2025年10月20日发布120M参数的Chronos-2,原生支持单变量、多变量和协变量条件预测,并通过Group Attention在相关序列之间共享上下文信息。需要区分的是,初代Chronos确实采用“缩放和量化后转为离散Token、再以语言模型交叉熵训练”的路线;Chronos-2已经引入新的组注意力和通用上下文学习机制,不能简单沿用“数值分桶导致尾部精度受限”来评价新版本。Amazon公布的“超过90%胜率”指Chronos-2相对Chronos-Bolt的头对头比较,并非GIFT-Eval总榜胜率。Chronos-Bolt的“最高250倍推理加速、20倍内存节省”同样是相对初代同规模Chronos的对比结果。

TimesFM 2.5用更小参数量换取更长上下文和连续分位数预测。Google Research于2025年9月15日发布TimesFM 2.5,将模型规模从2.0版的500M降至200M,上下文长度从2048扩展至最高16384,并增加可选的30M连续分位数预测头,最长支持1000步分位数预测。其后,Google在2025年10月恢复XReg协变量支持,2026年3月增加Agent技能接口,4月加入基于LoRA的微调示例。因此,“2.5版在2026年一次性加入分位数、LoRA和Agent”的说法并不准确,模型发布与生态增强分属不同时间节点。

Moirai 2.0证明时间序列基础模型并不需要持续堆大参数。Salesforce于2025年8月8日发布Moirai 2.0,将早期Moirai的Masked Encoder改为Decoder-Only Transformer,并把训练目标改为分位数损失和多Token预测,同时增加缺失值信息嵌入、随机Patch掩码和数据质量过滤。Salesforce公布的小型版本约11.4M参数,相比此前Moirai Large参数量缩小约96%、推理速度提高44%,当时在GIFT-Eval无测试数据泄漏模型中取得领先MASE。其意义在于,TSFM竞争正在从“更大”转向“更合适的数据、目标函数和训练策略”。

FlowState用状态空间模型回应Transformer对采样频率变化适应不足的问题。IBM Research于2026年7月6日公布ICML 2026论文FlowState,以状态空间模型编码器和函数基解码器实现连续时间建模,可在输入采样率变化和预测区间变化时动态调整时间尺度。IBM公开的GIFT-Eval提交中包含9.1M参数版本,规模显著小于主流Transformer TSFM。该路线更关注跨采样率和计算效率,目前公开论文的重点并非复杂异构多变量关系,因此在金融场景中仍需要与跨资产、跨因子建模能力组合评估。

三、Falcon TST的差异化已有金融场景验证支撑

Falcon TST先形成金融业务验证,再逐步形成公开模型家族。2025年5月,蚂蚁国际已与Barclays开展TST外汇预测合作;7月与Citi开展航空客户外汇风险管理试点;8月与Standard Chartered把TST接入其SCALE流动性引擎;10月Falcon-1.0才正式在Hugging Face开放。由此看,Falcon的发展路径与典型“先刷公开基准、再寻找行业应用”的TSFM不同,真实资金管理和外汇敞口预测在其公开发展史中出现得更早。

Falcon-1.0的核心设计是用层次化混合专家处理多尺度时间模式。蚂蚁国际官方仓库将Falcon-1.0定义为分层混合专家模型,通过Patch级专家特化和样本级层次路由处理不同时间尺度。当前Falcon官网展示3000亿个时间点和25亿参数的产品口径,而2025年与多家银行的联合公告普遍表述为“接近20亿参数”。两组数字很可能对应不同模型阶段或统计口径,公开材料没有给出完整对照,因此本文不把参数规模作为Falcon优势的核心证据。更可靠的公开证据是其对小时、日和周等多时间尺度现金流及外汇敞口的业务预测。

四、Falcon-2.0和Falcon-X分别强化单变量效率与多变量关系建模

Falcon-2.0把模型重点转向单变量预测效率和概率输出。蚂蚁国际2026年7月开放Falcon-2.0 API,官方将其定义为基于ORBIT训练框架的Encoder-Only单变量TSFM。相比初代层次化混合专家架构,Encoder-Only更适合一次前向计算完成直接预测,减少自回归逐步生成带来的延迟和误差累积。公开API可直接输出0.01、0.05、0.10至0.95、0.99共21个分位点,并提供input_mask显式标记缺失值,对节假日、停牌或交易日错位等金融数据处理更友好。

Falcon-X补上了金融场景最关键的异构多变量建模能力。蚂蚁国际团队于2026年5月26日公开Falcon-X论文,最大公开实验版本为591M参数。Falcon-X将不同物理含义的变量转换为统一的隐空间表示,通过差分注意力同时识别正向和负向关联,再处理变量间关系并重建各变量轨迹。论文在GIFT-Eval报告0.687的MASE,并在fev-bench进行多变量评测。对金融业务而言,更重要的含义是模型开始直接处理“汇率—利率—波动率—商品”等异构变量之间的关系,而不再只依赖单条序列自身历史。

多变量输入只有在变量关系真实有效时才会带来增益。Santa Clara University研究者2026年5月使用Chronos-2对“美股科技龙头”和美国国债利率进行2000—2025年滚动预测,发现相关变量联合输入总体优于单变量输入,但把股票和利率两个面板直接混合后,预测精度反而下降。该结果对Falcon-X同样具有启示:共享隐空间能够扩大信息来源,金融生产环境仍需严格控制变量选择、信息时点和滚动回测,避免无关因子把噪声带入模型。

分位数预测可以进入风险管理流程,但不能直接等同于监管意义上的VaR和ES。Falcon-2.0和Falcon-X均提供多分位数输出,可用于构造悲观、中性和乐观情景,也可作为风险价值和预期损失模型的重要输入。若预测目标本身是资产收益或组合损益,低分位数可以用于估计尾部损失;但在真实风控体系中仍需经过覆盖率检验、条件覆盖检验、压力情景和模型风险管理,才能判断分位数是否具备稳定校准能力。仅凭API能够输出1%或5%分位点,不能直接推导模型已满足VaR或ES要求。

五、金融机构合作开始把预测能力嵌入真实资金管理流程

巴克莱银行合作验证了Falcon进入银行外汇对冲平台的可行性。2025年5月7日,蚂蚁国际宣布巴克莱银行将TST模型接入BARX NetFX外汇对冲平台,用于提高蚂蚁国际外汇敞口预测准确度。公开材料称TST可按小时、日和周预测现金流及外汇敞口,蚂蚁国际自身场景准确率超过90%。合作的核心价值是用更准确的敞口预测减少不必要对冲和银行风险溢价,再由银行既有Guaranteed FX流程执行风险管理。

花旗银行试点将Falcon用于航空客户的线上售票外汇风险管理。2025年7月18日,花旗银行与蚂蚁国际宣布联合试点,将Falcon TST与花旗银行固定汇率解决方案(Citi Fixed FX Rates)结合,面向跨币种线上售票的航空公司客户。花旗银行官方公告确认首个航空客户已在实际交易中降低对冲成本,并援引蚂蚁国际数据称试点客户对冲成本节省约30%。该合作表明,时间序列基础模型开始以“预测即服务”的方式进入银行产品,最终定价与交易仍由花旗银行既有外汇系统执行。

渣打银行合作将Falcon接入24小时外汇流动性管理流程。2025年8月25日,渣打银行与蚂蚁国际宣布把Falcon TST接入该行SCALE聚合流动性引擎,实现实时、24小时外汇敞口预测。渣打银行公告称整合后对蚂蚁国际外汇敞口预测准确率超过90%,并披露Falcon当时已覆盖蚂蚁国际超过60%的涉及外汇转换交易;相关外汇成本最高下降60%、流动性管理成本最高下降50%。上述降本数据属于合作双方披露的业务口径,更适合作为商业落地成效,不宜与公开学术基准直接比较。

Capital A提供了目前较清晰的第三方企业客户效果数据。2025年10月7日,Capital A旗下AirAsia在官方新闻稿中披露,Falcon用于多币种现金流和外汇敞口预测后,按小时、日和周的预测准确率达到90%,外汇对冲成本最高下降40%。Capital A称该项目为Falcon首个商业部署,并披露航空行业版本加入旅行行业相关数据。该案例说明,行业专用化的实际价值更多来自模型、行业数据、银行交易设施和企业资金管理规则的组合,而非单个基础模型替代现有Treasury体系。

六、通用基准领先不能直接等同于金融业务领先

GIFT-Eval仍是观察TSFM通用能力的重要窗口,但榜单成绩需要结合时间和数据重叠情况解读。Salesforce建立GIFT-Eval的初衷就是统一零样本测试、减少数据泄漏并比较不同频率和变量数量。2026年以来,Falcon-X、Falcon-2.0、FlowState新版本以及多种Agent模型持续加入,榜单排名频繁变化。部分后续论文还专门区分“可能与GIFT训练数据存在重叠”的Chronos-2结果和更严格的无泄漏版本。对于金融机构而言,固定引用某一时点“全球第一”容易失真,更有意义的是检查模型是否在自己的资产、频率、市场状态和回测窗口中保持稳定。

现阶段没有一条技术路线在金融任务上形成绝对优势。Chronos-2擅长把相关变量和协变量作为上下文,TimesFM 2.5依托长上下文和成熟生态保持较强即插即用能力,Moirai 2.0证明小模型也能在通用基准上保持竞争力,FlowState突出跨采样率适应,Falcon-2.0和Falcon-X则分别押注高效单变量预测与异构多变量关系建模。金融任务对极端行情、时间对齐、外生变量、分位数校准和部署时延的要求不同,模型选择需要从具体业务目标倒推。

表1 主流时间序列基础模型的公开技术路线与金融应用观察

模型 公开版本与规模 核心技术路线 多变量与外生信息 金融应用观察
Falcon TST 2.0 Falcon-2.0最大实验版本585M;Falcon-X最大公开实验版本591M Falcon-2.0为Encoder-Only+ORBIT;Falcon-X采用共享隐原型空间 Falcon-X原生异构多变量;两者均提供分位数预测API 已有外汇与Treasury场景验证;Falcon-2.0完整论文尚待公开
Amazon Chronos-2 120M Encoder-based Group Attention与上下文学习 原生支持单变量、多变量和协变量条件预测 独立金融研究显示相关变量联合输入有效,无关跨市场变量可能引入噪声
Google TimesFM 2.5 200M;可选30M分位数头 Decoder-Only,最高16k上下文 原生以单变量为主,可通过XReg加入协变量 金融基准平均表现较强,但部分资产仍被本地监督模型超过
Salesforce Moirai 2.0 Small约11.4M Decoder-Only,分位数损失和多Token预测 Moirai家族面向通用多序列预测,2.0强化缺失值和鲁棒性处理 通用效率突出;公开训练语料并非金融专用
IBM FlowState GIFT-Eval公开提交含9.1M版本 状态空间模型编码器+函数基解码器 重点解决跨采样率和可变预测区间 适合跨频率任务;复杂异构多变量关系仍需额外验证

数据来源:各模型官方论文、技术博客与GIFT-Eval公开资料

注:GIFT-Eval为动态榜单,且部分提交存在训练数据重叠标记。为避免把阶段性排名固化为长期结论,表中不列统一“当前排名”。

七、金融TSFM竞争将更多取决于数据适配、风险校准和工程落地

金融TSFM的下一阶段竞争重点将从“能否零样本预测”转向“能否在真实风险流程中稳定使用”。通用模型已经证明大规模跨领域预训练可以显著降低时间序列建模门槛,金融实证又反复显示领域数据和任务适配仍然关键。对资金管理、流动性预测和外汇敞口等场景,衡量模型的核心标准应逐步转向滚动回测稳定性、极端行情失效边界、分位数校准、数据泄漏控制、推理成本和系统接入能力。通用榜单仍有价值,但只能回答模型“会不会预测”,无法单独回答“能不能进风控”。

Falcon TST 2.0已经形成一条较清楚的金融应用路径。2025年的主线是把TST模型嵌入Barclays、Citi、Standard Chartered以及Capital A等真实资金管理和外汇业务;2026年的主线是以Falcon-2.0和Falcon-X分别解决高效单变量预测和异构多变量预测。公开证据显示,这条路径具备较强的金融产品化基础。后续仍需补齐Falcon-2.0完整论文、预训练数据构成、可复现评测和极端市场压力测试等信息,才能进一步验证其领先能力的可持续性。

时间序列基础模型正在形成“通用底座与行业专用模型并存”的市场格局。TimesFM、Chronos等通用TSFM适合低成本试验、冷启动和跨行业快速迁移,金融专用模型更适合数据充足、指标明确、风险敏感的生产场景。Falcon TST 2.0的意义在于把竞争焦点进一步推向真实金融流程:模型要同时理解时间规律、变量关系和不确定性,还要被银行与企业既有风控、对冲和流动性管理体系消化。金融机构最终购买的是一套能够被验证、被校准、被治理并持续产生业务价值的预测能力,模型规模只是其中一项技术参数。

八、主要资料来源

1. Salesforce AI Research,GIFT-Eval: A Benchmark for General Time Series Forecasting Model Evaluation,2024-11-12。

2. Amazon Science / GitHub,Chronos-2: From Univariate to Universal Forecasting / Chronos repository,2025-10-20。

3. Google Research / GitHub,TimesFM 2.5 release and 2026 updates,2025-09-15—2026-04-09。

4. Salesforce AI Research,Introducing Moirai 2.0,2025-08-08。

5. IBM Research,FlowState: Sampling-Rate-Equivariant Time-Series Forecasting,2026-07-06。

6. Ant International,Falcon-TST Official Repository,截至2026-08-17。

7. Liu Yiding等,Falcon-X: A Time Series Foundation Model for Heterogeneous Multivariate Modeling,2026-05-26。

8. Citi,Citi and Ant International Pilot AI-Enabled Forecasting Solution to Enhance FX Risk Management for Airline Customers,2025-07-18。

9. Standard Chartered,Standard Chartered and Ant International Collaborate on AI-Powered Treasury and FX Management Solutions,2025-08-25。

10. Capital A / AirAsia Newsroom,Capital A采用Ant International AI-Enabled FX Solution,2025-10-07。

11. Ant International,Ant International Partners with Barclays on Global Treasury Management with Proprietary AI-Powered FX Model,2025-05-07。

12. Rahimikia, Ni, Wang,Re(Visiting) Time Series Foundation Models in Finance,2025-11-18。

13. Noguer I Alonso, Franklin,Pretrained Time-Series Foundation Models for Financial Return Forecasting,2026-06-25。

14. Das, Goyal, Yadav,Multivariate Financial Forecasting using the Chronos Time Series Foundation Models,2026-05-08。

15. Salesforce / Hugging Face,GIFT-Eval Live Results Repository,截至2026-08-17。

本文由蚂蚁国际提供,量子位获授权转载,观点归原作者所有。

版权所有,未经授权不得以任何形式转载及使用,违者必究。