美国利率策略 Joseph Abate 9月 1, 2026 joseph.abate@smbcnikko-si.com 1 212 893-1592 Sim FOMC AI和大语言模型已被用于分析和定性美联储讲话。它们能够准确地将评论按鹰派程度分类,并模仿人类推理。但AI模拟FOMC的准确性不如机械模型。对FOMC审议进行建模比对其评论进行分类更难。 • 分析师定期审视美联储评论,并根据经验和背景判断其是鹰派还是鸽派。但这种方法并不科学。 • ChatGPT可以分解并排名美联储评论的相对鹰派程度。它准确模仿人类推理,比简单的基于词典的评估更接近人类逻辑。 • AI可以创建模拟FOMC会议。这些会议涉及在类似实际FOMC会议结构的“实验室”中模拟FOMC成员互动。 • 创建模拟Warsh很复杂,因为他提供的关于其反应函数的信息很少,而且他的评论简洁。美联储主席有两个角色——作为投票者和作为“议程设定者”。 • AI模拟表明,当批评公开时,政治压力更可能改变会议结果。当压力私下施加给主席时,模拟结果不受影响;如果观点过于脱离共识,其他FOMC成员将忽略它。剖析Fedspeak 经济学家和分析师定期审视美联储评论,并根据经验和背景判断其是鹰派还是鸽派。但这种方法并不科学。判断不能一贯重复,解释也非普遍一致。1 此外,这些判断无法量化,因此不可能表达FOMC成员观点变化了多少。随着技术的进步,经济学家越来越多地使用分类模型自动“阅读”和评分Fedspeak。最简单的版本基于与特定政策偏好相关的敏感词词典。这些词按词频和关联性进行排名。鹰派词典条目可能包括“通胀”或“强劲”、“过热”等描述。词典模型可以计算鹰派与鸽派词语的比率,以构建相对1 背景很重要;同样的措辞在几周前发布远超预期的就业数据后,对经济学家来说可能听起来更加鹰派。
SMBC美国利率策略 2 “偏鹰派评分”。 2 由于该模型和评分可重复使用,并适用于FOMC成员和讲话,因此可以衡量美联储言论相对偏鹰派程度随时间的变化。但这些评分的有效性取决于词典的深度和全面性。它们忽略了词语使用时的上下文。“通胀已有所缓和”、“工资通胀温和”以及“成员们对油价通胀的担忧有所减轻”具有不同的含义。相反,更复杂的大语言模型会考虑“通胀”等词与“温和”、“工资”或“担忧”等词同时出现的概率。Hansen和Kazinnik将ChatGPT和基于词典的模型与经济学家对FOMC声明中随机选取的500个句子的相对鹰派程度的判断进行了比较。这些句子选自2010至-2020。3 句子按-1(鸽派)到1(鹰派)的等级进行评分。中性表述评为0。ChatGPT的评分比基于词典的模型更接近经济学家的评估。事实上,ChatGPT似乎能够准确模拟人类推理。由于通过ChatGPT运行美联储讲话只需几秒钟,经济学家或许能将更多时间投入到更有成效的工作中,比如预测美联储政策。
遇见“Sims”
如果AI能够准确反映美联储官员言论中的人类推理,那么理论上应该可以利用当前数据创建FOMC会议模拟,以生成政策预测。4 从结构上讲,这需要模拟FOMC成员在计算机“实验室”中像真人一样举行会议、辩论和讨论当前数据,该实验室模拟实际会议进行建模。Kazinnik和Sinclair测试了这样的结构。他们首先根据成员的传记、已知政策立场和最近的讲话创建FOMC成员的模拟版本。这些智能体被输入近期宏观和金融市场数据以及他们之前的FOMC投票模式。每位地区联储行长都被赋予模拟的褐皮书摘要。
创建“模拟人”很困难,如果关于成员观点的背景信息很少,例如新加入的成员,则尤其困难。而且,对于simWarsh而言,新主席的反馈函数信息很少且其声明和新闻发布会措辞简洁,这使情况更加复杂。
FOMC会议结构
然后,背景数据和角色在模拟实际FOMC会议结构的计算机实验室中相互交互。在实际FOMC会议中,理事会工作人员经济学家向委员会提交预测和替代情景。随后,FOMC成员依次发表准备好的讲话,表达他们的预测以及他们认为适当的政策路径。然后,主席提出反映这些观点并参考理事会工作人员预测的政策路径。FOMC成员进行讨论并投票。
会议结构意味着主席扮演两个角色——首先,作为与其他FOMC成员一样的参与讨论的投票者。2 参见“构建金融稳定词典”,R. Correa,K. Garud,J-M. Londono-Yarce和N. Mislang,理事会,2017年6月。3 参见“ChatGPT能解读Fedspeak吗?”,A. Lundgaard Hansen和S. Kazinnik,里士满联邦储备银行,10,年4月2024。4 参见“FOMC in silico:用于货币政策决策建模的多主体系统”,S. Kazinnik和T. Sinclair,斯坦福大学和乔治华盛顿大学
大学,七月 12, 2026
SMBC美国利率策略 3 成员,其次,作为“议程制定者”,总结其他成员的政策观点,这些观点随后提交投票。异议不是试图否决主席和共识,而是表达不同观点的努力。随着时间的推移,异议变得越来越少见;在 1957 至 2013, 年间关于利率政策的 7094 次投票中,仅有 6% 次是异议。5 自 2013, 年以来,即使考虑到今年的回升,异议比例已降至 3.7%(图 1)。6 异议更多来自地区联储银行行长,而非联储理事(图 2)。自 2013, 年以来 49 次投票异议中,仅有 12 次来自联储理事。其中,4 次发生在本年度,而一位理事就占自 2013 年以来总数的一半(米兰)。异议数量偏低可能反映了主席领导风格的转变——近几任主席比 2000 年之前更注重共识导向。联储主席沃什认为,共识建设可能导致FOMC会议上出现了一些“群体思维”。会议需要更像“家庭争吵”——更具对抗性的政策辩论。模拟审议与结果 基于AI的FOMC模拟有多准确?卡津尼克和辛克莱模拟了 218 次会议的结果,时间跨度为 2000-26,,其中 74 次涉及调整联邦基金目标利率。每次会议的平均绝对预测误差为 8bp,略高于使用蒙特卡洛模拟的其他模型。AI模型对虚假记忆效应敏感。7 用于训练模型的数据可能没有时间戳,因此训练截止日期之后发生的事件仍可能影响AI的预测;预测可能 5 参见“理解异议:FOMC异议的历史”,D. Thornton和D. Wheelock,圣路易斯联储银行评论,Q3 2014 6 我们关注与利率相关的异议,而非那些关于政策措辞或实施(资产负债表)的异议。如果包括这些额外的异议,自 2013 年以来的异议率仍然较低(5%)。7 参见“评估生成式AI的通胀预测”,M. J. Alam、S. Boyle和T. Sekhposyan,旧金山联储,一月 2026。图 1:异议比例(投票百分比) 图 2:异议分布(异议百分比) 资料来源:联储,SMBC日兴证券 资料来源:联储,SMBC日兴证券 0 1 2 3 4 5 6 7 1957-2013 1994-2013 2013-2026 0 20 40 60 80 100 1957-2013 1994-2013 2013-2026 行长 理事
SMBC美国利率策略 4 无意中“记忆”了未来事件。这有助于解释为什么人工智能对通胀的预测在样本期内表现优于样本期外。然而,虚假记忆可能并非FOMC预测错误的原因;在训练截止日期前后,模拟未接触过的数据所导致的错误大致相同。无论原因何在,FOMC模拟结果表明,尽管人工智能在解读美联储讲话方面能够合理地模仿人类,但在捕捉FOMC互动和审议的精髓方面却面临更大困难。政治压力 基于人工智能的模拟使建模者能够测试关于FOMC会议的不同假设。鉴于在模拟中准确捕捉FOMC审议的难度,这种“实验室工作”可能有些推测性。尽管如此,Kazinnik和Sinclair测试了政治压力是否影响会议结果。他们探讨了两个渠道。在第一个渠道中,美联储主席反映政府的观点,但FOMC其他成员并不知情。这种压力体现在主席的议程设置上——主席不是总结成员的准备意见并提交结果供审议,而是提交一份有偏见的政策声明供审议。人工智能模拟结果表明,如果主席的提议过于偏离共识,FOMC其他成员将不予理会。有趣的是,美联储主席上一次持异议是在1939;在美联储历史上,仅有3次此类异议。在第二个渠道中,所有FOMC成员都受到政府公开施压要求降息。模拟结果表明,这对政策决策的影响更大。Kazinnik和Sinclair发现,公开压力使委员会投票10%更接近政府的观点。有趣的是,这似乎是因为公开压力通过改变FOMC个别成员的观点,使FOMC更加协调一致。