
最新商议泄露,多个AI模子已能在几分钟内通过享有殊荣的CFA三级检修,而东谈主类频繁需要数年时刻和约1000小时学习才能完成。
纽约大学斯特恩商学院和AI金钱处置平台GoodFin的商议东谈主员测试了23个大型讲话模子,发现包括o4-mini、Gemini 2.5 Pro和Claude Opus在内的前沿推理模子唐突成效通过CFA三级模拟检修。

这些模子罗致\"想维链请示\"时期,有用搪塞了此前令AI头疼的论文题型。GoodFin首创东谈主兼首席实施官Anna Joo Fee流露:
我以为这项时期十足有异日变嫌通盘这个词行业的可能。AI模子全面冲突CFA三级检修壁垒
两年前的商议曾发现,AI模子唐突通过CFA一级和二级检修,但在三级检修的呈报题体式际遇紧要羁系。
最新商议证明,AI时期的快速发展也曾克服了这一枢纽瓶颈。
商议团队对23个大型讲话模子进行了全面测试,十分关怀AI模子是否具备\"专科金融决议所需的专科化、高风险分析推理才智\",以此评估其在CFA三级模拟检修中处理遴荐题和论文题的才智。
商议边界标明,在处理复杂金融问题时,推理模子的进展显耀优于传统的非推理模子。十分是罗致\"想维链请示\"时期的前沿推理模子成效通过了相干检修测试。
其中Gemini 2.5 Pro在呈报题评分中获取3.44分的最高获利,同期在概述进展(遴荐题和呈报题)中以2.1分位居榜首。
值得预防的是,国产的KIMI K2模子在多选题中进展最好,正确率高达78.3%,逾越谷歌的Gemini 2.5 Pro和GPT-5。

商议罗致了零样本、自我一致性和自我发现三种请示战略,其中自我一致性战略取得73.4%的最好进展评分。
在资本效益分析中,Llama 3.1 8B Instant获取5468的最好资本后果评分,而Palmyra Fin以0.3秒的平均反映时刻成为速率最快的模子。

尽管AI在圭臬化检修中进展出色,但业内众人以为完全替代东谈主类金融专科东谈主士仍存在局限。Fee强调:
诸如情境瓦解和意图判断等方面,机器当今还难以准确评估。这恰是东谈主类的上风场地,唐突瓦解客户的肢体讲话和多样流露。

