昊梵体育网

关于 AI 是否能胜任专业数据分析工作,关键在于其处理复杂任务时的稳定性,而非偶然的正确率。 Artificial Analysis 推出的 AA-AnalystAgent 基准测试专门评估 AI 在真实财务与统计场景下的表现。该测试设定了极高的标准:执行 80 项任务,每项任务尝试 5 次,只有连续 5 次全部正确才算通过。 最新 ​

关于 AI 是否能胜任专业数据分析工作,关键在于其处理复杂任务时的稳定性,而非偶然的正确率。

Artificial Analysis 推出的 AA-AnalystAgent 基准测试专门评估 AI 在真实财务与统计场景下的表现。该测试设定了极高的标准:执行 80 项任务,每项任务尝试 5 次,只有连续 5 次全部正确才算通过。
最新数据显示,Gemini 3.7 Flash 以 60.0% 的通过率位居榜首,Claude Opus 5 (53.8%) 和 GPT-5.5 (50.0%) 紧随其后。即便是排名第一的模型,在现实商业分析中仍有四成任务无法做通过。