列排名依据

← 返回时间线

各厂商列按其最强模型在 Artificial Analysis Intelligence Index 上的得分排序

加载中...

厂商列排名(按最强模型 AA 得分)

同分并列(名次跳跃);带 * 的分数为 AA 标注的估计/不完整数据。

AA 上有得分、但表格暂无对应列的厂商

该名录已扩充为独立的厂商简介页(收录月表全部厂商 + AA 在榜厂商):厂商名录 →

无 AA 榜单条目的表格列

加载中...

补充排行榜参考

AA Intelligence Index 的构成为 agents / coding / 通用能力 / 科学推理四类各占 25%,不含纯数学评测,也不含写作与文学评测。以下榜单可补足这些盲区:

榜单相比 AA 的优势
LMArena 人类盲评对战 Elo,行业影响力最大的榜单;直接反映真实使用偏好——写作风格、回答气质、拒答质量等 AA 完全不测的维度
MathArena ETH SRI Lab 出品,用刚结束的现场竞赛题(AIME / IMO / HMMT)评测并由人类专家判卷,零题目污染;AA 指数中没有纯数学成分
FrontierMath Epoch AI 出品,研究级最难数学基准(含数学家未解的开放问题),用于区分模型能力天花板
AIMO Prize 悬赏制数学竞赛($5M 大奖对应 IMO 金牌水平),以真金白银的竞赛规则验证竞赛数学能力
LiveMathBench OpenCompass 系,采用中国竞赛题(CMO 等)并持续换新,抗污染且对国产模型覆盖更全

评测口径:裸模型,非官方 harness

AA 分数测的是裸模型能力(raw model capability):所有模型在 AA 自家的标准化 harness 下评测——智能体类评测用其开源 Stirrup harness,Terminal-Bench 用 Terminus 2 + E2B 沙箱,τ³-Banking 用上游 τ-Bench 原版框架; 提示策略、温度(非推理 0 / 推理 0.6)、零样本设置全部统一,不使用任何厂商自家的智能体产品(如 OpenAI 的 Codex CLI、Anthropic 的 Claude Code、Kimi-CLI 等)。 因此 AA 分数反映的是"发动机"而非"整车":各厂商官方 harness 的自报成绩(如 SWE-bench Verified 上"模型 + 自家 CLI"的组合)包含大量 harness 层工程优化,与本页 AA 口径不可直接对比; 同时该口径也会低估"模型深度适配自家 harness"带来的红利。详见 AA 官方方法论

编者按:AA 简史与争议

AA 的历史、2025 年秋冬走红缘由、GPT-6 首测同分风波、编者评其优缺点——编者个人观察(非 AA 官方数据),已移至独立页面。