各厂商列按其最强模型在 Artificial Analysis Intelligence Index 上的得分排序
加载中...
同分并列(名次跳跃);带 * 的分数为 AA 标注的估计/不完整数据。
该名录已扩充为独立的厂商简介页(收录月表全部厂商 + AA 在榜厂商):厂商名录 →
加载中...
AA Intelligence Index 的构成为 agents / coding / 通用能力 / 科学推理四类各占 25%,不含纯数学评测,也不含写作与文学评测。以下榜单可补足这些盲区:
| 榜单 | 相比 AA 的优势 |
|---|---|
| LMArena | 人类盲评对战 Elo,行业影响力最大的榜单;直接反映真实使用偏好——写作风格、回答气质、拒答质量等 AA 完全不测的维度 |
| MathArena | ETH SRI Lab 出品,用刚结束的现场竞赛题(AIME / IMO / HMMT)评测并由人类专家判卷,零题目污染;AA 指数中没有纯数学成分 |
| FrontierMath | Epoch AI 出品,研究级最难数学基准(含数学家未解的开放问题),用于区分模型能力天花板 |
| AIMO Prize | 悬赏制数学竞赛($5M 大奖对应 IMO 金牌水平),以真金白银的竞赛规则验证竞赛数学能力 |
| LiveMathBench | OpenCompass 系,采用中国竞赛题(CMO 等)并持续换新,抗污染且对国产模型覆盖更全 |
AA 分数测的是裸模型能力(raw model capability):所有模型在 AA 自家的标准化 harness 下评测——智能体类评测用其开源 Stirrup harness,Terminal-Bench 用 Terminus 2 + E2B 沙箱,τ³-Banking 用上游 τ-Bench 原版框架; 提示策略、温度(非推理 0 / 推理 0.6)、零样本设置全部统一,不使用任何厂商自家的智能体产品(如 OpenAI 的 Codex CLI、Anthropic 的 Claude Code、Kimi-CLI 等)。 因此 AA 分数反映的是"发动机"而非"整车":各厂商官方 harness 的自报成绩(如 SWE-bench Verified 上"模型 + 自家 CLI"的组合)包含大量 harness 层工程优化,与本页 AA 口径不可直接对比; 同时该口径也会低估"模型深度适配自家 harness"带来的红利。详见 AA 官方方法论。
AA 的历史、2025 年秋冬走红缘由、GPT-6 首测同分风波、编者评其优缺点——编者个人观察(非 AA 官方数据),已移至独立页面。