数据快照 · 2026 年 8 月 30 日

全球顶级大模型排行 ×
主流 Agent 工具图鉴

基于 Arena 人类偏好榜与 Artificial Analysis 智能指数的最新数据,
横向对比旗舰模型的上下文、价格与开源状态,
一站看懂 Codex、Claude Code、WorkBuddy 等主流 Agent 工具。

12款入库模型 8款 Agent 工具 8个概念图解 2大评价体系
RANKING · 排行

全球大模型排行榜

主流评价体系有两类:Artificial Analysis 智能指数(客观基准综合分,衡量能力上限)与 Arena ELO(真人匿名盲评偏好分,衡量体验)。两者经常不一致——这很正常,因为它们量的东西不同。

点击榜单中的任意模型,可查看该模型的定位与亮点。Arena 已于 2026-07-12 对分数重新定基,跨期分数不宜直接比较。

Artificial Analysis 智能指数 · Top 榜

客观基准综合分(满分制动态扩展),2026-08-27 快照;同一梯队分差通常在误差范围内。

Arena 各分榜第一

Arena(原 LMArena)由真人对两个匿名模型盲评投票产生,2026-08-27 更新。

文本综合榜 · Claude Fable 5

Anthropic 旗舰,包揽总榜前三;偏好体验断层领先

≈1509
前端代码榜 · Kimi K3

月之暗面开源旗舰,史上最大开放权重模型

1679
Agent 榜 · GPT-5.5 / Claude Opus 4.8

并列第一;Agentic Index 则由 Claude Opus 5 领跑(55.3)

并列
视觉榜 · Claude Fable 5

多模态理解同样登顶视觉竞技场

1327
COMPARE · 对比

核心参数与价格对比

覆盖国内外 12 款代表性模型:上下文窗口、API 价格(每百万 token 输入/输出)、开源状态与一句话定位。
价格单位以厂商公示为准($ 美元 / ¥ 人民币),点击表格行可查看该模型的详细亮点。

模型 / 厂商 发布 上下文 API 价格(入/出 · 每百万token) 授权 一句话定位

大模型价格变动频繁,且常分档计价(如超长上下文加价、缓存折扣)。本页为 2026-08-30 快照,实际请以厂商官网为准。「—」表示暂未查到可靠公开数据。

AGENTS · 工具

主流 Agent 工具科普

Agent(智能体)= 大模型 + 工具调用 + 自主执行循环。它不止「回答问题」,而是拆解目标、动手干活、交付结果。 点击左侧工具查看详情与快速档案。

CONCEPTS · 科普

看懂榜单必备的 8 个概念

点击卡片展开解释。读懂这些词,你就能自己判断各类榜单与宣传话术。

在海量文本上训练、能理解和生成自然语言的超大规模神经网络。参数与数据规模越大,越会「涌现」出推理、创作等能力。代表系列:GPT(OpenAI)、Claude(Anthropic)、Gemini(Google)、Qwen(阿里)、DeepSeek、Kimi、GLM 等。

不满足于回答问题,而是自主拆解目标、调用工具、执行动作并根据反馈迭代,直到交付结果。典型循环:规划 → 行动 → 观察 → 调整。Codex、Claude Code、WorkBuddy、Manus 都是典型 Agent 产品。

Token 是文本计量的最小单位,中文 1 个字约等于 1~2 个 token;上下文窗口决定一次对话能装下多少资料。2026 年旗舰已普遍达到 256K~1M token(约 20~80 万字),Kimi、DeepSeek、GLM-5.x 等已卷到百万级。

推理模型在作答前先进行逐步「思考」(思维链),显著提升数学、编程等任务准确率。思考预算(thinking budget)越高,效果越强但更慢更贵。榜单上的 -high / xhigh 版本就是开了高思考预算的配置,与普通版本分数不可直接对比。

把模型拆成众多「专家」子网络,每次推理只激活其中少数几个,从而用更低的算力成本实现超大参数容量。DeepSeek V3.2(671B 总参/37B 激活)、GLM-5(744B)、Kimi K 系列都采用 MoE,这也是国产模型能把价格打到地板的原因。

Arena ELO 来自海量真人匿名盲评投票,反映「用起来爽不爽」;Artificial Analysis 智能指数则是 HLE、GPQA、SWE-bench 等客观基准的综合分,反映「能力上限高不高」。还有 Agentic Index 专门衡量工具调用与任务执行。选模型先看你的场景属于哪一类。

Model Context Protocol 是连接 AI 与外部工具/数据的开放标准:数据库、浏览器、公司内部系统都能以统一方式接入。Codex、Claude Code、Cursor、WorkBuddy 等主流工具均已支持,是 Agent 能「动手干活」的基础设施。

开源权重(DeepSeek、GLM-5.x、Kimi K3 等)可下载本地部署、自由微调,适合隐私敏感与深度定制场景,多采用 MIT 许可可商用;闭源模型(GPT、Claude、Gemini)只能通过 API 或官方产品按量使用,免运维、能力最强。2026 年的趋势是:开源阵营能力快速逼近闭源旗舰。

FAQ · 答疑

常见问题

关于「谁是最强模型」的高频疑问,一次讲清。

没有唯一答案,取决于评价维度:Arena 真人偏好榜第一是 Claude Fable 5,Artificial Analysis 智能指数第一是 Claude Opus 5(63 分),Agent 执行能力第一是 Claude Opus 5 / GPT-5.5 梯队,前端代码榜第一则是开源的 Kimi K3。按你的使用场景选,比迷信总榜更靠谱。

常见原因有三:① 思考预算不同(普通版 / -high / xhigh 是不同配置);② 榜单统计口径不同(ELO 是人类偏好,智能指数是客观基准);③ 榜单重定基——Arena 在 2026-07-12 重新校准了分数基线,前后分数不能直接比较。

差距正在快速缩小。Kimi K3 开放权重版本智能指数达 60,进入全球第一梯队;DeepSeek、GLM-5.x 以 MIT 许可开源且可商用。但在综合能力与极致体验上,闭源旗舰(Claude / GPT / Gemini)仍保持领先。隐私敏感、要私有化部署 → 选开源;追求开箱即用的最强能力 → 选闭源。

不是。大模型是「大脑」,Agent 是「大脑 + 工具 + 执行循环」的完整系统。同一个模型放进不同 Agent 框架,表现可能天差地别——这也是为什么 Artificial Analysis 专门有一个 Agentic Index 来衡量「干活能力」,它和纯智力分数并不完全挂钩。

按场景来:写代码 → Claude Code 或 Codex(终端深度任务)、Cursor / Copilot(IDE 内协作);日常办公自动化 → WorkBuddy、Manus;纯对话问答 → ChatGPT / Claude / Gemini 官方应用;预算有限 → 国产开源模型 API(DeepSeek、Kimi、GLM),价格通常只有海外旗舰的 1/5~1/10。

本页为 2026-08-30 的静态快照。大模型行业迭代极快——价格按月波动、榜单按周变化、新模型随时发布。做采购或选型决策前,请务必到 Arena(arena.ai)、Artificial Analysis 与各厂商官网核实最新数据。