「Qwen3.8-Max 排名世界第几」看似简单,其实容易误导——AI 模型没有所有人都承认的总排行榜。文本、代码、多模态、Agent 等任务排名可能完全不同。

截至 2026 年 8 月 4 日,Qwen3.8-Max 于 8 月 3 日发布。排名须按榜单 + 任务类别回答,不能把厂商说法写成世界总排名。

一、短答案:没有「世界第几」,只有「某榜某类第几」

榜单类别名次性质
Arena.aiFrontend Code第 4(1668 分)第三方众测
Arena.aiVision第 2(1305 分)第三方众测
BenchLM综合加权第 6 / 215第三方聚合
阿里官方Text Arena第 5厂商引用
💡 先行结论:代码第 4、视觉第 2、综合第 6、SWE-bench Pro 中游——这些数字可同时成立,不能简化为一个「世界排名」。

二、为什么没有唯一世界排名

Arena 靠投票评体验,BenchLM 聚合基准加权,SWE-bench 测修 bug,PaperBench 测科研复现。总榜、分类榜和投票榜不能混为一谈

三、当前成绩(截至 8 月 4 日)

模型为 2.4T MoE、100 万 token 上下文,可通过 Model Studio API 访问。

#4 Frontend Code
#2 Vision Arena
#6 BenchLM 综合

厂商自测(8 月 3 日,非独立复测):PaperBench 93.0 领先、Terminal Bench 86.6;短板 SWE-bench Pro 67.7(落后 Fable 5 的 80.0)。coding 行使用 Claude Code harness。

四、核验与误导

  • 查正式收录 → Arena / BenchLM 搜完整模型名。
  • 核对版本 → Max 后缀及 High / Max 推理档位。
  • 分清来源 → 厂商自测与第三方榜分开引用。
  • 警惕截图 → 「世界第二」通常指某一子榜。

要点回顾

① 无统一世界排名 → ② Arena 代码第 4、视觉第 2,BenchLM 综合第 6 → ③ 厂商自测与第三方分开引用 → ④ 真实任务 A/B 测试才是标准。

在 Mac mini 上跑模型 A/B 测试

用真实 prompt 批量对比 API 是最可靠的选型方式。Mac mini M4 统一内存架构跑评测脚本效率高,待机约 4W 适合 7×24 回归测试;macOS 让 Docker、SSH 开箱即用。

Mac mini M4 是目前最具性价比的起点——立即了解 Mac mini 云主机方案

vmzen · Mac mini 裸金属托管

立即开通,15 分钟上线全球节点

零硬件投入 · SSH 立即可达 · 按月计费随时扩容

15分钟 扩容上线
3 全球节点
不限流量
立即开通