「Qwen3.8-Max 排名世界第幾」看似簡單,其實容易誤導——AI 模型沒有所有人都承認的總排行榜。文本、程式碼、多模態、Agent 等任務的排名可能完全不同;同一模型在不同推理檔位、版本與工具鏈下,成績也可能差很多。

截至 2026 年 8 月 4 日,Qwen3.8-Max 於 8 月 3 日正式發布。排名須按榜單 + 任務類別回答,不能把媒體或廠商說法寫成世界總排名。

一、短答案:沒有「世界第幾」,只有「某榜某類第幾」

榜單類別名次性質
Arena.aiFrontend Code第 4(1668 分)第三方眾測
Arena.aiVision第 2(1305 分)第三方眾測
Arena.aiText Arena第 5第三方眾測
BenchLM綜合加權第 6 / 215第三方聚合
💡 先行結論:程式碼第 4、視覺第 2、文本第 5、BenchLM 綜合第 6、SWE-bench Pro 中游——這些數字可同時成立,不能簡化為一個「世界排名」。

二、為什麼沒有唯一世界排名

Arena 靠盲測投票評體驗,BenchLM 聚合多基準加權,SWE-bench 測修 bug,PaperBench 測科研複現。Artificial Analysis 與 Hugging Face 則各有獨立評測管線。總榜、分類榜與投票榜不能混為一談;廠商自測與第三方榜單也必須分開引用。

三、主流榜單怎麼看

  • Arena.ai → 人類盲測偏好,適合看對話、程式碼 UI、視覺理解體驗。
  • BenchLM → 多基準加權綜合分,適合橫向粗比整體能力。
  • SWE-bench / WebDev → 軟體工程與前端實作,看真實 repo 修復能力。
  • 廠商自測表 → 阿里 8 月 3 日發布 Terminal Bench、PaperBench 等,非獨立複測

四、Qwen3.8-Max 當前狀態(截至 8 月 4 日)

模型為 2.4T MoE、100 萬 token 上下文,可透過 Model Studio API 存取。Arena 已收錄正式版;截至 8 月 3 日,Artificial Analysis 與 Hugging Face 尚未列出該模型。

#4 Frontend Code
#2 Vision Arena
#6 BenchLM 綜合

廠商自測(8 月 3 日):PaperBench 93.0 領先、Terminal Bench 86.6;短板 SWE-bench Pro 67.7(落後 Fable 5 的 80.0)。coding 行使用 Claude Code harness——與 Arena 眾測口徑不同,不宜直接對比。

五、真實性核驗清單

  • 查正式收錄 → Arena / BenchLM 搜尋完整模型名與版本後綴(Max、High 等)。
  • 核對時間點 → 榜單每日變動,引用須標註截至日期。
  • 分清來源 → 廠商自測、媒體轉述、第三方榜單分開標註。
  • 警惕截圖 → 「世界第二」通常指某一子榜,非總排名。

六、別被這些說法誤導

「全面超越 GPT」「內部測試第一」「中國模型全球第二」——若未指明榜單、類別、推理檔位與測試日期,都不應當成世界總排名。新模型上架首週榜單波動大,樣本量小的子榜尤其不穩定。

要點回顧

① 無統一世界排名 → ② Arena 程式碼第 4、視覺第 2,BenchLM 綜合第 6 → ③ 廠商自測與第三方分開引用 → ④ 真實任務 A/B 測試才是選型標準。

在 Mac mini 上跑模型 A/B 測試

用真實 prompt 批量對比 API 是最可靠的選型方式。Mac mini M4 的統一記憶體架構跑評測腳本效率高,待機約 4W 適合 7×24 回歸測試;macOS 讓 Docker、SSH 開箱即用,Gatekeeper 與 SIP 也為 API 金鑰與測試資料提供隔離環境。

相比同價位 Windows 主機,Mac mini 體積小、靜音、長期綜合成本更低。Mac mini M4 是目前最具性價比的起點——立即了解 Mac mini 雲主機方案,在可控節點上搭建你的模型評測流水線。

vmzen · Mac mini 裸金屬託管

立即開通,15 分鐘上線全球節點

零硬體投入 · SSH 立即可達 · 按月計費隨時擴容

15分鐘 擴容上線
3 全球節點
不限流量
立即開通