Qwen3.8 Max重测后追平Opus 4.8,仍没打过Kimi K3
律动BlockBeats|2026年08月06日 10:31
评测机构 Artificial Analysis 重测 Qwen3.8 Max 后,将其 Intelligence Index 从 53 分上调到 56 分。此前测试接口出现间歇性异常,这次改用阿里云官方 API 重跑。新成绩追平 Claude Opus 4.8,但仍比 Kimi K3 低 1 分。千问进步最明显的是 Agent 任务。GDPval-AA 得分达到 1739,超过 Kimi K3 的 1685 和 GPT-5.6 Sol 的 1730,仅落后 Claude Opus 5。终端操作、科学推理和编程评测也普遍上涨。代价是更费 Token。Qwen3.8 Max 的 Token 单价比上一代更低,但完成一道综合评测任务的平均成本,仍从 0.53 美元涨到 1.14 美元,高于 Kimi K3 的 0.86 美元。主要原因是它在 Agent 任务中调用更多轮次,生成的内容也更多。它的知识可靠性还出现倒退。AA-Omniscience 准确率基本没变,幻觉率却从上一代的 23% 升到 40%。[原文链接](动察 Beating)
分享至:
脉络
热门快讯
APP下载
X
Telegram
复制链接