LiveBench 智能体编程榜:开源的 DeepSeek V4.1 Flash 以 77.3 分压过 Claude Opus 5.5
LiveBench 智能体编程榜上,DeepSeek V4.1 Flash(最高思考档)得 77.3 分排第一,Claude Opus 5.5 为 71.7 分,Qwen3.8 27B 为 61.4 分,GPT-6 Astra 为 57.3 分。X 上有人把它说成「一张二手 3090 就能跑赢所有 GPT」。
为什么重要 榜单第一被开放权重模型拿走,而且价格只有对手零头:Artificial Analysis 标注它每百万 token 输入 0.30 美元、输出 1.20 美元。不过这只是一个榜、一个类别,别当成全面超越;「3090 能跑」是网友说法,没有核实。
BenchLeader:LiveBench 智能体编程榜Artificial Analysis:DeepSeek V4.1 Flash 对比 Qwen3.8 27BX 上的原帖