三强格局

2026 年 3 月,OpenAI、Anthropic、Google 几乎同时发布了旗舰更新,市场上首次出现三款实力接近的顶级模型。

推理能力对比

维度 GPT-5.4 Pro Claude Opus 4.6 Gemini 3.1 Pro
AIME 2025 (数学) 94% 92% 91%
GPQA Diamond (科学) ~88% ~86% 94.3%
LiveCodeBench (编码) 87.0% 89.5% 85.2%
MMLU (通用知识) 91.5% 90.8% 93.1%

速度对比

模型 输出速度
GPT-5.4 82.1 tokens/s
Claude Opus 4.6 72.3 tokens/s
Gemini 3.1 Pro 114.8 tokens/s

价格对比

模型 输入 (per 1M tokens) 输出 (per 1M tokens)
GPT-5.4 $1.25 $10
Claude Opus 4.6 $5 $15
Gemini 3.1 Pro $2 $8
DeepSeek V4 $0.03 $0.10

结论

  • 编程首选:Claude Opus 4.6
  • 科学推理首选:Gemini 3.1 Pro
  • 综合通用首选:GPT-5.4
  • 性价比首选:DeepSeek V4(价格仅为 GPT 的 1/50)