三强格局
2026 年 3 月,OpenAI、Anthropic、Google 几乎同时发布了旗舰更新,市场上首次出现三款实力接近的顶级模型。
推理能力对比
| 维度 | GPT-5.4 Pro | Claude Opus 4.6 | Gemini 3.1 Pro |
|---|---|---|---|
| AIME 2025 (数学) | 94% | 92% | 91% |
| GPQA Diamond (科学) | ~88% | ~86% | 94.3% |
| LiveCodeBench (编码) | 87.0% | 89.5% | 85.2% |
| MMLU (通用知识) | 91.5% | 90.8% | 93.1% |
速度对比
| 模型 | 输出速度 |
|---|---|
| GPT-5.4 | 82.1 tokens/s |
| Claude Opus 4.6 | 72.3 tokens/s |
| Gemini 3.1 Pro | 114.8 tokens/s |
价格对比
| 模型 | 输入 (per 1M tokens) | 输出 (per 1M tokens) |
|---|---|---|
| GPT-5.4 | $1.25 | $10 |
| Claude Opus 4.6 | $5 | $15 |
| Gemini 3.1 Pro | $2 | $8 |
| DeepSeek V4 | $0.03 | $0.10 |
结论
- 编程首选:Claude Opus 4.6
- 科学推理首选:Gemini 3.1 Pro
- 综合通用首选:GPT-5.4
- 性价比首选:DeepSeek V4(价格仅为 GPT 的 1/50)