Entry / Pod's Garden

2026 年 9 月末前沿模型对照:一张够做选型的表

9 月的最后两周,模型圈几乎没有喘气。 GPT-6 Astra 在 9 月 3 日打头[22];Gemini 3.8 Flash 在 9 月 2 日跟上,这已经是 Google 四个月里的第四个 Flash[4]。 DeepSeek 在 9 月上线 V4.1 Flash,把官方 id 直接换成了 deepseek-flash[11][20]。

下半月更挤。 Grok 4.7 于 9 月 21 日落地[13];9 月 22 日同一天里,OpenAI 发布 GPT-6 Sol / Luna[9],Anthropic 发布 Claude Opus 5.5[7]。 9 月 28 日,Sonnet 5.5 收尾,Anthropic 预告 Haiku 5.5 随后就到[8]。

模型一多,表格就开始骗人。所以我先把这篇的两条规矩写在最前面:

  1. 厂商海报分和独立复跑分不混着看。 同一个 Terminal-Bench 4.0,Opus 5.5 的 66.4% 是 xhigh effort + Claude Code harness[7],AA 独立复跑出来大约 60%[15];Grok 自报约 38%,独立复测常落到 26–28%[14]。把它们并排放进一张「绝对排名」,排出来的东西没有意义。
  2. 单价不等于单任务成本。 Grok 4.7 的单价和 4.6 一样是 $2 / $6,但它每个任务的输出 token 翻了一倍多(约 81k 对 36k)[14]。Sonnet 5.5 的单价也和 Sonnet 5 一样是 $2 / $10,可它的单任务成本高了约 50%[2]。

下面所有数字都标了出处,末尾有完整来源列表。「单位是 USD / 百万 token」这句只在第 3 节成立,别的地方都是钱。


0. 一句话格局

档位模型一句话
旗舰智力Claude Opus 5.5独立指数目前最高;编码 + 知识工作最稳
几乎同档、更便宜Claude Sonnet 5.5多项接近 Opus;max 档极啰嗦,单任务可能比 Opus 更贵
旗舰科学 / 短输出GPT-6 Astra科学终端、计算机使用、token 效率强,单价最贵
中档默认GPT-6 Sol中档性价比尖端;日常编码 / API agent 默认
海量低价GPT-6 Luna摘要、抽取、高并发
开源便宜编码DeepSeek V4.1 Flash开源 MIT + 极低价,中等 agent 编码贴近 Gemini Flash
多模态工作马Gemini 3.8 Flash音视频 PDF;促销价用到 2026-12-31
特定领域 + CursorGrok 4.7电气 / 法律 agent 突出;输出偏长,单任务不一定便宜

合成建议:

  • 分看 Opus / Sonnet
  • 钱看 Sol / Luna / DeepSeek
  • Astra 只在科学终端和短输出旗舰任务上合理
  • Sonnet 5.5 不要默认开 max

1. 发布与定位

模型发布官方定位
Gemini 3.8 Flash2026-09-02Flash 线最强工作马;另有受限的 Flash Cyber
GPT-6 Astra2026-09-03GPT-6 旗舰:专业工作、编码、计算机使用、对齐
DeepSeek V4.1 Flash2026-09-10开源多模态 MoE,替换 V4-Flash / Vision-Exp
Grok 4.72026-09-21编码 / 知识工作旗舰
GPT-6 Sol / Luna2026-09-22把 Astra 的训练方法下放到中档和低价档,API 约半价
Claude Opus 5.52026-09-225.5 家族首发;多数任务对标 Fable 5.1,比 Opus 5 便宜约 40%
Claude Sonnet 5.52026-09-28日常 scoped 任务、修 bug、文档 / 幻灯 / 表格、设计

补充:

  • Anthropic 明确预告 Haiku 5.5 会在随后几周加入 5.5 家族[7][8]。
  • 知识截止:AA 目录给 Astra 记的是 2026-04-30[18],Grok 4.7 官方文档写 2026-05[23];Claude 5.5 系官方口径为 2026-06,Sol 约 2026-04-20。
  • DeepSeek 那一步是「换名」而不是「加名」:deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 两个老名字仍然能调,但请求会被转到 V4.1-Flash,按 Flash 的价格计费[11]。

2. 规格

模型上下文 / 最大输出输入模态推理档权重
Opus 5.51M / 128K(Batches 可到 300K)文本 + 图Adaptive,默认 medium,thinking 关不掉闭源
Sonnet 5.51M / 128K文本 + 图Adaptive,App 默认 medium闭源
GPT-6 Astra~1.05M文本 + 图有 effort,低档起步闭源
GPT-6 Sol~1.05M文本 + 图low → max,可关 reasoning闭源
GPT-6 Luna~1.05M文本等low → high闭源
DeepSeek V4.1 Flash1M / 384K文本 + 图思考 / 非思考;API low / high / max开源 MIT;552B MoE,激活约 16B
Gemini 3.8 Flash1M / 64K文本 + 图 + 视频 + 音频 + PDFlow / medium / high闭源
Grok 4.7500K / 无单独上限文本 + 图low / medium / high(默认)/ xhigh闭源

要点:

  • DeepSeek 的卖点是 KV cache 压缩(相对前代约 4×),长 agent 循环受益最明显[20]。552B 总参数 / 16B 激活,MIT 许可,权重在 Hugging Face 上[20][24]。
  • DeepSeek 的 Pro / Flash 双档阵容从 V4 一代开始,Flash 一直定位在「更快、更便宜」那一档[5]。
  • Gemini 3.8 Flash 是这张表里输入模态最全的:文本、图像、语音、视频都吃[19]。
  • Grok 4.7 的上下文最短,500K,和 4.6 一致[14][23]。
  • 一处口径不一致,值得单独记一笔: GPT-6 的上下文,厂商口径约 1.05M,而 AA 目录把 Sol 记作 872k[17]、Astra 记作 1M[18]。要写代码时以官方文档为准,别拿第三方目录的数字去卡上限。

3. API 标价(USD / 百万 token)

这一节才按 token 计价,而且单价 ≠ 单任务成本。 高 effort 会「想更久」,账最终是按任务结的。

模型InputOutputCache read备注
GPT-6 Luna0.100.500.01相对 5.6 Luna 半价[9]
DeepSeek V4.1 Flash谷 0.15 / 峰 0.300.60 / 1.20谷 0.003 / 峰 0.006官方 id deepseek-flash[11]
Gemini 3.8 Flash0.75(2027-01-01 起 1.50)3.75(起 7.50)0.075(起 0.15)促销到 2026-12-31[10]
Grok 4.72.00(输入 ≥200K 则 4.00)6.00(长上下文 12)0.50 / 1.00Fast 档 2×,仅 Cursor / Grok Build[12][23]
GPT-6 Sol2.0010.000.20与 Sonnet 同档单价[9]
Sonnet 5.52.0010.000.20官方称单任务可比 Sonnet 5 省约 30%[8]
Opus 5.54.0020.000.20Fast mode 8 / 40;cache 比 Opus 5 降 60%[7]
GPT-6 Astra10.0050.001.00最贵旗舰档[18]

几条读数:

  • DeepSeek 的峰谷。 谷时价是峰时的一半,峰时是 UTC 工作日 01:00–04:00 与 06:00–10:00,周末和中国法定节假日全天都算谷时[11]。
  • Gemini 的缓存是输入价的一折($0.075,90% 折扣),2027-01-01 起涨到 $0.15;输入输出也同步翻倍[10]。
  • Opus 5.5 的缓存折扣到了 95%:$0.20 对 $4 的输入价[7][15]。这一条对长 agent 循环的影响比单价本身大。
  • 第三方转售的 DeepSeek 可能到 $0.025 / $0.29 一带,和官方峰谷价不是同一张表,别混着算。

4. 独立复跑

4.1 Artificial Analysis Intelligence Index v4.3.2

10 项加权:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1[15][20]。

模型(测评档)Index单任务成本每任务输出 token备注
Opus 5.5 max + fallback58$5.98~119k现最高[1][15]
Opus 5.5 xhigh56$3.46~66k性价比更好的旗舰档[21]
Sonnet 5.5 max + fallback56$7.60~193kAA 测过最啰嗦[16]
Opus 5.5 high53.6$1.82~36k
GPT-6 Astra max53$3.26~27k最短输出的旗舰[18]
Fable 5.1 max + fallback53$7.63—
Opus 5.5 medium(默认)51.2$1.34~26k日常该看这档
Opus 5 max51$5.86~73k被 5.5 medium 完爆
GPT-6 Sol max48$1.06~31k中档最优[17]
Muse Spark 1.3 max48$1.60~60k
Grok 4.7 xhigh46$3.74~81k比 4.6 贵一倍多[14]
GPT-6 Sol xhigh44.1$0.53~16k
Gemini 3.8 Flash high41$1.24~48k促销价会更低[19]
DeepSeek V4.1 Flash max39$0.27—开源最便宜能打的[20]
GPT-6 Luna max37$0.07—海量档[21]

Sonnet 5.5 的几个关键读数[2][16]:

  • 分只比 Opus 低 2(56 对 58)。
  • max 档单任务比 Opus 还贵:$7.60 对 $5.98,因为它每任务的输出 token 高了约 60%。
  • 官方 $2 / $10 的单价在这里有误导性;低 / 中档 Sonnet 的单任务成本可以到约 $0.41 起,那才是它该待的位置。
  • fallback 大约发生在 0.1% 的任务上,主要在 Terminal-Bench 4.0,回退目标是 Sonnet 5。

AA 子项(独立复跑,不是厂商海报):

子项Opus 5.5 maxSonnet 5.5 maxAstra max
Terminal-Bench 4.059.6–60%64%59%
AA-Briefcase Elo182218111569
GDPval-AA Elo184618441542
AutomationBench-AA70%71%68%
HLE61.4%—55%
SciCode66.9%—56%

读数注意:

  • 独立 TB4 上 Sonnet 5.5 略超 Opus;知识工作两者持平,且都远超 Astra。
  • Astra 赢在 token 极短(约 27k / 任务)[18]。
  • 厂商海报里 Opus 的 66.4% 是另一套 harness / effort,不要和 AA 的约 60% 直接比[7][15]。
  • Opus 5.5 测评时开着生产护栏:部分网络 / 生物任务会 fallback 到 Opus 4.8 / Opus 5,Anthropic 自己说这会压低相关分[7]。

Coding Agent Index(各家原生 harness:Claude Code / Codex / Grok Build):

  • Grok 4.7 + Grok Build = 56,比 4.6 +9 分,在原生 harness 里排第 4,前面是 Fable 5.1、GPT-6 Astra、Opus 5[14]。
  • Sonnet 5.5 的 Coding Agent 全量分在 AA 文章里没有单列完整[16]。

GPT-6 Sol 各 effort(AA 口径)[3][17]:

EffortIndex单任务成本输出 token / 任务
none28.1$0.334.9k
low33.9$0.133.4k
medium39.8$0.256.5k
high42.8$0.3710.2k
xhigh44.1$0.5316k
max47.5$1.0631.2k

Opus 5.5 的成本前沿档位:

EffortIndex单任务成本
medium51.2$1.34
high53.6$1.82
xhigh56.0$3.46
max57.6–58$5.98

4.2 Vals Index(2026-09-27)

GDP 加权,覆盖金融 / 编码 / 法律。这里的 Cost / Test 是跑完整套 Vals,不是单次聊天[6]。

模型Vals IndexCost / Test时长量级
Opus 5.569.69%$32.77~1h12
Sonnet 5.569.22%$20.80~1h10
Fable 5.168.83%$28.92~1h16
Opus 567.21%$18.81~56m
GPT-6 Astra66.61%$19.09~25m
GPT-5.6 Sol63.71%$14.21~32m
GPT-6 Sol62.57%$7.56~27m
Gemini 3.8 Flash62.25%$5.39~45m
Grok 4.760.22%$11.16~33m
GPT-6 Luna58.45%——
DeepSeek V4.1 Flash57.86%$0.30~26m

Vals 要点:

  • Sonnet 5.5 总分只差 Opus 0.47 分,Cost / Test 大约是它的 2/3[6]。
  • Vibe Code / Code Migration 上 Sonnet 排第一。
  • Astra 再次呈现同一个形状:分稍低、时间短、token 少。它的 ~25 分钟是这张表里最快的[6]。
  • DeepSeek Flash 用 $0.30 换 57.86%,性价比极端。
  • Vals 对 GPT-6 Sol 的结论是 #8 / 65,62.57%,每测试 $7.56,不到 Astra $19.09 的一半。

两套独立榜对齐之后的排序:

  1. 智力天花板:Opus 5.5
  2. 几乎同档:Sonnet 5.5(Vals 更便宜,AA max 更贵)
  3. 科学 / 速度 / 短输出旗舰:Astra
  4. 中档默认:GPT-6 Sol
  5. Cursor / Grok Build 编码:Grok 4.7 可用,但 AA 单任务偏贵
  6. 多模态工作马:Gemini 3.8 Flash
  7. 开源 / 自托管:DeepSeek V4.1 Flash
  8. 海量:Luna

5. 厂商海报分(仅供对照,不与第 4 节混排)

这一节的数字全部来自厂商自己的发布页或系统卡,不能和第 4 节并排当排名看。

基准Opus 5.5Sonnet 5.5GPT-6 AstraGPT-6 SolGrok 4.7DS V4.1 FlashGemini 3.8 Flash
Terminal-Bench 4.066.4% (xhigh)70.6%57.9%—厂商 ~38%;AA 复测 33%——
Terminal-Bench 2.1—————90.6%89.4%
CursorBench 4.057.8%55.5%—5.6 Sol 41.7%46.3%——
FrontierCode v1.1 Main54.4%46.2% max / 52.1% xhigh53.3%接近 Fable———
DeepSWE v1.1系统卡 74.2%—~74.1%68.8% max71.0% high74.2%73.7–73.8%
SWE-bench Pro89.9%——————
Terminal-Bench-Science 0.158.7%—64.6%————
AutomationBench(Zapier)40.0%—41.4%33.2% xhigh(单任务 $0.27)———
HLE + tools67.7%64.5%57.2%————
OSWorldpartial 81.8% / strict 48.7%partial 80.1%—xhigh offline 60.5%———
EEBench———5.6 Sol 39.4%64.0%——
Harvey Legal Agent———5.6 Sol 2.5%19.6%——

三个必须记住的坑:

  • Grok 自报 TB4 约 38%,AA 复测是 33%(xhigh,Grok Build harness)[14]。
  • GPT-6 Astra 的 64.6% 出现在 Terminal-Bench-Science,不是 TB4;它在 TB4 上报的是 57.9%,而 Opus 的 66.4% 来自 xhigh[7][22]。
  • 很多 DeepSWE / TB2.1 的高分是厂商自跑,没有第三方复现。

6. 三类场景单任务成本

用官方单价 + AA 实测的 token 密度估算。Cache 命中按官方 cache read 价。

工作负载假设:

场景输入输出轮次cache
B1 Cursor 写代码首轮 80k,之后每轮 8k 新上下文每轮 6k20 轮80k 长期命中
B2 API agent每轮 12k 新 + 40k cache每轮 8k25 轮高
B3 批量抽取每条 6k 新 + 2k 系统提示命中每条 0.4k1 万条系统提示全命中

6.1 B1 Cursor 写代码(20 轮一次功能)

API 等价账单;订阅用户当作额度消耗看。

模型约成本
Luna$0.08–0.15
DeepSeek Flash 谷时$0.15–0.40
Gemini 3.8 Flash 促销$0.40–0.90
GPT-6 Sol medium / high$0.80–1.80
Sonnet 5.5 medium$1.20–2.50
Grok 4.7 high$1.50–3.50
Opus 5.5 medium$1.50–3.00
Sonnet 5.5 max$4–8
Astra max$4–8
Opus 5.5 max$5–10

经验法则:Cursor 里用 Sol 或 Sonnet medium 做日常;卡住了再升 Opus medium。Sonnet / Opus 开 max,会把「一次功能」做成「一顿饭钱」。

AA「一个 Index 任务」可以当一次偏难的编码 / 知识任务来锚:

模型档单任务
Sol max$1.06
Opus medium$1.34
Astra max$3.26
Grok xhigh$3.74
Opus max$5.98
Sonnet max$7.60

6.2 B2 API agent(25 步工具循环)

这一档更吃 cache。

模型cache read / M25 步量级
DeepSeek Flash 谷时0.003$0.20–0.60
Luna0.01$0.15–0.40
Gemini Flash 促销0.075$0.80–2.00
Sol0.20$1.50–3.50
Opus 5.5 medium0.20$2.50–5.00
Grok 4.70.50$3–7
Sonnet 5.5 max0.20$6–12
Astra1.00$8–15

说明:

  • 循环越长,DeepSeek / Luna 越赚,Astra 越亏。
  • OpenAI 自报的 AutomationBench 是短工作流:Sol xhigh 每任务 $0.27,Astra low 约 3.9×[9]。25 步的循环会按上表放大。
  • Gemini 在 2027-01-01 单价翻倍之后,这一档的成本大约翻番。

6.3 B3 批量抽取(1 万条)

1 万条,每条 6k 新输入 + 2k 命中系统提示 + 0.4k 输出,按官方单价算:

模型1 万条单条
GPT-6 Luna$8.20$0.00082
DeepSeek Flash 谷时$11.46$0.00115
DeepSeek Flash 峰时$22.92$0.00229
Gemini 3.8 Flash 促销$61.50$0.00615
Gemini 3.8 Flash 2027 标价$123$0.0123
Grok 4.7$154$0.0154
GPT-6 Sol$164$0.0164
Sonnet 5.5$164$0.0164
Opus 5.5$324$0.0324
GPT-6 Astra$820$0.0820

批量抽取只用 Luna 或 DeepSeek,不要碰旗舰。这一档几乎只看 input 单价,Opus 算下来是 Luna 的 40 倍。


7. 社区与产品层(截至 9/29,定性)

  • Opus 5.5:长程 coding agent、UI / 前端、文风更干净[7]。护栏 / fallback 会让部分安全向任务变钝。Pro / Max 额度上调,5 小时限额和限速重置都可保存[7]。
  • Sonnet 5.5:刚满一天。官方对标修 bug、文档 / 幻灯 / 表格、设计[8]。CursorBench 只比 Opus 低约 2 分。社区在等独立速度复测。
  • Astra:科研和计算机使用的「脑子」,token 效率高[22]。吐槽集中在 $10 / $50。
  • Sol / Luna:开发者更关心这两档。社区共识是 OpenAI 这周赢在价格曲线,不赢在智商天花板[3][9]。
  • DeepSeek V4.1 Flash:开源圈和成本敏感团队首选[20]。弱项是多模态广度、最难 agent 套件掉队。
  • Gemini 3.8 Flash:GCP / Workspace 友好,速度快(high 档约 278 t/s)[19]。记住 2027-01-01 翻倍。
  • Grok 4.7:Cursor / Grok Build 友好,电气、法律能出头[13]。更啰嗦,按任务算账单可能比 4.6 更贵。

尚未系统补的一层:中文写作、Claude Code / Codex / Grok Build 的额度与默认模型、一线稳定性。


8. 怎么选

用途默认升级不要用
Cursor / Grok Build 写代码Sol 或 Sonnet mediumOpus mediumSonnet / Opus max、Astra
难重构、长 agent、要一次对Opus medium / highOpus xhighLuna、Flash 硬顶
API 工具循环Sol 或 DeepSeek FlashOpus mediumAstra(cache 太贵)
万级抽取 / 分类Luna 或 DeepSeek 谷时Gemini Flash任何 $2+ input 的模型
音视频 PDFGemini 3.8 Flash—DeepSeek(没有音视频)
要开源 / 自托管DeepSeek V4.1 Flash—闭源旗舰

9. 读数坑

  1. Effort / harness 不统一。Opus 海报 TB4 用 xhigh + Claude Code;Astra 用 OpenAI 自报的 high;Grok 自报和 AA 复测能差 10 分[7][14][22]。
  2. 安全 fallback 会让 Anthropic 在网络 / 生物题上吃亏,官方自己承认会压低分数[7]。
  3. 单价 ≠ 单任务。Grok 4.7、Sonnet max、高 effort 的 Opus / Gemini 都可能「看起来便宜、做完更贵」[2][14]。
  4. 很多 DeepSWE / TB2.1 高分是厂商自跑。
  5. Sonnet 5.5 刚满一天,部分 GDPval / AA-Briefcase 是预发布部署上测的,Anthropic 说结构化输出有个 bug 会压分,已修[8][16]。
  6. AA 中途 rebase 过 —— GDPval-AA 的 Elo 锚点现在是 DeepSeek V4.1 Flash (max) = 1600[21],新旧分不要混比。本文以 v4.3.2 为主。
  7. DeepSeek 第三方托管价和官方峰谷价不是同一张表。
  8. Gemini 3.8 Flash 的「Index 59」是旧口径的分数(AA 9 月 2 日的文章[4]);在 v4.3.2 下它是 41[19]。这类跨版本混比是这张表里最容易踩的坑。

本文所有外部事实都标了编号;厂商页用于价格与定位,Artificial Analysis 与 Vals AI 用于独立复跑,两者不混排。

Sources

[1] Artificial Analysis · Claude Opus 5.5 登顶文
[2] Artificial Analysis · Claude Sonnet 5.5 评分文
[3] Artificial Analysis · GPT-6 Sol / Luna 成本前沿
[4] Artificial Analysis · Gemini 3.8 Flash 发布评测
[5] Artificial Analysis · DeepSeek V4 Pro / V4 Flash(4 月)
[6] Vals AI · 模型对比(Vals Index 2026-09-27)
[7] Anthropic · Introducing Claude Opus 5.5
[8] Anthropic · Introducing Claude Sonnet 5.5
[9] OpenAI · Introducing GPT-6 Sol and Luna
[10] Google · Gemini API 定价页
[11] DeepSeek · Models & Pricing
[12] xAI · Pricing
[13] xAI · Introducing Grok 4.7
[14] Artificial Analysis · Benchmarking Grok 4.7
[15] Artificial Analysis · Claude Opus 5.5 模型页
[16] Artificial Analysis · Claude Sonnet 5.5 模型页
[17] Artificial Analysis · GPT-6 Sol 模型页
[18] Artificial Analysis · GPT-6 Astra 模型页
[19] Artificial Analysis · Gemini 3.8 Flash 模型页
[20] Artificial Analysis · DeepSeek V4.1 Flash 模型页
[21] Artificial Analysis · Changelog(v4.3.2)
[22] OpenAI · GPT-6 Astra
[23] xAI · Grok 4.7 文档
[24] Hugging Face · DeepSeek-V4.1-Flash 模型卡\