2026 年 9 月末前沿模型对照:一张够做选型的表
9 月的最后两周,模型圈几乎没有喘气。
GPT-6 Astra 在 9 月 3 日打头[22];Gemini 3.8 Flash 在 9 月 2 日跟上,这已经是 Google 四个月里的第四个 Flash[4]。
DeepSeek 在 9 月上线 V4.1 Flash,把官方 id 直接换成了 deepseek-flash[11][20]。
下半月更挤。 Grok 4.7 于 9 月 21 日落地[13];9 月 22 日同一天里,OpenAI 发布 GPT-6 Sol / Luna[9],Anthropic 发布 Claude Opus 5.5[7]。 9 月 28 日,Sonnet 5.5 收尾,Anthropic 预告 Haiku 5.5 随后就到[8]。
模型一多,表格就开始骗人。所以我先把这篇的两条规矩写在最前面:
- 厂商海报分和独立复跑分不混着看。 同一个 Terminal-Bench 4.0,Opus 5.5 的 66.4% 是 xhigh effort + Claude Code harness[7],AA 独立复跑出来大约 60%[15];Grok 自报约 38%,独立复测常落到 26–28%[14]。把它们并排放进一张「绝对排名」,排出来的东西没有意义。
- 单价不等于单任务成本。 Grok 4.7 的单价和 4.6 一样是 $2 / $6,但它每个任务的输出 token 翻了一倍多(约 81k 对 36k)[14]。Sonnet 5.5 的单价也和 Sonnet 5 一样是 $2 / $10,可它的单任务成本高了约 50%[2]。
下面所有数字都标了出处,末尾有完整来源列表。「单位是 USD / 百万 token」这句只在第 3 节成立,别的地方都是钱。
0. 一句话格局
| 档位 | 模型 | 一句话 |
|---|---|---|
| 旗舰智力 | Claude Opus 5.5 | 独立指数目前最高;编码 + 知识工作最稳 |
| 几乎同档、更便宜 | Claude Sonnet 5.5 | 多项接近 Opus;max 档极啰嗦,单任务可能比 Opus 更贵 |
| 旗舰科学 / 短输出 | GPT-6 Astra | 科学终端、计算机使用、token 效率强,单价最贵 |
| 中档默认 | GPT-6 Sol | 中档性价比尖端;日常编码 / API agent 默认 |
| 海量低价 | GPT-6 Luna | 摘要、抽取、高并发 |
| 开源便宜编码 | DeepSeek V4.1 Flash | 开源 MIT + 极低价,中等 agent 编码贴近 Gemini Flash |
| 多模态工作马 | Gemini 3.8 Flash | 音视频 PDF;促销价用到 2026-12-31 |
| 特定领域 + Cursor | Grok 4.7 | 电气 / 法律 agent 突出;输出偏长,单任务不一定便宜 |
合成建议:
- 分看 Opus / Sonnet
- 钱看 Sol / Luna / DeepSeek
- Astra 只在科学终端和短输出旗舰任务上合理
- Sonnet 5.5 不要默认开 max
1. 发布与定位
| 模型 | 发布 | 官方定位 |
|---|---|---|
| Gemini 3.8 Flash | 2026-09-02 | Flash 线最强工作马;另有受限的 Flash Cyber |
| GPT-6 Astra | 2026-09-03 | GPT-6 旗舰:专业工作、编码、计算机使用、对齐 |
| DeepSeek V4.1 Flash | 2026-09-10 | 开源多模态 MoE,替换 V4-Flash / Vision-Exp |
| Grok 4.7 | 2026-09-21 | 编码 / 知识工作旗舰 |
| GPT-6 Sol / Luna | 2026-09-22 | 把 Astra 的训练方法下放到中档和低价档,API 约半价 |
| Claude Opus 5.5 | 2026-09-22 | 5.5 家族首发;多数任务对标 Fable 5.1,比 Opus 5 便宜约 40% |
| Claude Sonnet 5.5 | 2026-09-28 | 日常 scoped 任务、修 bug、文档 / 幻灯 / 表格、设计 |
补充:
- Anthropic 明确预告 Haiku 5.5 会在随后几周加入 5.5 家族[7][8]。
- 知识截止:AA 目录给 Astra 记的是 2026-04-30[18],Grok 4.7 官方文档写 2026-05[23];Claude 5.5 系官方口径为 2026-06,Sol 约 2026-04-20。
- DeepSeek 那一步是「换名」而不是「加名」:
deepseek-v4-flash和deepseek-v4-flash-vision-exp两个老名字仍然能调,但请求会被转到 V4.1-Flash,按 Flash 的价格计费[11]。
2. 规格
| 模型 | 上下文 / 最大输出 | 输入模态 | 推理档 | 权重 |
|---|---|---|---|---|
| Opus 5.5 | 1M / 128K(Batches 可到 300K) | 文本 + 图 | Adaptive,默认 medium,thinking 关不掉 | 闭源 |
| Sonnet 5.5 | 1M / 128K | 文本 + 图 | Adaptive,App 默认 medium | 闭源 |
| GPT-6 Astra | ~1.05M | 文本 + 图 | 有 effort,低档起步 | 闭源 |
| GPT-6 Sol | ~1.05M | 文本 + 图 | low → max,可关 reasoning | 闭源 |
| GPT-6 Luna | ~1.05M | 文本等 | low → high | 闭源 |
| DeepSeek V4.1 Flash | 1M / 384K | 文本 + 图 | 思考 / 非思考;API low / high / max | 开源 MIT;552B MoE,激活约 16B |
| Gemini 3.8 Flash | 1M / 64K | 文本 + 图 + 视频 + 音频 + PDF | low / medium / high | 闭源 |
| Grok 4.7 | 500K / 无单独上限 | 文本 + 图 | low / medium / high(默认)/ xhigh | 闭源 |
要点:
- DeepSeek 的卖点是 KV cache 压缩(相对前代约 4×),长 agent 循环受益最明显[20]。552B 总参数 / 16B 激活,MIT 许可,权重在 Hugging Face 上[20][24]。
- DeepSeek 的 Pro / Flash 双档阵容从 V4 一代开始,Flash 一直定位在「更快、更便宜」那一档[5]。
- Gemini 3.8 Flash 是这张表里输入模态最全的:文本、图像、语音、视频都吃[19]。
- Grok 4.7 的上下文最短,500K,和 4.6 一致[14][23]。
- 一处口径不一致,值得单独记一笔: GPT-6 的上下文,厂商口径约 1.05M,而 AA 目录把 Sol 记作 872k[17]、Astra 记作 1M[18]。要写代码时以官方文档为准,别拿第三方目录的数字去卡上限。
3. API 标价(USD / 百万 token)
这一节才按 token 计价,而且单价 ≠ 单任务成本。 高 effort 会「想更久」,账最终是按任务结的。
| 模型 | Input | Output | Cache read | 备注 |
|---|---|---|---|---|
| GPT-6 Luna | 0.10 | 0.50 | 0.01 | 相对 5.6 Luna 半价[9] |
| DeepSeek V4.1 Flash | 谷 0.15 / 峰 0.30 | 0.60 / 1.20 | 谷 0.003 / 峰 0.006 | 官方 id deepseek-flash[11] |
| Gemini 3.8 Flash | 0.75(2027-01-01 起 1.50) | 3.75(起 7.50) | 0.075(起 0.15) | 促销到 2026-12-31[10] |
| Grok 4.7 | 2.00(输入 ≥200K 则 4.00) | 6.00(长上下文 12) | 0.50 / 1.00 | Fast 档 2×,仅 Cursor / Grok Build[12][23] |
| GPT-6 Sol | 2.00 | 10.00 | 0.20 | 与 Sonnet 同档单价[9] |
| Sonnet 5.5 | 2.00 | 10.00 | 0.20 | 官方称单任务可比 Sonnet 5 省约 30%[8] |
| Opus 5.5 | 4.00 | 20.00 | 0.20 | Fast mode 8 / 40;cache 比 Opus 5 降 60%[7] |
| GPT-6 Astra | 10.00 | 50.00 | 1.00 | 最贵旗舰档[18] |
几条读数:
- DeepSeek 的峰谷。 谷时价是峰时的一半,峰时是 UTC 工作日 01:00–04:00 与 06:00–10:00,周末和中国法定节假日全天都算谷时[11]。
- Gemini 的缓存是输入价的一折($0.075,90% 折扣),2027-01-01 起涨到 $0.15;输入输出也同步翻倍[10]。
- Opus 5.5 的缓存折扣到了 95%:$0.20 对 $4 的输入价[7][15]。这一条对长 agent 循环的影响比单价本身大。
- 第三方转售的 DeepSeek 可能到 $0.025 / $0.29 一带,和官方峰谷价不是同一张表,别混着算。
4. 独立复跑
4.1 Artificial Analysis Intelligence Index v4.3.2
10 项加权:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1[15][20]。
| 模型(测评档) | Index | 单任务成本 | 每任务输出 token | 备注 |
|---|---|---|---|---|
| Opus 5.5 max + fallback | 58 | $5.98 | ~119k | 现最高[1][15] |
| Opus 5.5 xhigh | 56 | $3.46 | ~66k | 性价比更好的旗舰档[21] |
| Sonnet 5.5 max + fallback | 56 | $7.60 | ~193k | AA 测过最啰嗦[16] |
| Opus 5.5 high | 53.6 | $1.82 | ~36k | |
| GPT-6 Astra max | 53 | $3.26 | ~27k | 最短输出的旗舰[18] |
| Fable 5.1 max + fallback | 53 | $7.63 | — | |
| Opus 5.5 medium(默认) | 51.2 | $1.34 | ~26k | 日常该看这档 |
| Opus 5 max | 51 | $5.86 | ~73k | 被 5.5 medium 完爆 |
| GPT-6 Sol max | 48 | $1.06 | ~31k | 中档最优[17] |
| Muse Spark 1.3 max | 48 | $1.60 | ~60k | |
| Grok 4.7 xhigh | 46 | $3.74 | ~81k | 比 4.6 贵一倍多[14] |
| GPT-6 Sol xhigh | 44.1 | $0.53 | ~16k | |
| Gemini 3.8 Flash high | 41 | $1.24 | ~48k | 促销价会更低[19] |
| DeepSeek V4.1 Flash max | 39 | $0.27 | — | 开源最便宜能打的[20] |
| GPT-6 Luna max | 37 | $0.07 | — | 海量档[21] |
Sonnet 5.5 的几个关键读数[2][16]:
- 分只比 Opus 低 2(56 对 58)。
- max 档单任务比 Opus 还贵:$7.60 对 $5.98,因为它每任务的输出 token 高了约 60%。
- 官方 $2 / $10 的单价在这里有误导性;低 / 中档 Sonnet 的单任务成本可以到约 $0.41 起,那才是它该待的位置。
- fallback 大约发生在 0.1% 的任务上,主要在 Terminal-Bench 4.0,回退目标是 Sonnet 5。
AA 子项(独立复跑,不是厂商海报):
| 子项 | Opus 5.5 max | Sonnet 5.5 max | Astra max |
|---|---|---|---|
| Terminal-Bench 4.0 | 59.6–60% | 64% | 59% |
| AA-Briefcase Elo | 1822 | 1811 | 1569 |
| GDPval-AA Elo | 1846 | 1844 | 1542 |
| AutomationBench-AA | 70% | 71% | 68% |
| HLE | 61.4% | — | 55% |
| SciCode | 66.9% | — | 56% |
读数注意:
- 独立 TB4 上 Sonnet 5.5 略超 Opus;知识工作两者持平,且都远超 Astra。
- Astra 赢在 token 极短(约 27k / 任务)[18]。
- 厂商海报里 Opus 的 66.4% 是另一套 harness / effort,不要和 AA 的约 60% 直接比[7][15]。
- Opus 5.5 测评时开着生产护栏:部分网络 / 生物任务会 fallback 到 Opus 4.8 / Opus 5,Anthropic 自己说这会压低相关分[7]。
Coding Agent Index(各家原生 harness:Claude Code / Codex / Grok Build):
- Grok 4.7 + Grok Build = 56,比 4.6 +9 分,在原生 harness 里排第 4,前面是 Fable 5.1、GPT-6 Astra、Opus 5[14]。
- Sonnet 5.5 的 Coding Agent 全量分在 AA 文章里没有单列完整[16]。
GPT-6 Sol 各 effort(AA 口径)[3][17]:
| Effort | Index | 单任务成本 | 输出 token / 任务 |
|---|---|---|---|
| none | 28.1 | $0.33 | 4.9k |
| low | 33.9 | $0.13 | 3.4k |
| medium | 39.8 | $0.25 | 6.5k |
| high | 42.8 | $0.37 | 10.2k |
| xhigh | 44.1 | $0.53 | 16k |
| max | 47.5 | $1.06 | 31.2k |
Opus 5.5 的成本前沿档位:
| Effort | Index | 单任务成本 |
|---|---|---|
| medium | 51.2 | $1.34 |
| high | 53.6 | $1.82 |
| xhigh | 56.0 | $3.46 |
| max | 57.6–58 | $5.98 |
4.2 Vals Index(2026-09-27)
GDP 加权,覆盖金融 / 编码 / 法律。这里的 Cost / Test 是跑完整套 Vals,不是单次聊天[6]。
| 模型 | Vals Index | Cost / Test | 时长量级 |
|---|---|---|---|
| Opus 5.5 | 69.69% | $32.77 | ~1h12 |
| Sonnet 5.5 | 69.22% | $20.80 | ~1h10 |
| Fable 5.1 | 68.83% | $28.92 | ~1h16 |
| Opus 5 | 67.21% | $18.81 | ~56m |
| GPT-6 Astra | 66.61% | $19.09 | ~25m |
| GPT-5.6 Sol | 63.71% | $14.21 | ~32m |
| GPT-6 Sol | 62.57% | $7.56 | ~27m |
| Gemini 3.8 Flash | 62.25% | $5.39 | ~45m |
| Grok 4.7 | 60.22% | $11.16 | ~33m |
| GPT-6 Luna | 58.45% | — | — |
| DeepSeek V4.1 Flash | 57.86% | $0.30 | ~26m |
Vals 要点:
- Sonnet 5.5 总分只差 Opus 0.47 分,Cost / Test 大约是它的 2/3[6]。
- Vibe Code / Code Migration 上 Sonnet 排第一。
- Astra 再次呈现同一个形状:分稍低、时间短、token 少。它的 ~25 分钟是这张表里最快的[6]。
- DeepSeek Flash 用 $0.30 换 57.86%,性价比极端。
- Vals 对 GPT-6 Sol 的结论是 #8 / 65,62.57%,每测试 $7.56,不到 Astra $19.09 的一半。
两套独立榜对齐之后的排序:
- 智力天花板:Opus 5.5
- 几乎同档:Sonnet 5.5(Vals 更便宜,AA max 更贵)
- 科学 / 速度 / 短输出旗舰:Astra
- 中档默认:GPT-6 Sol
- Cursor / Grok Build 编码:Grok 4.7 可用,但 AA 单任务偏贵
- 多模态工作马:Gemini 3.8 Flash
- 开源 / 自托管:DeepSeek V4.1 Flash
- 海量:Luna
5. 厂商海报分(仅供对照,不与第 4 节混排)
这一节的数字全部来自厂商自己的发布页或系统卡,不能和第 4 节并排当排名看。
| 基准 | Opus 5.5 | Sonnet 5.5 | GPT-6 Astra | GPT-6 Sol | Grok 4.7 | DS V4.1 Flash | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% (xhigh) | 70.6% | 57.9% | — | 厂商 ~38%;AA 复测 33% | — | — |
| Terminal-Bench 2.1 | — | — | — | — | — | 90.6% | 89.4% |
| CursorBench 4.0 | 57.8% | 55.5% | — | 5.6 Sol 41.7% | 46.3% | — | — |
| FrontierCode v1.1 Main | 54.4% | 46.2% max / 52.1% xhigh | 53.3% | 接近 Fable | — | — | — |
| DeepSWE v1.1 | 系统卡 74.2% | — | ~74.1% | 68.8% max | 71.0% high | 74.2% | 73.7–73.8% |
| SWE-bench Pro | 89.9% | — | — | — | — | — | — |
| Terminal-Bench-Science 0.1 | 58.7% | — | 64.6% | — | — | — | — |
| AutomationBench(Zapier) | 40.0% | — | 41.4% | 33.2% xhigh(单任务 $0.27) | — | — | — |
| HLE + tools | 67.7% | 64.5% | 57.2% | — | — | — | — |
| OSWorld | partial 81.8% / strict 48.7% | partial 80.1% | — | xhigh offline 60.5% | — | — | — |
| EEBench | — | — | — | 5.6 Sol 39.4% | 64.0% | — | — |
| Harvey Legal Agent | — | — | — | 5.6 Sol 2.5% | 19.6% | — | — |
三个必须记住的坑:
- Grok 自报 TB4 约 38%,AA 复测是 33%(xhigh,Grok Build harness)[14]。
- GPT-6 Astra 的 64.6% 出现在 Terminal-Bench-Science,不是 TB4;它在 TB4 上报的是 57.9%,而 Opus 的 66.4% 来自 xhigh[7][22]。
- 很多 DeepSWE / TB2.1 的高分是厂商自跑,没有第三方复现。
6. 三类场景单任务成本
用官方单价 + AA 实测的 token 密度估算。Cache 命中按官方 cache read 价。
工作负载假设:
| 场景 | 输入 | 输出 | 轮次 | cache |
|---|---|---|---|---|
| B1 Cursor 写代码 | 首轮 80k,之后每轮 8k 新上下文 | 每轮 6k | 20 轮 | 80k 长期命中 |
| B2 API agent | 每轮 12k 新 + 40k cache | 每轮 8k | 25 轮 | 高 |
| B3 批量抽取 | 每条 6k 新 + 2k 系统提示命中 | 每条 0.4k | 1 万条 | 系统提示全命中 |
6.1 B1 Cursor 写代码(20 轮一次功能)
API 等价账单;订阅用户当作额度消耗看。
| 模型 | 约成本 |
|---|---|
| Luna | $0.08–0.15 |
| DeepSeek Flash 谷时 | $0.15–0.40 |
| Gemini 3.8 Flash 促销 | $0.40–0.90 |
| GPT-6 Sol medium / high | $0.80–1.80 |
| Sonnet 5.5 medium | $1.20–2.50 |
| Grok 4.7 high | $1.50–3.50 |
| Opus 5.5 medium | $1.50–3.00 |
| Sonnet 5.5 max | $4–8 |
| Astra max | $4–8 |
| Opus 5.5 max | $5–10 |
经验法则:Cursor 里用 Sol 或 Sonnet medium 做日常;卡住了再升 Opus medium。Sonnet / Opus 开 max,会把「一次功能」做成「一顿饭钱」。
AA「一个 Index 任务」可以当一次偏难的编码 / 知识任务来锚:
| 模型档 | 单任务 |
|---|---|
| Sol max | $1.06 |
| Opus medium | $1.34 |
| Astra max | $3.26 |
| Grok xhigh | $3.74 |
| Opus max | $5.98 |
| Sonnet max | $7.60 |
6.2 B2 API agent(25 步工具循环)
这一档更吃 cache。
| 模型 | cache read / M | 25 步量级 |
|---|---|---|
| DeepSeek Flash 谷时 | 0.003 | $0.20–0.60 |
| Luna | 0.01 | $0.15–0.40 |
| Gemini Flash 促销 | 0.075 | $0.80–2.00 |
| Sol | 0.20 | $1.50–3.50 |
| Opus 5.5 medium | 0.20 | $2.50–5.00 |
| Grok 4.7 | 0.50 | $3–7 |
| Sonnet 5.5 max | 0.20 | $6–12 |
| Astra | 1.00 | $8–15 |
说明:
- 循环越长,DeepSeek / Luna 越赚,Astra 越亏。
- OpenAI 自报的 AutomationBench 是短工作流:Sol xhigh 每任务 $0.27,Astra low 约 3.9×[9]。25 步的循环会按上表放大。
- Gemini 在 2027-01-01 单价翻倍之后,这一档的成本大约翻番。
6.3 B3 批量抽取(1 万条)
1 万条,每条 6k 新输入 + 2k 命中系统提示 + 0.4k 输出,按官方单价算:
| 模型 | 1 万条 | 单条 |
|---|---|---|
| GPT-6 Luna | $8.20 | $0.00082 |
| DeepSeek Flash 谷时 | $11.46 | $0.00115 |
| DeepSeek Flash 峰时 | $22.92 | $0.00229 |
| Gemini 3.8 Flash 促销 | $61.50 | $0.00615 |
| Gemini 3.8 Flash 2027 标价 | $123 | $0.0123 |
| Grok 4.7 | $154 | $0.0154 |
| GPT-6 Sol | $164 | $0.0164 |
| Sonnet 5.5 | $164 | $0.0164 |
| Opus 5.5 | $324 | $0.0324 |
| GPT-6 Astra | $820 | $0.0820 |
批量抽取只用 Luna 或 DeepSeek,不要碰旗舰。这一档几乎只看 input 单价,Opus 算下来是 Luna 的 40 倍。
7. 社区与产品层(截至 9/29,定性)
- Opus 5.5:长程 coding agent、UI / 前端、文风更干净[7]。护栏 / fallback 会让部分安全向任务变钝。Pro / Max 额度上调,5 小时限额和限速重置都可保存[7]。
- Sonnet 5.5:刚满一天。官方对标修 bug、文档 / 幻灯 / 表格、设计[8]。CursorBench 只比 Opus 低约 2 分。社区在等独立速度复测。
- Astra:科研和计算机使用的「脑子」,token 效率高[22]。吐槽集中在 $10 / $50。
- Sol / Luna:开发者更关心这两档。社区共识是 OpenAI 这周赢在价格曲线,不赢在智商天花板[3][9]。
- DeepSeek V4.1 Flash:开源圈和成本敏感团队首选[20]。弱项是多模态广度、最难 agent 套件掉队。
- Gemini 3.8 Flash:GCP / Workspace 友好,速度快(high 档约 278 t/s)[19]。记住 2027-01-01 翻倍。
- Grok 4.7:Cursor / Grok Build 友好,电气、法律能出头[13]。更啰嗦,按任务算账单可能比 4.6 更贵。
尚未系统补的一层:中文写作、Claude Code / Codex / Grok Build 的额度与默认模型、一线稳定性。
8. 怎么选
| 用途 | 默认 | 升级 | 不要用 |
|---|---|---|---|
| Cursor / Grok Build 写代码 | Sol 或 Sonnet medium | Opus medium | Sonnet / Opus max、Astra |
| 难重构、长 agent、要一次对 | Opus medium / high | Opus xhigh | Luna、Flash 硬顶 |
| API 工具循环 | Sol 或 DeepSeek Flash | Opus medium | Astra(cache 太贵) |
| 万级抽取 / 分类 | Luna 或 DeepSeek 谷时 | Gemini Flash | 任何 $2+ input 的模型 |
| 音视频 PDF | Gemini 3.8 Flash | — | DeepSeek(没有音视频) |
| 要开源 / 自托管 | DeepSeek V4.1 Flash | — | 闭源旗舰 |
9. 读数坑
- Effort / harness 不统一。Opus 海报 TB4 用 xhigh + Claude Code;Astra 用 OpenAI 自报的 high;Grok 自报和 AA 复测能差 10 分[7][14][22]。
- 安全 fallback 会让 Anthropic 在网络 / 生物题上吃亏,官方自己承认会压低分数[7]。
- 单价 ≠ 单任务。Grok 4.7、Sonnet max、高 effort 的 Opus / Gemini 都可能「看起来便宜、做完更贵」[2][14]。
- 很多 DeepSWE / TB2.1 高分是厂商自跑。
- Sonnet 5.5 刚满一天,部分 GDPval / AA-Briefcase 是预发布部署上测的,Anthropic 说结构化输出有个 bug 会压分,已修[8][16]。
- AA 中途 rebase 过 —— GDPval-AA 的 Elo 锚点现在是 DeepSeek V4.1 Flash (max) = 1600[21],新旧分不要混比。本文以 v4.3.2 为主。
- DeepSeek 第三方托管价和官方峰谷价不是同一张表。
- Gemini 3.8 Flash 的「Index 59」是旧口径的分数(AA 9 月 2 日的文章[4]);在 v4.3.2 下它是 41[19]。这类跨版本混比是这张表里最容易踩的坑。
本文所有外部事实都标了编号;厂商页用于价格与定位,Artificial Analysis 与 Vals AI 用于独立复跑,两者不混排。
Sources
[1] Artificial Analysis · Claude Opus 5.5 登顶文
[2] Artificial Analysis · Claude Sonnet 5.5 评分文
[3] Artificial Analysis · GPT-6 Sol / Luna 成本前沿
[4] Artificial Analysis · Gemini 3.8 Flash 发布评测
[5] Artificial Analysis · DeepSeek V4 Pro / V4 Flash(4 月)
[6] Vals AI · 模型对比(Vals Index 2026-09-27)
[7] Anthropic · Introducing Claude Opus 5.5
[8] Anthropic · Introducing Claude Sonnet 5.5
[9] OpenAI · Introducing GPT-6 Sol and Luna
[10] Google · Gemini API 定价页
[11] DeepSeek · Models & Pricing
[12] xAI · Pricing
[13] xAI · Introducing Grok 4.7
[14] Artificial Analysis · Benchmarking Grok 4.7
[15] Artificial Analysis · Claude Opus 5.5 模型页
[16] Artificial Analysis · Claude Sonnet 5.5 模型页
[17] Artificial Analysis · GPT-6 Sol 模型页
[18] Artificial Analysis · GPT-6 Astra 模型页
[19] Artificial Analysis · Gemini 3.8 Flash 模型页
[20] Artificial Analysis · DeepSeek V4.1 Flash 模型页
[21] Artificial Analysis · Changelog(v4.3.2)
[22] OpenAI · GPT-6 Astra
[23] xAI · Grok 4.7 文档
[24] Hugging Face · DeepSeek-V4.1-Flash 模型卡\