Gemini 3.8 Flash发布 谷歌性价比新王对飙Claude Opus 5 速度价格性能全面解析

Ai资讯2小时前发布 大国Ai
16 0 0

摘要

2026年9月初,谷歌正式发布 Gemini 3.8 Flash 及其网络安全特化版本 Gemini 3.8 Flash Cyber。这款模型以极低的 API 定价(输入 0.75 美元/百万 tokens、输出 3.75 美元/百万 tokens、缓存仅 0.075 美元/百万 tokens)提供了接近 Anthropic Claude Opus 5 的性能表现,据称仅用 Opus 约 15% 的价格就斩获 8 项编程基准第一,同时支持 1.05M 超长上下文与多模态能力。然而,伴随发布而来的还有“刷分争议”、任务级 token 消耗上升导致实际成本可能增加、以及“跑分好看但干活不灵”的口碑分歧。本文将从价格、性能、速度、争议与实测体验五个维度,全面拆解这款被称为“Agent 与代码性价比杀器”的新模型。


一、发布背景:四个月四款 Flash,谷歌在下什么棋

Gemini 3.8 Flash 于北京时间 9 月 2 日晚间至 9 月 3 日正式上线,同期谷歌还发布了安全特化版 Gemini 3.8 Flash Cyber,共两款新模型,官方称推理能力全面提升。

Gemini 3.8 Flash发布 谷歌性价比新王对飙Claude Opus 5 速度价格性能全面解析

值得注意的是,这已经是谷歌在约 4 个月内连续推出的第 4 款 Flash 系列模型,且本次发布距上一代更新仅六周,属于“三连更”节奏。这种高频迭代策略被业内解读为谷歌在性价比与 Agent 生态赛道上的激进打法。

二、价格与规格:把价格战打进 token 层

API 定价

  • 输入:$0.75 / 1M tokens
  • 输出:$3.75 / 1M tokens
  • 缓存:$0.075 / 1M tokens

相比 Claude Opus 5,Gemini 3.8 Flash 的价格优势显著,据信源报道约为 Opus 5 的 15% 价格水平,快 4.6 倍、便宜 6.4 倍,堪称“Agent 与代码的性价比杀器”。

上下文与多模态

Gemini 3.8 Flash 支持 1.05M 超长上下文窗口,并具备多模态处理能力。模型现已在 Antigravity 平台上线,主打更快的编码体验。

隐藏成本:单价不变,任务更贵

需要特别提醒的是,虽然单价保持不变,但多家媒体指出,由于 Gemini 3.8 Flash 在处理任务时倾向于消耗更多 tokens,实际单任务花费可能不降反升。有分析称谷歌这是“把价格战打进了 token 消耗层”,官方文档也建议用户不要急着全面迁移。

三、性能跑分:逼近 Opus 5,编程能力亮眼

从基准测试来看,Gemini 3.8 Flash 的表现相当激进:

  • 综合跑分:整体性能逼近 Claude Opus 5,据称仅用约 15% 的价格斩获 8 项编程基准第一名;
  • 智能指数:不过在权威智能指数排名上,相比竞品仍落后约 7 分,有观点认为“这波是赶上了还是继续拉”仍存争议;
  • Agent 编程:在 DeepSWE 1.1 基准测试中拿到 73.7% 的分数;
  • 推理能力:官方与多方报道称推理能力全面提升,在编码与安全领域的基准得分处于第一梯队。

四、速度优势:300+ tokens/s 遥遥领先

速度是 Gemini 3.8 Flash 的核心卖点之一。实测输出速度可达 300+ tokens/s,据信源报道比同级竞品快 4.6 倍,这一速度优势使其在 Agent 长链路任务和实时编码场景中具备明显体验优势。

五、实测体验:0.12 美元跑完四大场景

有开发者实测用 0.12 美元完成了四个典型场景的任务,成本控制能力突出。海外科技媒体的试用评价则是“It (Mostly) Lives Up to the Hype”——大体符合宣传预期。

但社区口碑呈现明显分化:

  • 有观点认为它“干活挺勤快,就是没开窍”,实际任务完成质量与跑分不匹配;
  • 也有评论称“六周三连更但干活不灵光”;
  • 更有声音质疑 Google 的产品短板,认为模型发布“全网被嘲”;
  • 此外,跑分接近 Opus 5 也引发了刷分争议

六、Gemini 3.8 Flash Cyber:安全特化版

与主模型同步发布的 Gemini 3.8 Flash Cyber 是面向网络安全领域的特化版本。据信源报道,该版本在安全补丁任务上速度提升 2.6 倍,但出于安全考量,仅限经过审核认证的专业防御人员使用。

七、总结:性价比真香还是买前需谨慎?

综合来看,Gemini 3.8 Flash 的优势集中在:价格低(约为竞品的 15%)、速度快(300+ tokens/s)、编程跑分强(8 项第一)、上下文长(1.05M)。但它也面临三重质疑:智能指数仍落后头部模型约 7 分、单任务 token 消耗上升可能推高实际成本、以及刷分争议与实际体验的落差。

对于高频调用 Agent 与代码场景的开发者,Gemini 3.8 Flash 值得一试;但对质量敏感的核心业务,建议参考官方文档“别急着换”的提示,先小规模验证再迁移。

© 版权声明

相关文章

暂无评论

none
暂无评论...