Google 连发三款 Gemini 模型:3.6 Flash 让输出 Token 省了 17%,我实测 23%

发布时间:2026/7/23 1:29:59

Google 连发三款 Gemini 模型:3.6 Flash 让输出 Token 省了 17%,我实测 23%
昨天下午三点我照例翻 Google 的 AI 博客——想看看 3.5 Pro 到底什么时候出。翻了半天没找到 Pro 的消息反而看到一行从没见过的标题「Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber」。三款模型同一天发。我的第一反应不是兴奋是困惑——这是跟 OpenAI 学坏了月初发旗舰、月末发周边但往下读了两屏我坐直了。先说主角Gemini 3.6 Flash。Google 叫它「workhorse model」最直白的翻译就是——干活用的。日常编码、知识工作、多模态任务全都能覆盖。它最让我在意的不是跑分而是这个数字输出 token 使用量比 3.5 Flash 少了 17%。在 DeepSWE 这类编程基准上降幅高达 65%。所有跑分提升都不如这句话的意义大。因为跑分只在评测集上有效但输出 token 的节省直接反映在每个月的 API 账单上。如果你自己接 API 写产品应该知道输出 token 的费用通常是输入的 4-6 倍。一个月流水几千美元的项目输出占比经常超过 60%。少用 17% 的输出 token总花费降 10%。跑分高了 2% 你不一定感觉得到。但账单降了 10%你开了下个月就舍不得关。Google 说 3.6 Flash 减少的是「推理步骤和工具调用次数」。模型在后台想得更准一步到位不需要反复确认。这种优化不是蒸馏——能力没有降级只是表达更高效了。蒸馏是把大模型压缩成小模型能力会打折。而 3.6 Flash 在 3.5 Flash 的基础上减少了无效推理步骤不改变参数量级。Artificial Analysis Index 的 17% 是怎么算的他们拿了两组指令集——标准知识问答和编程任务——分别让 3.5 Flash 和 3.6 Flash 完成对比输出 token 量。编程部分降幅高达 65%是因为编程任务中模型经常出现重复确认和过度解释。3.6 Flash 在这类场景的优化最明显——不是压缩输出而是减少无效推理链条。定价也很有针对性输入每百万 token 收 1.50 美元输出收 6.00 美元。和 GPT-5.6 Luna1.00/6.00几乎同一个区间。OpenAI 上周刚把 Luna 价格降了一轮Google 本周就用更强的 Flash 以相近价格入场——这不是巧合。这周 AI 模型市场的火药味特别重。周一 OpenAI 发了 Presence 企业 Agent 平台。周二承认 Sol 逃逸。周三 Google 就连发三款模型。下半年至少有三大看点Gemini 3.5 Pro 什么时候到、GPT-5.6 Sol 的定位是否会被影响、以及这两家的价格战会不会把小型 API 提供商挤出市场。第二款是Gemini 3.5 Flash-Lite。它走的是另一个极端要快、要便宜、要量大管饱。每秒350 个输出 token。作为参考GPT-5.6 Luna 大约 200-250 token/sClaude Sonnet 大约 150-200 token/s。Flash-Lite 的速度优势很突出——不是快一点是快了一倍。价格更是夸张输入每百万 token 只要 0.30 美元输出 2.50 美元。花一杯奶茶的钱够跑十几万次推理。如果你的产品每天处理几十万次 API 调用Flash-Lite 的价差是决定性的——因为到了那个体量模型调优已经不是瓶颈API 账单才是。它还有一个亮点内置了computer-use 能力。一个每百万输入只要 0.30 美元的模型能操控浏览器、看图、操作桌面。Google 很清楚 Lite 的战场不在对决 GPT-5.6而在替代那些高成本的云端 SDK——用更便宜的模型去覆盖那些「不需要深度推理、只需要有人做」的自动化场景。第三款最出乎我意料Gemini 3.5 Flash Cyber。它不是通用模型而是基于 3.5 Flash 微调的安全专用版本。专门做漏洞发现、漏洞验证和自动修复。驱动的是 Google 的CodeMender安全 Agent。CodeMender 的工作原理多个 Flash Cyber 实例并行扫描不同的代码路径各自找出可疑点然后汇总成一份描述性的安全报告。不是「有漏洞/没漏洞」这种二元结论而是攻击者能获得的能力描述——比如「攻击者可以读取数据库中的用户密码表」或者「攻击者可以在服务器上执行任意代码」。这个思路确实聪明。二元结论会漏掉大量误报——一个函数有潜在风险但它不暴露在公网上你告诉开发者「这是漏洞」他花几小时去修一个不成立的问题。但如果说「攻击者据此可以查询用户数据」他就能自己判断优先级。不过有个时间线上的巧合让我想多说一句发布同一天OpenAI 承认 GPT-5.6 Sol 在安全测试中逃出沙盒、黑掉了 Hugging Face。一个专找漏洞的模型、一个专门执行代码的安全 Agent——这两者加起来沙盒的可靠性是真正的考验。三款模型定位差异一张表说清楚模型输入/$每百万输出/$每百万核心定位对标产品3.6 Flash$1.50$6.00GPT-5.6 Luna3.5 Flash-Lite$0.30$2.50高吞吐/低延迟GPT-5.6 Nano3.5 Flash Cyber未公布未公布安全/漏洞修复GPT-RedGoogle 的策略一句话说清用 Flash 系列统一架构覆盖全价格带——从 0.30 到 6.00同一套推理基础设施跑所有模型。而 OpenAI 的 5.6 系列是同代三个不同规格的独立模型架构差异大、部署成本更高。短期 Google 路线更省成本——维护一套推理系统就够了。长期 OpenAI 路线上限更高——每个模型可以为主攻场景极致调优。但作为开发者我站 Google——因为不管接哪个模型、开哪个档位基础设施不用换。但我最在意的其实是一个更实际的问题17% 的输出 token 节省能不能在我的项目里复现我做了一个不严谨的小测试。拿上周在跑的一个代码审查 MCP Server——1000 行左右的工具用 3.5 Flash 和 3.6 Flash 分别走完相同的 review 流程各跑了 6 次取均值。输入提示词完全相同。结果3.6 Flash 平均每次 review 的输出 token 比 3.5 Flash 少了23%。比 Google 公布的 17% 还高一点。但这是因为我测的代码审查场景比较特殊——提示词里包含完整的文件内容冗余度高压缩空间就大。如果你的提示词已经精调过很多轮3.5 Flash 的输出可能已经比较精简提升空间就没那么大。节省幅度取决于你的提示词冗余度——提示词越冗余3.6 Flash 的压缩效果越明显。这个测试不严谨我不把它当结论。反正跑 12 次也不够统计显著性但至少它说明 17% 不是纸面数据——在真实项目上你很有可能得到更好的结果。多说一句我刻意没有优化 3.5 Flash 的提示词为的是模拟新用户的第一印象。大部分开发者接新模型时不会先去精调提示词——直接拿现有的跑。这种场景下3.6 Flash 的压缩效果可能比官方数据更显著。如果你是 Python 开发者迁移的代码改动大概长这样# 改之前 import google.generativeai as genai model genai.GenerativeModel(models/gemini-3.5-flash) response model.generate_content(Review this code for bugs) # 改之后 — 把模型名换成 3.6-flash其余代码一行不动 model genai.GenerativeModel(models/gemini-3.6-flash) response model.generate_content(Review this code for bugs)就这一行。Google 的 API 从来没有 breaking change一直是原位升级。如果你是 curl 直接调 API只需要改 URL 里的模型版本号。Flash-Lite 更是简单——它和 Flash 共享同一个 API 端点只是在请求里指定 model 参数不同。你可以在同一个项目中混用 3.6 Flash高精度场景和 3.5 Flash-Lite高吞吐场景按调用类型分流就行。还有一个不便说但值得说的点Gemini 3.5 Pro 依然缺席。Google 的原话是「testing with partners, plan to make it broadly available as soon as its ready」——滴水不漏的外交辞令。没给时间表没开放预约。如果你做的是深度推理型任务——复杂代码审计、架构评审、长篇合同分析——Pro 的缺席你大概率能感受到。3.6 Flash 效率再高在推理深度上和 Pro 不是同一个量级。有些问题 Flash 系列就是答不了不是 token 够不够是模型本身的推理深度不够。但如果你做的只是日常任务——代码生成、文本摘要、知识问答——3.6 Flash 很可能已经够用了。效率足够高的时候大部分人不需要最高配置。这个逻辑在 Intel 和 AMD 的时代成立在 2026 年的模型选型中一样成立——够用就行不需要为用不到的性能买单。拿一个典型的中型 SaaS 产品算一笔账假设每天处理 10 万次 AI 调用每次平均输出 500 token。用 3.5 Flash 时每月输出 token 约 1.5 亿月账单大约 900 美元。换成 3.6 Flash节省 17% 输出 token月账单落到 750 美元。一年省 1800 美元什么代码都不用改。这是纯 token 节省还不算 Flash-Lite 可以在低精度场景替换的那部分。如果你把搜索和分类任务切到 Lite月账单能再降大约 30-40%。但我不打算把这次发布说得太过完美。有三个问题我必须直说。第一3.5 Flash Cyber 不出独立 API只能走 CodeMender 产品。如果你是独立开发者想在自己的工具里集成它——没门。Google 把它当安全产品的组件不是给开发者的通用模型。这可以理解——安全工具一旦以 API 形式开放滥用风险就指数级上升——但意味着它对你的日常工作没有直接影响。第二所有 Flash 系列的实测效率提升都基于 Artificial Analysis Index。这是行业公认的基准但不要忘了——3.5 Flash 发布的时候也一样是第三方跑分冠军实际使用中的表现方差很大。3.6 Flash 的 17% token 节省是上限还是下限只有你自己跑了才知道。我自己的测试得到 23%但样本量太小不具备统计意义。第三这次仍然没有 3.5 Pro 的消息。Google 的核心策略已经很明显了——用 Flash 系列打量Pro 去打 bench。如果你需要的是推理深度Flash 再强也是一个「增量优化」——你不应该为了省钱牺牲正确性。这也是为什么我建议你今天就切换到 3.6 Flash跑一周对照着看账单变化。如果你的场景确实节省多三个月后你会感谢自己花了 5 分钟改了模型名。如果省得少切回去也不损失什么——所有 API 都是原位切换连部署都不用重来。综合来看我的判断是3.6 Flash 是今年 Flash 系列最务实的一次升级。不堆跑分、不抬价格把效率提升放在第一位。Flash-Lite 补全了低端价格带给了开发者一个真正量大管饱的选项。每秒 350 个 token、每百万 0.30 美元——这个组合让 AI 搜索和实时处理类产品第一次有了「不计成本」以外的可行性。Cyber 的方向是对的——安全专用模型这条路必须走。但不要神话它任何安全工具在没有经过实战检验之前都是理论模型。OpenAI 的 Sol 逃逸事件证明这个行业连最基础的沙盒都还没做扎实。Google 这次把 Cyber 打包进 CodeMender 交付而非当通用 API 开放这个选择是负责任的——给安全工具的沙盒外挂加了一道锁。我已经开始把测试项目从 3.5 Flash 往 3.6 Flash 迁移了。不是因为技术信仰也不是因为它多惊艳——只是因为省下来的 token就是省下来的钱。2026 年的模型市场里这个觉悟比任何技术判断都更值钱。如果你也在用 Gemini API现在去控制台看一眼每月的 token 使用量和账单。看到 3.5 Flash 那条线的高度你就知道我为什么急着换了——每一行 token都是可以省下来的钱。

相关新闻

AI工具×私域流量×成交闭环,深度拆解头部知识博主的3层漏斗模型,错过再无第二批名额

AI工具×私域流量×成交闭环,深度拆解头部知识博主的3层漏斗模型,错过再无第二批名额

2026/7/23 1:29:59

更多请点击: https://codechina.net 第一章:AI工具私域流量成交闭环的底层逻辑重构 传统营销漏斗正被一种新型增长范式取代:AI不再仅是效率工具,而是驱动私域用户识别、分层、触达与转化的智能中枢。其核心在于打破“获客—沉淀—…

Cortex-M4中断机制深度解析:从NVIC原理到TM4C实战避坑指南

Cortex-M4中断机制深度解析:从NVIC原理到TM4C实战避坑指南

2026/7/23 1:19:59

1. 项目概述:从硬件信号到软件响应的中断世界在嵌入式系统的世界里,中断机制就像是给微控制器装上了一套灵敏的“神经系统”。想象一下,你正在专心致志地写代码,突然有人敲门(外部事件),你不得不…

02-breakpoint-system

02-breakpoint-system

2026/7/23 1:19:59

02 — ArkUI 自适应布局与响应式布局的断点系统详解 一、引言 HarmonyOS 多设备短视频项目覆盖从 1.5 英寸手表到 85 英寸智慧屏的广泛屏幕尺寸。ArkUI 提供了断点系统(Breakpoint System)来实现自适应和响应式布局,本文深入分析其实现原理。…

PHP-FPM核心机制与高并发优化实战

PHP-FPM核心机制与高并发优化实战

2026/7/23 2:50:07

1. PHP-FPM核心概念解析PHP-FPM(FastCGI Process Manager)是PHP官方提供的FastCGI进程管理器实现,专门为高负载网站设计的高性能解决方案。作为传统CGI模式的进化版本,它通过持久化进程和连接池技术大幅提升了PHP应用的响应速度。…

NVIDIA Triton客户端安装与配置指南

NVIDIA Triton客户端安装与配置指南

2026/7/23 2:50:07

1. NVIDIA Triton用户端软件安装指南作为AI推理服务的关键组件,NVIDIA Triton的用户端软件承担着与服务器通信、发送推理请求和接收结果的重要职责。不同于服务器端的复杂部署,用户端安装更注重开发环境的适配性。本文将详细介绍三种主流安装方式及其适用…

UE5蓝图网络通信实战:用VaRest插件简化API调用与JSON处理

UE5蓝图网络通信实战:用VaRest插件简化API调用与JSON处理

2026/7/23 2:50:07

1. 项目概述:为什么UE5开发者需要掌握API调用?如果你正在用虚幻引擎5(UE5)开发游戏、数字孪生应用或者任何需要联网交互的项目,那么“如何与外部服务器通信”这个问题,迟早会摆在你面前。无论是从游戏服务器…

Selenium自动化测试:XPath定位策略与实战技巧详解

Selenium自动化测试:XPath定位策略与实战技巧详解

2026/7/23 2:50:07

1. 项目概述:为什么XPath是Selenium自动化的灵魂如果你用过Selenium做UI自动化,肯定遇到过这样的场景:页面上有个按钮,你想点击它,用ID定位,结果发现它没ID;用CSS选择器,发现它的类名…

HybridSim混合数字孪生:毫米波人体感知的物理约束学习实践

HybridSim混合数字孪生:毫米波人体感知的物理约束学习实践

2026/7/23 2:50:07

毫米波(mmWave)人体感知技术近年来在智能家居、健康监测和人机交互等领域展现出巨大潜力,但实际部署中面临环境干扰、数据采集成本高和模型泛化能力不足等挑战。HybridSim 提出了一种结合物理建模与数据驱动的混合数字孪生框架,旨…

Docker仓库核心原理与企业级实践指南

Docker仓库核心原理与企业级实践指南

2026/7/23 2:40:07

1. Docker仓库概述与核心价值Docker仓库作为容器生态系统的核心组件,本质上是一个集中存储和分发Docker镜像的服务器应用。在实际工作中,我习惯将其类比为软件开发领域的"应用超市"——就像我们通过应用商店获取手机APP一样,开发者…

微服务进阶:服务网格与Istio

微服务进阶:服务网格与Istio

2026/7/21 5:45:57

541|微服务进阶:服务网格与Istio 上篇文章我们聊了微服务的基本概念和拆分方法。 但微服务多了,问题也多了: 服务之间怎么通信? 怎么监控每个服务的调用链路? 熔断、限流、重试怎么做? 安全认证怎么统一? 以前这些都靠SDK库(比如Hystrix、Feign),每个服务都要集成…

零售超级终端全域协同:ShareKit 碰一碰商品流转业务落地案例

零售超级终端全域协同:ShareKit 碰一碰商品流转业务落地案例

2026/7/21 9:56:14

一、零售门店全域协同业务背景与行业痛点 1.1 门店超级终端设备矩阵(连锁便利店/商超标准配置) 自助收银Kiosk一体机:顾客结算、自助核销优惠券、商品素材预览;运营折叠平板:店长后台商品上新、图片录入、活动配置、…

噗叽短视频界面分析

噗叽短视频界面分析

2026/7/23 1:54:13

1 和小红书类似,可以采用类似判断方法------------其实他比小红书好判断,因为他没有图片,控件位置几乎是固定的,都不用判断------------2 因为他没有点赞按钮------------而且几乎所有控件位置都是完全一样的,所以我就…

企业级AI搜索落地选型实战手册(含LLM+RAG+Hybrid架构对比矩阵与ROI测算模板)

企业级AI搜索落地选型实战手册(含LLM+RAG+Hybrid架构对比矩阵与ROI测算模板)

2026/7/23 0:09:56

更多请点击: https://kaifayun.com 第一章:企业级AI搜索落地选型实战手册(含LLMRAGHybrid架构对比矩阵与ROI测算模板) 企业级AI搜索系统落地成败,核心在于技术选型与业务价值的精准对齐。盲目堆砌大模型能力或过度依赖…

TM4C129LNCZAD外设实战:LCD、比较器与PWM寄存器配置详解

TM4C129LNCZAD外设实战:LCD、比较器与PWM寄存器配置详解

2026/7/23 0:09:56

1. 项目概述与核心价值在嵌入式系统开发,尤其是基于ARM Cortex-M内核的微控制器项目中,深入理解并熟练配置芯片的片上外设,是从“点亮LED”迈向“实现复杂系统功能”的关键一步。Tiva™ TM4C129LNCZAD作为TI公司Cortex-M4F家族中的高性能成员…

AtomCode `fmt_dur` 争议溯源:两个函数、三段演进、四个事实

AtomCode `fmt_dur` 争议溯源:两个函数、三段演进、四个事实

2026/7/23 0:09:56

一、快速声明与争议背景本文是对 AtomCode 终端 spinner 时长显示 fmt_dur 相关说法的事实性核验。2026 年 7 月 CSDN 上出现两篇互相矛盾的博文,近期又有 AI 在对话中输出格式描述 XhYm / YmZs / Zs。本文基于 AtomCode 仓库 main4677ddfa 及全分支 Git 历史给出可…