智谱GLM-5.3-Flash低价挑战DeepSeek,AI大模型性价比之王要易主?

发布时间:2026/8/29 11:30:11

智谱GLM-5.3-Flash低价挑战DeepSeek,AI大模型性价比之王要易主?
【智谱挑战DeepSeek】当了这么久的“价格屠夫”DeepSeek终于也等来了砍向自己的一刀动刀的是智谱。智谱AI刚刚发布的GLM-5.3-Flash即是风靡海外社区的神秘大模型OX Alpha也是GLM-5系列里的第一个原生多模态模型。【GLM-5.3-Flash性能与价格优势】虽它的名字带着Flash但性能可一点都不Flash特别是在Artificial Analysis Intelligence Index上它拿下57分高于DeepSeek V4 Pro正式版的53分连官方也毫不谦虚说在某些口径上性能甚至可以对标之前Claude的旗舰Opus 4.8。据悉GLM-5.3-Flash最震撼的莫过于模型一上线就把“便宜”两个字写在了脸上。每百万Token输入0.8元、输出2.8元甚至还有两周限时半价优惠。能力可以对标Opus 4.8价格却只有它的1/40甚至比“价格屠夫”DeepSeek的闲时价格还要低。而这恰恰是DeepSeek最熟悉的打法。前脚主打超绝性价比的DeepSeek开始执行峰谷定价涨幅最高可达1100%后脚GLM-5.3-Flash就价格压到了“日常消耗品”的区间。难道AI大模型性价比之王要“改朝换代”了【从“牛来”模型说起】要了解GLM-5.3-Flash还是得从一头神秘的“牛”说起。8月20日AI聚合平台OpenRouter突然上线了一个名为Ox Alpha的匿名模型。没官宣、没预热没有公布开发者没有披露参数规模更没有给出技术报告堪称“野模”。适逢动画电影《牛来》走红而“Ox”本身就是“牛”的意思于是中文开发者顺手借梗把Ox Alpha叫成了“牛来”模型。“野模”虽“野”却相当大方Ox Alpha可以接收文本、图片和视频输入输出文本匿名测试版本还提供104万Token上下文然而开发者调用它却不用花一分钱全部由模型公司买单。这种几乎“白嫖”的方式让Ox Alpha迅速走红。上线不到一天Ox Alpha同时登顶了OpenRouter和OpenCode两个调用量榜创下了OpenRouter的模型发布纪录终结了DeepSeek连续56天霸榜的纪录。就连Hermes Agent创始人也震惊发文这个模型正在屠杀我们所有的内部基准究竟发生了什么一时间猜测Ox Alpha背后的“爹妈”成为了开发者社区的新乐子。毕竟能拿出这种性能模型的还出手如此阔绰的背后大概率不会是个“无名之辈”。事实上果真如此。背后是智谱这样的头部大模型公司当然解释了它为什么有底气替全球开发者买单。但再家大业大也经不起海量Token一直免费烧下去。Ox Alpha敢于如此阔绰还因为这头“牛”看着块头很大饭量却比想象中小得多。GLM-5.3-Flash拥有3200亿总参数但每处理一个Token只会激活约180亿参数占比只有5.6%。面对104万Token的超长上下文它又把线性注意力和稀疏注意力结合起来尽量减少处理海量历史信息所需的计算量。两套设计服务的其实是同一个目标模型看起来是个3200亿参数的大块头实际账单却尽量不按3200亿参数来开。这才是智谱出手阔绰的另一层底气公司负责兜底模型自己也得学会省钱。现在回头看Ox Alpha匿名期间的免费大放送本身也像是一场“低成本宣言”。海量Token全部由智谱买单除了测试模型、制造热度也是在向开发者证明智谱敢把调用量彻底放开是因为这款模型本身就没有想象中那么烧钱。总价下来就是一句话这头“牛”确实吃得不多。【瞄准Agent场景】到了Agent场景这一点就更加重要了。一次任务可能连续调用模型几十次甚至上百次单次调用省下的一点成本最终都会被高频调用不断放大。所以GLM-5.3-Flash的架构真正瞄准的是让Agent把大模型当成一种可以高频消耗的基础设施。而在开发者心中“性能强、价格低、可以放心调用”这些标签过去几乎都属于DeepSeek。智谱真正想冲击的恐怕正是DeepSeek最值钱的性价比招牌。【发布时间巧妙】GLM-5.3-Flash发布的时间点相当巧妙。7月31日DeepSeek V4 Flash正式版上线后OpenCode上的使用量单日增长了30%OpenCode Go的新订阅用户也增长了30%。仅8月1日一天DeepSeek V4 Flash的单日处理量就高达8万亿Token。但8月17日DeepSeek的新版定价正式生效。DeepSeek V4 Pro高峰时间段涨幅最高达1100%DeepSeek V4 Flash峰时输出价格也从0.28美元提高到1.32美元涨了4.71倍。大幅涨价最直接的影响就是开发者开始用脚投票。此前流出的梁文锋录音中他曾提到智能需求没有弹性。但现实似乎没那么简单尤其对于轻量级模型。涨价后DeepSeek的日Token用量很快跌到了此前峰值的一半以下。OpenCode CEO甚至估算平台因此空出了接近10万亿Token的日需求。偏偏就在这个时候披着“牛来”外套的GLM-5.3-Flash来了。【价格对比】GLM-5.3-Flash堪称“便宜大碗”每百万Token缓存未命中输入0.8元、输出2.8元相当于GLM-5.3的十分之一。上线后还有两周限时半价优惠缓存未命中输入0.4元、输出1.4元缓存命中输入0.115元优惠一直持续到2026年9月9日24时。按这组最显眼的价格来看GLM-5.3-Flash确实杀气腾腾。但要判断GLM-5.3-Flash究竟有没有砍到DeepSeek只看缓存未命中输入和输出还不够。因为到了真实的Agent场景缓存命中价格反而可能成为账单的大头。所谓缓存命中可以简单理解成Agent反复调用模型时经常会带着相同的系统提示词、工具定义、历史对话和代码。这些内容平台此前已经计算过下一次可以直接复用。既然是用过的东西再拿出来用那价格当然也比“缓存未命中”的便宜。这在普通聊天里可能没那么重要但Agent完成一次任务往往要连续调用模型几十次甚至上百次同一套任务背景和历史记录会被反复塞进上下文。特别是写代码这类输入很长、输出相对较短的任务缓存命中价格会更多地影响账单。这也是智谱定价里藏着的一点小心思。它在宣传中重点突出每百万Token输入0.8元、输出2.8元以及限时半价后的0.4元和1.4元。按照缓存未命中输入和输出比较GLM确实比DeepSeek便宜。但GLM-5.3-Flash的标准缓存命中价格是0.23元半价期间也要0.115元。DeepSeek V4 Flash峰时只要0.1元谷时更低至0.05元。只看缓存这一项即便在半价期间GLM也比DeepSeek峰时更贵恢复原价后更是DeepSeek峰时的2.3倍、谷时的4.6倍。假设一个Agent任务累计输入50万Token其中99%命中缓存最终只输出1万Token。也就是49.5万Token按照缓存命中计费剩下5000 Token按照缓存未命中计费。优惠结束后这个任务使用GLM-5.3-Flash大约需要0.146元使用DeepSeek V4 Flash谷时只需要约0.077元峰时则需要约0.155元。按照这个假设同一个任务GLM比“梁文谷”贵了接近90%只比“梁文峰”便宜了不到6%。这也解释了为什么有开发者实际使用后发现GLM综合用下来比DeepSeek谷时更贵只是比峰时便宜对于高缓存命中的Agent任务GLM在输入和输出上省下的钱很容易被更贵的缓存吃掉。更关键的是智谱的半价优惠只有两周9月10日就会恢复原价。所以GLM-5.3-Flash只能砍过“梁文峰”却未必砍得过“梁文谷”。但除了缓存命中GLM-5.3-Flash其他方面的定价确实全面低于DeepSeek。【国产算力支撑】DeepSeek已经够便宜了智谱究竟是怎么在保持不错性能的同时还把价格地板继续打穿的而答案就藏在支撑这头“牛”的算力里。不光模型出自国内撑住这波全球海量真实流量的算力用的也是国产方案。匿名上线期间Ox Alpha单日处理量一度达到约62万亿Token线上流量全部由10万张国产芯片扛下。有媒体报道这些芯片可能来自华为、摩尔线程和海光。当然把10万张卡堆在一起并不会自动变成一套高效的推理系统。按照智谱的说法这批国产芯片面临的主要瓶颈是内存容量和带宽。为了支撑最长104万Token的上下文智谱在SGLang基础上搭建了一套专用推理引擎把多模态编码、提示词预填充和逐Token解码拆开分别进行调度和扩缩容再通过量化、并行和内存优化尽可能把国产芯片的性能榨出来。更有意思的是这套系统的优化也有GLM-5.3自己参与。智谱用Infra Agent协助工程师开发和优化算子、诊断性能瓶颈、改进部署服务栈形成了一个“模型优化系统系统承载模型”的循环。智谱称与同一批硬件上的初始基线相比这套系统的端到端服务性能提升了3倍硬件效率和单Token成本已经达到主流英伟达GPU的水平。国外半导体研究机构SemiAnalysis也评价称英伟达的护城河再次受到了考验。模型架构负责少算推理系统负责把国产芯片的性能尽量榨出来两者合在一起才构成了智谱继续压低价格的工程底座。这当然不是说国产芯片已经全面追上英伟达。10万张国产卡承载全球开发者的真实流量能够证明的是这套系统已经具备大规模服务能力至于硬件效率和单Token成本是否真正达到主流英伟达GPU的水平目前仍主要来自智谱自己的测算。但这头“牛”真正难缠的地方是它背后站着的除了一个国产模型还有一整套被真实流量压过的国产算力方案。对于DeepSeek来说这恐怕比单纯的低价更棘手。你是否会关注GLM-5.3-Flash后续的发展呢

相关新闻

Godot 多存档槽:3 层实现加 4 个高频坑的存档搭建指南

Godot 多存档槽:3 层实现加 4 个高频坑的存档搭建指南

2026/8/29 11:30:11

Godot 多存档槽:3 层实现加 4 个高频坑的存档搭建指南 【免费下载链接】godot Godot Engine – Multi-platform 2D and 3D game engine 项目地址: https://gitcode.com/GitHub_Trending/go/godot 测试时玩家总反馈进度被覆盖:昨天打到第三关&…

OpenCV 上手指南:3 条路径把计算机视觉跑起来

OpenCV 上手指南:3 条路径把计算机视觉跑起来

2026/8/29 11:30:11

OpenCV 上手指南:3 条路径把计算机视觉跑起来 【免费下载链接】opencv Open Source Computer Vision Library 项目地址: https://gitcode.com/GitHub_Trending/opencv31/opencv OpenCV(Open Source Computer Vision Library,开源计算机…

给 HiC_tools 这个 Hi-C 分析工具库贡献新工具:3 步 PR 流程,一次过审

给 HiC_tools 这个 Hi-C 分析工具库贡献新工具:3 步 PR 流程,一次过审

2026/8/29 11:30:11

给 HiC_tools 这个 Hi-C 分析工具库贡献新工具:3 步 PR 流程,一次过审 【免费下载链接】awesome-public-datasets A topic-centric list of HQ open datasets. 项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-public-datasets 你常用…

Design Compiler:边界优化(Boundary Optimization)

Design Compiler:边界优化(Boundary Optimization)

2026/8/29 12:30:14

相关阅读 Design Compilerhttps://blog.csdn.net/weixin_45791458/category_12738116.html?spm1001.2014.3001.5482 前言 默认情况下,Design Compiler在综合时不会跨越层次结构进行优化,这会导致一些关键路径的逻辑无法得到简化。边界优化(Boundary O…

AIGC创作风格迁移方法介绍

AIGC创作风格迁移方法介绍

2026/8/29 12:30:14

在内容创作过程中,风格是作者独特个性的体现,也是文章吸引读者的重要因素。风格可以涵盖语言的选择、句子的构造及情感色彩的渲染等多个方面。例如正式的风格可能更适用于严谨的学术论文,而轻松幽默的笔触则可能让博客文章更加引人入胜。 对于…

Google无需LLM冠军,生态与落地才是决胜关键

Google无需LLM冠军,生态与落地才是决胜关键

2026/8/29 12:30:14

Google 不需要拿 LLM 冠军,但绝不能缺席。这个判断可能和很多人看到的“排行榜焦虑”不太一样。LLM 领域每隔一段时间就会冒出一个“最强模型”,但排名变化太快,真正决定长期位置的,从来不是单一模型的 benchmark 分数&#xff0c…

一年半前端面试Shopee复盘:项目深挖与算法准备的实战心得

一年半前端面试Shopee复盘:项目深挖与算法准备的实战心得

2026/8/29 12:30:14

面试这事,真的很看缘分,但也真的很看准备。我在写这篇文章的时候,特意回看了自己当初一年半经验时投 Shopee 那段时间的记录和聊天截图,一边看一边冒冷汗。不是因为表现多差,而是因为我发现自己对"面经"这两…

Unscrambler:从黑箱到白箱,用PCA与PLSR实现可解释的数据建模

Unscrambler:从黑箱到白箱,用PCA与PLSR实现可解释的数据建模

2026/8/29 12:30:14

1. 从“黑箱”到“白箱”:为什么Unscrambler是数学建模的“翻译官” 如果你参加过数学建模竞赛,或者在工作中处理过一堆数据,你大概率经历过这样的场景:你费了九牛二虎之力,用Python或MATLAB跑出了一个看起来不错的模型…

Spring Boot月度绩效考核系统源码解析与本地部署实战

Spring Boot月度绩效考核系统源码解析与本地部署实战

2026/8/29 12:20:13

简介:在企业管理系统中,绩效考核模块常被视为核心业务之一,它涉及角色权限、数据隔离、流程状态与报表统计等典型技术点。基于Spring Boot、MyBatis Plus和MySQL等主流技术栈构建的后台管理系统,通过RBAC权限模型实现员工、主管、…

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

2026/8/27 11:10:02

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

2026/8/29 10:22:10

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

2026/8/28 7:34:42

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

四款热门降AI工具测评:研究生和本科生怎么选?

四款热门降AI工具测评:研究生和本科生怎么选?

2026/8/29 0:09:39

马上要交论文了,最近真的被论文ai率折磨的够呛。 明明查重都没问题了,但是ai率就是居高不下,崩溃了,明明都是我自己写的,天杀的,明明都是我亲生的啊 改来改去,终于给我搞出一套完美的降ai方案…

论文降AI率免费攻略:自查、提示词与工具推荐

论文降AI率免费攻略:自查、提示词与工具推荐

2026/8/29 0:09:39

马上要交论文了,最近真的被论文ai率折磨的够呛。 明明查重都没问题了,但是ai率就是居高不下,崩溃了,明明都是我自己写的,天杀的,明明都是我亲生的啊 改来改去,终于给我搞出一套完美的降ai方案…

北京GEO优化服务商推荐:预算型企业如何选北京GEO优化服务商?

北京GEO优化服务商推荐:预算型企业如何选北京GEO优化服务商?

2026/8/29 0:09:39

前言:预算有限的企业更关心投入能否形成可持续的品牌资产。评估北京GEO优化服务商时,不能只比较单篇内容或单月报价,还要看是否能够把问题词、官网、信源和监测串成完整链路。本期重点放在预算配置、试点范围和交付边界,帮助企业先…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/28 7:35:26

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/28 7:34:51

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/28 7:34:35

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…