我实测了千问 3.8 Max:强是真强,但是别着急,看完再决定用不用

发布时间:2026/7/23 16:50:49

我实测了千问 3.8 Max:强是真强,但是别着急,看完再决定用不用
2.4 万亿参数、仅次于 Fable 5、即将开源——阿里这次口号喊得震天响。我花了一天时间把它翻了个底朝天说点大实话。7 月 19 号千问团队静悄悄地把 Qwen 3.8 Max Preview 扔上了线。没有发布会没有预热就一条推文「这是除了 Fable 5 外最强大的模型」。2.4 万亿参数原生多模态即将开源。听上去牛逼得不行。但我这个人比较俗不看广告看疗效。于是花了一天时间在 Qoder千问的编程 IDE和网页版上把它里里外外测了个遍。先说结论能用有些场景甚至让人眼前一亮。但别急着把你的主力模型切过来它还是个预览版坑不少。先搞清楚你现在拿到的是什么这是一个 Preview 预览版不是正式版。什么概念没有公开的 Benchmark 跑分表没有技术报告没有激活参数量没有开源权重连许可证长什么样都不知道——这些官方自己都没拿出来。官方说的是「正式版出了之后会开放完整权重」。所以你现在拿到手的跟最终成品可能会有不小差距。举个例子之前腾讯 Hy3 的预览版和正式版时隔三个月简直像两个模型。但 Preview 也不是完全不能用。它已经在千问官网、Token Plan API、Qoder 和 QoderWork 全量开放了。Qoder 里甚至可以直接把上下文拉到 100 万 token百万字级别这一点是实打实的。哪些场景让我觉得「行啊千问」复杂数据仪表盘——最强的加分项第三方评测机构 ZPedia 用一套很硬核的题目测了它。其中一道是给定 28 条多模型 API 运行记录制作一个运营驾驶舱包含五项核心指标、四类图表、三级筛选、异常检测规则和成本模拟器。Qwen 3.8 交出了一个 1203 行的单文件 HTML。柱状图、折线图、气泡散点图、环形图全部用原生 SVG 生成没有依赖任何第三方库。五项指标默认视图的数值跟标准答案完全一致。这说明什么模型第一反应不是画个好看的壳而是先把数据层的计算逻辑理顺再让图表和指标共用同一份状态。 这种「先算对再画好看」的思维方式在真实业务场景比跑分重要得多。复杂规则仿真系统——逻辑能力到位同一组测试里还有道变态题给一个 24×16 的建筑网格12 个人员、4 扇防火门、2 个出口、1 个烟雾源要求写一个完整的疏散仿真沙盘。烟雾会扩散门会在特定时间关闭人要根据当前状态动态重新规划路线。Qwen 3.8 用 724 行代码搞定了。不是写死轨迹的那种「伪仿真」而是建立了网格、门、人员、烟雾、出口六类独立状态以 0.5 秒为步长推进用 A* 寻路算法动态计算路径。我们验证了 12 名人员的初始路径长度全部跟标准答案对得上。数据到视频的端到端生成还有一道题是给一组 JSON 格式的服务异常和恢复数据直接生成一支可播放的复盘视频 MP4。还别说Qwen 3.8 真的干出来了——1920×1080、30fps、15 秒、H.264 编码。延迟曲线随时间上升、恢复阶段的指标向改善方向运动、片头片尾文案完整——而且所有文字是程序化绘制的没有生成式视频常见的跳字和变形问题。从结构化数据到一支能直接用的视频这是一个完整的生产闭环。网站和前端开发——基本功扎实我在 Qoder 里让它做了几个网页。一个个人作品集首页第一版就带了缓入缓出的过渡动画审美在线。Qoder 内置了 161 种风格参考Airbnb、Apple、Figma 等可以直接套用。简单前端需求它是真的能省时间。哪些场景让我直摇头3D 复杂场景——翻车了我让它做一个「莫奈吉维尼睡莲花园」的 Three.js 3D 体验场景。提示词写得很详细整片池塘就是一幅画水面和花园由漂浮的纯色笔触构成可以乘船穿行。结果第一次交付完全是碎片在旋转看不出任何花园的样子。第二次让它修正勉强能看到桥的形状了但跟「莫奈花园」的关系大概就是几片绿和几个圆圈。跟 Fable 5 的 3D 能力比差了一个档次。3D 魔方——直接崩溃ZLedia 的评测里同一套题目下的 3D 魔方任务——需要实现真正可玩的 3×3×3 魔方包括六面旋转、算法队列、撤销重做、25 步确定性打乱。Qwen 3.8 在分析阶段表现得相当出色它主动检查了动画速度、非法算法拒绝、撤销重做历史、Promise 语义等。看思考过程你以为稳了。结果写到一半直接 Internal error: terminated。这对于开发者意味着什么你花了 token、时间眼看着推理质量很高结果最后一步崩了前功尽弃。这种不稳定性是真没法放进工作流里。视觉还原——八成功力差两成细节让它复刻 NASA Webb 太空望远镜的网页——结构识别得很准双层导航、正文区域、八类图片分类全对。Logo 用 SVG 重绘、底部天文图用 Canvas 生成断网也能看。但整体缩小了一圈。 它知道页面上有什么但不知道这些东西在屏幕上该占多大。留白不够、对比度偏低、信息密度差了那么一口气。简单说能用但不精致。速度慢多个评测都提到同一个问题——它比 Kimi K3 慢。一个 3D 任务深度思考能跑几十秒出来的结果还不一定对。对需要快速迭代的场景这个等待成本不小。幻觉率偏高有评测指出Qwen 3.8 Preview 的幻觉率不低尤其长任务中容易出现编造。Kimi K3 的幻觉率虽然也高51%但至少基准性能更强容错空间大一些。一张表说清楚Qwen 3.8 vs 竞品我的真实建议什么人现在可以试试你已经在阿里云生态里百炼平台上跑着其他千问模型想看看新旗舰的能力天花板在哪你做的工作偏数据分析、报表生成、API 数据转可视化Qwen 3.8 在这个领域确实有新意你对视频自动生成有需求5 个 Case 里视频那道表现最完整你就是好奇拿 Token Plan 的免费额度玩玩——反正不亏什么人千万别急着换你的生产环境跑了千问 3.7稳定运行中——别动。3.7 是成熟产品3.8 是 Preview两者可能差一个季度以上的打磨。你做 3D 网页、游戏原型、视觉设计类任务——目前的 3.8 Preview 还不如 Kimi K3你需要把模型部署在自己服务器上——权重没出来就算出来了2.4T 参数你也没法跑你的工作流有交付截止日期——一次崩溃就够你受的你在做财务、医疗等对幻觉零容忍的场景——Preview 的幻觉率还不靠谱最后一句话Qwen 3.8 Max 不是一个能「平替 Fable 5」的模型但它确实在某些领域数据结构化、Agent 长程逻辑、数据到视频做出了让人愿意继续关注的东西。问题在于现在拿到的只是一个 Preview而且 Preview 和最终版可能差很远。所以我不会说「赶紧上车」——我会说「再等等等正式版和权重出来看独立评测机构的分数再决定要不要认真用」。这批国产万亿模型Kimi K3、Qwen 3.8、DeepSeek V4 正式版的节奏已经越来越快。再过一两个月这片天可能又不一样了。以上数据均采用与芯云token调取www.xinyuntoken.com/sign-up?aff… Kimi K3 或其他模型欢迎在评论区交流测试方法和结果。

相关新闻

CDN能力边界的技术探讨与实践

CDN能力边界的技术探讨与实践

2026/7/23 16:40:49

1. 项目概述:CDN能力边界的技术探讨 最近在技术社区看到不少关于CDN(内容分发网络)功能局限性的讨论,作为一个在基础设施领域摸爬滚打多年的从业者,我发现很多观点存在明显的认知偏差。这次我们不谈CDN能做什么&#x…

如何借助节气装置,实现氩弧焊40%-60%节气率?

如何借助节气装置,实现氩弧焊40%-60%节气率?

2026/7/23 16:40:49

一、前言:手工氩弧焊车间普遍存在的氩气浪费痛点从事机械制造、钢结构加工、五金精密焊接的一线从业者和车间管理者都清楚,手工氩弧焊的隐性生产成本非常高。除了焊丝、电费、人工工时、设备折旧之外,氩气消耗是多数工厂最容易被忽视的大额耗…

A股量化策略日报(2026年07月23日)

A股量化策略日报(2026年07月23日)

2026/7/23 16:40:49

A股量化策略整合报告 2026年07月23日 整合时间:08:20📊 报告自动同步 (03:16) Response API call failed after 3 retries: HTTP 429: 已达到 Token Plan 用量上限:请升级 Token Plan 套餐或购买积分补充用量。 (2056)📊 量化策略…

2026年7月22日科技热点新闻

2026年7月22日科技热点新闻

2026/7/23 17:30:51

科技热点速览|2026年07月22日 国内外技术动态 定位:技术资讯简报,仅客观记录新技术发布、产品迭代与项目进展,不含主观评价。 国内科技动态2026世界人工智能大会(WAIC)正式闭幕。大会为期四天,汇…

TI Tiva™ MCU HIB模块深度解析:精准低功耗休眠与唤醒实战

TI Tiva™ MCU HIB模块深度解析:精准低功耗休眠与唤醒实战

2026/7/23 17:30:51

1. 项目概述与HIB模块核心价值 在物联网节点、便携式医疗设备或者野外环境监测仪这类对功耗极其敏感的应用里,工程师们最头疼的问题往往不是功能实现,而是如何让设备在“待机”时近乎“假死”,同时又能精准地在需要的时候“醒来”。我经手过不…

Seedance 2.0第三方创作工具怎么选?商用视频工作流评估指南

Seedance 2.0第三方创作工具怎么选?商用视频工作流评估指南

2026/7/23 17:30:51

Seedance 2.0第三方创作工具怎么选?商用视频工作流评估指南 选择Seedance 2.0第三方创作工具,不能只看“能不能生成视频”,还要看它是否适合你的创作角色与交付流程。FusionAI(融艺 AI),属于面向电商、品牌…

2026 AI Agent 工具选型指南:搭建类工具与搜索增强工具搭配方案

2026 AI Agent 工具选型指南:搭建类工具与搜索增强工具搭配方案

2026/7/23 17:30:51

2026 年,AI Agent 产业进入规模化落地阶段,对应的工具生态也日趋完善,从零代码搭建平台到企业级商用方案,从开源开发框架到海外成熟产品,各类工具覆盖了不同技术能力、不同业务规模的用户需求,基本解决了搭…

企业地址数据治理指南|空间智能厂商,深度解析技术能力

企业地址数据治理指南|空间智能厂商,深度解析技术能力

2026/7/23 17:30:51

存量地址杂乱、口语化地址无法识别、企业经营地址难以核验,是全行业数字化转型普遍遇到的空间数据难题,挑选适配自身业务的空间智能服务商,需要从底层数据资产、技术解析能力、行业适配度多维度评判,丰图科技依托 4 亿标准地址、100 亿语义地址数据底座,成为覆盖全行业的通用型…

Claude Code周限额提升50%:AI编程助手高效使用指南

Claude Code周限额提升50%:AI编程助手高效使用指南

2026/7/23 17:20:51

Claude Code 用户注意:官方刚刚宣布周限额提升 50%,这个福利将持续到 8 月 19 日。对于经常使用 Claude Code 进行编程辅助的开发者来说,这意味着一周内可以处理更多的代码任务、获得更长时间的 AI 编程支持。 这次限额提升直接关系到每个用…

微服务进阶:服务网格与Istio

微服务进阶:服务网格与Istio

2026/7/23 3:40:08

541|微服务进阶:服务网格与Istio 上篇文章我们聊了微服务的基本概念和拆分方法。 但微服务多了,问题也多了: 服务之间怎么通信? 怎么监控每个服务的调用链路? 熔断、限流、重试怎么做? 安全认证怎么统一? 以前这些都靠SDK库(比如Hystrix、Feign),每个服务都要集成…

零售超级终端全域协同:ShareKit 碰一碰商品流转业务落地案例

零售超级终端全域协同:ShareKit 碰一碰商品流转业务落地案例

2026/7/23 4:40:05

一、零售门店全域协同业务背景与行业痛点 1.1 门店超级终端设备矩阵(连锁便利店/商超标准配置) 自助收银Kiosk一体机:顾客结算、自助核销优惠券、商品素材预览;运营折叠平板:店长后台商品上新、图片录入、活动配置、…

噗叽短视频界面分析

噗叽短视频界面分析

2026/7/23 1:54:13

1 和小红书类似,可以采用类似判断方法------------其实他比小红书好判断,因为他没有图片,控件位置几乎是固定的,都不用判断------------2 因为他没有点赞按钮------------而且几乎所有控件位置都是完全一样的,所以我就…

企业级AI搜索落地选型实战手册(含LLM+RAG+Hybrid架构对比矩阵与ROI测算模板)

企业级AI搜索落地选型实战手册(含LLM+RAG+Hybrid架构对比矩阵与ROI测算模板)

2026/7/23 0:09:56

更多请点击: https://kaifayun.com 第一章:企业级AI搜索落地选型实战手册(含LLMRAGHybrid架构对比矩阵与ROI测算模板) 企业级AI搜索系统落地成败,核心在于技术选型与业务价值的精准对齐。盲目堆砌大模型能力或过度依赖…

TM4C129LNCZAD外设实战:LCD、比较器与PWM寄存器配置详解

TM4C129LNCZAD外设实战:LCD、比较器与PWM寄存器配置详解

2026/7/23 0:09:56

1. 项目概述与核心价值在嵌入式系统开发,尤其是基于ARM Cortex-M内核的微控制器项目中,深入理解并熟练配置芯片的片上外设,是从“点亮LED”迈向“实现复杂系统功能”的关键一步。Tiva™ TM4C129LNCZAD作为TI公司Cortex-M4F家族中的高性能成员…

AtomCode `fmt_dur` 争议溯源:两个函数、三段演进、四个事实

AtomCode `fmt_dur` 争议溯源:两个函数、三段演进、四个事实

2026/7/23 0:09:56

一、快速声明与争议背景本文是对 AtomCode 终端 spinner 时长显示 fmt_dur 相关说法的事实性核验。2026 年 7 月 CSDN 上出现两篇互相矛盾的博文,近期又有 AI 在对话中输出格式描述 XhYm / YmZs / Zs。本文基于 AtomCode 仓库 main4677ddfa 及全分支 Git 历史给出可…