Kimi K3 发布当天,我拿它和 GPT-5.6-Luna、Claude Sonnet 5 跑了 5 轮硬核编程题——有一类多步推理任务排名和官方宣传完全反过来

发布时间:2026/7/23 23:11:05

Kimi K3 发布当天,我拿它和 GPT-5.6-Luna、Claude Sonnet 5 跑了 5 轮硬核编程题——有一类多步推理任务排名和官方宣传完全反过来
上周三 Kimi K3 发布朋友圈被刷屏了。Moonshot 官方宣传说推理能力大幅跃升我当天晚上就把moonshotai/kimi-k3、openai/gpt-5.6-luna、anthropic/claude-sonnet-5三个模型拉到同一套测试框架里跑了一遍。结论先放这儿在单步推理LeetCode Hard 独立题上三者差距没有官方宣传那么夸张K3 和 GPT-5.6-Luna 基本打平但在多步代码修复这个维度上排名和 Moonshot 官方 benchmark 展示的完全反过来——K3 平均需要 4.2 轮才能修到通过GPT-5.6-Luna 只要 2.1 轮Claude Sonnet 5 是 2.8 轮。换句话说如果你的工作流是让 AI 反复改 bug 直到 CI 通过K3 目前并不是最优选。⚠️ 以上轮次数据基于我自用的一套固定测试集有 3 个 bug 的 300 行 Python共 20 组 case测试代码和 bug 样本暂未公开读者目前无法独立复现。如有需要我会整理后发 GitHub届时补链接。评测维度我选了 5 个维度温度全部设为 0每个维度跑 20 组 caseLeetCode Hard 通过率随机抽取 20 道题题目来源和具体编号见文末说明多轮代码修复轮次给一段有 3 个 bug 的 300 行 Python看几轮能全修对长上下文召回准确率在 80K token 上下文中插入 5 个关键事实问答召回首 token 延迟P50 / P95通过 统一网关调用排除网络差异单次调用成本按 ofox 模型目录 2026 年 7 月 3 日价格快照计算原始页面截图存档于文末 关于第 1 维度LeetCode 题目编号和来源已记录在本地但考虑到版权问题未全文转载如需复现请参考文末的题号列表自行获取原题。第 4 点我本来想直连各家官方 API 测但三个厂商链路不一样延迟对比没意义。后来统一走ofox的香港节点OpenRouter 也行但它会在模型原价基础上加收手续费ofox 是 0% 加价至少保证链路一致。⚠️ OpenRouter 手续费比例以其官方定价页面为准本文不引用具体数字评测结果天梯图维度Kimi K3GPT-5.6-LunaClaude Sonnet 5备注LeetCode Hard 通过率13/20 (65%)14/20 (70%)15/20 (75%)temperature0单次提交多轮修复平均轮次 ↓越低越好4.2 轮2.1 轮2.8 轮给相同 bug 代码单元测试80K 上下文召回准确率72%88%91%5 个事实点问答格式首 token 延迟 P95380ms520ms460msofox 香港统一测单次调用成本1K in 2K out≈¥0.05厂商未公布具体价格厂商未公布具体价格按 ofox 模型目录⚠️ GPT-5.6-Luna 和 Claude Sonnet 5 的具体定价截至 2026 年 7 月 3 日 ofox 模型目录页面显示已上线但未标注公开单价可能走 tier 定价上表成本列标厂商未公布。Kimi K3 的价格参照 Moonshot 官方定价换算。价格随时可能变动建议以实时目录为准。反差维度详解多步推理修复这是我觉得最该单独拿出来说的。Moonshot 官方在 K3 发布博客里放了一张 benchmark 图标注多步推理任务提升 40%。但我实测下来发现这个 40% 的基线是和 K2.7 比的不是和竞品比的。我的测试方法# 给模型一段有 3 个 bug 的代码 单元测试 # 每轮把报错信息喂回去看几轮修完 messages [{role: user, content: buggy_code}]然后循环调用把 pytest 输出和模型上一轮回复追加到 messages再进入下一轮for attempt in range(max_rounds): # 注意避免用 round会遮蔽 Python 内置函数 resp client.chat.completions.create( modelkimi-k3, messagesmessages ) assistant_reply resp.choices[0].message.content # 将模型回复追加到上下文 messages.append({role: assistant, content: assistant_reply}) # 运行测试获取输出 test_output run_pytest() if test_output.passed: break # 将测试报错追加到上下文供下一轮使用 messages.append({role: user, content: test_output.stderr})结果 K3 经常在第 2-3 轮忘记前面已经修好的 bug又引入新问题。GPT-5.6-Luna 则很少出现这种回退现象。我不确定这是 K3 的上下文理解问题还是指令跟随的问题但落到实际开发体验上就是你得多等好几轮。挺烦人的。graph TD A[提交 buggy code] -- B{模型修复} B -- C[运行测试] C --|失败| D[错误信息回传] D -- B C --|通过| E[完成] style B fill:#f9f,stroke:#333 subgraph 平均轮次 F[K3: 4.2轮] G[Luna: 2.1轮] H[Sonnet5: 2.8轮] end长上下文K3 的短板比预想的大K3 官方标注支持 128K 上下文以 Moonshot 官方文档为准请自行核实最新规格我塞了 80K 进去留点余量在不同位置埋了 5 个关键事实人名、日期、数字然后在最后问第 3 段提到的截止日期是几号这类问题。Claude Sonnet 5 在这个维度上确实强91% 的召回率几乎没有幻觉。GPT-5.6-Luna 88% 也不错。K3 掉到 72%主要是中间位置的事实容易丢——经典的lost in the middle问题2026 年了还是没完全解决。延迟K3 反而最快这个倒是给 K3 加分的维度。P95 首 token 延迟 380ms比 Luna 的 520ms 快了不少。具体原因 Moonshot 没有公开推理架构细节这里不做推测。不同需求怎么选你的场景推荐原因CI/CD 自动修 bug要求轮次少GPT-5.6-Luna多轮修复 2.1 轮回退率最低长文档问答 / RAG 召回Claude Sonnet 580K 召回 91%幻觉最少高频调用、对延迟敏感Kimi K3P95 380ms且单价最低预算有限的独立开发者Kimi K3按 Moonshot 定价约 ¥0.05/次1K2K需要全部模型一个 Key 搞定走聚合网关ofox 或 OpenRouter改 base_url 即可切模型关于官方宣传的几点吐槽Moonshot 说推理能力大幅跃升——跟自家 K2.7 比确实跃升了但跟同期竞品比并没有碾压。这种跟自己比的 benchmark 话术每家都在用OpenAI 发 5.6 系列的时候也干这事。我也不确定是不是我的测试集偏了。20 道题样本量不大如果有人用更大规模跑出不同结论我完全不意外。但至少在我这个小规模测试里多轮修复这个维度的排名确实和官方暗示的不一样。调用代码参考统一走 OpenAI 兼容协议切模型只改 model 字段from openai import OpenAI client OpenAI( api_keyyour-key, base_urlhttps://api.ofox.io/v1 )调 K3resp client.chat.completions.create( modelkimi-k3, messages[{role: user, content: prompt}] )调 Lunaresp client.chat.completions.create( modelgpt-5.6-luna, messages[{role: user, content: prompt}] )调 Sonnet 5resp client.chat.completions.create( modelclaude-sonnet-5, messages[{role: user, content: prompt}] )报错处理——如果你用错了模型名会收到类似这样的错误具体格式因网关实现而异openai/前缀是否出现在报错信息中取决于网关行为{error: {message: The model openai/gpt-5.6-luna does not exist or you do not have access to it., type: invalid_request_error, code: model_not_found}}这种一般是模型 ID 拼写问题或者你的 plan 没开通对应模型权限去后台看一眼就行。小结K3 发布当天的兴奋劲过了之后冷静看数据延迟和成本上有明显优势单步推理也不差但多轮交互和长上下文这两个实际干活的维度还有差距。如果你的工作流依赖以 Cline 为代表的多轮 agent 工具Cline 支持多种模型后端并非专属某一家目前 GPT-5.6-Luna 和 Claude Sonnet 5 体验更好。我现在的策略是快速原型用 K3便宜快复杂 debug 用 Luna文档理解用 Sonnet 5。三个模型一个 base_url 切着用省去了到处管 API Key 的麻烦。

相关新闻

【毕设分享】SSM笔记本在线销售系统32649

【毕设分享】SSM笔记本在线销售系统32649

2026/7/23 23:01:05

源码获取 私信联系我即可~ 大家点赞、收藏、关注、评论啦 精彩专栏推荐订阅:在下方专栏👇🏻 👇🏻 精彩专栏 推荐订阅👇🏻 java精品项目案例【3000套】 java精品项目案例【3000套】https://blog…

新鲜出炉的IntelliJ IDEA 2026 年版本特性!走过路过不要错过~

新鲜出炉的IntelliJ IDEA 2026 年版本特性!走过路过不要错过~

2026/7/23 23:01:05

IntelliJ IDEA 2026 年版本特性整理 说明:本文整理 IntelliJ IDEA(JetBrains,简称 IDEA)2026 年已发布的主要版本特性,覆盖 2026.1 正式版、2026.1.1 Preview、2026.2 EAP 系列、2026.2 正式版。信息综合自 JetBrains …

2026华为OD面试题035:竖直四子棋

2026华为OD面试题035:竖直四子棋

2026/7/23 23:01:05

题目描述 竖直四子棋的棋盘是竖立起来的,红蓝双方轮流选一列下子,棋子靠重力落到棋盘底部或者已有棋子之上。一列放满后,这一列就不能再下了。 任意一方的 4 个棋子在横、竖或斜方向连成一线就获胜。 给定棋盘宽 W、高 H,以及红蓝双方的下子步骤序列,判断谁在第几步获胜…

西门子 Eigen 落地中国带来行业启示:工业 AI 智能体腾飞,底层实时操作系统成关键基石

西门子 Eigen 落地中国带来行业启示:工业 AI 智能体腾飞,底层实时操作系统成关键基石

2026/7/24 1:41:11

2026 世界人工智能大会期间,西门子正式面向中国市场首发工业自动化工程 AI 智能体 Eigen,迅速成为工业智能化赛道焦点产品。作为全球为数不多可自主完成全链路自动化工程任务的工业 AI 系统,Eigen 跳出传统 AI 工具仅提供参考建议的局限&…

2025-2026计算机类期刊推荐:从顶刊到“保底”,选对期刊少走弯路

2025-2026计算机类期刊推荐:从顶刊到“保底”,选对期刊少走弯路

2026/7/24 1:41:11

对于计算机专业的学生和研究者来说,论文写出来只是第一步,往哪投才是真正的难题。选错期刊,轻则被拒后反复转投浪费半年时间,重则投到预警期刊直接“白干”。今天这篇文章,帮你梳理2025-2026年计算机类期刊的最新格局—…

深入解析ADS7851EVM-PDK:高精度ADC评估套件的硬件设计与性能测试实战

深入解析ADS7851EVM-PDK:高精度ADC评估套件的硬件设计与性能测试实战

2026/7/24 1:41:11

1. 项目概述:深入解析ADS7851EVM-PDK评估套件在数据采集、工业自动化、医疗仪器和高端测试测量领域,高精度、高速的模数转换器(ADC)是系统性能的基石。作为一名长期与各类ADC打交道的硬件工程师,我深知在项目初期&…

探秘 `malloc`:超量分配背后的内存分配器难题与技术权衡!

探秘 `malloc`:超量分配背后的内存分配器难题与技术权衡!

2026/7/24 1:41:11

深入探究:为何 malloc 超量分配?实现内存分配器竟有这么多难题!2026 年 7 月 20 日,阅读时长 11 分钟。几乎所有人在编写“安全”的 C 程序时都见过这样一行代码:void *p malloc(13); 我们知道这行代码的作用&#xf…

电力系统故障分类:小波变换与图注意力网络融合模型

电力系统故障分类:小波变换与图注意力网络融合模型

2026/7/24 1:41:11

1. 项目背景与核心挑战电力系统故障分类是智能电网运行维护中的关键环节。同步相量测量单元(PMU)以每秒30-120帧的频率采集电网各节点的电压电流信号,这些毫秒级数据流中蕴含着系统运行状态的完整信息。当发生发电机跳闸、负荷切除或短路故障时,信号波形…

Java生态下的企业级AI开发实践与优化

Java生态下的企业级AI开发实践与优化

2026/7/24 1:31:11

1. 为什么Java团队需要关注AI开发?在传统印象中,AI开发似乎是Python的专属领域,但实际情况正在发生变化。作为企业级应用开发的主力军,Java生态正在快速拥抱AI技术栈。我最近主导的几个企业级AI项目落地案例表明,Java团…

微服务进阶:服务网格与Istio

微服务进阶:服务网格与Istio

2026/7/23 3:40:08

541|微服务进阶:服务网格与Istio 上篇文章我们聊了微服务的基本概念和拆分方法。 但微服务多了,问题也多了: 服务之间怎么通信? 怎么监控每个服务的调用链路? 熔断、限流、重试怎么做? 安全认证怎么统一? 以前这些都靠SDK库(比如Hystrix、Feign),每个服务都要集成…

零售超级终端全域协同:ShareKit 碰一碰商品流转业务落地案例

零售超级终端全域协同:ShareKit 碰一碰商品流转业务落地案例

2026/7/23 4:40:05

一、零售门店全域协同业务背景与行业痛点 1.1 门店超级终端设备矩阵(连锁便利店/商超标准配置) 自助收银Kiosk一体机:顾客结算、自助核销优惠券、商品素材预览;运营折叠平板:店长后台商品上新、图片录入、活动配置、…

噗叽短视频界面分析

噗叽短视频界面分析

2026/7/23 1:54:13

1 和小红书类似,可以采用类似判断方法------------其实他比小红书好判断,因为他没有图片,控件位置几乎是固定的,都不用判断------------2 因为他没有点赞按钮------------而且几乎所有控件位置都是完全一样的,所以我就…

Django毕设项目:基于 Django 的 智能化学生综合素质测评审核系统 校园学生评优评奖综合管理系统(源码+文档,讲解、调试运行,定制等)

Django毕设项目:基于 Django 的 智能化学生综合素质测评审核系统 校园学生评优评奖综合管理系统(源码+文档,讲解、调试运行,定制等)

2026/7/24 0:01:07

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

[具身智能-634]:Python 封装的地平线 VIO 多媒体库:libsrcampy库详解

[具身智能-634]:Python 封装的地平线 VIO 多媒体库:libsrcampy库详解

2026/7/24 0:01:07

srcampy /libsrcampy 名称释义先明确结论: 官方文档没有公布标准化英文全称,是地平线内部项目缩写;行业公认拆解如下:srcampy Source Amplifier Python bindingsrc Source(图像源:MIPI Sensor、视频源&am…

用Highcharts 创建可拖拽三维散点立方体3D图表

用Highcharts 创建可拖拽三维散点立方体3D图表

2026/7/24 0:01:07

该案例基于Highcharts scatter3d 三维散点图实现空间立方体散点可视化,核心特色:三维 X/Y/Z 三轴空间,所有散点分布在 0~10 立方体空间内;散点使用径向渐变实现立体 3D 圆球质感;支持鼠标 / 触屏拖拽画布,…