表征格式实测:JSON 换 HTML 省 33% token 且质量不掉,Markdown 最省却答错

发布时间:2026/8/21 8:40:08

表征格式实测:JSON 换 HTML 省 33% token 且质量不掉,Markdown 最省却答错
系列第 8 篇 · 反直觉优化✅本文性质说明token 数、prefill 延迟、问答正确率全部本机真跑Qwen2.5-0.5B-Instruct纯 NumPy CPU脚本eng_repr_tokens.py给全。成本金额是「本机实测 token 数 × 公开挂牌单价假设」的外推单价已标注为假设值。Skyvern 生产 A/B 的成功率数据作为外部佐证单独标注。一句话结论同一份订单数据只改写法不改内容喂给模型的开销差得离谱——而且省下的比例随数据量变大还在涨明细条数JSONHTMLHTML 省MarkdownMD 省1775824.7%4344.2%31389928.3%7347.1%1035124231.1%18048.7%3094063132.9%47449.6%但省 token 不等于能用。同一批问题问下来JSON 3/3、HTML 3/3、Markdown 2/3——最省的 Markdown 答错了一题。HTML 是甜点位省 33% token、prefill 快 19%、正确率和 JSON 打平。背景与痛点JSON 是默认选项也是最贵的选项给模型喂结构化数据几乎所有人第一反应是json.dumps()。问题是 JSON 为机器解析设计不为 token 效率设计每个字段名都要重复一遍加上引号、冒号、逗号、缩进——这些标点税你按 token 付费。以 30 条明细的订单为例JSON 里name、qty、price这三个键各重复 30 次光键名就烧掉几百个 token而它们没有携带任何信息——第一次出现就够了。核心方法三种表征怎么权衡同一份订单三种写法# JSON字段名逐条重复标点最多 { order_id: A1024, customer: 张三, items: [ {name: 机械键盘, qty: 1, price: 399.0}, {name: 鼠标垫, qty: 2, price: 29.9} ], total: 458.8, status: paid } # HTML/XML属性紧凑键名仍在但没有引号税缩进税模型预训练见得极多 order idA1024 statuspaid customer张三/customer item name机械键盘 qty1 price399.0/ item name鼠标垫 qty2 price29.9/ total458.8/total /order # Markdown最省但字段语义被压平成自然语言 # 订单 A1024 (paid) - 客户张三 - 机械键盘 x1 399.0 - 鼠标垫 x2 29.9 - 合计458.8判断维度三个信息密度同内容多少 token、模型熟悉度预训练分布里见过多少、字段保真度键值对应关系是否还在。JSON 保真度最高但最贵Markdown 最便宜但把status: paid压成了标题里的(paid)HTML 两头都不吃亏。实验与数字本机真跑2026-08-19复现命令python eng_repr_tokens.py # A: token 规模扫描 B: 理解力探针环境Qwen2.5-0.5B-Instruct纯 NumPy CPU 推理引擎本系列第 3 篇那套模型加载 1.3s全程 94s。① token 规模扫描省的比例会放大关键代码——用真 tokenizer 数不用字符数估def ntok(s): 内容 token 数去掉 encode() 自动加的 BOS避免虚增 return len(eng.encode(s)) - 1 for n in (1, 3, 10, 30): js, ht, md, _ build(n) # 同一份数据的三种序列化 tj, th, tm ntok(js), ntok(ht), ntok(md) print(n, tj, th, f{(1-th/tj)*100:.1f}%, tm, f{(1-tm/tj)*100:.1f}%)结果就是开头那张表。HTML 的节省从 24.7% 涨到 32.9%Markdown 从 44.2% 涨到 49.6%。为什么会涨因为固定开销order_id、customer、total、status这些只出现一次的字段被摊薄了而逐条重复的键名开销随条数线性增长——JSON 越长冗余占比越高。这个规律很实用你的 payload 越大这个优化越值得做。反过来说小 payload 上测出来才省 24%不要据此判断它不划算。② 成本外推token 实测单价为假设按 30 条明细、100 万次调用、输入单价$0.15 / 1M token假设值非本机产出表征token/次100 万次成本JSON940$141HTML631$95Markdown474$71仅 JSON→HTML 这一项省$46。这里的重点不是绝对金额单价随模型和厂商差几十倍而是比例结构不换模型、不裁数据、不动 prompt 逻辑只改序列化函数账单直接砍三分之一。③ 理解力探针Markdown 翻车了省 token 的前提是模型还读得懂。我用官方 chat 模板问了三个只能从数据里读出的问题表征prompt token客户名字订单状态鼠标垫数量答对JSON182张三✅paid✅2✅3/3HTML143张三✅paid✅2✅3/3Markdown118张三✅已支付❌2✅2/3Markdown 那一题很有意思它并没有不知道而是答了已支付。数据里paid被我压进了标题# 订单 A1024 (paid)失去了status: paid这种显式键值绑定模型于是把它当自然语言意译了。这就是保真度损失的真实形态不是幻觉不是漏读而是字段值被改写成语义等价但字符串不等的东西。如果下游代码要if status paid这条链就断了——而且断得很隐蔽因为答案看起来是对的。④ 附带发现prefill 延迟跟着 token 一起降每题的实际生成耗时纯 CPUprefill 占主导表征三题耗时平均相对 JSONJSON12.3s / 12.7s / 12.8s12.60s—HTML10.1s / 10.2s / 10.2s10.17s-19.3%Markdown8.3s / 8.3s / 8.2s8.27s-34.4%省 token 是双重收益账单降首 token 延迟也降。这条和第 2 篇首 token 延迟拆解直接呼应——prefill 成本正比于输入长度砍输入就是砍 TTFT比改推理参数省事得多。⑤ 外部佐证Skyvern 生产 A/B指标JSONHTML变化单任务成本$1.22$1.08-11.4%成功率59.9%63.8%3.9%来源Skyvern 生产 A/B 报告2026-06约 1,100 个真实任务。他们的成本降幅11.4%小于我本机的 token 降幅33%合理——真实请求里还有 system prompt、历史消息、输出 token 等不受表征影响的固定部分。而成功率反升 3.9%和我本机 HTML 打平 JSON 的结果同向HTML 更贴近模型预训练分布噪声更少。至少可以说省 token 不必然牺牲质量。为什么重要这是极少数纯赚的优化成本↓、延迟↓、质量不降。不像量化省显存但掉精度或换小模型省钱但掉能力那样要做权衡。改动量小到离谱动的是序列化函数几十行不碰模型、不碰 prompt 逻辑、不碰架构。payload 越大越划算而生产里的 payload 通常比 demo 大得多——demo 上测出 24%生产可能是 33%。呼应第 1 篇账单砍 79%降本的杠杆多数不在模型上在你怎么喂它。反过来给了个警告别无脑上 Markdown。它最省但会压平字段语义对需要精确字段值的下游是隐性风险。读者可复用交付物表征格式选型决策表先问一句下游要不要按字段精确取值 要写库 / 走 if 判断 / 触发流程 └─ 优先 HTML/XML 标签表征 · 键值绑定完整namex qty1 · 省 25-33% token量越大省越多 · 本机实测正确率与 JSON 持平 3/3 └─ 必须 JSON 的唯一场景你要把模型输出直接 json.loads() 输入用 HTML、输出要 JSON —— 这两件事可以分开定 不要摘要 / 分类 / 问答 / 语义检索 └─ 用 Markdown省 44-50% · 但字段值可能被意译paid → 已支付 · 只要下游不做字符串精确比较就无所谓 落地检查清单 □ 用真 tokenizer 数 token别用 len(str)/4 估 □ 在你的真实 payload 规模上测别用 1 条 demo 测 □ 换格式后必须跑正确率回归至少 20 题别只看 token 降了就上线 □ 重点回归精确字段值类问题状态码、枚举、ID、金额 □ 输入表征和输出格式解耦输入 HTML 省钱输出仍可要求 JSON □ 长列表数据优先 HTML/MD单条小对象差异不大不用折腾踩坑记录复现时会遇到encode()不认特殊 tokenchat 模板必须手拼 ID。本系列踩过的老坑|im_start|走 BPE 会被切成碎片。必须直接拼151644/151645python def chat_ids(system, user): enc lambda t: eng.encode(t)[1:] # 去掉自动 BOS ids [IM_START] enc(system\n system) [IM_END] enc(\n) ids [IM_START] enc(user\n user) [IM_END] enc(\n) ids [IM_START] enc(assistant\n) return ids只解码新生成的 token。如果 decode 整个prompt gen模型会把整段输入回显进答案于是关键词永远命中正确率假性 100%。第 10 篇的注入实验就是这么被坑过一次。数 token 要减掉 BOS。encode()会自动加一个 BOS三种表征各加 1 个比例算出来会被稀释。早期我那版没减同一份数据得到 95/78/59省 17.9%减掉后是 94/77/58省 18.1%——小 payload 上这个误差不能忽略。别用字符数或len(text)/4估 token。中文场景下这个经验公式误差极大Markdown 的字符数比 HTML 少得有限但 token 少得多因为中文词在 tokenizer 里的切分和标点完全不是一个量级。HTML 表征别真去塞完整网页 DOM。省 token 的是标签化的紧凑表征不是原始 HTML——真实 DOM 里的class、style、data-*属性比 JSON 还冗余。手工构造语义标签或先做 DOM 精简。今日可做的 3 件事找到你最高频的那个 LLM 调用把输入的json.dumps()换成标签表征用真 tokenizer 数一下前后 token10 分钟的事。按你真实 payload 的最大规模再测一遍。小样本会低估收益——我这儿 1 条时省 24.7%30 条时省 32.9%。跑一次正确率回归专门挑精确字段值的问题状态、枚举、ID。如果你打算用 Markdown这一步是必须的——我这儿正是在status上翻的车。下篇预告第 9 篇函数调用真跑——0.5B 调工具比 1.5B 还准我拿 12 个真实场景本机真跑了一遍。系列终篇10 篇汇总在 09、10 之后。本文数据来源本机真跑eng_repr_tokens.py2026-08-19Qwen2.5-0.5B-Instruct 纯 NumPy CPUtoken 规模扫描1/3/10/30 条明细HTML 省 24.7%→32.9%MD 省 44.2%→49.6%理解力探针JSON 3/3、HTML 3/3、Markdown 2/3status被意译为「已支付」prefill 延迟JSON 12.60s / HTML 10.17s-19.3%/ MD 8.27s-34.4%原始结果存eng_repr_tokens.json成本外推token 数为本机实测输入单价 $0.15/1M token 为公开挂牌价假设值非本机产出外部佐证引用Skyvern 生产 A/B 报告2026-06约 1,100 任务——单任务成本 $1.22→$1.08-11.4%、成功率 59.9%→63.8%3.9%

相关新闻

萤石云多窗口自动续播工具|免安装绿色版,一键点击继续播放

萤石云多窗口自动续播工具|免安装绿色版,一键点击继续播放

2026/8/21 8:40:08

温馨提示:文末有联系方式 工具核心功能亮点 本工具为原创开发的萤石云网页端辅助程序,专注解决视频播放中断后需手动点击‘继续播放’的重复操作问。 采用精准窗口识别技术,可同时并响应多个萤石云浏览器标签页或独立窗口,实时触发…

系统分析师之计算机网络与分布式系统

系统分析师之计算机网络与分布式系统

2026/8/21 8:40:08

知识点一:Telnet协议知识点二:HDLC协议HDLC(High-level Data Link Control,高级数据链路控制)是一种通用的数据链路协议框架,支持三种基本帧类型:①信息帧(I帧):用于携带…

多乐信ER-630ES深度评测:30L大除湿量如何解决别墅地下室潮湿难题?

多乐信ER-630ES深度评测:30L大除湿量如何解决别墅地下室潮湿难题?

2026/8/21 8:40:08

最近南方又到了“回南天”,墙壁“流汗”、地板湿滑、衣服晾不干,连空气都带着一股霉味。对于住在低楼层、别墅地下室或者沿海地区的朋友来说,这不仅是体感不适,更是对家居、藏书、电子设备甚至健康的潜在威胁。传统的空调除湿效果…

CachyOS:极致性能的Arch Linux发行版安装与优化指南

CachyOS:极致性能的Arch Linux发行版安装与优化指南

2026/8/21 9:50:11

这次我们来看一个有点“凡尔赛”的 Linux 发行版问题:CachyOS。它不是一个新模型或AI工具,而是一个基于 Arch Linux 的、以极致性能优化为卖点的操作系统。用户反馈的核心矛盾点很有趣——“它太快了,以至于我遇到了问题”。这背后反映的是Ca…

STM32-USART 05

STM32-USART 05

2026/8/21 9:50:11

USART简介USART前置:发送接送 双工:可发送,可接送 单工:仅支持发送与接送的一种 全双工:同时进行发送与接收 半双工:同一时刻进行发送或者接收同步异步 同步:时钟 异步:波特率电平特…

第17篇_Client 06|chunked、关闭和 keep-alive 边界

第17篇_Client 06|chunked、关闭和 keep-alive 边界

2026/8/21 9:50:11

适合谁收藏正在让 PLC 主动访问 HTTP 服务的工程师。需要处理请求构造、响应边界、超时与连接复用的人。希望把 Client 故障定位到确定状态和错误出口的读者。本篇位置 客户端篇,第 6/7 篇;主系列第 17/28 篇。现场问题同一个 API,用测试服务…

基于STM32与DS18B20的智能输液温度控制系统设计与仿真

基于STM32与DS18B20的智能输液温度控制系统设计与仿真

2026/8/21 9:50:11

在医疗输液过程中,药液温度是一个至关重要的参数。冰冷的药液直接输入患者血管,不仅会引起不适,还可能诱发血管痉挛、寒战等不良反应,影响治疗效果。传统的输液加温方式如热水袋、电热毯等,存在温度控制不精准、安全性…

构建原生端侧Agent框架:从PalmClaw架构到移动AI应用实践

构建原生端侧Agent框架:从PalmClaw架构到移动AI应用实践

2026/8/21 9:50:11

1. 从“云端依赖”到“端侧自主”:为什么我们需要一个原生设备上的Agent框架? 最近在折腾手机上的AI应用,一个绕不开的痛点就是:但凡想搞点稍微复杂点的自动化任务,比如自动整理相册、根据日程安排自动调整手机模式&am…

产品数据的信任边界

产品数据的信任边界

2026/8/21 9:40:11

产品数据的信任边界 “合规、隐私与信任风险检查”说的不是一套通用技巧,而是 AI 生产力工具产品化与 PMF 验证实战 中一个必须被单独处理的环节。沿着数据进入、处理、导出三条路径检查,而不是只写一份原则。本文不假定任何真实公司数据或项目经历&…

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

2026/8/19 3:36:59

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

【双层规划,节点出清价,绿证交易,CVaR方法】两级电力市场环境下计及风险的省间交易商最优购电模型附Matlab代码

【双层规划,节点出清价,绿证交易,CVaR方法】两级电力市场环境下计及风险的省间交易商最优购电模型附Matlab代码

2026/8/20 21:07:35

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

隐式mpc+自适应mpc+时变mpc,线性时变模型预测控制附Simulink仿真

隐式mpc+自适应mpc+时变mpc,线性时变模型预测控制附Simulink仿真

2026/8/19 8:02:16

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

091、主从同步控制策略

091、主从同步控制策略

2026/8/21 0:09:47

091、主从同步控制策略:从一次多轴抖动事故说起 去年调试一台四轴龙门平台,Z轴和两个X轴做主从同步。电机选的是台达A2系列,驱动器工作在位置模式,主站发脉冲指令,从站硬线跟随。调试时发现一个诡异现象:当主站以500rpm匀速运行时,从站电流波形每隔几秒会出现一次毛刺,…

向量检索实验失败后该查什么

向量检索实验失败后该查什么

2026/8/21 0:09:47

向量检索实验失败后该查什么 这篇要解决什么 向量检索实验失败后该查什么讨论的是一个可复查的工程问题。向量检索实验失败后该查什么不拿未经记录的事故、跑分或成本当作论据;判断需要回到当前项目的输入、版本和运行条件。 从边界开始 处理向量检索实验失败后该查…

提示词发布过程中的止损边界

提示词发布过程中的止损边界

2026/8/21 0:09:47

提示词发布过程中的止损边界 这篇要解决什么 提示词发布过程中的止损边界讨论的是一个可复查的工程问题。提示词发布过程中的止损边界不拿未经记录的事故、跑分或成本当作论据;判断需要回到当前项目的输入、版本和运行条件。 从边界开始 处理提示词发布过程中的止损…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/17 12:00:53

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/15 10:10:27

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/18 12:20:24

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…