Qwen3-Embedding上TPU:16K长上下文怎么稳住

发布时间:2026/8/28 2:18:38

Qwen3-Embedding上TPU:16K长上下文怎么稳住
Embedding 服务最容易被低估的性能问题不是单条文本有多快。而是输入突然从1K tokens 变成15K tokens以后 系统还能不能稳定批处理Google 8月26日公开了 vLLM 在 Cloud TPU 上服务 Qwen3 Embedding 系列的一组工程实现。目标场景已经不是短文本向量化而是文本4K tokens 多模态15K tokens公开的 Qwen3-Embedding-8B 配置支持max_model_len16384在 Ironwood TPU 上Google 报告的一个 16K 序列、BF16、TP4 配置达到83,996 total token/s、5.13 req/s同时使用跨硬件向量余弦相似度校验精度文本阈值设为≥0.999多模态阈值为≥0.995。真正值得拆的是它为长上下文做的三件事Tensor Alignment Compilation Pre-warming Chunked Prefill StepPool为什么Embedding也会把HBM打爆很多人对长上下文的第一反应是LLM KV Cache但 Embedding Pooling 同样需要保存长序列中间状态、Pooling State 和 Batch Metadata。如果 15K tokens 一次性 Prefill请求多 序列长 Batch大HBM 压力会迅速上升。所以需要Chunked Prefill把一次长输入拆成多个 Step。Chunked Prefill最危险的不是慢而是状态丢失假设 16K tokens 分成4K 4K 4K 4K每一段执行完都要把 Pooling 所需状态保留下来。如果请求被 Preempt、Reschedule 或 Batch 重排以后中间状态没有恢复最终向量可能看起来“有结果”但数学上已经偏了。这比直接报错更危险。所以长Embedding一定要做Golden Parity不要只测API返回200同一条输入分别跑Reference Backend Candidate Backend然后比较向量。importnumpyasnpdefcosine(a,b):anp.asarray(a)bnp.asarray(b)returnfloat(np.dot(a,b)/(np.linalg.norm(a)*np.linalg.norm(b)))Gateassertcosine(reference,candidate)0.999文本模型可以先用 0.999 作为高精度目标。多模态可按业务设不同阈值。为什么不能只看TopK一致率两个 Embeddingcosine 0.995在普通搜索里可能 TopK 还差不多。但当你的向量库有几千万条、而且很多候选距离很近时小偏差也可能改变排名。所以我会同时测Vector Parity TopK Overlap NDCG Business Recall一套完整精度回归embedding_gate:vector_cosine:p50:0.9999p01:0.9990top10_overlap:min:0.98retrieval_recall:regression_max:0.005不要因为吞吐翻倍就接受检索质量悄悄下降。Google公开配置里有几个值得照抄的测试维度示意配置fromvllmimportLLM llmLLM(modelQwen/Qwen3-Embedding-8B,runnerpooling,tensor_parallel_size2,max_model_len16384,max_num_batched_tokens512,dtypebfloat16,trust_remote_codeTrue,)真正需要调的是tensor_parallel_size max_model_len max_num_batched_tokens它们共同决定吞吐 内存 调度 长序列稳定性max_num_batched_tokens不是越大越好Batch Token 上限大吞吐可能提高但也可能出现HBM上涨 尾延迟上涨 长请求挤压短请求所以压测至少分512 1024 2048 4096看Tokens/s Req/s P95 HBM OOM我会按长度建4个Bucket0—1K 1K—4K 4K—8K 8K—16K每个 Bucket 独立看P50 P95 Throughput Queue Time不要把短文本和长文档平均在一起。否则“平均延迟80ms”可能掩盖15K输入P95 4秒生产路由可以按长度分池例如Short Pool: 4K Long Pool: 4KKubernetesembeddingPools:short:max_tokens:4096replicas:8long:max_tokens:16384replicas:4流量由 Gateway 按 Token Count 路由。这样长请求不会把短查询堵住。Tensor Parallel为什么会遇到AlignmentTPU 的矩阵执行单元对切分维度有对齐要求。当词表矩阵做 Tensor Parallel Sharding 时如果维度不能整除拓扑就可能出现 All-Gather 对齐问题。Google 的做法是统一做硬件安全的 Vocabulary Padding。这类优化提醒我们跨硬件迁移 不是换一个device参数尤其是高维 Pooling Model。Compilation Pre-warming解决的是发布抖动JAX/XLA 类后端常见第一次请求触发编译线上就会出现新Pod Ready ↓ 第一批请求进入 ↓ P95突然几十倍更稳的是启动 →加载权重 →预热常见Shape →编译Cache稳定 →ReadyKubernetes Readiness 不应该只测HTTP 200而要等Model Loaded Compile Warmed Memory Stable才放量。长Context还要测Preemption故意把队列打满长请求执行一半 ↓ 被调度器抢占 ↓ 恢复最后向量必须和无抢占 Reference 一致。这是测试 StepPool / Cached State 最关键的一类 Case。一个Preemption TestInput: 15,500 tokens Baseline: 单请求运行 Stress: 并发64 触发Preemption Check: cosine 0.999如果只做性能压测不做向量一致性这类 Bug 很难发现。混合硬件弹性也要测结果一致Google 的架构方向允许 GKE 在 TPU Capacity 不足时回退到其他 GPU Spot / On-demand Pool。这意味着同一个服务可能出现请求A → TPU 请求B → GPU所以硬件间 Parity 必须是发布门禁。否则用户可能发现同样文本 上午一个向量 下午另一个向量进而造成索引和查询 Embedding 不一致。最危险的是Index和Query跑不同后端比如离线索引 GPU 在线Query TPU如果两边向量偏差明显Recall 会直接下降。所以必须记录embedding_model_version backend_profile precisionVector Metadata建议增加{model:qwen3-embedding-8b,model_version:v1,dtype:bf16,backend_profile:tpu-ironwood-tp4,embedding_schema:emb-v7}后续迁移可以知道哪些向量需要重建。一个真正实用的压测矩阵Length: 1K / 4K / 8K / 16K Concurrency: 1 / 8 / 32 / 64 Batch Tokens: 512 / 1024 / 2048 Backend: TPU / GPU 共 4 × 4 × 3 × 2 96组每组输出Req/s Token/s P95 HBM OOM Cosine Recall这样才知道最优点在哪。长上下文 Embedding 服务真正难的地方是性能问题和精度问题会绑在一起。Chunked Prefill、TP Sharding、JIT Compilation、Preemption 都可能提升系统效率也可能制造很隐蔽的向量偏差。所以发布标准可以压成两句话先证明向量没变 再证明系统变快。以及短请求和长请求分开看 不要被平均值骗了。做到这两点16K Embedding 才算从“能跑”进入“能稳定服务”。

相关新闻

牧场边缘端YOLOv8牛羊识别系统实战部署

牧场边缘端YOLOv8牛羊识别系统实战部署

2026/8/28 2:18:38

简介:目标检测是计算机视觉的基础任务,其核心在于从图像中准确定位并分类物体;YOLOv8作为当前主流的实时检测模型,凭借其速度与精度平衡优势,被广泛应用于农业智能化场景。然而,将YOLOv8落地到真实牧场环境…

界面迁移要给旧交互留出回退

界面迁移要给旧交互留出回退

2026/8/28 2:18:38

界面迁移要给旧交互留出回退旧系统迁移最难的往往是那些没人写在文档里的交互:全局事件、层级规则、快捷键和边缘状态。把整个页面一次替换掉,出问题时很难定位。更稳的办法是选一个边界清楚的区域,做可回退的渐进替换。 Shadow DOM 能隔离一…

设计令牌的安全入口不能漏

设计令牌的安全入口不能漏

2026/8/28 2:18:38

设计令牌的安全入口不能漏从设计工具拉回来的 Token 是外部输入,不该因为它来自“内部协作”就被默认信任。真正的风险通常是构建脚本把名字和值直接拼成 CSS 或 JavaScript。先验证来源,再验证结构和允许的值域,最后生成受控产物。 Token 名…

开源大模型医疗问答落地:基于Qwen2.5与RAG构建知识库助手

开源大模型医疗问答落地:基于Qwen2.5与RAG构建知识库助手

2026/8/28 3:28:43

这次我们来看一个把开源大模型用到医疗知识问答场景的完整落地案例:基于 Qwen2.5-14B-Instruct 构建通义医疗大模型问答助手,先把病理学、诊疗指南这类垂直语料做成向量知识库,再通过 RAG 检索增强生成方式接进大模型,最后用 Fast…

Autoformer时间序列预测:周期与趋势显式建模实战

Autoformer时间序列预测:周期与趋势显式建模实战

2026/8/28 3:28:43

简介:时间序列预测的核心在于准确刻画周期性与趋势性两大本质特征。传统Transformer将时序视作离散符号序列,忽视其物理连续性与多尺度动态结构,导致长程依赖建模失真、注意力泛化失效。Autoformer通过STL可微分分解实现趋势-周期-残差的显式…

构建工业级抽烟检测数据集的实战方法论

构建工业级抽烟检测数据集的实战方法论

2026/8/28 3:28:43

简介:行为识别是计算机视觉落地的关键方向,而抽烟检测作为典型细粒度行为分析任务,其核心挑战不在模型选型,而在数据质量。从基础概念看,行为检测依赖时空耦合特征;原理上,需同时建模人体姿态、…

感知先行:利用反事实盲区实现自包含视觉蒸馏

感知先行:利用反事实盲区实现自包含视觉蒸馏

2026/8/28 3:28:43

在视觉表示学习里,“Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots”这个标题看起来很抽象,但它描述的其实是一条具体的技术路线:在外部监督信号介入之前,先让模型获得对图…

豆包工作Agent实战:飞书集成、批量任务与避坑指南

豆包工作Agent实战:飞书集成、批量任务与避坑指南

2026/8/28 3:28:43

字节跳动这次发布“豆包工作”Agent 产品,释放的信号很明确:企业级 AI Agent 不再停留在对话机器人层面,而是直接长在飞书的日常协作流程里。豆包工作并不是又一个通用聊天助手,它把豆包大模型的理解与执行能力,接到飞…

C++逆向实战:从函数名修饰、调用约定到异或算法分析与爆破

C++逆向实战:从函数名修饰、调用约定到异或算法分析与爆破

2026/8/28 3:18:43

1. 项目概述:一次典型的C逆向实战复盘几年前打CTF比赛,遇到一道印象挺深的题,叫“[2019红帽杯]CHILDRE”。这题当时卡了不少人,因为它把C逆向里几个经典又容易让人迷糊的点,全给揉一块儿了。题目本身是个控制台程序&am…

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

2026/8/27 11:10:02

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

2026/8/27 7:25:23

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

2026/8/26 17:50:58

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

基于Claude Code的开源AI求职框架:从职位搜索到Offer的全自动化闭环

基于Claude Code的开源AI求职框架:从职位搜索到Offer的全自动化闭环

2026/8/28 0:08:32

当AI助手能够独立完成从职位匹配、简历定制到面试准备的全链路求职流程时,求职不再是一场信息战,而是一场工程化战役。框架概述:本地运行的AI求职引擎这是一个构建在Claude Code之上的开源AI求职框架,核心理念是"在工作者的机…

Godot 4 仿 agar.io:相机缩放被 max_zoom 卡死,窗口越大球越小的根因与修复

Godot 4 仿 agar.io:相机缩放被 max_zoom 卡死,窗口越大球越小的根因与修复

2026/8/28 0:08:32

1. 问题现象 在 Godot 4 仿 agar.io 的 2D 项目中,相机缩放设计为「由球组整体尺寸决定」,世界可见高度恒定,窗口只作为视口裁剪。默认小窗口 1280x720 时相机高度正常;但窗口最大化到 2940x1912 后,视角被明显拉远、…

从软件测试大赛到实战:Java+Selenium自动化测试进阶指南

从软件测试大赛到实战:Java+Selenium自动化测试进阶指南

2026/8/28 0:08:32

1. 缘起:从校园到赛场,我的软件测试之路几年前,我还是一个在校园里对着Java课本和“Hello World”程序挠头的普通学生。软件测试对我来说,只是一个在开发流程末尾、用鼠标点点按钮的模糊概念。直到我偶然在学校的公告栏上看到了“…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/22 2:02:26

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/26 18:07:30

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/26 17:57:52

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…