小模型为何能胜过大模型?Ornith-1.5-35B-A3B端到端自我改进训练原理全解析

发布时间:2026/8/23 15:23:07

小模型为何能胜过大模型?Ornith-1.5-35B-A3B端到端自我改进训练原理全解析
小模型为何能胜过大模型Ornith-1.5-35B-A3B端到端自我改进训练原理全解析【免费下载链接】Ornith-1.5-35B-A3B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3BOrnith-1.5-35B-A3B 是一款 35B 总参数、每 token 仅激活约 3B 参数的 MoE 小模型。它最大的亮点不是参数规模而是一套端到端自我改进训练体系模型自己生成任务、自己搭建解题脚手架、自己产出解答再用强化学习闭环迭代最终在编程与智能体基准上全面超过更大、更密的模型。什么是 Ornith-1.5-35B-A3B一句话定位Ornith-1.5-35B-A3B 是面向编程与智能体Agentic场景的推理型 MoE 语言模型。命名中的A3B表示 Activated 3B——35B 总参数里每个 token 只激活约 3B 参数推理成本低bf16 权重约 70 GB2 张 80GB 显卡即可部署。它是 Ornith-1.5 家族的中型成员Ornith-1.0 基于 Qwen3.5 与 Gemma4 做了继续预训练、中期训练和后训练1.5 则把自我改进从脚手架与轨迹优化扩展到全链路联合优化。原生支持 256K 上下文配合 YaRN 扩展可达约 1M token内置视觉与视频模块也支持工具调用与推理链think块。架构细节可查阅模型配置config.json40 层隐藏层、每层 256 个专家、每 token 激活 8 个专家并采用线性注意力 全注意力交错布局每 4 层 1 次全注意力这也是它能兼顾长上下文与推理效率的关键。小模型胜过大模型的第一个秘密MoE 架构 传统稠密大模型每次前向都要动用全部参数而 MoE混合专家模型像一家大型医院——256 位专家坐诊但每个 token 只分诊给 8 位最对口的专家。特性Ornith-1.5-35B-A3B传统 35B 稠密模型总参数量约 35B约 35B每 token 激活参数约 3B全部 35B单 token 推理开销≈ 1/10100%256K 长上下文原生支持通常更贵配合每 4 层 1 个全注意力层、其余为线性注意力的混合结构见config.json中的layer_types模型在长文本上的注意力成本进一步下降。参数多不等于算得动激活少 注意力省就是小模型能打赢大模型的第一块基石。核心原理端到端自我改进训练闭环 这才是本文的重头戏。过去训练会用工具的智能体任务和评测脚手架基本靠人工设计人出题、人写评测脚本、模型负责做。Ornith-1.5 把这个闭环整体交给模型自己完成任务自生成Task Generation模型持续生成新的训练任务替代固定的人工题集。题库随模型能力自动扩容永远刚刚好难避免学完就过时。脚手架自搭建Scaffold Construction解题用的脚手架harness——如何调用工具、组织多步执行、验证结果——也由模型自己发现和优化而不是沿用人工写死的评测脚本。解答轨迹自优化Rollout Optimization模型在生成的任务上实际执行、产出完整解答轨迹轨迹质量作为强化学习的奖励信号。三者联合优化任务更难 → 逼出更好的解题策略 → 更好的策略反过来生成更有价值的任务。这是一个出题—解题—评分全自主的飞轮模型在整个过程中持续通过强化学习更新策略即官方所称从 Self-Scaffolding 走向 Self-Improvement。对新手来说可以这样理解传统训练是老师带着学生刷题自我改进训练是让学生自己当老师——自己出题、自己批卷、自己进步而模型在编程这类开放任务上的进步速度远快于静态题库能提供的上限。成绩单3B 激活参数 vs 更大模型 Ornith-1.5-35B-A3B 在全部编程与智能体基准上超过同尺寸竞品并在智能体编程上大幅领先 Gemma 4-31B、Muse Glimmer-30B 等稠密模型完整数据见 README.md 中的评测表格基准Ornith-1.5-35B-A3BQwen3.6-35B-A3BGemma-4-31B稠密SWE-bench Verified7973.452Terminal-Bench 2.167.852.542.1SWE-bench Pro59.649.535.7DeepSWE220—GPQA Diamond推理89.286.084.3几个值得注意的信号DeepSWE 上其他同尺寸模型几乎为 0它拿到 22——深度软件工程任务正是自我改进训练主攻的方向相比 1.0 版本SWE-bench Verified 75.6 → 79仅靠扩大自我改进闭环就带来明显提升甚至压过了参数多一个数量级的 Qwen3.5-397B 在多个智能体基准上的成绩——这回答了标题之问小模型靠每 token 更聪明的参数使用方式 更对口的自我改进训练取胜而不是单纯堆参数。如何快速上手 Ornith-1.5-35B-A3B 部署门槛并不高。以下是最小可用路径详细命令见 README.md准备 2 张 80GB 显卡安装 vLLM ≥ 0.19.1或 SGLang ≥ 0.5.9一条vllm serve ornith-ai/Ornith-1.5-35B-A3B命令起服务记得开启--enable-auto-tool-choice与--reasoning-parser qwen3工具调用会自动解析成 OpenAI 风格tool_calls推理链输出到reasoning_content字段任意 OpenAI 兼容客户端接入即可通用任务推荐temperature0.6, top_p0.95, top_k20见generation_config.json与 README 说明。作为智能体大脑它可直接对接 Ollama、OpenCode 等编程 CLI——ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF一行命令就能让本地终端 Agent 跑起来。模型权重按 16 个分片存放model-00001-of-00016.safetensors等分片索引在model.safetensors.index.json对话行为由chat_template.jinja定义复现官方评测时需按 README 提示调整模板以保证训练/推理一致。写在最后这套方法意味着什么 Ornith-1.5 给出的信号很明确下一代模型竞争的关键可能不是更大而是更会自我练习。当任务生成、脚手架构建、解答优化全部纳入同一强化学习闭环训练数据上限被彻底打开——静态数据集训练模型的上限是数据集自我改进训练模型的上限是它自己的想象力。对普通用户和开发者而言这意味着一台双卡工作站就能获得一个越用越懂你的编程智能体大脑对研究者而言Ornith-1.5 展示了从人工驱动到自主驱动的训练范式跃迁。Chirp Chirp! 【免费下载链接】Ornith-1.5-35B-A3B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

如何免费快速把QQ音乐QMC加密文件转成MP3/FLAC:qmc-decoder新手指南

如何免费快速把QQ音乐QMC加密文件转成MP3/FLAC:qmc-decoder新手指南

2026/8/23 15:23:07

如何免费快速把QQ音乐QMC加密文件转成MP3/FLAC:qmc-decoder新手指南 【免费下载链接】qmc-decoder Fastest & best convert qmc 2 mp3 | flac tools 项目地址: https://gitcode.com/gh_mirrors/qm/qmc-decoder qmc-decoder 是一款免费的命令行工具&#…

如何快速看懂 Shardeum 核心架构:EVM v2 实现原理完全指南

如何快速看懂 Shardeum 核心架构:EVM v2 实现原理完全指南

2026/8/23 15:13:06

如何快速看懂 Shardeum 核心架构:EVM v2 实现原理完全指南 【免费下载链接】shardeum Shardeum is an EVM based autoscaling blockchain 项目地址: https://gitcode.com/GitHub_Trending/sh/shardeum Shardeum 是一个基于 EVM 的自动扩缩容区块链&#xff0…

we-work-bot企业微信机器人框架上手指南

we-work-bot企业微信机器人框架上手指南

2026/8/23 15:13:06

we-work-bot企业微信机器人框架上手指南 【免费下载链接】we-work-bot A lite framework for wechat work bot. 轻量级企业微信群聊机器人框架。 项目地址: https://gitcode.com/gh_mirrors/we/we-work-bot 发布结果没人提醒,监控告警没有固定出口&#xff0…

ide-eval-resetter:30 秒让 JetBrains IDE 重新拥有全新 30 天试用

ide-eval-resetter:30 秒让 JetBrains IDE 重新拥有全新 30 天试用

2026/8/23 16:33:09

ide-eval-resetter:30 秒让 JetBrains IDE 重新拥有全新 30 天试用 【免费下载链接】ide-eval-resetter 项目地址: https://gitcode.com/gh_mirrors/id/ide-eval-resetter ide-eval-resetter 是一款能把 JetBrains 全家桶 IDE 试用期重置回来的开源插件&…

如何训练自己的Pigaios匹配模型:数据集生成与模型训练完整教程

如何训练自己的Pigaios匹配模型:数据集生成与模型训练完整教程

2026/8/23 16:33:09

如何训练自己的Pigaios匹配模型:数据集生成与模型训练完整教程 【免费下载链接】pigaios A tool for matching and diffing source codes directly against binaries. 项目地址: https://gitcode.com/gh_mirrors/pi/pigaios Pigaios 是一款将 C 源代码直接与…

SMU Debug Tool实战指南:深度掌控Ryzen底层控制

SMU Debug Tool实战指南:深度掌控Ryzen底层控制

2026/8/23 16:33:09

SMU Debug Tool实战指南:深度掌控Ryzen底层控制 【免费下载链接】SMUDebugTool A dedicated tool to help write/read various parameters of Ryzen-based systems, such as manual overclock, SMU, PCI, CPUID, MSR and Power Table. 项目地址: https://gitcode.…

11款地震数据分析开源工具横评|Awesome Open Geoscience精选

11款地震数据分析开源工具横评|Awesome Open Geoscience精选

2026/8/23 16:33:09

11款地震数据分析开源工具横评|Awesome Open Geoscience精选 【免费下载链接】awesome-open-geoscience Curated from repositories that make our lives as geoscientists, hackers and data wranglers easier or just more awesome 项目地址: https://gitcode.c…

黑苹果 OpenCore EFI 怎么自动生成?OpCore Simplify 实操教程

黑苹果 OpenCore EFI 怎么自动生成?OpCore Simplify 实操教程

2026/8/23 16:33:09

黑苹果 OpenCore EFI 怎么自动生成?OpCore Simplify 实操教程 【免费下载链接】OpCore-Simplify A tool designed to simplify the creation of OpenCore EFI 项目地址: https://gitcode.com/GitHub_Trending/op/OpCore-Simplify SMBIOS 填错一位、ACPI 补丁…

OpenStack Cinder 高可用架构设计:Active-Active 部署与数据灾备完整指南

OpenStack Cinder 高可用架构设计:Active-Active 部署与数据灾备完整指南

2026/8/23 16:23:09

OpenStack Cinder 高可用架构设计:Active-Active 部署与数据灾备完整指南 【免费下载链接】cinder OpenStack Block Storage (Cinder). Mirror of code maintained at opendev.org. 项目地址: https://gitcode.com/gh_mirrors/cin/cinder OpenStack Cinder 是…

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

2026/8/23 0:02:09

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

2026/8/23 0:02:09

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

2026/8/23 0:02:09

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

2026/8/23 0:02:09

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

2026/8/23 0:02:09

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

2026/8/23 0:02:09

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/22 2:02:26

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/22 4:13:47

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/22 1:32:34

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…