刚刚!Claude Fable 5.1 发布:科研跑分翻倍,缓存成本骤降 75%,AI 开始亲自做科学

发布时间:2026/9/3 0:46:20

刚刚!Claude Fable 5.1 发布:科研跑分翻倍,缓存成本骤降 75%,AI 开始亲自做科学
2026年9月2日Anthropic 正式发布 Claude Fable 5.1 与 Mythos 5.1前者面向所有用户开放后者以相同底层模型为基础、专供通过审核的网络安全和生命科学团队调用。在 Terminal-Bench-Science 0.1 基准上Fable 5.1 以 52.6% 的成绩将上代 Fable 524.7%和 GPT-5.6 Sol22.4%甩出整整一个数量级代码工程能力在 Terminal-Bench 4.0 上从 42.0% 升至 55.8%Mythos 版达 60.9%缓存读取价格同步骤降 75%高强度 Agent 任务的总成本最高可省 45%。本文整理官方公告与三大真实科研案例帮助开发者快速评估 Fable 5.1 在复杂任务、科研辅助和多模型架构中的适用位置。Fable 5.1 和 Mythos 5.1同一内核两套权限Claude Fable 5.1是 Anthropic 截至 2026 年 9 月的最强通用模型API 模型 ID 为claude-fable-5-1同时上线 Anthropic API、AWS Bedrock、Google Agent Platform 和 Microsoft Foundry。Claude Mythos 5.1共用相同权重但开放了更高风险能力上限目前仅向通过 Cyber Verification ProgramCVP和 Life Sciences Verification ProgramLSVP审核的美国机构开放国际扩展将配合美国政府节奏推进。两者的核心差异不在模型能力而在安全护栏的松紧程度Mythos 5.1 可在漏洞研究和生物分子设计场景下执行更高风险的操作。跑分解读多个基准形成断层基准测试Fable 5.1Fable 5Opus 5GPT-5.6 SolTerminal-Bench-Science 0.152.6%24.7%29.0%22.4%Terminal-Bench 4.055.8%42.0%52.3%37.3%CursorBench 3.273.4%70.5%70.0%67.2%AutomationBench31.4%17.1%26.9%19.6%GDPval-AA v21853172318241711HLE无工具60.9%57.8%56.6%—HLE含工具65.0%63.8%63.6%—科研向基准Terminal-Bench-Science的涨幅最为显著——相较上代直接翻倍且与竞争对手拉开代差。AutomationBench商业工作流自动化从 17.1% 飙升至 31.4%接近翻倍意味着 Agent 场景的实用性边界正在快速扩大。三个真实案例AI 不再只是辅助重绘金星三分之一地形NASA 麦哲伦号于 1990 年代采集的金星雷达数据分辨率仅 10—20 公里人类迄今只完成其中约五分之一区域的高程建图。Fable 5.1 在这批公开数据上训练了一个神经网络输出覆盖金星约三分之一面积的高分辨率地形图空间分辨率提升至 2—3 公里高度估计精度最高提升 25%。生成结果已以 Creative Commons 授权公开发布。蛋白质设计命中率逼近五成在抗体和多肽设计领域调用开源设计工具后Mythos 5.1 为 EGFR、Nipah G 等 12 个靶点提交了分子设计方案。外部机构直接完成湿实验验证3 个靶点的结合亲和力达 Adaptyv Bio 竞赛最佳参赛方案的10 倍12 个靶点的总体命中率接近50%行业常态为 10—15%手写 GPU Kernel生信推理成本腰斩基因组学和蛋白质研究中模型推理往往要反复运行数千至数万次GPU 成本随之叠加。Mythos 5.1 仅凭公开源码独立为 7 个开源生物信息学模型包括 Evo 2 大模型手写了 CUDA Kernel在 NVIDIA H100 上推理速度最高提升2.5 倍且输出结果与原版完全一致。实际账单对比一项扫描 300 万个变异的全基因组分析用 Evo 2 跑的成本从约 18000 元降至约 8000 元。代码工程长链路任务的一次完整交付过去的代码 AI 最怕的不是写代码本身而是在连续运行数小时、调用数十个工具后丢失任务目标或者遭遇报错时绕开根因而非修复。Fable 5.1 在设计上强化了这条完整动作闭环读取仓库文档拆解任务目标执行修改运行测试定位失败根因进入下一轮修复在 CursorBench 3.2 上Fable 5.1 以 73.4% 刷新最高分。Anthropic 案例中它帮助对冲基金 Millennium 定位了一个潜伏 4—5 年的偶发性崩溃——根因在第三方库内部Fable 5.1 一路追踪到外部、完成反汇编后将其彻底修复。定价变化总成本最高节省 45%计费项Fable 5.1Fable 5变化输入每百万 token与上代持平—不变输出每百万 token与上代持平—不变缓存读取每百万 token¼ 上代价格—↓75%缓存读取是 Agent 任务成本的主要构成——长上下文多轮对话每次都要重读已有内容。普通场景可节省约 25%重度 Agent 场景节省幅度最高达 45%。如何调用 Fable 5.1 API通过 Anthropic 官方 SDK 接入fromanthropicimportAnthropic clientAnthropic()# 使用 ANTHROPIC_API_KEY 环境变量responseclient.messages.create(modelclaude-fable-5-1,max_tokens8096,messages[{role:user,content:分析以下代码中潜在的性能瓶颈}])print(response.content[0].text)在需要同时调用国产大模型的多模型架构中可通过 OpenAI 兼容格式平行接入七牛云 Token PlanfromAnthropicimportAnthropic# 七牛云 Token Plan单 Key 覆盖 DeepSeek-V4、Kimi-K3、GLM-5.3、MiniMax-M3 等 15 款国产模型qiniu_clientAnthropic(base_urlhttps://api.qnaigc.com/v1,api_keyyour-qiniu-token-plan-key)responseqiniu_client.chat.completions.create(modeldeepseek-v4,# 可切换至 kimi-k3、glm-5.3、minimax-m3 等messages[{role:user,content:请处理...}])国内多模型推理 API 平台速查2026年9月在混合架构或国内合规场景中若需将 Fable 5.1 与国产模型并联使用以下平台可作为接入选项平台模型覆盖起步价格计费模式API 兼容格式七牛云 Token PlanDeepSeek-V4、Kimi-K3、GLM-5.3、MiniMax-M3 等 15 款国产模型¥2,999/月月度积分每周刷新OpenAI / Anthropic硅基流动Llama、Qwen 等开源模型按量付费Token 按量OpenAI火山方舟豆包/Doubao 系列按量付费Token 按量OpenAI七牛云 Token Plan 的差异化在于单 API Key 切换多款国产模型月度积分按周刷新适合需要控制成本上限的团队。接入端点api.qnaigc.com/v1。安全机制护栏松紧并行安全侧的主要变化体现在两个方向同步推进降低误伤针对网络安全场景Fable 5.1 对漏洞发现类请求的误拦截率较 Fable 5 降低约 60%对基础生物学查询的误拦截率下降约 85%。漏洞发现现已被允许漏洞利用代码仍被完全阻断。反蒸馏保护2026 年 8 月 31 日后注册的 API 账号无法在对话中途手动修改上下文来提取模型思维链尝试修改时 API 将直接报错或清除整个思考块。Anthropic 表示后续新模型将对全账号强制生效。此外Fable 5.1 在外部 Prompt 注入防御基准上成为最强一档针对越权访问外部资源和动机推理的对齐度也较 Mythos 5 有所提升。小结Fable 5.1 标志着 AI 模型的能力边界已从辅助工具迈向亲自执行金星地形建图、蛋白质设计、GPU 核函数手写三个案例共同指向同一个趋势——AI 可以作为一线科研执行者而不只是信息检索工具。对开发者而言缓存读取降价 75% 是部署长上下文 Agent 任务的直接利好对科研机构而言Mythos 5.1 的限制性开放意味着这一轮红利仍处于早期。文中数据来自 Anthropic 官方公告2026年9月Terminal-Bench-Science、CursorBench 数据均为发布时最新版本模型定价以官方发布为准。此为高时效选题建议 39 天内跟进更新。延伸阅读Anthropic 官方公告https://www.anthropic.com/claude-fable-and-mythos-5-1Enterprise Frontier Safeguards 说明https://www.anthropic.com/news/enterprise-frontier-safeguards七牛云 Token Planhttps://qiniu.com/ai/plan

相关新闻

「GPT-6」灰测demo刷屏,OpenAI官方尚未认领

「GPT-6」灰测demo刷屏,OpenAI官方尚未认领

2026/9/3 0:46:20

过去几天,一批自称拿到 OpenAI 内部检查点权限的开发者,陆续在社交平台上放出神秘模型的实测 demo,社区普遍认为它就是传闻中的 GPT-6(内部代号 Astra)。据量子位等媒体报道,这些 demo 均来自社区&#xff…

OpenAI囤数万台Mac做强化学习,苹果芯片凭什么

OpenAI囤数万台Mac做强化学习,苹果芯片凭什么

2026/9/3 0:46:20

据《The Information》援引 OpenAI 内部人士的报道(8 月 31 日多家媒体转载),过去几个月,OpenAI 购买数万台 Mac mini 和 Mac Studio,用于强化学习和"会操作电脑的智能体"(computer-using agent&…

免费AI写作辅助网站分享,AI写作辅助网站大合集!

免费AI写作辅助网站分享,AI写作辅助网站大合集!

2026/9/3 0:36:19

大学生写论文,优先选中文适配、学术合规、有免费额度、能降重 / 控 AI 率、自动排版的工具。接下来按场景推荐工具,每款附带核心功能、免费 / 付费情况、适用人群,方便读者直接选型。 一、全流程全能型(从开题到答辩一站式&#x…

电动汽车门线束3D参数化设计:CATIA模块画线全流程解析

电动汽车门线束3D参数化设计:CATIA模块画线全流程解析

2026/9/3 1:36:22

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

Android反编译工具全解析:jadx、apktool与dex2jar实战指南

Android反编译工具全解析:jadx、apktool与dex2jar实战指南

2026/9/3 1:36:22

简介:这是一款面向安卓开发与安全分析人员的反编译集成工具包,将安装包解包、DEX 转 JAR、Java 源码查看等常见流程整合在一起,适合刚接触逆向的新手快速搭建分析环境,也能提升日常应用拆解的效率,对希望系统了解 APK …

Graph工程自嗨陷阱:用Neo4j实战用户-订单-商品关系分析

Graph工程自嗨陷阱:用Neo4j实战用户-订单-商品关系分析

2026/9/3 1:36:22

之前在复盘一个图数据库项目时,有个现象让我印象很深:项目做完了,图模型很完整,路径查询很炫酷,PageRank 也跑了一堆,但业务方只问了一句“这个结果对我有什么用”,整个团队沉默了。那次之后我开…

智能体开发实战:工具调用与结果回执如何决定Agent闭环质量

智能体开发实战:工具调用与结果回执如何决定Agent闭环质量

2026/9/3 1:36:22

这期 GitHub 日报的关键词是智能体,但真正值得关注的不是某个仓库的对话效果,而是两个经常被忽略的工程能力:手和回执。所谓“手”,就是工具调用、动作执行、API 对接;所谓“回执”,就是任务执行完&#xf…

特摄动作对战一挑三测试:从环境配置到批量统计

特摄动作对战一挑三测试:从环境配置到批量统计

2026/9/3 1:36:22

这次我们来看一个特摄粉丝向动作对战玩法里非常典型的压力场景:在“奥传2”素材包中,使用布莱泽的法多兰形态,同时应对巴罗萨星人、巴克西卜和达达机器人三个对手。名字虽然绕,但战斗逻辑很直白,一对多,索敌…

论文总自查Skills发布:300条格式要求,AI一键查完

论文总自查Skills发布:300条格式要求,AI一键查完

2026/9/3 1:26:22

30日备赛计划第26期|论文总自查Skills发布:300条格式要求,AI一键查完过去半个月,我们完成了论文各板块的模板制作与专项自查Skills开发。本期将所有板块的自查内容合并为一款论文总自查Skills——基于竞赛论文将近300条格式要求&a…

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析

2026/9/2 10:08:07

每年校招季我都会接触不少准备数据库方向笔试的同学,看到最多的状态就是:简历上写着“熟悉 MySQL”“了解索引优化”,一碰到数据库管理工程师的笔试卷,却在索引、事务、锁、备份恢复这些题目上翻车。网易这套 2018 校园招聘数据库…

数字电路时序基石:深入理解建立时间与保持时间

数字电路时序基石:深入理解建立时间与保持时间

2026/9/2 12:11:52

1. 这不是“背公式”的事:时间参数到底在约束什么你翻过数字电路教材,一定见过这两个词:建立时间(Setup Time)和保持时间(Hold Time)。它们常被并列写在触发器(Flip-Flop&#xff09…

蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

2026/9/1 23:49:08

1. 项目缘起:从赛题到超声波测距机的诞生第八届蓝桥杯单片机设计与开发国赛的题目,我至今记忆犹新。它没有直接给出一个花哨的名字,而是用“超声波测距机”这个朴实无华的功能描述,精准地勾勒出了考核的核心。对于当时备赛的我而言…

【原创】基于微信小程序+AI大模型+uni-app的宠物用品商城小程序(设计与实现)

【原创】基于微信小程序+AI大模型+uni-app的宠物用品商城小程序(设计与实现)

2026/9/3 0:06:18

摘要:随着电子商务与本地生活服务的普及,线上交易与店铺运营管理已成为常规业态。传统分散式进销存与人工对账方式存在流程割裂、库存难同步、促销规则难落地、经营数据难沉淀等弊端,难以支撑一体化的数字化运营。同类课题亦多见多商户在线商…

【原创】基于AI大模型+SpringBoot+Vue的宠物用品商城(设计与实现)

【原创】基于AI大模型+SpringBoot+Vue的宠物用品商城(设计与实现)

2026/9/3 0:06:18

摘要:随着电子商务与本地生活服务的普及,线上交易与店铺运营管理已成为常规业态。传统分散式进销存与人工对账方式存在流程割裂、库存难同步、促销规则难落地、经营数据难沉淀等弊端,难以支撑一体化的数字化运营。同类课题亦多见多商户在线商…

【原创】基于微信小程序+AI大模型+uni-app的节日礼品定制商城小程序(设计与实现)

【原创】基于微信小程序+AI大模型+uni-app的节日礼品定制商城小程序(设计与实现)

2026/9/3 0:06:18

摘要:随着电子商务与本地生活服务的普及,线上交易与店铺运营管理已成为常规业态。传统分散式进销存与人工对账方式存在流程割裂、库存难同步、促销规则难落地、经营数据难沉淀等弊端,难以支撑一体化的数字化运营。同类课题亦多见多商户在线商…

远程协作的工作台整理

远程协作的工作台整理

2026/9/2 6:21:32

远程协作的工作台整理远程协作的核心不是再加一个工具,而是让交接信息足够完整。异步任务要写明目标、输入位置、完成标准和需要决策的人。 工作台的最小配置 将日程、待办、代码和沟通入口收拢到少数固定位置;通知按紧急程度分层。工作台不需要模仿办公…

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

2026/9/2 6:21:32

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

2026/9/2 2:45:06

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…