FSR-Bench 前沿科学推理榜单发布:GPT-5.5 居首,“会推理”未必“能答对”

发布时间:2026/9/2 8:25:34

FSR-Bench 前沿科学推理榜单发布:GPT-5.5 居首,“会推理”未必“能答对”
评测背景当大模型开始具备联网搜索、代码执行和数据分析能力我们对模型科学推理能力的评价标准也在发生变化。真实的科研与专业分析中模型不仅要理解问题还要判断何时检索资料、如何筛选证据、是否需要运行代码以及怎样把工具返回的信息转化为可靠结论。前沿科学推理评测集Frontier Scientific Reasoning Benchmark简称 FSR-Bench正是围绕这一变化构建的高难度评测基准。它包含 867 道题覆盖化学、医疗、地理、天文、数学、物理、生物和金融 8 个学科其中纯文本题 425 道、多模态题 442 道。每道题分别在开启原生工具和不开启原生工具两种配置下评测并同时考察作答过程与最终答案。本次晓天衡宇 FSR-Bench 榜单覆盖国内外主流大模型的 28 个评测配置。我们从学科类别、题型形态和工具使用等维度组织题目采用过程分与结果分双维度评分考查大模型对高难度前沿科学问题的专业理解、跨模态分析、证据整合、工具调用与答案推导能力。榜单概览主榜将开启工具与不开启工具的配置放在同一张榜单中开启工具的模型以“w.Tool”标识同一模型的两种配置会被视为两个独立条目下表仅展示前 20 名。点击访问晓天衡宇评测社区查看完整榜单、排行榜规则、评测集详情、详细得分榜单。核心结论结论 1GPT-5.5 开工具位居总榜第一榜单呈现明显梯队分化在“所有题·结果分”主榜中GPT-5.5xhighw.Tool以 64.70 分排名第一GPT 5.6 Solloww.Tool以 60.40 分位列第二两款模型不开工具时分别获得 60.20 分和 55.20 分四个配置包揽总榜前四。第二十名Seed 2.1 Prow.Tool的结果分仅为16.15 分。这说明本次评测中各模型在前沿科学推理任务上的表现存在较大差异。结论 2过程分普遍高于结果分推理完整不等于答案正确在本次评测的模型配置中所有模型的过程分都高于结果分。其中GPT 5.6 Solloww.Tool的过程分为 74.20高于 GPT-5.5xhighw.Tool的 73.60但其结果分为 60.40低于 GPT-5.5xhighw.Tool的 64.70。说明模型可能给出结构完整、表述专业的推理过程却仍在计算或答案环节表现不如推理过程。结论 3纯文本题得分整体高于所有题多模态题对模型要求更高在本次评测的模型配置中大部分模型的纯文本题结果分高于“所有题”结果分。GPT-5.5xhighw.Tool两项得分分别为 70.70 分和 64.70 分Gemini 3.5 Flashw.Tool 分别为 45.10 分和 36.00 分Gemini 3.1 Pro Previeww.Tool 分别为 37.50 分和 24.10 分。这表明在本次评测的多数开工具配置中纯文本题结果分高于“所有题”结果分含图片或图表的题目可能构成额外压力。结论 4工具整体带来得分提升但不同模型的工具收益差异显著在具有完整开关工具配对成绩的 14 款模型中13 款开启工具后结果分上升平均结果分由 24.67 分提高至 31.65 分增加 6.98 分。Claude Fable 5、Claude Sonnet 5 和 Claude Opus 4.8 分别提高 26.34 分、24.95 分和 18.57 分Gemini 3.5 Flash 和 Gemini 3.1 Pro 则仅提高 0.80 分和 0.30 分Qwen3.6-Plus 反而下降 1.00 分。这说明多数模型在开工具配置下获得了更高的结果分但不能仅凭是否开启工具预测模型成绩。评测设计晓天衡宇本次评测基于 FSR-Bench (Frontier Scientific Reasoning Benchmark)数据集共包含 867 道高难度前沿科学问题覆盖化学、医疗、地理、天文、数学、物理、生物和金融 8 个学科。其中纯文本题 425 道多模态题 442 道后者包含科学图像、图表等视觉信息。评测在两种配置下分别进行不开原生工具与开启原生工具。开工具 / 不开工具合并在同一个榜单开工具的模型名带 w.Tool 后缀不开工具默认不带后缀。不同模型的工具能力有所不同——GPT 系列主要使用原生搜索Claude、Gemini 及部分 Qwen 配置同时支持搜索与代码执行其他模型多以搜索工具为主。这一设计回答的不是“给所有模型装上完全相同的工具后会怎样”而是“各模型在自身实际可用的原生工具体系中能否提高科学问题的完成质量”。评测方法双维度评分FSR-Bench对每道题的作答过程和最终结果分别采用100分制独立评分。这一设计下模型即便最终答案错误仍可因推理路径合理获得较高的过程分反之猜对答案但推理过程存在缺陷的模型过程分则会暴露其不足。其中过程分评估推理链的完整性与质量主要考察作答过程是否完整、合理能否正确使用知识、证据和工具结果分评估最终答案的正确性判断答案是否准确、是否满足题目要求。裁判机制每道题由三个裁判模型独立评分取三者平均值作为最终得分。三个裁判模型分别为Qwen3.7-Max、GPT-5.6 Luna和Claude Sonnet 5。三裁判取平均的设计旨在降低单一裁判模型的评分偏好对结果的影响使评分更加稳健。排名与观测口径主榜仅使用“所有题·结果分”排序。其余指标作为分项观察口径不与主榜结果混排。所有题的过程分榜单用于分析模型是否形成了较高质量的解题过程纯文本题榜单用于观察模型在不含视觉输入题目上的科学推理表现开工具与不开工具配置的对比用于观察两套完整系统配置下的表现差异。分析与结论榜首优势明显主榜呈现出较清晰的分数层次从“所有题·结果分”看GPT-5.5xhighw.Tool以 64.70 分位列第一GPT 5.6 Solloww.Tool以 60.40 分排名第二两者相差 4.30 分。不开工具时GPT-5.5xhigh和 GPT 5.6 Sollow仍分别以 60.20 分和 55.20 分位列第三、第四。这两款 GPT 模型的四个配置包揽主榜前四。第五名 Claude Fable 5w.Tool为 49.97 分与第四名相差 5.23 分第六名 Qwen3.7-Plusw.Tool为 38.43 分与第五名相差 11.54 分。第六至第十名集中在 35.04—38.43 分之间最大分差仅 3.39 分构成较为接近的中部区间。28 个“模型×工具配置”条目的平均结果分为 28.16最高分与平均分相差 36.54 分。这表明高难度前沿科学推理能力目前仍集中在少数模型上尚未在本次参评模型中普遍形成。过程质量与最终答案正确性并不完全一致FSR-Bench分别评估过程分和结果分过程分关注推理链是否完整、分析是否合理结果分关注最终答案是否正确。两者独立评分可以区分“分析看起来合理”和“真正得到正确结论”这两种不同的能力。过程分与结果分的排名并不总是一致。开工具后GPT 5.6 Solloww.Tool的所有题过程分为74.20高于GPT-5.5xhighw.Tool的73.60但两者的结果分分别为60.40和64.70排名顺序发生反转。在纯文本题中GPT 5.6 Solloww.Tool的过程分为78.70同样略高于GPT-5.5xhighw.Tool的78.10而结果分分别为 65.20 和 70.70排名再次反转。这说明过程质量更高的模型配置未必能更准确地抵达正确答案。在开工具配置中所有模型的过程分都高于结果分。两者差距从 GPT-5.5xhighw.Tool的 8.90 分到 Kimi-K3w.Tool的 27.60 分不等。这说明部分模型能够形成结构完整、术语准确的分析却可能在精确计算、证据引用、条件处理、单位换算或结论收敛环节出现错误。工具整体提升得分但不同模型的工具收益差异明显在具有完整开关工具配对成绩的 14 款模型中13 款模型开启工具后的结果分上升平均结果分由 24.67 分提高至 31.65 分平均增加 6.98 分。不同模型的工具收益差异明显。Claude Fable 5 从 23.63 分升至 49.97 分增加 26.34 分Claude Sonnet 5 增加 24.95 分Claude Opus 4.8 增加 18.57 分Claude 系列包揽工具增益前三。相比之下GPT-5.5 和 GPT 5.6 Sol 分别提高 4.50 分和 5.20 分Gemini 3.5 Flash、Kimi-K3 和 Gemini 3.1 Pro 分别只提高 0.80 分、0.44 分和 0.30 分Qwen3.6-Plus 开启工具后反而下降 1.00 分。这说明开工具并不意味着模型能够稳定获得更高分模型还需要正确判断调用时机、提出有效的检索或代码请求、辨别外部信息质量并将工具输出准确整合进最终答案。纯文本题与“所有题”得分差异明显影响因模型而异FSR-Bench包含 425 道纯文本题和 442 道含图片或图表的多模态题。在总榜前二十名中有十八款模型配置的纯文本题得分高于所有题得分仅有两款例外。具体来看GPT-5.5xhighw.Tool的纯文本题结果分为 70.70所有题结果分为 64.70相差 6.00 分Gemini 3.5 Flashw.Tool分别为 45.10 分和 36.00 分相差 9.10 分Gemini 3.1 Pro Previeww.Tool分别为 37.50 分和 24.10 分相差 13.40 分。仅有的两款例外来自Claude系列Claude Fable 5w.Tool的所有题结果分反超纯文本题 0.64 分Claude Sonnet 5w.Tool反超 2.32 分差距均很微弱。这说明当模型需要同时理解专业文本、图片、图表和数值关系时任务难度通常会进一步上升。Claude系列两款模型在多模态题上的表现并未出现明显下滑说明多模态题的额外压力并非对所有模型同等显著少数模型已展现出较好的跨模态整合能力。模型在不同学科各有所长没有全面领先从总榜前 20 个模型配置的学科结果分看八个学科的最高分全部来自 GPT-5.5 和 GPT 5.6 Sol 的相关配置。其中GPT-5.5xhighw.Tool在地理、数学和金融上排名第一GPT-5.5xhigh在天文上排名第一GPT 5.6 Solloww.Tool则在化学、医疗、物理和生物上取得最高分。两款模型各领先四个学科但具体优势对应的工具配置并不完全相同。Gemini 3.5 Flashw.Tool虽然总榜仅排名第八但化学成绩达到 64.10 分在总榜前20个配置中位列第三Kimi-K3不开工具配置总榜排名第十八医疗成绩却达到 35.87 分位列第六。相反Claude Fable 5w.Tool以 49.97 分排名总榜第五并在数学和金融上分别以 70.39 分和68.88分位列第四和第三但其生物成绩仅为16.16分在总榜前 20 个配置中排名第十九。这说明综合排名靠后的模型仍可能在特定学科具备相对优势而总榜靠前的模型也可能存在十分明显的学科短板。开工具与不开工具配置之间的成绩差异也因学科而异。GPT-5.5xhighw.Tool相较 GPT-5.5xhigh化学、数学和物理结果分分别高出 10.10 分、7.50 分和 7.10 分但天文和生物分别低 1.60 分和 1.70 分。GPT 5.6 Solloww.Tool相较 GPT 5.6 Sollow化学和数学分别高出 12.10 分和 10.00 分但天文和金融分别低 4.80 分和 0.50 分。Gemini 3.5 Flashw.Tool相较 Gemini 3.5 Flash化学、数学和生物分别高出 5.20 分、9.00 分和 2.10 分但医疗、地理、天文、物理和金融均有所下降。可见即使模型在开工具配置下的“所有题·结果分”更高各学科成绩的变化方向和幅度也不完全一致。总体而言主榜排名概括了模型在 867 道题上的综合表现但无法完整反映其在各学科、各题型和不同工具配置下的具体差异。综合得分较高的模型可能在某些学科明显失分排名靠后的模型也可能在特定学科进入前列。综合判断从本次 FSR-Bench 评测结果来看前沿大模型已经能够在部分高难度科学问题中形成较完整的分析并借助工具提高最终得分但这种能力在不同模型、学科和题型之间存在明显差异。GPT-5.5在所有题结果分上取得最高分GPT 5.6 Sol在过程分上略占优势过程分普遍高于结果分说明即便模型能够形成结构完整、表述流畅的分析过程在精确计算、证据引用和最终结论收敛等环节仍可能出现偏差分析过程的完整并不等同于结论的准确。Claude系列在开启工具后得分提升最为明显。加入图片和图表后多数模型的得分有所下降说明多模态推理仍是当前多数模型的薄弱环节。注本文结论基于晓天衡宇本期评测体系与样本反映模型在该评测框架下的相对表现不代表所有业务场景中的绝对优劣。写在最后最新垂类领域模型评测榜单已同步上线至晓天衡宇评测社区官网欢迎访问查看更详细的评测数据关注晓天衡宇•评测社区官方账号获取更多大模型相关知识~

相关新闻

单相交流电子负载能量回馈系统:从PWM整流到并网逆变全解析

单相交流电子负载能量回馈系统:从PWM整流到并网逆变全解析

2026/9/2 8:25:34

简介:本资源是面向电子设计竞赛参赛者与高校电类专业学生的完整工程实践方案,聚焦湖北省电子设计大赛A组赛题——具备能量回馈能力的单相交流电子负载系统。项目基于STM32F4平台实现全数字控制,解决传统电子负载能耗高、谐波大、功率因数不可…

# Kubernetes(K8s)笔记Day11 : HPA 自动扩缩容

# Kubernetes(K8s)笔记Day11 : HPA 自动扩缩容

2026/9/2 8:25:34

一、扩缩容概述 弹性伸缩是根据用户的业务需求和策略,自动“调整”其“弹性资源”的管理服务。通过弹性伸缩功能,用户可设置定时、周期或监控策略,恰到好处地增加或减少“弹性资源”,并完成实例配置,保证业务平稳健康…

YOLOv5落地非机动车违规停放识别的工程实践

YOLOv5落地非机动车违规停放识别的工程实践

2026/9/2 8:25:34

简介:本资源是面向机器视觉算法工程师与智能交通系统开发者的YOLOv5训练专用数据集,聚焦非机动车违规停放场景中的自行车细粒度识别任务,特别适用于城市治理、智慧城管等实际落地项目。压缩包内含735张高质量JPG图像及配套的724个PASCAL VOC格…

从10个规格到10分钟:FreeCAD参数化设计自动化零件库完整指南

从10个规格到10分钟:FreeCAD参数化设计自动化零件库完整指南

2026/9/2 9:35:37

从10个规格到10分钟:FreeCAD参数化设计自动化零件库完整指南 【免费下载链接】FreeCAD Official source code of FreeCAD, a free and opensource multiplatform 3D parametric modeler. 项目地址: https://gitcode.com/GitHub_Trending/fr/FreeCAD 先说个真…

oh-my-codex(OMX)完整指南:三步把单人 Codex 变成有节奏的团队流

oh-my-codex(OMX)完整指南:三步把单人 Codex 变成有节奏的团队流

2026/9/2 9:35:37

oh-my-codex(OMX)完整指南:三步把单人 Codex 变成有节奏的团队流 【免费下载链接】oh-my-codex OmX - Oh My codeX: Your codex is not alone. Add hooks, agent teams, HUDs, and so much more. 项目地址: https://gitcode.com/GitHub_Tre…

从技术复盘视角解析王者荣耀高端局博弈:女娲与云缨的克制与反制策略

从技术复盘视角解析王者荣耀高端局博弈:女娲与云缨的克制与反制策略

2026/9/2 9:35:37

这次我们来看一个在《王者荣耀》游戏社区内引发热议的竞技话题:“(陌路女娲)国一晋级赛 撞车世一云缨子默 能做到吗?”。这本质上不是一个软件项目,而是一场极具代表性的高分段对局悬念分析。对于技术博主和游戏开发者…

用Python脚本高效拆分超大CSV文件:从原理到代码实战

用Python脚本高效拆分超大CSV文件:从原理到代码实战

2026/9/2 9:35:37

简介:针对逗号分隔值(CSV)文件因体积过大而无法直接导入MATLAB、Excel等软件的问题,这款csv拆分工具提供了实用的轻型解决方案,尤其适合数据分析、开发及测试人员按需将大文件切分为多个小文件,从而降低单次…

Scrapy股吧评论爬虫:毕业设计级可落地实现

Scrapy股吧评论爬虫:毕业设计级可落地实现

2026/9/2 9:35:37

简介:这是一套基于Scrapy框架实现的股吧评论高效爬取项目,面向Python初学者、数据采集实践者及计算机类本科毕业设计学生,解决股票舆情数据快速获取与结构化存储的实际需求。资源包共17个文件,含7个核心Python源码(如s…

AgentsView S3根配置:中心实例如何读取其他机器推送的会话文件

AgentsView S3根配置:中心实例如何读取其他机器推送的会话文件

2026/9/2 9:25:37

AgentsView S3根配置:中心实例如何读取其他机器推送的会话文件 【免费下载链接】agentsview Local-first session search, analytics, insights, and token use statistics for coding agents, supporting Claude Code, Codex, and more than 20 other agents. 项…

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析

2026/9/1 1:53:39

每年校招季我都会接触不少准备数据库方向笔试的同学,看到最多的状态就是:简历上写着“熟悉 MySQL”“了解索引优化”,一碰到数据库管理工程师的笔试卷,却在索引、事务、锁、备份恢复这些题目上翻车。网易这套 2018 校园招聘数据库…

数字电路时序基石:深入理解建立时间与保持时间

数字电路时序基石:深入理解建立时间与保持时间

2026/9/1 9:55:14

1. 这不是“背公式”的事:时间参数到底在约束什么你翻过数字电路教材,一定见过这两个词:建立时间(Setup Time)和保持时间(Hold Time)。它们常被并列写在触发器(Flip-Flop&#xff09…

蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

2026/9/1 23:49:08

1. 项目缘起:从赛题到超声波测距机的诞生第八届蓝桥杯单片机设计与开发国赛的题目,我至今记忆犹新。它没有直接给出一个花哨的名字,而是用“超声波测距机”这个朴实无华的功能描述,精准地勾勒出了考核的核心。对于当时备赛的我而言…

单片机毕业设计-基于单片机与蓝牙通讯的输液状态监测终端设计与开发 基于 STM32 或 51 单片机的液位‑滴速‑温度多参数输液监护装置设计(024005)

单片机毕业设计-基于单片机与蓝牙通讯的输液状态监测终端设计与开发 基于 STM32 或 51 单片机的液位‑滴速‑温度多参数输液监护装置设计(024005)

2026/9/2 0:04:59

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于嵌入式单片机,Java、小程序技术领域和毕业项目实战 ✌️…

DeepSeek字幕翻译实战:从API调用到批量SRT转中文的完整方案

DeepSeek字幕翻译实战:从API调用到批量SRT转中文的完整方案

2026/9/2 0:04:59

这次我们来看一个很实用的 DeepSeek 落地场景:用 DeepSeek 把英文视频字幕自动翻译成中文。具体案例是《恶魔君》1989 年第 28 集的英转中字幕任务,标题写得很直白,但背后其实是一整套可以复用的技术流程:字幕解析、模型调用、批量…

用Python搭建搞笑语音助手:从语音识别到语音合成全教程

用Python搭建搞笑语音助手:从语音识别到语音合成全教程

2026/9/2 0:04:59

当你家里摆着一台天猫精灵,却总希望语音助手偶尔“不正经”一点,不用官方腔回答问题,而是张口就接几句搞笑段子,会是什么体验?我最近动手验证了一下这个想法——没有去改装任何市面上现有的智能音箱,而是直…

远程协作的工作台整理

远程协作的工作台整理

2026/9/2 6:21:32

远程协作的工作台整理远程协作的核心不是再加一个工具,而是让交接信息足够完整。异步任务要写明目标、输入位置、完成标准和需要决策的人。 工作台的最小配置 将日程、待办、代码和沟通入口收拢到少数固定位置;通知按紧急程度分层。工作台不需要模仿办公…

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

2026/9/2 6:21:32

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

2026/9/2 2:45:06

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…