CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Lang...

发布时间:2026/7/27 23:26:38

CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Lang...
CrossVid论文核心总结与翻译一、主要内容研究背景:现有视频理解基准多聚焦于单视频分析,无法评估多模态大语言模型(MLLMs)的跨视频推理(CVR)能力——即同时理解多个视频、聚合对比跨视频信息的能力。部分多视角基准仅局限于同一场景的不同视角,难以覆盖真实世界中多样复杂的CVR场景。CrossVid基准构建:数据集规模:包含5331个视频和9015个高质量问答对,涵盖单选、多选、开放式三种题型,平均每个查询需模型理解约770秒的视频内容。任务体系:采用分层设计,包含4个高级维度(比较分析、时间理解、多视角推理、自由形式问答)和10个具体任务,覆盖32种视频类型,来源包括Animal Kingdom、YouCook2等6个公开数据集。标注流程:通过半自动化 pipeline 构建,结合Qwen2.5-VL-72B生成帧描述、DeepSeek-R1生成问答对,经10名专家标注者的过滤、优化和质量控制,确保数据可靠性。实验与发现:评估了22个开源和闭源MLLMs(参数规模7B-78B),Gemini-2.5-Pro表现最佳,平均准确率仅50.4%,远低于人类的89.2%。关键结论:闭源模型显著优于开源模型;具备“思考”机制的模型推理性能更优;输入帧数、思维链(CoT)提示对性能有正向影响,但过量无关帧会引入噪声;现有模型的核心缺

相关新闻

Group-Aware Reinforcement Learning for Output Diversity in Large Language Models

Group-Aware Reinforcement Learning for Output Diversity in Large Language Models

2026/7/27 23:26:38

一、文章主要内容总结 该研究针对大型语言模型(LLMs)在生成任务中普遍存在的模式崩溃(mode collapse) 问题——即即便存在多个有效答案,模型仍反复生成少量相同输出,限制了输出多样性——提出了一种强化学习方法:Group-Aware Policy Optimization(GAPO,群体感知策略优…

大数据转大模型实战,第一道门槛可能不是算法

大数据转大模型实战,第一道门槛可能不是算法

2026/7/27 23:16:38

聊《大数据转大模型实战,第一道门槛可能不是算法》之前,先说一句实在的:别急着背概念,先看它在真实项目里到底解决什么问题。摘要摘要:从大数据到大模型,你以为要学算法、练 Prompt?其实企业最在…

六、定语从句和状语从句

六、定语从句和状语从句

2026/7/27 23:16:38

定语从句 & 状语从句 最全对比精讲一、核心本质总区分表格项目定语从句(关系从句)状语从句别名关系从句、形容词性从句副词性从句作用修饰前面的名词 / 代词修饰主句动词、形容词、整句话位置紧跟被修饰名词后句首 / 句中 / 句尾都可前置标志前面一定…

Mission Planner:从飞行控制到任务执行的3种实用解决方案

Mission Planner:从飞行控制到任务执行的3种实用解决方案

2026/7/28 0:36:56

Mission Planner:从飞行控制到任务执行的3种实用解决方案 【免费下载链接】MissionPlanner Mission Planner Ground Control Station for ArduPilot (c# .net) 项目地址: https://gitcode.com/gh_mirrors/mi/MissionPlanner 当无人机操作从简单的遥控飞行升级…

[具身智能-671]:亚博 STM32 机器人控制板 + 电机就可以构建一个运动机器人,可以不需要主控,如 X5?

[具身智能-671]:亚博 STM32 机器人控制板 + 电机就可以构建一个运动机器人,可以不需要主控,如 X5?

2026/7/28 0:36:56

结论先说清楚硬件上:亚博这块 STM32 控制板 编码器电机 锂电池,确实可以构成一台能运动的机器人,不强制需要 RDK X5 / Jetson 这类 Linux 主控。 但是要严格区分两种工作模式,能力上限差距巨大:一、模式 1&#xff1…

如何快速使用League Akari:英雄联盟本地自动化工具完整指南

如何快速使用League Akari:英雄联盟本地自动化工具完整指南

2026/7/28 0:36:56

如何快速使用League Akari:英雄联盟本地自动化工具完整指南 【免费下载链接】League-Toolkit An all-in-one toolkit for LeagueClient. Gathering power 🚀. 项目地址: https://gitcode.com/gh_mirrors/le/League-Toolkit 你是否曾在英雄联盟游戏…

PE 与 PDB 的调试身份匹配

PE 与 PDB 的调试身份匹配

2026/7/28 0:36:56

PE 与 PDB 的调试身份匹配 具体实现可见于KswordARK项目,开源地址:https://github.com/KSwordDEV/KSword/ 目标与四步流程 要想从指定 PE 文件中取得可核验的 PDB 调试身份,分为四步: 以只读方式取得完整且长度受限的 PE 文件…

【风电功率预测】【多变量输入单步预测】基于TCN-GRU-Attention的风电功率预测研究

【风电功率预测】【多变量输入单步预测】基于TCN-GRU-Attention的风电功率预测研究

2026/7/28 0:36:56

✅作者简介:热爱科研的Matlab仿真开发者,擅长数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。 🍎 往期回顾关注个人主页:Matlab科研工作室 🍊个人信条:格物致知,完整Matlab代码及仿真咨…

英雄联盟玩家的终极效率工具:League-Toolkit完全使用指南

英雄联盟玩家的终极效率工具:League-Toolkit完全使用指南

2026/7/28 0:26:56

英雄联盟玩家的终极效率工具:League-Toolkit完全使用指南 【免费下载链接】League-Toolkit An all-in-one toolkit for LeagueClient. Gathering power 🚀. 项目地址: https://gitcode.com/gh_mirrors/le/League-Toolkit 你是否曾经在英雄联盟对局…

[具身智能-649]:个人电脑搭建 RTSP 服务完整方案(Windows / Ubuntu 双平台,适配 RDK X5 rtsp2display 调试)

[具身智能-649]:个人电脑搭建 RTSP 服务完整方案(Windows / Ubuntu 双平台,适配 RDK X5 rtsp2display 调试)

2026/7/27 8:45:59

目标:电脑作为RTSP 服务端,循环推送 H264/H265 视频流; RDK X5 通过 rtsp2display 拉流预览,完全不需要在开发板编译 live555。 提供两套成熟方案: ✅ 方案 A:FFmpeg(最简单,优先推…

PDF合并与动态水印的工程化方案:2026国内免费工具实测对比

PDF合并与动态水印的工程化方案:2026国内免费工具实测对比

2026/7/27 8:42:17

一、背景与测试方案 在实际项目交付中,PDF文件合并与版权保护水印的叠加是一个高频但容易被低估的技术需求。典型的处理链路涉及:多源PDF的文件流合并、页面级水印渲染(含透明度混合与图层叠加)、输出文件体积控制。看似简单的操作…

PDF拆分压完图糊了?2026国内免费实测,档案员都在用的组合方案

PDF拆分压完图糊了?2026国内免费实测,档案员都在用的组合方案

2026/7/27 14:56:57

说实话,提到PDF拆分再压缩,我真是被折腾得够呛。 上个月公司年度合同归档,一份300多页的PDF总合同,需要按年份拆分成三个独立文件,再分别压缩到10MB以内方便邮件发送各部门确认。我心想这还不简单?先找个海…

零基础搭建桌面智能体,OpenClaw 2.7.9 分步实操,避开绝大多数部署陷阱

零基础搭建桌面智能体,OpenClaw 2.7.9 分步实操,避开绝大多数部署陷阱

2026/7/28 0:06:55

📌 一、工具核心优势盘点 数据本地存储,安全系数高所有操作日志、文档资料均保存在本机,不会上传至云端,能够有效保护企业文件与个人隐私,规避数据泄露风险。 上手简单,零编程门槛采用全图形化可视化界面&…

计算机毕业设计之基于springboot的购物平台设计与实现

计算机毕业设计之基于springboot的购物平台设计与实现

2026/7/28 0:06:55

由于移动应用技术的持续性的快速发展,现实生活中人们大多数都是通过移动手机、电脑等智能设备来完成生活中的事务。因此,许多的人工传统行业也开始与互联网结合,不再一味的依靠人工手动,努力打造半自动数字化甚至是全自动数字化模…

豆包AI绘图提示词失效真相:NLP模型层token截断机制首次披露,3招绕过字数限制

豆包AI绘图提示词失效真相:NLP模型层token截断机制首次披露,3招绕过字数限制

2026/7/28 0:06:55

更多请点击: https://codechina.net 第一章:豆包AI绘图提示词失效现象全景扫描 近期大量用户反馈,豆包(Doubao)AI绘图功能对常规提示词(Prompt)响应异常:语义明确的指令被忽略、中英…