arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4155 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 1018 篇

2608.09068 2026-08-11 cs.SE 新提交 78%

Pseudo2CodeQA: A Benchmark for LLM-Based Structured Algorithmic Reasoning in Code Generation

Pseudo2CodeQA:面向基于大语言模型的代码生成中结构化算法推理的基准测试

Shadikur Rahman, Umme Ayman Koana, Syed Muhammad Danish

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出Pseudo2Code基准测试及Pseudo2Code Agentic Framework,实验表明该框架性能优于现有基线,验证了结构化伪代码对代码生成的提升作用。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06769 2026-08-10 cs.CV 新提交 78%

GraphVerse: A Comprehensive Visual Graph Reasoning Benchmark for Multimodal Large Language Models

GraphVerse:面向多模态大语言模型的综合性视觉图推理基准

Yuanfu Sun, Yuanhang Ren, Kang Li, Chuanhao Ji, Jiaxi Li, Jiajin Liu, Ninghao Liu, Qiaoyu Tan

机构 * New York University(纽约大学) Sensetime Research(商汤科技研究院) Tsinghua University(清华大学) New York University Shanghai(上海纽约大学) University of Georgia(佐治亚大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 针对现有多模态大语言模型(MLLMs)评估缺乏结构化视觉推理测试的问题,提出GraphVerse基准,通过以图为中心的图像编辑(GIE)策略和VGR-Score指标,评估MLLMs在单/配对图像场景下的视觉图推理能力,揭示其相关局限并验证方法有效性。

Comments 33 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06013 2026-08-07 cs.HC 新提交 78%

OneEmo: A Unified Multimodal Reasoning Model for Emotion Perception, Understanding, and Interaction

OneEmo:用于情感感知、理解与交互的统一多模态推理模型

Jiahao Huang, Zheng Lian, Jingyi Zhang, Zhide Chen, Xiaojiang Peng, Shaonan Wang

专题命中 推理评测 :reasoning(title,abstract)

AI总结 针对现有情感智能多模态模型忽略任务协同的问题,研究人员提出统一多模态情感模型OneEmo,构建EmoWorld-130K数据集并采用Emo-Chord强化学习策略,其性能优于同规模基线模型,参数远少于商业模型且结果具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05757 2026-08-07 cs.CV 新提交 78%

Beyond Relevance: Bayesian Evidence Acquisition for Agentic Whole-Slide Image Reasoning

超越相关性:面向智能体的全切片图像推理的贝叶斯证据获取

Bryan Wong, Xun Xu, Huazhu Fu, Nancy F. Chen, Mun Yong Yi

机构 * A*STAR(新加坡科技研究局)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本研究提出BEACON框架,将WSI推理建模为贝叶斯证据获取问题,通过最大化预期信息增益减少诊断不确定性,在五个WSI-VQA基准的零样本实验中,其性能优于同类无训练智能体框架,提升了证据获取效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05820 2026-08-07 physics.ed-ph 新提交 78%

A multi-agent AI classroom based on dual-process reasoning hazards: a pilot with prospective physics teachers

基于双加工推理风险的多智能体AI课堂:面向未来物理教师的试点研究

Eugenio Tufino

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本研究构建基于双加工理论风险框架的多智能体AI模拟课堂,用于培养未来物理教师回应学生推理的能力,发现其能显著提升诊断分数,且可揭示教师知与行的发展差距,为物理教师培养提供支持。

Comments 16 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23472 2026-07-28 cs.CV 新提交 78%

VIPER: Visual In-Context Physics Reasoning for Physically Plausible Video Generation

VIPER:用于物理上合理的视频生成的视觉上下文物理推理

Tianxiao Chen, Hanmo Chen, Huajin Chen, Bo Li, Qi Ye, Peng-Tao Jiang

机构 * Zhejiang University(浙江大学) vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 研究针对视频生成模型控制物理行为难的问题,提出VIPER框架,利用多模态大语言模型提取物理线索,通过分层训练引导图像到视频生成器,构建VIPER-19K数据集,实验证明该框架能实现物理行为转移且效果良好。

Comments tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21993 2026-07-27 cs.GT 新提交 78%

Three-Body Alignment: Aligning Chess Agent with Human Reasoning through Reranked Rationale

三体对齐:通过重新排序的理由将国际象棋智能体与人类推理对齐

Jaymari Chua, Chen Wang, Liming Zhu, Lina Yao

专题命中 推理评测 :reasoning(title,abstract)

AI总结 研究如何通过国际象棋中的“三体对齐”,分析人类专家、引擎辅助评论员和大语言模型产生的理由间语义差异,构建多源理由数据集,进行实证分析与实验,开发数据集结构并开源,以改善智能体与人类对齐及决策的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20197 2026-07-23 cs.CV 新提交 78%

RS-RIE-Bench: Benchmarking Reasoning-Guided Remote Sensing Image Editing

RS-RIE-Bench:推理引导的遥感图像编辑基准测试

Zihan Qin, Boao Xu, Zhao Dong, Yingping Sun, Ziheng Jiao, Junying Wang, Hongwei Wang

机构 * Huawei(华为)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 该研究针对遥感图像编辑,引入RS-RIE-Bench基准,将任务分类,通过特定评估协议和方法评估模型,经实验发现当前模型在推理引导的遥感编辑中有局限,为未来模型提供了基准和研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19238 2026-07-22 cs.CE 新提交 78%

FinanceComplexQA: Benchmarking Agentic Reasoning on Industrial-grade Financial Documents

FinanceComplexQA:对工业级金融文档进行智能体推理的基准测试

Xianfu Cheng, Shiwei Zhang, Jiyu Zhao, Jian Yang, Xinyuan Wang, Ming Zhou, Weixiao Zhou, Xiangyuan Guan, Xiang Li, Zhenhe Wu, Ziyi Ni, Zhoujun Li, Bingjing Xu

专题命中 推理评测 :reasoning(title,abstract)

AI总结 研究针对金融文档智能体推理性能差异问题,设计Finance-LaTeX SKILL生成金融文档和问答对,引入FinanceComplexQA基准测试,对领先系统和工具全面评估,通过分析失败案例研究其在多方面的能力。

Comments 27 pages, 9 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16595 2026-07-21 q-bio.OT 新提交 78%

Orientation Reading by Production Vision-Language Models on Optotype Charts: A Controlled Multi-Model Evaluation Across Reasoning Modes, Prompts, and Access Modalities

通过生产视觉语言模型在视标图表上进行方向读取:跨推理模式、提示和访问方式的受控多模型评估

Shahryar Wasif, Avneek Sandhu, Bin Hu

专题命中 推理评测 :reasoning(title,abstract)

AI总结 研究通过消费者聊天界面评估四个视觉语言模型在视标图表上读取方向的能力,在多种推理模式、提示变体下运行,发现各模型准确率有差异,错误有特定方向,单一准确率掩盖问题,强调应多轴评估视觉语言模型。

Comments 4 figures, 4 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16193 2026-07-20 cs.CV 新提交 78%

Knowing the Self, Understanding the World: A Dual-Cognition Benchmark for UAV Spatio-temporal Reasoning with MLLMs

认识自我,理解世界:用于基于多模态大语言模型的无人机时空推理的双认知基准测试

Like Liu, Zhengzheng Xu, Haitao He, Hongzhe Li, Shuchang Zhang, Dian Shao

机构 * Northwestern Polytechnical University(西北工业大学) China University of Petroleum(中国石油大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 该研究针对多模态大语言模型在无人机场景双认知能力评估不足的问题,提出UAV-DualCog基准测试,涵盖图像和视频任务,通过自动化管道构建数据,评估发现现有模型存在瓶颈,该基准测试有价值。

Comments 11 pages, 4 figures, 7 tables. Project website: https://uav-dualcog.lozumi.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15255 2026-07-17 cs.CV 新提交 78%

HoloGeo: Mitigating Landmark Bias in Geo-localization via Evidence-Driven Reasoning

HoloGeo:通过证据驱动推理减轻地理定位中的地标偏差

Pengcheng Zhou, Xuanyu Liu, Yanchen Yin, Bobo Li, Shengqiong Wu, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) Shandong University of Science and Technology(山东科技大学) University of Oxford(牛津大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 研究针对视觉语言模型地理定位易受地标偏差影响的问题,提出证据驱动推理框架HoloGeo,借助高质量数据集,通过多维度奖励实现平衡关注与联合推理,经实验验证其在多个数据集上能有效减轻地标偏差,提升地理定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12786 2026-07-15 cs.CV 新提交 78%

CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models

CoRe:视觉语言模型中跨图像比较推理的综合框架

Lin Peng, Cong Wan, Zeyu Guo, SongLin Dong, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 针对视觉语言模型跨图像比较推理难题,提出CoRe框架,含自动构建的训练集CoRe-20K、结构化奖励框架TriSR及基准CoRe-Bench,实验显示其在CoRe-Bench上大幅超越现有模型,在标准基准上也有竞争力。

Comments Accepted by ACMMM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11044 2026-07-14 cs.MM 新提交 78%

RetroHolmes: When Semantic Plausibility Fails Retrospective Physical Process Reasoning

RetroHolmes:当语义合理性失效时的回顾性物理过程推理

Ruoxuan Zhang, Qiyun Zheng, Siyu Wu, Ling Zou, Hongxia Xie, Zhiyu Zhou, Jian-Yu Jiang-Lin, Zihan Li, Zhengguang Wang, Bin Wen, Ling Lo, Jianlong Fu, Meibao Yao, Juncheng Hu, Wen-Huang Cheng

专题命中 推理评测 :reasoning(title,abstract)

AI总结 研究针对视觉语言模型物理推理评估不足问题,引入回顾性物理过程推理范式,提出RetroHolmes基准,通过它分析模型,发现失败模式,还展示综合分析实例,验证其诊断价值,凸显物理基础中间表示对物理推理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08790 2026-07-13 q-bio.QM 新提交 78%

DentiAsk: A VQA Benchmark for Multimodal Reasoning in Panoramic Dental Radiographs

DentiAsk:全景牙科X光片中多模态推理的视觉问答基准测试

Debesh Jha, Tapas Kumar Dutta, Roshan Paudel, Onkar Kishor Susladkar, Aashish Ghimire, Anupam Dhakal, Sabin Adhikari, Nand Kumar Yadav, Deepak Ranjan Nayak, Pravin Pawar, William C. W. Chen, Glenda Reynolds

专题命中 推理评测 :reasoning(title,abstract)

AI总结 研究旨在解决现有医学视觉问答基准测试无法充分体现全景牙科X光片解读复杂性的问题,引入DentiAsk基准测试,涵盖多种病变和推理层次,对10种模型测试发现其在空间定位等方面存在局限,为推进医学成像多模态推理提供挑战基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05440 2026-07-08 econ.EM cs.SY eess.SY 新提交 78%

Retrieval over Reasoning: A Cost-Controlled Benchmark of Language Models for Energy-Retrofit Recommendation

基于推理的检索:用于能源改造推荐的语言模型成本控制基准

Eliseo Curcio

专题命中 推理评测 :reasoning(title,abstract)

AI总结 研究为建筑推荐节能措施问题,通过树集成解决EUI预测,发现推荐任务框架影响模型选择,对八个大语言模型基准测试,表明其过度推荐,检索可缩小差距,还给出成本控制下模型的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03261 2026-07-08 cs.CV 新提交 78%

OmniLayout: A Schematic-Coupled Multimodal Benchmark for Constraint-Aware Geometric Reasoning in PCB Layout

OmniLayout:用于印刷电路板布局中约束感知几何推理的原理图耦合多模态基准测试

Taiting Lu, Kaiyuan Lin, Mingjia Wang, Haolin Ye, Runze Liu, Yuxin Tian, Vahe Melkonyan, Haoyu Wang, Muchuan Wang, Chufan Hong, Yifan Yang, Sung-Liang Chen, Yi-Chao Chen, Yicheng Jin, Mahanth Gowda

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Shanghai Jiao Tong University(上海交通大学) Microsoft Research(微软研究院) Binghamton University(宾汉姆顿大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 介绍OmniLayout基准测试,用于评估大语言模型在印刷电路板布局放置推理。含1681个工业级原理图耦合PCB布局及四项任务,揭示当前大语言模型在PCB布局放置上有诸多局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04149 2026-07-07 cs.CV 新提交 78%

Beyond Scene Priors: Fine-Grained Traffic Scene Reasoning with Benchmarking and Query-Guided Small-Object Focus

超越场景先验:通过基准测试和查询引导的小目标聚焦进行细粒度交通场景推理

Waikit Xiu, Qiang Lu, Zian Wang, Xinjie Yang, Zhiwei Chen, Chen Sun, Xiying Li

机构 * The University of Hong Kong(香港大学) Sun Yat-Sen University(中山大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理评测 :reasoning(title,abstract)

AI总结 针对安全关键交通场景中复杂问题,提出细粒度交通推理基准FGTR - Bench和文本引导小目标推理MLLM(TSR - MLLM),解决视觉语言对齐中关键小目标被忽视问题,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03166 2026-07-07 cs.CL cs.AI cs.LG 新提交 78%

KARMA: Knowledge graph-based Automated Reasoning Materialization and Alignment

KARMA:基于知识图谱的自动推理实例化与对齐

Jinkyeong Choi, Chaebin Jeong, Donghyeon Park

机构 * Sejong University(世宗大学)

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对基于模板对比合成的问题,提出KARMA方法,通过枚举知识图谱路径生成对比候选,用解耦槽级目标进行偏好监督,在多领域基准测试中表现优于基线。

Comments First version, 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02748 2026-07-07 cs.OS cs.PL cs.SE 新提交 78%

Characterizing and Bridging the Diagnostic Gap in eBPF Verifier Rejections

表征和弥合eBPF验证器拒绝中的诊断差距

Yusheng Zheng, Zhengjie Ji, Weichen Tao, Xiangyu Gao, Jianchang Su, Wei Zhang, Andi Quinn, Dan Williams

专题命中 推理评测 :verifier(title,abstract)

AI总结 研究eBPF验证器拒绝程序时的诊断差距,通过对235次拒绝进行实证研究量化问题。提出bpfix工具重建证明过程,构建75个LLM修复任务基准评估,发现定位证明丢失位置对修复关键,bpfix可提升修复成功率。

Comments Yusheng Zheng, Zhengjie Ji, Weichen Tao have equal contribution to the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12057 2026-07-07 stat.AP 新提交 78%

ChargeBD: Character-Aware Heterogeneous Agent Reasoning for Guided Engineering in Battery Development

ChargeBD:面向电池开发中引导工程的字符感知异构智能体推理

Rui Huang, Zekun Jiang, Mengran Hou, Xingyu Niu, Yuqiang Li, Qinying Gu, Tianhang Zhou

专题命中 推理评测 :reasoning(title,abstract)

AI总结 提出ChargeBD框架,通过MBTI启发的角色智能体矩阵,结合异构推理,解决液流电池多尺度多目标研发中的自适应问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01308 2026-07-03 cs.MA 新提交 78%

Cache Merging as a Convergent Replicated State for Multi-Agent Latent Reasoning

缓存合并作为多智能体潜在推理的收敛复制状态

Carlos Baquero, Luís Brito

专题命中 推理评测 :reasoning(title,abstract)

AI总结 提出CanonicalMerge方法,通过按内容排序KV缓存实现交换律合并,确保多智能体潜在推理中缓存合并的确定性,在保持准确率的同时提供结构保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00260 2026-07-03 eess.AS 新提交 78%

Do Multimodal Large Language Models Need Reasoning to Classify Dementia from Speech?

多模态大语言模型是否需要推理来从语音中分类痴呆症?

Liming Wang, Neguine Rezaii, Bradford C. Dickerson, James Glass

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文评估了多模态大语言模型在自动痴呆症分类中的推理能力,发现基于文本理由的策略会导致幻觉和不一致,并提出DeTAiL框架,通过非线性适配器和强化学习利用内部表示,在两个数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00115 2026-07-02 cs.CV 新提交 78%

PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking

PixelEyes: 解耦感知与推理以实现精准视觉证据查找

Dengxian Gong, Yuanzheng Wu, Haobo Yuan, Zhengdong Hu, Tao Zhang, Yikang Zhou, Shihao Chen, Quanzhu Niu, Kai Wang, Jason Li, Haochen Wang, Lu Qi, Shunping Ji, Ming-Hsuan Yang

机构 * Wuhan University(武汉大学) UC Merced(加州大学默塞德分校) UTS(UTS大学) NUS(新加坡国立大学) NTU(南洋理工大学) CASIA(中国科学院自动化所)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 针对多轮视觉推理中目标定位失败导致轨迹冗余的问题,提出PixelEyes,通过解耦推理与感知(推理器决定查找目标,专用感知工具定位),引入掩码引导视觉搜索和语义区域广度优先搜索,构建PixelEyes-6K数据集和Pinpoint-Bench基准,显著提升定位准确性。

Comments 22pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24548 2026-07-02 cs.CV 新提交 78%

Are Text-to-Image Models Inductivist Turkeys? A Counterfactual Benchmark for Causal Reasoning

文本到图像模型是归纳主义的火鸡吗?一个用于因果推理的反事实基准

Jiayi Lei, Yuandong Pu, Xingyu Han, Rongpeng Zhu, Jing Xu, Jinyao Wang, Zijian Zhou, Bin Fu, Yuewen Cao, Yihao Liu, Hongsheng Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 提出反事实基准CF-World,通过三个递进层级测试T2I模型在违反现实先验规则下的图像生成能力,发现所有模型在反事实设置下性能急剧下降,原因是模型将世界知识与视觉外观编码为紧密耦合的模式。

Comments 10 pages, 7 figures. Project page: https://github.com/jylei16/CF-World.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27264 2026-06-26 cs.CV 新提交 78%

CORTEX: A Structured Reasoning Benchmark for Trustworthy 3D Chest CT MLLMs

CORTEX:用于可信3D胸部CT多模态大语言模型的结构化推理基准

Hashmat Shadab Malik, Anees Ur Rehman Hashmi, Numan Saeed, Muzammal Naseer, Salman Khan, Christoph Lippert

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Hasso Plattner Institute(哈索·普拉特纳研究所) Khalifa University(哈利法大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 提出CORTEX基准,通过四阶段诊断推理轨迹和阶段级评估协议,为3D胸部CT多模态大语言模型提供结构化监督与验证,包含76,177个验证推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20561 2026-06-19 cs.CV 新提交 78%

TimeProVe: Propose, then Verify for Efficient Long Video Temporal Reasoning in Activities of Daily Living

TimeProVe: 先提出后验证,实现日常活动中的高效长视频时间推理

Arkaprava Sinha, Dominick Reilly, Siddharth Krishnan, Hieu Le, Srijan Das

机构 * University of North Carolina, Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 提出TimeProVe框架,先通过轻量模块生成基于动作的候选假设,再调用昂贵VLM验证,在长视频问答中降低75%VLM调用和93%推理成本,性能提升7.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17639 2026-06-18 cs.RO cs.CV 新提交 78%

ERQA-Plus: A Diagnostic Benchmark for Reasoning in Embodied AI

ERQA-Plus:具身AI推理的诊断基准

Hong Yang, Basura Fernando

机构 * Centre for Frontier AI Research, Agency for Science, Technology and Research(新加坡科技研究局前沿人工智能研究中心) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 提出ERQA-Plus基准,包含1766个基于机器人中心图像的问答实例,覆盖感知、动作、社交、导航和常识推理,用于诊断具身AI的推理能力。

Comments under review at NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17298 2026-06-17 cs.CV 新提交 78%

Reasoning Text-to-Video Retrieval for Operating Room Clips via Action-Driven Digital Twins

面向手术室视频的推理式文本-视频检索:基于动作驱动数字孪生

Yiqing Shen, Hao Ding, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 提出OR3方法,通过动作驱动数字孪生(ActDT)将视频片段转化为结构化表示,并利用大语言模型生成假设ActDT进行检索,结合证据修正实现隐式查询推理,在手术室视频检索中显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17279 2026-06-17 cs.CV 新提交 78%

Training LLMs with Reinforcement Learning over Digital Twin Representations for Reasoning-Intensive Surgical VideoQA

基于数字孪生表示的强化学习训练LLMs用于推理密集型手术视频问答

Yiqing Shen, Han Zhang, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 提出强化学习框架,通过手术基础模型构建数字孪生表示,解耦视觉感知与推理,并引入分层表示与新型奖励,在三个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏