arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10379 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10379 篇

2604.10425 2026-04-14 cs.CV 82%

DiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domain

DiningBench:面向饮食领域的分层多视角基准测试平台

Song Jin, Juntian Zhang, Xun Zhang, Zeying Tian, Fei Jiang, Guojun Yin, Wei Lin, Yong Liu, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Meituan(美团) Wuhan University(武汉大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出DiningBench,一个分层多视角基准,用于评估视觉语言模型在饮食领域感知与推理能力,包含3021种不同菜品,通过多视角输入和链式推理方法,揭示了当前VLM在细粒度视觉识别和营养推理上的不足。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08266 2026-04-10 cs.CV 82%

Orion-Lite: Distilling LLM Reasoning into Efficient Vision-Only Driving Models

Orion-Lite:将LLM推理能力蒸馏到高效视觉-only驾驶模型

Jing Gu, Niccolò Cavagnero, Gijs Dubbelman

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

AI总结 本文提出Orion-Lite,通过潜特征蒸馏和真实轨迹监督,在闭环评估中实现高效视觉-only驾驶模型,超越大规模VLA模型ORION,达到Bench2Drive基准的80.6 Driving Score。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06192 2026-04-09 cs.CL cs.AI cs.IT cs.LG math.IT 82%

The Stepwise Informativeness Assumption: Why are Entropy Dynamics and Reasoning Correlated in LLMs?

逐步信息性假设:为什么在大语言模型中熵动态与推理相关?

Mar Gonzàlez I Català, Haitz Sáez de Ocáriz Borde, George D. Montañez, Pietro Liò

机构 * University of Cambridge(剑桥大学) University of Oxford(牛津大学) Harvey Mudd College(哈维穆德学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了大语言模型中熵动态与推理正确性相关的原因,提出逐步信息性假设,并通过实验验证其在多个基准和模型中的有效性。

Comments 21 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01754 2026-04-03 cs.CL cs.AI cs.LG 82%

LiveMathematicianBench: A Live Benchmark for Mathematician-Level Reasoning with Proof Sketches

LiveMathematicianBench: 一个用于数学家级推理的实时基准

Linyang He, Qiyao Yu, Hanze Dong, Baohao Liao, Xinxing Xu, Micah Goldblum, Jiang Bian, Nima Mesgarani

机构 * Columbia University(哥伦比亚大学) Microsoft Research(微软研究院) University of Amsterdam(阿姆斯特丹大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LiveMathematicianBench,一个基于近期arXiv论文的动态多选基准,用于评估大语言模型的数学推理能力,通过证明草图指导的干扰项生成机制,提升对真实理解的检测。

Comments Project page: https://livemathematicianbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12957 2026-04-03 cs.CV 82%

Adaptive Reinforcement for Open-ended Medical Reasoning via Semantic-Guided Reward Collapse Mitigation

通过语义引导的奖励崩溃缓解实现自适应的开放性医疗推理

Yizhou Liu, Dingkang Yang, Zizhi Chen, Minghao Han, Xukun Zhang, Keliang Liu, Jingwei Wei, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Fysics Intelligence Technologies Co., Ltd. (Fysics AI)(菲斯克智能科技有限公司(菲斯克AI)) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出ARMed框架,通过监督微调和强化优化提升开放性医疗VQA的推理一致性和事实准确性,实验表明其在六个医疗VQA基准上显著提升准确性和泛化能力。

Comments Accept to 2026 CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12864 2026-04-03 cs.CL cs.AI cs.LG 82%

LEXam: Benchmarking Legal Reasoning on 340 Law Exams

LEXam:基于340法律考试的法律推理基准测试

Yu Fan, Jingwei Ni, Jakob Merane, Yang Tian, Yoan Hermstrüwer, Yinya Huang, Mubashara Akhtar, Etienne Salimbeni, Florian Geering, Oliver Dreyer, Daniel Brunner, Markus Leippold, Mrinmaya Sachan, Alexander Stremitzer, Christoph Engel, Elliott Ash, Joel Niklaus

机构 * ETH Zurich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) University of Lausanne(洛桑大学) Max Planck Institute for Research on Collective Goods(马克斯·普朗克集体物品研究所) Omnilex University of St. Gallen(圣加仑大学) Swiss Federal Supreme Court(瑞士联邦最高法院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LEXam基准测试通过340法律考试数据,包含7537道英语和德语法律考试题目,涵盖多种法律课程和学位级别,旨在评估大语言模型在长文本法律推理中的挑战与性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29791 2026-04-01 cs.AI cs.CL cs.LG 82%

Reasoning-Driven Synthetic Data Generation and Evaluation

基于推理的合成数据生成与评估

Tim R. Davidson, Benoit Seguin, Enrico Bacis, Cesar Ilharco, Hamza Harkous

机构 * EPFL(瑞士联邦理工学院洛桑) Google(谷歌) Google Deepmind(谷歌DeepMind)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Simula框架,通过无种子、代理化方法生成大规模合成数据,提供可解释且可控的生成流程,验证了其在多种数据集上的有效性,为合成数据机制设计和大规模生成评估提供指导。

Comments Accepted to TMLR 2026, J2C Certification

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28021 2026-04-01 cs.SD 82%

Audio Language Model for Deepfake Detection Grounded in Acoustic Chain-of-Thought

基于声学推理的深度伪造检测音频语言模型

Runkun Chen, Yixiong Fang, Pengyu Chang, Yuante Li, Massa Baali, Bhiksha Raj

机构 * Carnegie Mellon University, USA(卡内基梅隆大学,美国)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract)

AI总结 本文提出CoLMbo-DF,通过整合深度伪造检测与显式的声学推理,利用结构化文本表示提升检测准确性,实验表明其在解释性深度伪造语音检测中取得显著进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16189 2026-03-18 cs.CV 82%

Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning

通过多任务多奖励强化学习实现SVG-LLMs的可靠推理

Haomin Wang, Qi Wei, Qianli Ma, Shengyuan Ding, Jinhui Yin, Kai Chen, Hongjie Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Nanjing University(南京大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出CTRL-S框架,通过多任务多奖励优化提升SVG生成的结构连贯性和视觉保真度,实验表明其在任务成功率和SVG代码质量上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15668 2026-03-17 cs.SD 82%

EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning

EmotionThinker: 基于语调感知的强化学习用于可解释的语音情绪推理

Dingdong Wang, Shujie Liu, Tianhua Zhang, Youjun Chen, Jinyu Li, Helen Meng

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出EmotionThinker,通过强化学习将语音情绪识别转化为深度推理问题,利用细粒度声学线索生成可解释的情绪预测,改进了语音大语言模型的语调感知能力。

Comments ICLR 2026 (Oral). Project page: https://github.com/dingdongwang/EmotionThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14468 2026-03-17 cs.CV cs.IR 82%

LongVidSearch: An Agentic Benchmark for Multi-hop Evidence Retrieval Planning in Long Videos

LongVidSearch: 一种多跳证据检索规划的代理基准

Rongyi Yu, Chenyuan Duan, Wentao Zhang

专题命中 推理评测 :planning(title,abstract);reasoning(abstract)

AI总结 LongVidSearch 是一个评估长视频中多跳证据检索规划的基准,通过标准化接口强制多跳检索,包含3000个问题,涵盖四种推理类别,测试代理在相同访问条件下检索规划的准确性与效率。

Comments 12 pages, 2 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14326 2026-03-17 cs.LG cs.AI cs.CL 82%

ECG-Reasoning-Benchmark: A Benchmark for Evaluating Clinical Reasoning Capabilities in ECG Interpretation

ECG-Reasoning-Benchmark: 一个用于评估心电图解读中临床推理能力的基准

Jungwoo Oh, Hyunseung Chung, Junhee Lee, Min-Gyu Kim, Hangyul Yoon, Ki Seong Lee, Youngchae Lee, Muhan Yeo, Edward Choi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ECG-Reasoning-Benchmark,通过6400个样本系统评估17种核心心电图诊断的逐步推理能力,发现现有多模态大语言模型在多步逻辑推理中存在严重缺陷,无法有效将心电图发现与实际信号证据关联。

Comments Preprint. 9 pages for main text, 2 pages for references, 19 pages for supplementary materials (appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09512 2026-03-11 cs.CV 82%

Probing the Reliability of Driving VLMs: From Inconsistent Responses to Grounded Temporal Reasoning

探测驾驶视觉语言模型的可靠性:从不一致响应到基于现实的时序推理

Chun-Peng Chang, Chen-Yu Wang, Holger Caesar, Alain Pagani

机构 * DFKI Augmented Vision(DFKI增强视觉实验室) TU Delft(代尔夫特理工大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文研究了驾驶视觉语言模型的可靠性问题,通过引入FutureVQA数据集和自监督微调方法,提升模型在时序推理和一致性上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11595 2026-03-11 cs.LG cs.AI cs.CL 82%

Stepwise Guided Policy Optimization: Coloring your Incorrect Reasoning in GRPO

逐步引导策略优化:在GRPO中着色你的错误推理

Peter Chen, Xiaopeng Li, Ziniu Li, Xi Chen, Tianyi Lin

机构 * Department of Industrial Engineering and Operations Research(工业工程与运营管理系) Department of Mathematics(数学系) Columbia University(哥伦比亚大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Stern School of Business, New York University(纽约大学斯特恩商学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SGPO通过引入组内响应多样性,解决GRPO在所有负样本组时无法更新策略的问题,提升推理模型性能。

Comments Accepted by TMLR; 47 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05587 2026-03-10 cs.AI cs.CL cs.DB cs.LG 82%

MMTU: A Massive Multi-Task Table Understanding and Reasoning Benchmark

MMTU: 一个大规模多任务表格理解和推理基准

Junjie Xing, Yeye He, Mengyu Zhou, Haoyu Dong, Shi Han, Lingjiao Chen, Dongmei Zhang, Surajit Chaudhuri, H. V. Jagadish

机构 * University of Michigan(密歇根大学) Microsoft Corporation(微软公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MMTU是一个大规模多任务表格理解和推理基准,旨在评估模型在专家级别处理真实表格的能力,揭示了当前模型在表格理解、推理和编码方面的挑战。

Comments Full version of a paper accepted at NeurIPS 2025; Code and data available at https://github.com/MMTU-Benchmark/MMTU and https://huggingface.co/datasets/MMTU-benchmark/MMTU

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24210 2026-03-06 cs.CL cs.AI cs.LG 82%

BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models

超越基准:语言模型推理能力的抗污染评估

Gaurav Srivastava, Aafiya Hussain, Zhenyu Bi, Swastik Roy, Priya Pitre, Meng Lu, Morteza Ziyadi, Xuan Wang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BeyondBench通过算法问题生成提供抗污染的推理评估,揭示语言模型在复杂任务中的推理缺陷。

Comments Accepted to ICLR 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23729 2026-03-02 cs.CL cs.AI cs.LG 82%

From Static Benchmarks to Dynamic Protocol: Agent-Centric Text Anomaly Detection for Evaluating LLM Reasoning

从静态基准到动态协议:面向评估LLM推理能力的代理中心文本异常检测

Seungdong Yoa, Sanghyu Yoon, Suhee Yoon, Dongmin Kim, Ye Seul Sim, Junhyun Lee, Woohyung Lim

机构 * LG AI Research(LG人工智能研究)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种动态协议,通过代理中心文本异常检测评估LLM推理能力,以克服静态数据集的局限性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19455 2026-02-24 cs.LG cs.AI cs.CL stat.ML 82%

SenTSR-Bench: Thinking with Injected Knowledge for Time-Series Reasoning

SenTSR-Bench: 带注入知识的思考以实现时间序列推理

Zelin He, Boran Han, Xiyuan Zhang, Shuai Zhang, Haotian Lin, Qi Zhu, Haoyang Fang, Danielle C. Maddix, Abdul Fatir Ansari, Akash Chandrayan, Abhinav Pradhan, Bernie Wang, Matthew Reimherr

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) AWS AI Labs(AWS人工智能实验室) Amazon RME Project(亚马逊RME项目)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SenTSR-Bench通过注入领域知识提升时间序列推理能力,结合强化学习方法实现高效的知识注入,方法在多个数据集上显著优于现有模型。

Comments Accepted by the 29th International Conference on Artificial Intelligence and Statistics (AISTATS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19318 2026-02-23 cs.RO cs.CV 82%

Perception-to-Pursuit: Track-Centric Temporal Reasoning for Open-World Drone Detection and Autonomous Chasing

感知到追捕:面向开放世界的无人机检测与自主追捕的以轨迹为中心的时序推理

Venkatakrishna Reddy Oruganti

机构 * Sithara Inc.(Sithara公司)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

AI总结 P2P通过轨迹为中心的时序推理框架,提升了无人机轨迹预测精度和追捕可行性,实现了准确的预测与可操作的追捕规划。

Comments 7 pages, 2 figures, 3 tables, 15 references. Intended for submission to ICCV 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17520 2026-02-20 cs.AR 82%

When Models Ignore Definitions: Measuring Semantic Override Hallucinations in LLM Reasoning

当模型忽略定义:在LLM推理中测量语义覆盖幻觉

Yogeswar Reddy Thota, Setareh Rafatirad, Homayoun Houman, Tooraj Nikoubin

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract)

AI总结 本研究探讨了LLM在局部语义重新定义时的失败模式,发现模型常回归预训练默认解释,提出微基准测试以评估其语义合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11176 2026-02-13 cs.CL cs.AI cs.CE cs.LG 82%

Evaluating Few-Shot Temporal Reasoning of LLMs for Human Activity Prediction in Smart Environments

评估LLM在智能环境中的少样本时间推理用于人类活动预测

Maral Doctorarastoo, Katherine A. Flanigan, Mario Bergés, Christopher McComb

机构 * organization= Department of Civil \& Environmental Engineering, Carnegie Mellon University , addressline= 5000 Forbes Ave , city= Pittsburgh , state= PA , postcode= 15213 , country= USA organization= Department of Mechanical Engineering, Carnegie Mellon University , addressline= 5000 Forbes Ave , city= Pittsburgh , state= PA , postcode= 15213 , country= USA

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了预训练语言模型在智能环境中的少样本时间推理能力,通过评估其在人类活动预测中的表现,发现其在低数据环境下具备强大的时间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24836 2026-02-13 cs.AI cs.CL cs.LG 82%

Logical Structure as Knowledge: Enhancing LLM Reasoning via Structured Logical Knowledge Density Estimation

逻辑结构作为知识:通过结构化逻辑知识密度估计增强LLM推理

Zhen Bi, Zhenlin Hu, Xueshu Chen, Mingyang Chen, Cheng Deng, Yida Xue, Zhen Wang, Qing Shen, Ningyu Zhang, Jungang Lou

机构 * Huzhou University(湖州大学) Zhejiang Key Laboratory of Intelligent Education Technology and Application(浙江智能教育技术与应用重点实验室) Banbu AI Foundation(Banbu AI基金会) Baichuan Inc(白川公司) University of Edinburgh(爱丁堡大学) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过结构化逻辑知识密度估计提升LLM推理能力,通过增强逻辑密度而非扩大数据量来提高模型认知潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03130 2026-02-04 cs.CV cs.CE 82%

FinMTM: A Multi-Turn Multimodal Benchmark for Financial Reasoning and Agent Evaluation

FinMTM:面向金融推理和智能体评估的多轮多模态基准

Chenxi Zhang, Ziliang Gan, Liyun Zhu, Youwei Pang, Qing Zhang, Rongjunchen Zhang

机构 * HiThink Research(HiThink研究机构) Wuhan University(武汉大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Shanghai Institute of Technology(上海理工大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

AI总结 FinMTM提出一个多轮多模态基准,用于评估金融推理和智能体任务,通过多样化数据和任务设计,揭示了VLMs在视觉感知、推理和复杂工作流中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02975 2026-02-04 cs.CL cs.AI cs.LG 82%

Where Norms and References Collide: Evaluating LLMs on Normative Reasoning

规范与参照的碰撞:评估大语言模型在规范推理中的能力

Mitchell Abrams, Kaveh Eskandari Miandoab, Felix Gervits, Vasanth Sarathy, Matthias Scheutz

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SNIC测试平台,评估大语言模型在基于规范的参照解析任务中的能力,发现现有模型在处理隐含或冲突规范时存在显著不足。

Comments Accepted to the 40th AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01298 2026-02-03 cs.CV 82%

Interaction-Consistent Object Removal via MLLM-Based Reasoning

基于MLLM的交互一致物体移除

Ching-Kai Huang, Wen-Chieh Lin, Yan-Cen Lee

机构 * National Yang Ming Chiao Tung University(阳明交通大学)

专题命中 推理评测 :reasoning(title,abstract);self-correction(abstract)

AI总结 本文提出基于MLLM的REORM框架,通过多模态语言模型推断需共同删除的交互元素,解决交互一致物体移除问题,并在ICOREval基准上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15612 2026-02-02 cs.SD eess.AS 82%

Thinking in cocktail party: Chain-of-Thought and reinforcement learning for target speaker automatic speech recognition

在鸡尾酒派对中思考:用于目标说话人自动语音识别的链式思维和强化学习

Yiru Zhang, Hang Su, Lichun Fan, Zhenbo Luo, Jian Luan

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) MiLM Plus, Xiaomi Inc., China(MiLM Plus,小米公司,中国)

专题命中 推理评测 :chain-of-thought(title);reasoning(abstract);CoT(abstract)

AI总结 本文提出结合链式思维和强化学习的新型框架,提升目标说话人自动语音识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21617 2026-01-30 cs.CV 82%

PathReasoner-R1: Instilling Structured Reasoning into Pathology Vision-Language Model via Knowledge-Guided Policy Optimization

PathReasoner-R1: 通过知识引导的策略优化在病理视觉-语言模型中引入结构化推理

Songhan Jiang, Fengchun Liu, Ziyue Wang, Linghan Cai, Yongbing Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学) Technical University of Dresden(德累斯顿技术大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 PathReasoner-R1通过知识引导的策略优化,在病理视觉-语言模型中引入结构化推理,提升模型的临床推理能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01146 2026-01-29 cs.CL cs.AI cs.LG 82%

mR3: Multilingual Rubric-Agnostic Reward Reasoning Models

mR3:多语言无评分标准奖励推理模型

David Anugraha, Shou-Yi Hung, Zilu Tang, Annie En-Shiun Lee, Derry Tanti Wijaya, Genta Indra Winata

机构 * Stanford University(斯坦福大学) University of Toronto(多伦多大学) Boston University(波士顿大学) Ontario Tech University(安大略技术大学) Monash University Indonesia(墨尔本大学印尼分校) Capital One(Capital One公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 mR3是一种多语言无评分标准奖励推理模型,通过72种语言训练实现广泛语言覆盖,超越更大模型并验证其在多语言奖励模型基准上的最佳性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11027 2026-01-28 cs.CV 82%

Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning

Vlaser:具有协同具身推理能力的视觉-语言-动作模型

Ganlin Yang, Tianyi Zhang, Haoran Hao, Weiyun Wang, Yibin Liu, Dehui Wang, Guanzhou Chen, Zijian Cai, Junting Chen, Weijie Su, Wengang Zhou, Yu Qiao, Jifeng Dai, Jiangmiao Pang, Gen Luo, Wenhai Wang, Yao Mu, Zhi Hou

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Fudan University(复旦大学) Tsinghua University(清华大学) NUS(新加坡国立大学) Northeastern University(东北大学) Shenzhen University(深圳大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

AI总结 Vlaser通过整合高级推理与低级控制,解决了具身推理与VLA策略学习之间的关键差距,在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00555 2026-01-27 cs.LG cs.AI cs.CL cs.CV 82%

MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning

MMedAgent-RL: 优化多智能体协作以实现多模态医疗推理

Peng Xia, Jinglu Wang, Yibo Peng, Kaide Zeng, Zihan Dong, Xian Wu, Xiangru Tang, Hongtu Zhu, Yun Li, Linjun Zhang, Shujie Liu, Yan Lu, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft Research(微软研究院) CMU(卡内基梅隆大学) Rutgers University(罗格斯大学) Yale University(耶鲁大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MMedAgent-RL通过强化学习优化多智能体协作,提升多模态医疗推理性能,实现23.6%的性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏