arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10428 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10428 篇

2512.22673 2026-04-22 cs.AI 79%

Beyond Itinerary Planning-A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks

超越行程规划——多轮和工具使用旅行任务的现实世界基准

Xiang Cheng, Yulan Hu, Xiangwen Zhang, Lu Xu, Lide Tan, Zheng Pan, Xin Li, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光林人工智能学院) National University of Singapore(新加坡国立大学) Beihang University(北航) AMAP, Alibaba Group(阿里云实验室)

专题命中 推理评测 :planning(title,abstract);分类 cs.AI

AI总结 本文提出TravelBench,一个现实世界旅行规划基准,通过多轮对话和工具使用评估LLM的独立解决问题、隐含偏好获取和能力边界识别能力。

Comments Accepted to the ACL 2026 Main Conference. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18234 2026-04-21 cs.IR cs.AI 79%

Evaluating Multi-Hop Reasoning in RAG Systems: A Comparison of LLM-Based Retriever Evaluation Strategies

评估基于检索增强生成系统的多跳推理:LLM检索评估策略的比较

Lorenz Brehme, Thomas Ströhle, Ruth Breu

机构 * Universität Innsbruck(因斯布鲁克大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过对比三种LLM评估策略,提出上下文感知检索评估(CARE),证明其在提升RAG系统多跳推理能力方面效果显著,尤其在参数多和上下文长的模型中表现更优。

Comments 15 Pages, Accepted for publication at the SynIRgy Workshop, ECIR 2026 (48th European Conference on Information Retrieval)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18176 2026-04-21 cs.AI quant-ph 79%

QuantumQA: Enhancing Scientific Reasoning via Physics-Consistent Dataset and Verification-Aware Reinforcement Learning

量子QA:通过物理一致的数据集和验证意识强化学习增强科学推理

Songxin Qu, Tai-Ping Sun, Yun-Jie Wang, Huan-Yu Liu, Cheng Xue, Xiao-Fan Xu, Han Fang, Yang Yang, Yu-Chun Wu, Guo-Ping Guo, Zhao-Yun Chen

机构 * Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) School of Physics, University of Science and Technology of China(中国科学技术大学物理学院) School of Electronics and Information Engineering, Anhui University(安徽大学电子与信息工程学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出量子QA数据集和验证意识奖励模型,通过物理一致的数据集和强化学习提升科学推理能力,实验证明其在科学领域表现优异。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12320 2026-04-21 cs.CV cs.AI cs.MM 79%

EgoEsportsQA: An Egocentric Video Benchmark for Perception and Reasoning in Esports

EgoEsportsQA:一种用于电子竞技感知与推理的视角视频基准

Jianzhe Ma, Zhonghao Cao, Shangkui Chen, Yichen Xu, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出EgoEsportsQA基准,通过六阶段流程收集1745对高质量问答对,评估视频大语言模型在虚拟环境中的感知与推理能力,揭示模型在战术推理和微操作方面的不足。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05543 2026-04-21 cs.CL cs.SD eess.AS 79%

Closing the Modality Reasoning Gap for Speech Large Language Models

弥合语音大语言模型的模态推理差距

Chaoren Wang, Heng Lu, Xueyao Zhang, Shujie Liu, Yan Lu, Jinyu Li, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Microsoft Corporation(微软公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出TARS框架,通过不对称奖励设计对齐文本和语音条件轨迹,显著缩小模态推理差距并在7B级语音大语言模型中取得最佳性能。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04809 2026-04-21 cs.AI 79%

SCALER:Synthetic Scalable Adaptive Learning Environment for Reasoning

SCALER:合成可扩展自适应学习环境用于推理

Caijun Xu, Changyi Xiao, Zhongyuan Peng, Xinrun Wang, Yixin Cao

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Singapore Management University(新加坡国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SCALER通过自适应环境设计维持有效学习信号,解决RL训练中任务难度与模型能力不匹配及训练模式狭窄的问题,提升推理能力。

Comments 22 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09351 2026-04-21 cs.CL 79%

ReTraceQA: Evaluating Reasoning Traces of Small Language Models in Commonsense Question Answering

ReTraceQA:评估小语言模型在常识问答中的推理轨迹

Francesco Maria Molfese, Luca Moroni, Ciro Porcaro, Simone Conia, Roberto Navigli

机构 * Sapienza NLP Group(萨皮恩扎大学自然语言处理小组) Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 ReTraceQA通过引入过程级评估,揭示小语言模型在常识推理中存在大量推理过程错误,但最终答案正确的情况,表明现有评价方法高估了模型能力。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17186 2026-04-21 cs.SE cs.AI cs.ET cs.HC cs.MA 79%

Persona-Based Requirements Engineering for Explainable Multi-Agent Educational Systems: A Scenario Simulator for Clinical Reasoning Training

基于角色的可解释多智能体教育系统需求工程:用于临床推理训练的场景模拟器

Weibing Zheng, Laurah Turner, Jess Kropczynski, Matthew Kelleher, Murat Ozer, Shane Halse

机构 * School of Information Technology University of Cincinnati, OH Cincinnati, USA(信息科技学院 奥地利辛辛那提大学) College of Medicine University of Cincinnati, OH Cincinnati, USA(医学院 奥地利辛辛那提大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出基于角色的可解释多智能体教育系统需求工程框架,通过临床推理训练系统展示如何利用角色和用户故事捕捉多方需求,提升系统可解释性和临床场景真实性。

Comments 7 pages, 2 figures, CSTE2026: https://cste.net/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11161 2026-04-21 cs.HC cs.CL 79%

Althea: Human-AI Collaboration for Fact-Checking and Critical Reasoning

Althea:面向事实核查和批判性推理的人机协作

Svetlana Churina, Kokil Jaidka, Anab Maulana Barik, Harshit Aneja, Cai Yang, Wynne Hsu, Mong Li Lee

机构 * Centre for Trusted Internet & Community (CTIC)(可信互联网与社区中心) National University of Singapore (NUS)(新加坡国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 Althea通过整合问题生成、证据检索和结构化推理,提升在线主张的核查效率与准确性,其在AVeriteC基准测试中达到宏F1值0.44,且在用户研究中显示指导性交互对短期准确性和长期改进均有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16929 2026-04-21 cs.CL 79%

MeasHalu: Mitigation of Scientific Measurement Hallucinations for Large Language Models with Enhanced Reasoning

MeasHalu:通过增强推理缓解大型语言模型中的科学测量幻觉

Ruijun Huang, Zhiqiao Kang, Yuxuan Zhu, Junxiong Li, Jiahao Zhao, Minghuan Tan, Feng Jiang, Min Yang

机构 * Shenzhen Key Laboratory for High Performance Data Mining(深圳高性能数据挖掘重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出MeasHalu框架,通过增强推理和针对性优化缓解LLM的科学测量幻觉问题,改进测量提取的准确性。

Comments To appear in ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16862 2026-04-21 cs.LG 79%

Learning to Trade Like an Expert: Cognitive Fine-Tuning for Stable Financial Reasoning in Language Models

学习像专家一样交易:用于语言模型在金融推理中稳定性的认知微调

Yuchen Pan, Soung Chang Liew

机构 * Department of Information Engineering, The Chinese University of Hong Kong(信息工程系,香港中文大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出一种框架,通过 curated 多选题数据集和两阶段评估协议,训练语言模型在金融决策中具备稳定性和风险意识,优于开源基线并接近前沿模型表现。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18361 2026-04-21 cs.CL 79%

Synthetic Data Generation for Training Diversified Commonsense Reasoning Models

为训练多样化常识推理模型生成合成数据

Tianhui Zhang, Bei Peng, Danushka Bollegala

机构 * University of Liverpool(利物浦大学) University of Sheffield(谢菲尔德大学) Amazon(亚马逊)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出两阶段方法生成首个合成数据集CommonSyn,提升生成多样性和质量,适用于不同规模的大语言模型。

Comments ACL2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16256 2026-04-20 cs.CV cs.CL 79%

Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap

视觉-语言模型真的能进行视觉推理吗?一种对模态差距的严格研究

Yige Xu, Yongjie Wang, Zizhuo Wu, Kaisong Song, Jun Lin, Zhiqi Shen

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡) Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-国立大学全球可持续发展公司实验室(ANGEL)) Tongyi Lab, Alibaba Group, China(阿里云实验室,阿里巴巴集团,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过CrossMath基准测试,发现视觉-语言模型在文本输入时表现优异,但加入图像信息后推理性能下降,表明其推理主要依赖文本空间,而非真实视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14799 2026-04-17 cs.CL cs.CV 79%

Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems

在何时不回答:评估多模态推理系统中的退避

Nishanth Madhusudhan, Vikas Yadav, Alexandre Lacoste

机构 * ServiceNow Research(ServiceNow研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出MM-AQA基准,通过视觉模态依赖性和证据充分性变换生成不可回答实例,评估三种前沿VLM和两种MAS架构,发现VLM在标准提示下 rarely 退避,MAS提升退避但引入准确率-退避权衡,序列设计表现优异,表明退避意识训练比提示或更多代理更重要。

Comments 10 pages and 4 figures (excluding appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14316 2026-04-17 cs.AI 79%

Seeing Through Experts Eyes A Foundational Vision Language Model Trained on Radiologists Gaze and Reasoning

通过专家之眼:一个基于放射学家目光和推理训练的基础视觉语言模型

Kinhei Lee, Peiyuan Jing, Zhenxuan Zhang, Yue Yang, Tao Wang, Dominic C Marshall, Yingying Fang, Guang Yang

机构 * Bioengineering Department and Imperial-X(生物工程系和Imperial-X) Imperial College London(帝国理工学院伦敦分校) College of physics and information engineering, Fuzhou University(福州大学物理与信息工程学院) Department of Surgery and Cancer, Imperial College London(外科与癌症部门,帝国理工学院伦敦分校) National Heart and Lung Institute, Imperial College London(国家心脏和肺研究所,帝国理工学院伦敦分校) Cardiovascular Research Centre, Royal Brompton Hospital(心血管研究中心,皇家布里顿医院) School of Biomedical Engineering & Imaging Sciences, King’s College London(生物医学工程与成像科学学院,国王学院伦敦分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出GazeX模型,通过放射学家的眼动数据模拟专家推理过程,提升医学影像分析的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21094 2026-04-17 cs.CL 79%

ReasonScaffold: A Scaffolded Reasoning-based Annotation Protocol for Human-AI Co-Annotation

ReasonScaffold: 一种基于推理的标注协议用于人机协同标注

Smitha Muthya Sudheendra, Jaideep Srivastava

机构 * University of Minnesota, Twin Cities(明尼苏达大学,双城分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出ReasonScaffold协议,通过暴露LLM生成的推理过程来提升标注一致性,发现推理能增加标注者一致性和最小化修订,为人类与AI协同标注提供实用机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11133 2026-04-16 cs.CL 79%

How Robust Are Large Language Models for Clinical Numeracy? An Empirical Study on Numerical Reasoning Abilities in Clinical Contexts

大型语言模型在临床数字能力上的鲁棒性如何?一项关于临床情境中数值推理能力的实证研究

Minh-Vuong Nguyen, Fatemeh Shiri, Zhuang Li, Karin Verspoor

机构 * School of Computing Technologies, RMIT University(计算机技术学院,皇家墨尔本理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过ClinicNumRobBench基准测试,评估了17种LLM在临床情境下的数值推理能力,发现数值检索表现良好,但关系比较和聚合仍存在挑战,且医疗数据微调会降低数值能力。

Comments Accepted to ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10291 2026-04-15 cs.AI 79%

TimeSeriesExamAgent: Creating Time Series Reasoning Benchmarks at Scale

时间序列考试代理:大规模创建时间序列推理基准测试

Malgorzata Gwiazda, Yifu Cai, Mononito Goswami, Arjun Choudhry, Artur Dubrawski

机构 * Technical University of Munich(慕尼黑技术大学) Auton Lab, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机学院自主实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出TimeSeriesExamAgent,通过模板灵活性与LLM代理创造力结合,创建涵盖医疗、金融和天气领域的综合性时间序列推理基准测试,验证LLM在时间序列理解上的能力与局限。

Journal ref Proc. Int. Conf. Learn. Representations ICLR (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14812 2026-04-14 cs.CL 79%

Physical Commonsense Reasoning for Lower-Resourced Languages and Dialects: a Study on Basque

低资源语言和方言的物理常识推理:以巴斯克语为例的研究

Jaione Bengoetxea, Itziar Gonzalez-Dios, Rodrigo Agerri

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出BasPhyCo数据集,评估LLM在巴斯克语中物理常识推理能力,发现低资源语言中LLM在处理方言时物理常识能力有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10386 2026-04-14 cs.AI cs.MA 79%

TrajOnco: a multi-agent framework for temporal reasoning over longitudinal EHR for multi-cancer early detection

TrajOnco:一个用于纵向电子健康记录上时间推理的多智能体框架,用于多癌症早期检测

Sihang Zeng, Young Won Kim, Wilson Lau, Ehsan Alipour, Ruth Etzioni, Meliha Yetisgen, Anand Oka

机构 * Truveta Inc.(Truveta公司) University of Washington(华盛顿大学) Fred Hutch Cancer Center(弗雷德·哈钦森癌症中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 TrajOnco通过多智能体框架对纵向EHR中的时间序列临床事件进行推理,生成患者总结和风险评分,实现多癌症早期检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02460 2026-04-14 cs.CL cs.MA 79%

Single-Agent LLMs Outperform Multi-Agent Systems on Multi-Hop Reasoning Under Equal Thinking Token Budgets

单代理LLM在多跳推理中优于多代理系统(在相等的思考令牌预算下)

Dat Tran, Douwe Kiela

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 在相等的思考令牌预算下,单代理系统在多跳推理任务中表现优于多代理系统,研究通过信息论论证指出单代理系统在信息效率上更具优势,并揭示了多代理系统在计算和上下文利用下降时的竞争性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04038 2026-04-14 cs.CL cs.CV 79%

ZARA: Training-Free Motion Time-Series Reasoning via Evidence-Grounded LLM Agents

ZARA:通过证据驱动的LLM代理实现无训练的运动时间序列推理

Zechen Li, Baiyu Chen, Hao Xue, Flora D. Salim

机构 * University of New South Wales, Sydney(新南威尔士大学悉尼校区) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 ZARA通过证据驱动的LLM代理实现无训练的运动时间序列推理,利用参考数据构建统计学基础的知识库,提升活动识别的泛化能力和跨领域适应性。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21380 2026-04-14 cs.CL 79%

Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models

挑战推理的边界:为大语言模型设计的奥林匹克级数学基准

Haoxiang Sun, Yingqian Min, Zhipeng Chen, Wayne Xin Zhao, Ji-Rong Wen

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 OlymMATH是一个包含350道题的奥林匹克级数学基准,通过自然语言和形式验证两种方式评估大语言模型,揭示语言间性能差异及模型推理不足问题。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11008 2026-04-14 cs.CL 79%

CounterBench: Evaluating and Improving Counterfactual Reasoning in Large Language Models

CounterBench: 评估和改进大型语言模型中的反事实推理

Yuefei Chen, Vivek K. Singh, Jing Ma, Ruixiang Tang

机构 * Rutgers University(罗格斯大学) Case Western Reserve University(凯斯西储大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出CounterBench基准数据集,评估大型语言模型在反事实推理中的表现,并提出CoIn方法提升其能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13987 2026-04-14 cs.CL 79%

RiTeK: A Dataset for Large Language Models Complex Reasoning over Textual Knowledge Graphs in Medicine

RiTeK:一个用于大型语言模型在医学领域文本知识图谱上复杂推理的数据集

Jiatan Huang, Mingchen Li, Zonghai Yao, Dawei Li, Yuxin Zhang, Zhichao Yang, Yongkang Xiao, Feiyun Ouyang, Xiaohan Li, Shuo Han, Hong Yu

机构 * University of Connecticut(康涅狄格大学) University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) School of Computing, and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) UMass Chan Medical School(马萨诸塞大学陈医学院) University of Minnesota(明尼苏达大学) Rollins School of Public Health, Emory University(埃默里大学罗林斯公共卫生学院) Optum AI University of Massachusetts, Lowell(马萨诸塞大学洛厄尔分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出RiTeK数据集,用于评估大型语言模型在医学领域文本知识图谱上的复杂推理能力,通过合成高质量查询和专家评估,揭示现有检索方法的不足。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09455 2026-04-13 cs.AI 79%

E3-TIR: Enhanced Experience Exploitation for Tool-Integrated Reasoning

E3-TIR: 增强经验利用以实现工具集成推理

Weiyang Guo, Zesheng Shi, Liye Zhao, Jiayuan Ma, Zeen Zhu, Junxian He, Min Zhang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Huawei Technologies Co., Ltd.(华为技术有限公司) Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出E3-TIR方法,通过整合专家前缀、专家引导和自探索三种经验类型,提升工具集成推理的效率与性能,实验显示在工具使用任务中性能提升6%,数据成本降低。

Comments 22 pages 10 figures, published in acl2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08457 2026-04-13 cs.CV cs.AI cs.RO 79%

CrashSight: A Phase-Aware, Infrastructure-Centric Video Benchmark for Traffic Crash Scene Understanding and Reasoning

CrashSight:面向交通事故场景理解与推理的相位感知、基础设施导向视频基准

Rui Gan, Junyi Ma, Pei Li, Xingyou Yang, Kai Chen, Sikai Chen, Bin Ran

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Wyoming(怀俄明大学) Columbia University(哥伦比亚大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 CrashSight通过真实道路摄像头数据构建大规模视频基准,评估视觉语言模型在交通事故场景中的理解与推理能力,揭示现有模型在时间与因果推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21692 2026-04-13 cs.AI cs.DC cs.SE 79%

Reasoning Provenance for Autonomous AI Agents: Structured Behavioral Analytics Beyond State Checkpoints and Execution Traces

自主AI代理的推理溯源:超越状态检查点和执行轨迹的结构化行为分析

Neelmani Vispute, Aditya Kadam

机构 * Oracle Cloud Infrastructure(甲骨文云基础设施)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Agent Execution Record(AER),通过结构化推理溯源记录代理每个动作的选择原因、观察结论及策略影响,支持群体层面的行为分析与反事实测试。

Comments 10 pages, 2 tables, 1 figure, preprint, v2: adds co-author and transport-layer verification mechanism

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09158 2026-04-13 cs.HC cs.AI 79%

Structuring versus Problematizing: How LLM-based Agents Scaffold Learning in Diagnostic Reasoning

结构化与问题化:基于LLM的智能体如何在诊断推理中构建学习

Fatma Betül Güreş, Tanya Nazaretsky, Seyed Parsa Neshaei, Tanja Käser

机构 * ETH Zürich(苏黎世联邦理工学院) EPFL(洛桑联邦理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文探讨了基于LLM的智能体如何通过结构化和问题化策略促进诊断推理学习,研究发现两种策略在不同参与度指标上各有优势。

Comments 12 pages, 8 figures. Accepted at LAK 2026

Journal ref In Proceedings of the 16th International Learning Analytics and Knowledge Conference (LAK 2026), April 27-May 1, 2026, Bergen, Norway. ACM, New York, NY, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09114 2026-04-13 cs.CV cs.LG 79%

FIRE-CIR: Fine-grained Reasoning for Composed Fashion Image Retrieval

FIRE-CIR:细粒度复合时尚图像检索中的精细推理

François Gardères, Camille-Sovanneary Gauthier, Jean Ponce, Shizhe Chen

机构 * Louis Vuitton(路易威登) Inria, École normale supérieure, CNRS, PSL Research University(法国国家信息与自动化研究所, 巴黎高等师范学院, 法国国家科学研究中心, 巴黎文理研究大学) Courant Institute of Mathematical Sciences and Center for Data Science, New York University(纽约大学库朗数学科学研究所与数据科学中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 FIRE-CIR通过问题驱动的视觉推理提升时尚图像检索的可解释性和准确性,通过生成属性聚焦的视觉问题并验证参考与候选图像中的证据,实现更精确的检索结果。

详情

展开后加载摘要…

URL PDF HTML 收藏