arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-12 至 2026-05-12 共收录 384 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 102 篇

2605.09502 2026-05-12 cs.CL cs.AI cs.LG 92%

Hidden Error Awareness in Chain-of-Thought Reasoning: The Signal Is Diagnostic, Not Causal

链式推理中的隐藏错误意识:信号是诊断性的,而非因果性的

Aojie Yuan, Zhiyuan Julian Su, Haiyue Zhang, Yi Nian, Yue Zhao

机构 * University of Southern California, Los Angeles, CA, USA(南加州大学,洛杉矶,加利福尼亚州,美国)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);self-correction(abstract)

AI总结 研究揭示链式推理中模型内在检测自身推理错误但外在表现自信的现象,通过隐藏状态线性探针显示其正确性预测能力,但无法通过干预修复错误,表明信号为诊断而非因果。

Comments 10 pages, 5 figures, 10 tables.Mechanistic Interpretability @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09260 2026-05-12 cs.NI 90%

Chain-of-Thought Reasoning Enhances In-Context Learning for LLM-Based Mobile Traffic Prediction

基于链式推理的LLM移动交通预测增强情境学习

MohammadMahdi Ghadaksaz, Mohammad Farzanullah, Akram Bin Sediq, Ali Afana, Melike Erol-Kantarci

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn)

AI总结 本文提出一种基于链式推理的LLM移动交通预测框架,通过离线阶段生成结构化推理示例和在线阶段实时预测,提升交通预测精度,实验表明其在MAE、RMSE和R2-score上均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09008 2026-05-12 cs.LG cs.CL 88%

Relative Kinetic Utility for Reasoning-Aware Structural Pruning in Large Language Models

相对动能效用用于推理感知的结构剪枝在大语言模型中

Tianhao Qian

机构 * School of Mathematics, Southeast University(东南大学数学学院)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文提出相对动能效用框架,通过连续动能积分提升结构剪枝效果,实验证明在高稀疏度下提升模型性能,尤其在GSM8K数据集上表现优异。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14702 2026-05-12 cs.AI cs.CL 84%

Polymath: A Challenging Multi-modal Mathematical Reasoning Benchmark

PolyMATH:一个具有挑战性的多模态数学推理基准

Himanshu Gupta, Shreyas Verma, Ujjwala Anantheswaran, Kevin Scaria, Mihir Parmar, Swaroop Mishra, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 PolyMATH基准通过5000张高质量图像评估多模态大语言模型的推理能力,揭示其在空间关系和抽象推理上的不足,指出模型无法真正理解视觉信息,存在逻辑错误风险。

Comments Accepted in Neural Information Processing Systems (NeurIPS 2025) Workshop: Foundations of Reasoning in Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08178 2026-05-12 cs.AI 83%

Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward Modeling

通过规划对齐代理:一个轨迹级奖励建模的基准测试

Jiaxuan Wang, Yulan Hu, Wenjin Yang, Zheng Pan, Xin Li, Lan-Zhe Guo

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) AMAP, Alibaba Group(阿里集团AMAP)

专题命中 推理评测 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出Plan-RewardBench,用于评估奖励模型在复杂工具使用场景中区分优选与干扰代理轨迹的能力,揭示了代理级奖励建模在长周期轨迹上的挑战。

Comments accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22919 2026-05-12 cs.CL 83%

ER-Reason: A Benchmark Dataset for LLM Clinical Reasoning in the Emergency Room

ER-Reason:用于急诊科大型语言模型临床推理的基准数据集

Nikita Mehandru, Niloufar Golchini, Namrata Garg, Kathy T. LeSaint, Christopher J. Nash, Anu Ramachandran, Travis Zack, Liam G. McCoy, Adam Rodman, David Bamman, Melanie Molina, Ahmed Alaa

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, San Francisco(加州大学旧金山分校) Duke University(杜克大学) University of Alberta(阿尔伯塔大学) Beth Israel Deaconess Medical Center(贝斯以色列德aconess医疗中心) UC Berkeley and UCSF(伯克利大学和旧金山分校)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 ER-Reason基准数据集通过真实患者病例评估LLM在急诊流程中逐步推理能力,包含25174份脱敏临床记录,采用Script Concordance Test风格问题测试模型在积累临床证据时的诊断信念更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10761 2026-05-12 cs.CV 82%

RadThinking: A Dataset for Longitudinal Clinical Reasoning in Radiology

RadThinking:放射学中纵向临床推理的数据集

Wenxuan Li, Pedro R. A. S. Bassi, Xinze Zhou, Jakob Wasserthal, Alan L. Yuille, Zongwei Zhou

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Clinic of Radiology and Nuclear Medicine, University Hospital Basel(巴塞尔大学医院放射科与核医学科) Department of Oncology, Johns Hopkins School of Medicine(约翰霍普金斯医学院肿瘤科)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 RadThinking数据集通过三个难度层级的VQA任务,提供放射学纵向临床推理的训练和评估框架,支持多步骤推理和临床指南标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20381 2026-05-12 cs.CV 82%

ReaMOT: A Benchmark and Framework for Reasoning-based Multi-Object Tracking

ReaMOT:基于推理的多目标跟踪基准与框架

Sijia Chen, Yanqiu Yu, En Yu, Wenbing Tao

机构 * National Key Laboratory of Science and Technology on Multi-spectral Information Processing, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(国家多谱信息处理科学与技术重点实验室,人工智能与自动化学院,华中科技大学)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract)

AI总结 ReaMOT通过引入推理能力的多目标跟踪框架,解决传统方法在复杂指令下的泛化问题,提出ReaTrack框架并实现RHOTA指标的显著提升。

Comments Code: https://github.com/chen-si-jia/ReaMOT

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13332 2026-05-12 cs.AI cs.CL 82%

Explicit Reasoning Makes Better Judges: A Systematic Study on Accuracy, Efficiency, and Robustness

显式推理使评判更可靠:对准确性、效率和鲁棒性的系统研究

Pratik Jayarao, Himanshu Gupta, Neeraj Varshney, Chaitanya Dwivedi

机构 * Arizona State University(亚利桑那州立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过对比显式推理与非显式推理模型在RewardBench任务中的表现,发现显式推理模型在准确性、效率和鲁棒性上均优于非显式模型,且在多语言环境下也表现出优势。

Comments Accepted in 2025 NeurIPS Foundations of Reasoning in Language Models Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10806 2026-05-12 cs.CV cs.AI cs.LG 81%

PhyGround: Benchmarking Physical Reasoning in Generative World Models

PhyGround:用于生成世界模型中物理推理的基准测试

Juyi Lin, Arash Akbari, Yumei He, Lin Zhao, Haichao Zhang, Arman Akbari, Xingchen Xu, Zoe Y. Lu, Enfu Nan, Hokin Deng, Edmund Yeh, Sarah Ostadabbas, Yun Fu, Jennifer Dy, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) Tulane University(路易斯安那州立大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 PhyGround通过250个精心设计的提示和13种物理定律的分类,评估视频生成中的物理推理能力,采用大规模人工研究验证并发布专用VLM评估工具PhyJudge-9B,显著降低偏见。

Comments Preprint. 56 pages, 39 figures, 40 tables. Project page: https://phyground.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09900 2026-05-12 cs.AI cs.CL cs.CV 81%

The Gordian Knot for VLMs: Diagrammatic Knot Reasoning as a Hard Benchmark

为视觉语言模型解开 Gordian 结:图式结理作为一项难题基准

Hao Liu, Jicheng Liu

机构 * Department of Psychology(心理学系) New York University(纽约大学) Department of Computer Science(计算机科学系) University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出 KnotBench 基准,通过 858,318 张图像与 Regina 签名验证,评估 VLMs 在结图识别、预测和跨模态接地任务中的能力,发现模型在结操作模拟上存在显著不足。

Comments 41 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02972 2026-05-12 cs.CL cs.AI 81%

LINGOLY-TOO: Disentangling Reasoning from Knowledge with Templatised Orthographic Obfuscation

LINGOLY-TOO:通过模板化正交混淆分离推理与知识

Jude Khouja, Lingyi Yang, Karolina Korgul, Simeon Hellsten, Vlad A. Neacsu, Harry Mayne, Ryan Othniel Kearns, Andrew M. Bean, Adam Mahdi

机构 * University of Oxford(牛津大学) University of Nottingham(诺丁汉大学) University of Glasgow(格拉斯哥大学) United Kingdom Linguistics Olympiad(英国语言学奥林匹克) Asia-Pacific Linguistics Olympiad(亚太语言学奥林匹克)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 LINGOLY-TOO通过模板化正交混淆技术,设计了1203个问题和6995个子问题,旨在减少对知识和记忆的依赖,评估模型真正的推理能力。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08498 2026-05-12 cs.LG cs.AI cs.LO 81%

MathConstraint: Automated Generation of Verified Combinatorial Reasoning Instances for LLMs

MathConstraint:为LLMs自动生成验证的组合推理实例

Viresh Pati, Zhengyu Li, Piyush Jha, Rahul Garg, Yatharth Sejpal, Vijay Ganesh

机构 * Georgia Institute of Technology, USA(佐治亚理工学院) KNOWIDEA Technologies(KNOWIDEA技术公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 MathConstraint是一个用于评估LLMs组合推理能力的严格适应性基准,通过结合约束满足问题和严格求解器验证,生成持续具有挑战性的实例,展示基准生成器对LLM推理能力进步的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26574 2026-05-12 cs.AI cond-mat.other cs.CL hep-th quant-ph 81%

Probing the Critical Point (CritPt) of AI Reasoning: a Frontier Physics Research Benchmark

探测人工智能推理的临界点(CritPt):一个前沿物理研究基准

Minhui Zhu, Minyang Tian, Xiaocheng Yang, Tianci Zhou, Lifan Yuan, Penghao Zhu, Eli Chertkov, Shengyan Liu, Yufeng Du, Ziming Ji, Indranil Das, Qingzhi Chen, Junyi Cao, Yufeng Du, Jiabin Yu, Peixue Wu, Jinchen He, Yifan Su, Yikun Jiang, Yujie Zhang, Chang Liu, Ze-Min Huang, Weizhen Jia, Yunkai Wang, Farshid Jafarpour, Yong Zhao, Xinan Chen, Jessie Shelton, Aaron W. Young, John Bartolotta, Wenchao Xu, Yue Sun, Anjun Chu, Victor Colussi, Chris Akers, Nathan Brooks, Wenbo Fu, Jinchao Zhao, Marvin Qi, Anqi Mu, Yubo Yang, Allen Zang, Yang Lyu, Peizhi Mai, Christopher Wilson, Xuefei Guo, Juntai Zhou, Daniel Inafuku, Chi Xue, Luyu Gao, Ze Yang, Yaïr Hein, Yonatan Kahn, Kevin Zhou, Di Luo, John Drew Wilson, Jarrod T. Reilly, Dmytro Bandak, Ofir Press, Liang Yang, Xueying Wang, Hao Tong, Nicolas Chia, Eliu Huerta, Hao Peng

机构 * Argonne National Laboratory(阿贡国家实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Virginia Tech(弗吉尼亚理工大学) Ohio State University(俄亥俄州立大学) Independent(独立) Northeastern University(东北大学) Caltech(加州理工学院) University of Florida(佛罗里达大学) University of Waterloo(滑铁卢大学) University of Maryland, College Park(马里兰大学学院公园分校) Columbia University(哥伦比亚大学) Perimeter Institute for Theoretical Physics(理论物理研究所) University of Connecticut(康涅狄格大学) University of Cologne(科隆大学) The Chinese University of Hong Kong(香港中文大学) Utrecht University(乌得勒支大学) Harvard University(哈佛大学) ETH Zürich(苏黎世联邦理工学院) Paul Scherrer Institute(保罗·谢尔研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CritPt基准,用于测试LLM在未发表的科研级推理任务中的能力,涵盖现代物理多个领域,发现当前LLM在复杂科研挑战中表现有限,仅能实现5.7%的准确率。

Comments 40 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08142 2026-05-12 cs.LG cs.CL cs.CV 81%

Reasoning emerges from constrained inference manifolds in large language models

推理源自大型语言模型中受限推断流形

Yanbiao Ma, Fei Luo, Linfeng Zhang, Chuangxin Zhao, Mingxuan Wang, Yinan Wu, Zhe Qian, Yang Lu, Long Chen, Zhao Cao, Xiaoshuai Hao, Ji-Rong Wen, Jungong Han

机构 * Renmin University of China(中国人民大学) Tsinghua University(清华大学) Xiaomi EV(小米电动车) Xiamen University(厦门大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 研究通过分析推理过程中的内部表示演变,发现推理动态在高维空间中自组织为低维流形,但需满足表示能力、流形压缩和非退化信息体积等条件才能实现稳定推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10698 2026-05-12 cs.MA cs.AI 79%

The Bystander Effect in Multi-Agent Reasoning: Quantifying Cognitive Loafing in Collaborative Interactions

多智能体推理中的旁观者效应:量化协作互动中的认知惰性

Dahlia Shehata, Ming Li

机构 * University of Waterloo(滑铁卢大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究揭示多智能体系统中社交压力引发的认知惰性现象,通过评估22500条轨迹发现模型在协作中逻辑主权崩溃,揭示了主权缺口与对齐幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10410 2026-05-12 cs.LG 79%

Equilibrium Residuals Expose Three Regimes of Matrix-Game Strategic Reasoning in Language Models

均衡残差揭示语言模型在矩阵博弈战略推理中的三种模式

Wenhua Nie, Binhan Luo, Zijie Meng, Jyh-Shing Roger Jang, Ching-Wen Ma

机构 * National Taiwan University(国立台湾大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 研究揭示语言模型在矩阵博弈中存在三种战略推理模式,通过实验发现残差奖励在不同矩阵规模下表现差异,证明残差训练在收益变化时具有转移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10327 2026-05-12 quant-ph cs.AI cs.SC 79%

SCALAR: A Neurosymbolic Framework for Automated Conjecture and Reasoning in Quantum Circuit Analysis

SCALAR:用于量子电路分析中自动猜想和推理的神经符号框架

Sean Feeney, Pooja Rao, Andreas Klappenecker, Reuben Tate, Yuri Alexeev, Stefano Mensa, Elica Kyoseva, Stephan Eidenbenz

机构 * 1Department of Computer Science, Texas A\&M University, College Station, USA 2NVIDIA Corporation, Santa Clara, USA Artificial Intelligence Division (CAI-3), Los Alamos National Laboratory, Los Alamos, USA

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SCALAR框架结合量子模拟、符号猜想生成和LLM解释,通过CUDA-Q平台分析量子电路,生成优化QAOA参数与图不变量的关系猜想,并识别图结构特征与优化景观属性的关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10146 2026-05-12 cs.AI cs.CR 79%

Benchmarking Safety Risks of Knowledge-Intensive Reasoning under Malicious Knowledge Editing

在恶意知识编辑下知识密集推理安全风险的基准测试

Qinghua Mao, Xi Lin, Jinze Gu, Jun Wu, Siyuan Li, Yuliang Chen

机构 * School of Computer Science(计算机科学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出EditRisk-Bench,通过整合恶意场景和多级推理任务,系统评估知识编辑对推理行为的影响,揭示恶意知识编辑导致错误推理的风险因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09929 2026-05-12 cs.LG cs.SE 79%

TeleResilienceBench: Quantifying Resilience for LLM Reasoning in Telecommunications

TeleResilienceBench: 评估大语言模型在电信领域推理中的韧性

Pranshav Gajjar, Emmanuel Ojo, Vijay K Shah

机构 * NextG Wireless Lab, North Carolina State University(NextG无线实验室,北卡罗来纳州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出TeleResilienceBench,通过七个电信子领域评估大语言模型在继承不完整推理并纠正错误时的韧性,发现模型在恢复能力上表现有限,且规模扩大并不必然提升韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09822 2026-05-12 cs.CR cs.AI 79%

Oracle Poisoning: Corrupting Knowledge Graphs to Weaponise AI Agent Reasoning

Oracle Poisoning:污染知识图谱以武器化AI代理推理

Ben Kereopa-Yorke, Guillermo Diaz, Holly Wright, Reagan Johnston, Ron F. Del Rosario, Timothy Lynar

机构 * Microsoft(微软) UNSW Canberra(新南威尔士大学堪培拉分校) SAP OWASP Gen AI Security Project(OWASP生成式人工智能安全项目)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究了通过污染知识图谱来破坏AI代理推理的攻击方法,展示了六个针对生产级代码知识图谱的攻击场景,揭示了攻击者熟练度对信任度的影响,并评估了多种防御措施的有效性。

Comments 26 pages, 3 fugres, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09544 2026-05-12 cs.AI 79%

TIDE-Bench: Task-Aware and Diagnostic Evaluation of Tool-Integrated Reasoning

TIDE-Bench:面向任务的工具整合推理评估

Yize Li, Junzhi Li, Jason Song, Chuxiong Sun, Rui Wang, Changwen Zheng

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出TIDE-Bench,一个高效全面的工具整合推理评估基准,通过多样任务设置、任务感知评估协议和高质量评价集,揭示工具整合推理中的持续瓶颈。

Comments 10 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09262 2026-05-12 cs.CV cs.CL 79%

Reinforcing Multimodal Reasoning Against Visual Degradation

增强多模态推理以对抗视觉退化

Rui Liu, Dian Yu, Haolin Liu, Yucheng Shi, Tong Zheng, Runpeng Dai, Haitao Mi, Pratap Tokekar, Leoweiliang

机构 * Tencent Hunyuan(腾讯文言) University of Maryland, College Park(马里兰大学 College Park 分校) University of Virginia(弗吉尼亚大学) University of North Carolina, Chapel Hill(北卡罗来纳大学 Chapel Hill 分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出ROMA框架,通过优化动态增强多模态大语言模型对视觉退化的鲁棒性,提升在多种基准测试中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00371 2026-05-12 cs.CL cs.CY cs.SE 79%

Reasoning Trajectories for Socratic Debugging of Student Code: From Misconceptions to Contradictions and Updated Beliefs

为学生代码进行苏格拉底调试的推理轨迹:从误解到矛盾与更新信念

Erfan Al-Hossami, Razvan Bunescu

机构 * University of North Carolina at Charlotte(北卡罗来纳州夏洛特大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出推理轨迹生成任务,通过标注的调试问题数据集探讨生成推理轨迹和基于LLM的苏格拉底对话方法,实验显示LLM能生成91%正确的推理轨迹和98.7%有效的对话内容。

Comments 25 pages, 2 tables, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09042 2026-05-12 cs.CL 79%

Evaluating Pragmatic Reasoning in Large Language Models: Evidence from Scalar Diversity

评估大语言模型的语用推理:来自量级多样性的证据

Ye-eun Cho

机构 * Sungkyunkwan University(成均馆大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 研究通过量级多样性评估大语言模型的语用推理能力,发现不同模型和任务结构下语用行为差异显著,评价方法无法单一确定模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08755 2026-05-12 cs.LG 79%

LAQuant: A Simple Overhead-free Large Reasoning Model Quantization by Layer-wise Lookahead Loss

LAQuant: 一种简单且无开销的大型推理模型量化方法通过分层前瞻损失

Euntae Choi, Sumin Song, Sungjoo Yoo

机构 * Seoul National University(首尔国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出LAQuant,通过分层前瞻损失和推理领域校准,解决量化中的精度与速度问题,提升推理性能并加快解码速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08094 2026-05-12 cs.CY cs.AI 79%

MedThink: Enhancing Diagnostic Accuracy in Small Models via Teacher-Guided Reasoning Correction

MedThink: 通过教师引导的推理校正提升小模型的诊断准确性

Xinchun Su, Chunxu Luo, Lipeng Ma, Yixuan Li, Weidong Yang

机构 * School of Computer Science, Fudan University, Shanghai, China(复旦大学计算机学院,上海,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 MedThink通过两阶段知识蒸馏框架提升小语言模型的临床推理能力,在医疗基准测试和胃肠病数据集上均优于传统方法,提升诊断准确率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08695 2026-05-12 cs.CV 78%

EditSleuth: A Dataset of Grounded Reasoning Chains for Image-Edit Forensics

EditSleuth:用于图像编辑取证的 grounded 推理链数据集

Van-Loc Nguyen, AprilPyone MaungMaung, Minh-Triet Tran, Isao Echizen

机构 * University of Science, Vietnam National University Ho Chi Minh City(越南胡志明市国家大学科学大学) National Institute of Informatics(国立信息研究所)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出EditSleuth数据集,包含257,725个图像编辑三元组,用于图像编辑取证的 grounded 推理。数据集包含编辑图像、源图像、二元编辑掩码、12类编辑分类标签、难度评分和六步推理链,通过确定性方法生成,并验证了难度评分与编辑类型的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08452 2026-05-12 cs.CV 78%

NICE FACT: Diagnosing and Calibrating VLMs in Quantitative Reasoning for Kinematic Physics

NICE FACT: 诊断和校准VLMs在运动物理定量推理中的能力

Jian Lan, Zhicheng Liu, Xinpeng Wang, Yuhao Zhou, Haokun Chen, Jiancheng Lv, Barbara Plank, Thomas Seidl

机构 * University of Munich (LMU)(慕尼黑大学(LMU)) Munich Center of Machine Learning(慕尼黑机器学习中心) Sichuan University(四川大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文研究VLMs在运动物理定量推理中的表现,提出NICE和FACT双诊断框架,分析视觉真实性、物理定律理解和时间定位,揭示模型在识别视觉前提和应用物理定律方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08412 2026-05-12 cs.CV 78%

SYNCR: A Cross-Video Reasoning Benchmark with Synthetic Grounding

SYNCR: 一个具有合成接地的跨视频推理基准

Sara Ghazanfari, Siddharth Garg, Prashanth Krishnamurthy, Farshad Khorrami

机构 * New York University(纽约大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 SYNCR通过合成数据评估多视频推理能力,发现现有模型在物理空间推理上表现不足,参数扩展和训练后优化能提升时间对齐能力,但无法可靠解决细粒度物理跟踪和全局空间合成问题。

详情

展开后加载摘要…

URL PDF HTML 收藏