arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10414 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10414 篇

2605.08498 2026-05-12 cs.LG cs.AI cs.LO 81%

MathConstraint: Automated Generation of Verified Combinatorial Reasoning Instances for LLMs

MathConstraint:为LLMs自动生成验证的组合推理实例

Viresh Pati, Zhengyu Li, Piyush Jha, Rahul Garg, Yatharth Sejpal, Vijay Ganesh

机构 * Georgia Institute of Technology, USA(佐治亚理工学院) KNOWIDEA Technologies(KNOWIDEA技术公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 MathConstraint是一个用于评估LLMs组合推理能力的严格适应性基准,通过结合约束满足问题和严格求解器验证,生成持续具有挑战性的实例,展示基准生成器对LLM推理能力进步的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26574 2026-05-12 cs.AI cond-mat.other cs.CL hep-th quant-ph 81%

Probing the Critical Point (CritPt) of AI Reasoning: a Frontier Physics Research Benchmark

探测人工智能推理的临界点(CritPt):一个前沿物理研究基准

Minhui Zhu, Minyang Tian, Xiaocheng Yang, Tianci Zhou, Lifan Yuan, Penghao Zhu, Eli Chertkov, Shengyan Liu, Yufeng Du, Ziming Ji, Indranil Das, Qingzhi Chen, Junyi Cao, Yufeng Du, Jiabin Yu, Peixue Wu, Jinchen He, Yifan Su, Yikun Jiang, Yujie Zhang, Chang Liu, Ze-Min Huang, Weizhen Jia, Yunkai Wang, Farshid Jafarpour, Yong Zhao, Xinan Chen, Jessie Shelton, Aaron W. Young, John Bartolotta, Wenchao Xu, Yue Sun, Anjun Chu, Victor Colussi, Chris Akers, Nathan Brooks, Wenbo Fu, Jinchao Zhao, Marvin Qi, Anqi Mu, Yubo Yang, Allen Zang, Yang Lyu, Peizhi Mai, Christopher Wilson, Xuefei Guo, Juntai Zhou, Daniel Inafuku, Chi Xue, Luyu Gao, Ze Yang, Yaïr Hein, Yonatan Kahn, Kevin Zhou, Di Luo, John Drew Wilson, Jarrod T. Reilly, Dmytro Bandak, Ofir Press, Liang Yang, Xueying Wang, Hao Tong, Nicolas Chia, Eliu Huerta, Hao Peng

机构 * Argonne National Laboratory(阿贡国家实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Virginia Tech(弗吉尼亚理工大学) Ohio State University(俄亥俄州立大学) Independent(独立) Northeastern University(东北大学) Caltech(加州理工学院) University of Florida(佛罗里达大学) University of Waterloo(滑铁卢大学) University of Maryland, College Park(马里兰大学学院公园分校) Columbia University(哥伦比亚大学) Perimeter Institute for Theoretical Physics(理论物理研究所) University of Connecticut(康涅狄格大学) University of Cologne(科隆大学) The Chinese University of Hong Kong(香港中文大学) Utrecht University(乌得勒支大学) Harvard University(哈佛大学) ETH Zürich(苏黎世联邦理工学院) Paul Scherrer Institute(保罗·谢尔研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CritPt基准,用于测试LLM在未发表的科研级推理任务中的能力,涵盖现代物理多个领域,发现当前LLM在复杂科研挑战中表现有限,仅能实现5.7%的准确率。

Comments 40 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08142 2026-05-12 cs.LG cs.CL cs.CV 81%

Reasoning emerges from constrained inference manifolds in large language models

推理源自大型语言模型中受限推断流形

Yanbiao Ma, Fei Luo, Linfeng Zhang, Chuangxin Zhao, Mingxuan Wang, Yinan Wu, Zhe Qian, Yang Lu, Long Chen, Zhao Cao, Xiaoshuai Hao, Ji-Rong Wen, Jungong Han

机构 * Renmin University of China(中国人民大学) Tsinghua University(清华大学) Xiaomi EV(小米电动车) Xiamen University(厦门大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 研究通过分析推理过程中的内部表示演变,发现推理动态在高维空间中自组织为低维流形,但需满足表示能力、流形压缩和非退化信息体积等条件才能实现稳定推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08057 2026-05-11 cs.CL cs.AI 81%

CA-SQL: Complexity-Aware Inference Time Reasoning for Text-to-SQL via Exploration and Compute Budget Allocation

CA-SQL:基于探索与计算预算分配的文本到SQL推理方法

James Petullo, Nianwen Xue

机构 * Brandeis University(布雷纳大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 CA-SQL通过动态扩展探索广度和自定义提示种子方法,提升文本到SQL任务在Bird-Bench基准中的表现,达到51.72%的挑战性问题得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07274 2026-05-11 cs.AI cs.LG 81%

Structured Role-Aware Policy Optimization for Multimodal Reasoning

结构化角色感知策略优化用于多模态推理

Bingqing Jiang, Difan Zou

机构 * School of Computing & Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) School of Computing & Data Science and Institute of Data Science, The University of Hong Kong(计算与数据科学学院和数据科学研究所,香港大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出结构化角色感知策略优化(SRPO),通过角色感知的token级信用分配提升多模态推理中的证据基础推理能力,无需外部奖励模型。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18744 2026-05-11 cs.AI cs.LG 81%

TSRBench: A Comprehensive Multi-task Multi-modal Time Series Reasoning Benchmark for Generalist Models

TSRBench: 一个全面的多任务多模态时间序列推理基准,用于通用模型

Fangxu Yu, Xingang Guo, Lingzhi Yuan, Haoqiang Kang, Hongyu Zhao, Lianhui Qin, Furong Huang, Bin Hu, Tianyi Zhou

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Illinois at Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Maryland, College Park(马里兰大学学院公园分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 TSRBench通过4125个问题和15个任务评估通用模型的时间序列推理能力,揭示了感知和推理中的缩放定律失效以及多模态融合的不足。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04731 2026-05-11 cs.AI cs.CL 81%

Miner:Mining Intrinsic Mastery for Data-Efficient RL in Large Reasoning Models

Miner:挖掘内在掌握以实现大推理模型的数据高效强化学习

Shuyang Jiang, Yuhao Wang, Ya Zhang, Yanfeng Wang, Yu Wang

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Miner方法,通过利用策略内在不确定性作为自监督奖励信号,提升大推理模型的数据高效强化学习性能,实现状态-of-the-art结果。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04850 2026-05-11 cs.CL cs.AI 81%

Detecting Distillation Data from Reasoning Models

从推理模型中检测蒸馏数据

Hengxiang Zhang, Hyeong Kyu Choi, Sharon Li, Hongxin Wei

机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) Department of Computer Sciences, University of Wisconsin–Madison(计算机科学系,威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于输出token概率偏差的检测方法,用于识别推理模型蒸馏数据中的问题,通过量化生成token与高置信度参考概率的偏差,提升检测性能,实验表明在蒸馏数据集上AUC提升达31%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20822 2026-05-08 cs.CL cs.AI 81%

MediEval: A Unified Medical Benchmark for Patient-Contextual and Knowledge-Grounded Reasoning in LLMs

MediEval: 一个统一的医疗基准,用于评估大语言模型在患者上下文和知识引导推理中的表现

Zhan Qu, Michael Färber

机构 * TU Dresden and ScaDS.AI(德累斯顿理工大学和ScaDS.AI)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 MediEval通过整合MIMIC-IV电子健康记录与统一的知识库,系统评估医疗模型的知识基础和上下文一致性,识别关键失败模式并提出CoRFu方法提升准确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05438 2026-05-08 cs.LG cs.AI 81%

On Semantic Loss Fine-Tuning Approach for Preventing Model Collapse in Causal Reasoning

在因果推理中防止模型崩溃的语义损失微调方法

Pratik Deshmukh, Atirek Gupta

机构 * Technical University of Vienna(维也纳技术大学) HCLTech

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种语义损失函数,通过图逻辑约束和动态lambda调度防止因果推理中的模型崩溃,提升模型在transitivity和d-separation任务上的准确率。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01203 2026-05-08 cs.AI cs.CL 81%

GR-Ben: A General Reasoning Benchmark for Evaluating Process Reward Models

GR-Ben:一种通用推理基准,用于评估过程奖励模型

Zhouhao Sun, Xuan Zhang, Xiao Ding, Bibo Cai, Li Du, Kai Xiong, Xinran Dai, Fei Zhang, weidi tang, Zhiyuan Kan, Yang Zhao, Bing Qin, Ting Liu

机构 * Research Center for Social Computing(社会计算研究中心) Interactive Robotics, Harbin Institute of Technology, China(交互机器人学,哈尔滨工业大学,中国) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 GR-Ben旨在评估过程奖励模型在科学和逻辑两大领域及九个子领域的误差检测能力,揭示现有模型在非数学领域和计算错误检测上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09883 2026-05-05 cs.CL cs.LG 81%

DELTA: Dynamic Layer-Aware Token Attention for Efficient Long-Context Reasoning

DELTA: 动态层感知令牌注意力机制用于高效的长上下文推理

Hossein Entezari Zarch, Lei Gao, Chaoyi Jiang, Murali Annavaram

机构 * University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 DELTA通过动态层感知令牌注意力机制提升长上下文推理效率,减少计算成本而不牺牲准确性,在AIME和GPQA-Diamond等基准上表现优异。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07731 2026-05-05 cs.AI cs.CL 81%

oMeBench: Towards Robust Benchmarking of LLMs in Organic Mechanism Elucidation and Reasoning

oMeBench:面向有机机制阐明和推理的鲁棒基准测试

Ruiling Xu, Yifan Zhang, Qingyun Wang, Carl Edwards, Heng Ji

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出oMeBench,首个大规模专家 curated 的有机机制推理基准,包含10000+注释步骤,评估LLM在化学一致性与多步推理能力,发现通过提示策略和领域微调可使性能提升50%。

Comments We need adjust some authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00206 2026-05-04 cs.LG cs.CL 81%

State Stream Transformer (SST) V2: Parallel Training of Nonlinear Recurrence for Latent Space Reasoning

状态流变换器(SST)V2:通过非线性递归实现潜在空间推理的并行训练

Thea Aviss

机构 * Fifth Dimension(第五维度)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 SST V2通过在解码器层中引入FFN驱动的非线性递归,实现连续潜在空间中的参数高效推理,利用学习融合在完整序列中水平流式传输潜在状态,并通过双阶段并行训练解决递归的序列依赖性,提升推理能力。

Comments 48 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01020 2026-05-04 cs.AI cs.CL 81%

Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics

用法律问题树准则评估法律推理轨迹

Jinu Lee, Kyoung-Woon On, Simeng Han, Arman Cohan, Julia Hockenmaier

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) LBOX Stanford(斯坦福) Yale(耶鲁)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出 LEGIT 数据集,用于评估 LLM 在法律领域推理轨迹的质量,发现法律问题覆盖度和正确性影响 LLM 推理能力,RAG 和带准则的 RL 分别提升整体能力与正确性。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07630 2026-05-04 cs.CL cs.AI cs.CV 81%

InterChart: Benchmarking Visual Reasoning Across Decomposed and Distributed Chart Information

InterChart:跨分解与分布式图表信息的基准测试

Anirudh Iyengar Kaniyar Narayana Iyengar, Srija Mukhopadhyay, Adnan Qidwai, Shubhankar Singh, Dan Roth, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) IIIT, Hyderabad(海得拉巴印度理工学院) Mercer Mettl University(梅森-梅特尔大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 InterChart通过评估视觉语言模型在多图表间推理的能力,揭示了模型在复杂图表集成中的局限性,推动多模态推理的发展。

Comments 22 pages, 8 figures, 14 tables. Accepted at IJCNLP-AACL 2025

Journal ref Proceedings of the 14th International Joint Conference on Natural Language Processing and the 4th Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics 2025, 2046-2067

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12249 2026-04-30 cs.CL cs.AI cs.CV 81%

SciMDR: Advancing Scientific Multimodal Document Reasoning

SciMDR:推动科学多模态文档推理

Ziyu Chen, Yilun Zhao, Chengye Wang, Rilyn Han, Manasi Patwardhan, Arman Cohan

机构 * Yale University(耶鲁大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SciMDR数据集,通过合成与重嵌框架生成大规模多模态文档推理数据,提升科学问答任务的复杂度和真实性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21459 2026-04-30 cs.LG cs.AI 81%

HER: Human-like Reasoning and Reinforcement Learning for LLM Role-playing

HER:面向大语言模型角色扮演的人类级推理与强化学习

Chengyu Du, Xintao Wang, Aili Chen, Weiyuan Li, Rui Xu, Junteng Liu, Zishan Huang, Rong Tian, Zijun Sun, Yuhao Li, Liheng Feng, Deming Ding, Pengyu Zhao, Yanghua Xiao

机构 * Fudan University(复旦大学) MiniMax

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出HER框架,通过双层推理和人类对齐的奖励模型,提升大语言模型在角色扮演中的认知模拟能力,实验表明其在CoSER和Minimax Role-Play Bench上显著优于基线模型。

Comments Findings of ACL, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25231 2026-04-29 cs.CV cs.AI cs.CL 81%

DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams

DRAGON:一个用于基于证据的视觉推理的图示基准

Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Gaurav Najpande, Manan Suri, Dinesh Manocha, Puneet Mathur, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Adobe Research(Adobe研究) University of Maryland(马里兰大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 DRAGON基准评估模型在图示中基于证据的视觉推理能力,要求模型定位支持答案的视觉元素,包含图表、地图等,通过标注数据和评估框架检验八种最新视觉语言模型的定位能力。

Comments 22 Pages, 14 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07101 2026-04-29 cs.CL cs.AI 81%

Less Is More: Fast and Accurate Reasoning with Cross-Head Unified Sparse Attention

少即是多:基于交叉头统一稀疏注意力的快速准确推理

Lijie Yang, Zhihao Zhang, Arti Jain, Shijie Cao, Baihong Yuan, Yiwei Chen, Zhihao Jia, Ravi Netravali

机构 * DeepSeek-AI DeepMind OpenAI Team

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LessIsMore方法,通过交叉头统一稀疏注意力机制提升长 horizon 推理效率,减少 token 数量同时保持高精度,实现更快的端到端解码速度和稀疏注意力计算速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24665 2026-04-28 cs.CL cs.AI 81%

Benchmarking Source-Sensitive Reasoning in Turkish: Humans and LLMs under Evidential Trust Manipulation

在土耳其语中评估来源敏感推理的基准测试:人类与LLM在证据信任操控下的对比

Sercan Karakaş, Yusuf Şimşek

机构 * University of Chicago(芝加哥大学) F rat University(费拉特大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了来源信任对土耳其语证据形态学的影响,并评估了LLM对此的敏感性。人类在可控的cloze情境中表现出稳定的信任效应,而LLM表现不一致且常受输出合规性问题影响。

Comments Accepted to The 15th edition of the Workshop on Cognitive Modeling and Computational Linguistics, co-located with the Language Resources and Evaluation Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24645 2026-04-28 cs.CL cs.AI 81%

K-MetBench: A Multi-Dimensional Benchmark for Fine-Grained Evaluation of Expert Reasoning, Locality, and Multimodality in Meteorology

K-MetBench:一个多维基准,用于细粒度评估气象学中的专家推理、局部性和多模态能力

Soyeon Kim, Cheongwoong Kang, Myeongjin Lee, Eun-Chul Chang, Jaedeok Lee, Jaesik Choi

机构 * KAIST(韩国科学技术院) INEEJI Kongju National University(康久国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出K-MetBench,一个基于韩国资格考试的多维基准,揭示了专家推理、逻辑有效性、韩国地理文化理解及领域分析四个维度的差距,发现韩国模型在本地情境中优于大模型。

Comments 39 pages, 32 figures, 14 tables, including appendices. Accepted to Findings of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24473 2026-04-28 cs.AI cs.CL 81%

Agentic clinical reasoning over longitudinal myeloma records: a retrospective evaluation against expert consensus

基于纵向骨髓瘤记录的代理临床推理:一项回顾性评估与专家共识的对比

Johannes Moll, Jannik Lübberstedt, Christoph Nuernbergk, Jacob Stroh, Luisa Mertens, Anna Purcarea, Christopher Zirn, Zeineb Benchaaben, Fabian Drexel, Hartmut Häntze, Anirudh Narayanan, Friedrich Puttkammer, Andrei Zhukov, Jacqueline Lammert, Sebastian Ziegelmayer, Markus Graf, Marion Högner, Marcus Makowski, Florian Bassermann, Lisa C. Adams, Jiazhen Pan, Daniel Rueckert, Krischan Braitsch, Keno K. Bressem

机构 * Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM) and TUM University Hospital(人工智能在医疗与健康中的研究所,慕尼黑技术大学(TUM)及慕尼黑技术大学医院) Department of Diagnostic and Interventional Radiology, Klinikum rechts der Isar, TUM University Hospital, School of Medicine and Health, Technical University of Munich(诊断与介入放射科,莱茵河右岸医院,慕尼黑技术大学医院,医学与健康学院,慕尼黑技术大学) Department of Cardiovascular Radiology and Nuclear Medicine, German Heart Center, TUM University Hospital, School of Medicine and Health, Technical University of Munich(心血管放射学与核医学科,德国心脏中心,慕尼黑技术大学医院,医学与健康学院,慕尼黑技术大学) Department of Medicine III, Klinikum rechts der Isar, TUM University Hospital, School of Medicine and Health, Technical University of Munich(第三医学部,莱茵河右岸医院,慕尼黑技术大学医院,医学与健康学院,慕尼黑技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了代理推理系统在骨髓瘤长期记录中的表现,发现其在复杂问题和长记录中优于传统方法,但需进一步验证以确保临床应用的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24186 2026-04-28 cs.CL cs.AI 81%

MultiDx: A Multi-Source Knowledge Integration Framework towards Diagnostic Reasoning

MultiDx: 一个面向诊断推理的多源知识整合框架

Yimin Deng, Zhenxi Lin, Yejing Wang, Guoshuai Zhao, Pengyue Jia, Zichuan Fu, Derong Xu, Yefeng Zheng, Xiangyu Zhao, Li Zhu, Xian Wu, Xueming Qian

机构 * Xi’an Jiaotong University(西安交通大学) City University of Hong Kong(香港城市大学) Tencent Jarvis Lab(腾讯 Jarvis实验室) Westlake University(西湖大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MultiDx框架,通过多源知识整合提升诊断推理能力,结合网络搜索、病例数据库等多视角证据,生成最终预测。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14952 2026-04-28 cs.CL cs.AI 81%

CorpusQA: A 10 Million Token Benchmark for Corpus-Level Analysis and Reasoning

CorpusQA:一个1000万词的语料库分析与推理基准

Zhiyuan Lu, Chenliang Li, Yingcheng Shi, Weizhou Shen, Ming Yan, Fei Huang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 CorpusQA提出一个1000万词的基准,解决大规模语料库推理问题,通过合成数据框架生成复杂查询,验证长文本推理能力,发现先进架构对全局信息整合的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20904 2026-04-24 cs.LG cs.AI 81%

Reinforcing privacy reasoning in LLMs via normative simulacra from fiction

通过小说中的规范仿像强化大语言模型的隐私推理

Matt Franchi, Madiha Zahrah Choksi, Harold Triedman, Helen Nissenbaum

机构 * Cornell Tech(康奈尔科技)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过从小说中提取规范仿像,结合监督学习和GRPO强化学习,提升大语言模型的隐私推理能力,验证了小说来源的规范仿像在现实领域中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15096 2026-04-24 cs.AI cs.LG 81%

OpenEstimate: Evaluating LLMs on Reasoning Under Uncertainty with Real-World Data

OpenEstimate:评估语言模型在不确定性下的推理能力实现实验

Alana Renda, Jillian Ross, Michael Cafarella, Jacob Andreas

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出OpenEstimate基准测试,用于评估语言模型在不确定环境下进行数值估计的能力,发现模型的先验概率常不准确且过度自信,但通过改进不确定性引导方式可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20273 2026-04-23 cs.AI cs.CL 81%

ActuBench: A Multi-Agent LLM Pipeline for Generation and Evaluation of Actuarial Reasoning Tasks

ActuBench: 一个用于生成和评估精算推理任务的多智能体LLM流水线

Jan-Philipp Schmidt

机构 * TH Köln, Institut für Versicherungswesen (ivwKöln)(TH Köln保险学系(ivwKöln))

专题命中 推理评测 :reasoning(title);verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ActuBench,一个多智能体LLM流水线,用于自动生成和评估符合国际精算协会教育大纲的高级精算评估题目。通过四个LLM角色的分工,结合成本优化的辅助代理,评估了50个模型并在两个基准上报告了三个主要发现。

Comments 19 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04225 2026-04-23 cs.CV cs.AI cs.CL 81%

Locate-Then-Examine: Grounded Region Reasoning Improves Detection of AI-Generated Images

定位后检查:基于区域的推理提升AI生成图像的检测

Yikun Ji, Yan Hong, Bowen Deng, Jun Lan, Huijia Zhu, Weiqiang Wang, Liqing Zhang, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LTE框架,通过定位可疑区域并重新检查以提升AI生成图像检测的准确性和鲁棒性,提供可理解的区域级解释。

Comments 18 pages, 11 figures (including supplementary material)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20806 2026-04-23 cs.CV cs.AI cs.CL 81%

OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model

OMIBench:用于大型视觉-语言模型在奥林匹克级多图像推理中的基准测试

Qiguang Chen, Chengyu Luan, Jiajun Wu, Qiming Yu, Yi Yang, Yizhuo Li, Jingqi Tong, Xiachong Feng, Libo Qin, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究室) Harbin Institute of Technology(哈尔滨工业大学) Central South University(中南大学) Fudan University(复旦大学) The University of Hong Kong(香港大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Text Computing and Cognitive Intelligence Ministry of Education Engineering Research Center(教育部文本计算与认知智能工程研究中心) Guizhou University(贵州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 OMIBench旨在评估多图像推理能力,包含生物、化学、数学和物理奥林匹克问题,提供精确和语义答案匹配的评估协议,实验显示现有模型性能存在显著差距。

Comments ACL 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏