arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10414 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10414 篇

2603.12458 2026-03-16 cs.CL cs.AI 81%

Shattering the Shortcut: A Topology-Regularized Benchmark for Multi-hop Medical Reasoning in LLMs

打破捷径:一种用于LLMs多跳医学推理的拓扑正则化基准

Xing Zi, Xinying Zhou, Jinghao Xiao, Catarina Moreira, Mukesh Prasad

机构 * University of Technology Sydney(悉尼技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出ShatterMed-QA基准,通过拓扑正则化知识图谱评估深度诊断推理能力,揭示LLMs在多跳医学推理中的缺陷,并验证RAG方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11339 2026-03-13 cs.AI cs.CE cs.LG 81%

FinRule-Bench: A Benchmark for Joint Reasoning over Financial Tables and Principles

FinRule-Bench:一个用于金融表和原则联合推理的基准

Arun Vignesh Malarkkan, Manan Roy Choudhury, Guangwei Zhang, Vivek Gupta, Qingyun Wang, Yanjie Fu, Denghui Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 FinRule-Bench是一个评估金融表与原则联合推理能力的基准,通过三个任务测试模型在规则验证、识别和多违规诊断中的表现,揭示LLMs在高风险金融分析中的局限性。

Comments 8 pages + Ethics Statement + References + Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09993 2026-03-12 cs.CL cs.AI 81%

CEI: A Benchmark for Evaluating Pragmatic Reasoning in Language Models

CEI:一种评估语言模型隐含推理能力的基准

Jon Chun, Hannah Sussman, Adrian Mangine, Murathan Kocaman, Kirill Sidorko, Abhigya Koirala, Andre McCloud, Gwen Eisenbeis, Wisdom Akanwe, Moustapha Gassama, Eliezer Gonzalez Chirinos, Anne-Duncan Enright, Peter Dunson, Tiffanie Ng, Anna von Rosenstiel, Godwin Idowu

机构 * Kenyon College(肯尼恩学院) US NIST AI Consortium(美国NIST人工智能联合体) Schmidt Science HAVI(施密特科学HAVI)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 CEI基准通过300个经人类验证的场景评估语言模型在处理隐含意义复杂语句时的歧义消除能力,涵盖讽刺、混合信号等五种隐含子类型,采用三种权力配置进行测试。

Comments 38 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25426 2026-03-12 cs.AI cs.LG 81%

RADAR: Reasoning-Ability and Difficulty-Aware Routing for Reasoning LLMs

RADAR: 为推理LLM进行推理能力与难度感知的路由

Nigel Fernandez, Branislav Kveton, Ryan A. Rossi, Andrew S. Lan, Zichao Wang

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Adobe Research(Adobe研究)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 RADAR通过推理能力与难度感知路由,实现对不同查询的高效模型选择,提升推理性能与可扩展性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17862 2026-03-12 cs.AI cs.CL cs.CV 81%

Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities

Daily-Omni: 向音频-视觉推理迈进:跨模态时间对齐

Ziwei Zhou, Rui Wang, Zuxuan Wu, Yu-Gang Jiang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 Daily-Omni提出一个包含684个真实世界视频和1,197个问题的音频-视觉问答基准,评估24个模型在跨模态时间对齐任务上的性能,发现端到端模型在对齐关键问题上仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16368 2026-03-11 cs.LG cs.AI 81%

SATURN: SAT-based Reinforcement Learning to Unleash LLMs Reasoning

SATURN: 基于求解的强化学习以释放大语言模型的推理能力

Huanyu Liu, Ge Li, Jia Li, Hao Zhu, Kechi Zhang, Yihong Dong

机构 * Peking University(北京大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 Saturn通过基于SAT问题的强化学习框架,提升大语言模型的推理能力,实现可扩展的任务构建、规则验证和难度控制,取得显著效果。

Comments Camera-ready version for Neural Information Processing Systems (NeurIPS) 2025, Spotlight Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07888 2026-03-10 cs.CV cs.AI cs.LG 81%

VLM-SubtleBench: How Far Are VLMs from Human-Level Subtle Comparative Reasoning?

VLM-SubtleBench: VLMs在人类水平的细微比较推理方面还有多远?

Minkyu Kim, Sangheon Lee, Dongmin Park

机构 * KRAFTON KAIST(韩国科学技术院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 VLM-SubtleBench通过评估VLMs在细微比较推理上的表现,揭示了模型与人类性能之间的差距,并为提升VLMs的推理能力提供了基础。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07733 2026-03-10 cs.AI cs.CL math.OC 81%

Large Language Model for Discrete Optimization Problems: Evaluation and Step-by-step Reasoning

大规模语言模型在离散优化问题中的应用:评估与逐步推理

Tianhao Qian, Guilin Qi, Z. Y. Wu, Ran Gu, Xuanyi Liu, Canchen Lyu

机构 * School of Mathematics, Southeast University(东南大学数学学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Mathematical Sciences, Chongqing Normal University(重庆师范大学数学学院)

专题命中 推理评测 :reasoning(title);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了大规模语言模型在解决离散优化问题中的能力,探讨了CoT技术的有效性,并提出了未来研究的基准。

Comments 50 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07365 2026-03-10 cs.SD cs.AI cs.CL cs.MM eess.AS 81%

Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content Reasoning

多领域音频问答基准:面向声音内容推理

Chao-Han Huck Yang, Sreyan Ghosh, Qing Wang, Jaeyeon Kim, Hengyi Hong, Sonal Kumar, Guirui Zhong, Zhifeng Kong, S Sakshi, Vaibhavi Lokegaonkar, Oriol Nieto, Ramani Duraiswami, Dinesh Manocha, Gunhee Kim, Jun Du, Rafael Valle, Bryan Catanzaro

机构 * NVIDIA University of Maryland, College Park(马里兰大学 College Park 分校) University of Science and Technology of China(中国科学技术大学) Seoul National University(首尔国立大学) Adobe

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 DCASE 2025挑战赛提出多领域音频问答基准,通过生物声学、时间声音景观和复杂问答子集测试音频-语言模型在多样声音场景中的交互式问答能力,推动音频理解和推理能力发展。

Comments Dataset: https://huggingface.co/datasets/PeacefulData/2025_DCASE_AudioQA_Official DCASE Task-5 challenge: dcase.community/challenge2025/task-audio-question-answering. Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05900 2026-03-09 cs.LG cs.AI 81%

Reference-guided Policy Optimization for Molecular Optimization via LLM Reasoning

基于参考的策略优化用于分子优化 via LLM 推理

Xuan Li, Zhanke Zhou, Zongze Li, Jiangchao Yao, Yu Rong, Lu Zhang, Bo Han

机构 * Hong Kong Baptist University(香港 Baptist 大学) CMIC, Shanghai Jiao Tong University(CMIC,上海交通大学) DAMO Academy, Alibaba Group(DAMO 院,阿里巴巴集团) Hupan Lab(虎盘实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 RePO通过结合强化学习和参考引导策略优化,在分子优化中提升探索与利用的平衡,优于SFT和RLVR方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00177 2026-03-06 cs.CL cs.AI 81%

PrefDisco: Benchmarking Proactive Personalized Reasoning

PrefDisco:主动个性化推理的基准测试

Shuyue Stella Li, Avinandan Bose, Faeze Brahman, Simon Shaolei Du, Pang Wei Koh, Maryam Fazel, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能联盟)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 PrefDisco提出了一种评估方法,通过心理基础的人设将静态基准转化为互动个性化任务,定义PrefAlign作为细粒度的偏好对齐度量,揭示个性化推理需要专门开发而非自然产生。

Comments 65 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03790 2026-03-05 cs.CL cs.AI 81%

T2S-Bench & Structure-of-Thought: Benchmarking and Prompting Comprehensive Text-to-Structure Reasoning

T2S-Bench 及 Structure-of-Thought:基准测试与提示的综合文本到结构推理

Qinsi Wang, Hancheng Ye, Jinhee Kim, Jinghan Ke, Yifei Wang, Martin Kuo, Zishan Shao, Dongting Li, Yueqian Lin, Ting Jiang, Chiyue Wei, Qi Qian, Wei Wen, Helen Li, Yiran Chen

机构 * duke(杜克大学) meta

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Structure-of-Thought和T2S-Bench,通过显式文本结构化提升模型文本处理性能,实验表明其在多个任务中显著提升准确率。

Comments Dataset and Code have been released at https://t2s-bench.github.io/T2S-Bench-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03441 2026-03-05 cs.CL cs.AI 81%

CareMedEval dataset: Evaluating Critical Appraisal and Reasoning in the Biomedical Field

CareMedEval 数据集:评估生物医学领域中的批判性评估与推理

Doria Bonzi, Alexandre Guiggi, Frédéric Béchet, Carlos Ramisch, Benoit Favre

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 CareMedEval数据集用于评估生物医学领域中LLM的批判性评估与推理能力,揭示了现有模型在专业领域中的局限性。

Comments Accepted at LREC 2026. To access the dataset, see https://github.com/bonzid/CareMedEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19517 2026-03-04 cs.AI cs.CE cs.CL cs.CV 81%

Classroom Final Exam: An Instructor-Tested Reasoning Benchmark

教室期末考试:一个由教师测试的推理基准

Chongyang Gao, Diji Yang, Shuyan Zhou, Xichen Yan, Luchuan Song, Shuo Li, Kezhen Chen

机构 * Northwestern University(西北大学) UC Santa Cruz(加州大学圣克鲁兹分校) Duke University(杜克大学) University of Birmingham(伯明翰大学) University of Rochester(罗切斯特大学) Analogy AI, Inc.(Analogy AI 公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 CFE-Bench是一个由教师测试的多模态推理基准,用于评估大语言模型在STEM领域中的推理能力,发现前沿模型在多步骤解决方案中存在中间状态推导和保持的困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02248 2026-03-04 cs.DB cs.CL cs.IR cs.LG 81%

HELIOS: Harmonizing Early Fusion, Late Fusion, and LLM Reasoning for Multi-Granular Table-Text Retrieval

HELIOS: 协调早期融合、后期融合和大语言模型推理以实现多粒度表格-文本检索

Sungho Park, Joohyung Yun, Jongwuk Lee, Wook-Shin Han

机构 * POSTECH(POSTECH大学) Sungkyunkwan University(成均馆大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 HELIOS通过结合早期融合、后期融合和LLM推理,提升多粒度表格-文本检索性能,实验显示在召回率和nDCG上显著优于现有模型。

Comments 9 pages, 6 figures. Accepted at ACL 2025 main. Project page: https://helios-projectpage.github.io/

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 32424-32444, July 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02119 2026-03-03 cs.AI cs.GT cs.LG 81%

Pencil Puzzle Bench: A Benchmark for Multi-Step Verifiable Reasoning

笔算谜题基准:多步骤可验证推理的基准

Justin Waugh

机构 * Approximate Labs

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 Pencil Puzzle Bench通过笔算谜题评估大语言模型的多步骤可验证推理能力,揭示推理努力和代理迭代能力的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02024 2026-03-03 cs.CL cs.AI cs.CV 81%

MMR-Life: Piecing Together Real-life Scenes for Multimodal Multi-image Reasoning

MMR-Life: 组合真实场景以进行多模态多图像推理

Jiachun Li, Shaoping Huang, Zhuoran Jin, Chenlong Zhang, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉学科学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 MMR-Life是一个评估多模态多图像推理能力的综合基准,通过现实场景中的多图像信息整合和多种推理类型测试,揭示了现有模型在复杂推理任务中的挑战和性能差异。

Comments Accepted by ICLR 2026, 78 pages, 60 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08616 2026-03-03 q-fin.ST cs.AI cs.LG q-fin.CP 81%

Reasoning on Time-Series for Financial Technical Analysis

用于金融技术分析的时间序列推理

Kelvin J. L. Koa, Jan Chen, Yunshan Ma, Huanhuan Zheng, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) Technical University of Munich(慕尼黑技术大学) Singapore Management University(新加坡管理学院) City University of Hong Kong(香港城市大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 VTA通过结合语言和潜在推理,生成准确且可解释的股票时间序列预测,展示了在金融技术分析中的优越性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02386 2026-03-03 cs.CR cs.AI cs.LG 81%

On The Fragility of Benchmark Contamination Detection in Reasoning Models

在推理模型中基准污染检测的脆弱性

Han Wang, Haoyu Li, Brian Ko, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(title);CoT(abstract);分类 cs.AI、cs.LG

AI总结 研究发现LRMs在基准污染检测中存在脆弱性,通过简单方法可轻易污染模型以提升排行榜表现,威胁评估公平性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02010 2026-03-03 cs.LG cs.AI 81%

When Reasoning Meets Compression: Understanding the Effects of LLMs Compression on Large Reasoning Models

当推理遇见压缩:理解LLMs压缩对大推理模型的影响

Nan Zhang, Eugene Kwek, Yusen Zhang, Ngoc-Hieu Nguyen, Prasenjit Mitra, Rui Zhang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了压缩对大推理模型的影响,通过基准测试和机制解释,发现权重数量对知识记忆的影响大于推理,并揭示了蒸馏模型中关键组件的重要性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23371 2026-03-02 cs.IR cs.AI cs.CL 81%

Domain-Partitioned Hybrid RAG for Legal Reasoning: Toward Modular and Explainable Legal AI for India

领域划分混合RAG用于法律推理:迈向模块化和可解释的印度法律AI

Rakshita Goel, S Pranav Kumar, Anmol Agrawal, Divyan Poddar, Pratik Narang, Dhruv Kumar

机构 * Birla Institute of Technology and Science, Pilani(巴尔·印度技术科学学院,比兰地)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出了一种针对印度法律研究的领域划分混合RAG与知识图谱架构,通过模块化设计和结构化关系推理提升法律AI的可解释性和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00564 2026-02-27 cs.AI cs.CL 81%

Unmasking Reasoning Processes: A Process-aware Benchmark for Evaluating Structural Mathematical Reasoning in LLMs

揭示推理过程:一种评估大语言模型结构性数学推理的过程感知基准

Xiang Zheng, Weiqi Zhai, Wei Wang, Boyu Yang, Wenbo Li, Ruixiang Luo, Haoxiang Sun, Yucheng Wang, Zhengze Li, Meng Wang, Yuetian Du, Guojie Lin, Yaxuan Wang, Xiaoxiao Xu, Yanhu Mo, Xuan Ren, Hu Wei, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出ReasoningMath-Plus基准,通过过程感知评估方法揭示大语言模型在结构性数学推理中的不足,引入HCRS评分函数和过程奖励模型,发现仅答案指标可能高估推理能力。

Comments 8 pages, and 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21226 2026-02-26 cs.CL cs.AI 81%

IslamicLegalBench: Evaluating LLMs Knowledge and Reasoning of Islamic Law Across 1,200 Years of Islamic Pluralist Legal Traditions

伊斯兰法律基准:评估LLMs在1200年伊斯兰多元法律传统中的知识和推理能力

Ezieddin Elmahjub, Junaid Qadir, Abdullah Mushtaq, Rafay Naeem, Ibrahim Ghaznavi, Waleed Iqbal

机构 * Qatar University(卡塔尔大学) Information Technology University(信息技术大学) Northeastern University(东北大学) Queen Mary University of London(伦敦女王学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 伊斯兰法律基准评估LLMs在伊斯兰法推理中的能力,揭示其在复杂任务中存在显著缺陷,强调基础知识缺失对AI性能的影响。

Comments This manuscript has been submitted for review to Artificial Intelligence \& Law

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06899 2026-02-26 cs.CL cs.AI 81%

RPTS: Tree-Structured Reasoning Process Scoring for Faithful Multimodal Evaluation

RPTS: 基于树结构的推理过程评分用于忠实多模态评估

Haofeng Wang, Yu Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 RPTS提出了一种基于树结构的评分方法,用于评估多模态推理过程的忠实度,通过构建推理树和动态权重调整,揭示模型推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19895 2026-02-24 cs.LG cs.CL 81%

DSDR: Dual-Scale Diversity Regularization for Exploration in LLM Reasoning

DSDR:双尺度多样性正则化用于LLM推理中的探索

Zhongwei Wan, Yun Shen, Zhihao Dou, Donghao Zhou, Yu Zhang, Xin Wang, Hui Shen, Jing Xiong, Chaofan Tao, Zixuan Zhong, Peizhou Huang, Mi Zhang

机构 * The Ohio State University, USA(俄亥俄州立大学) Case Western Reserve University, USA(凯斯西储大学) The Chinese University of Hong Kong, Hong Kong(香港中文大学) Macquarie University, Australia(麦考瑞大学) University of Michigan, USA(密歇根大学) The University of Hong Kong, Hong Kong(香港大学) University College London, UK(伦敦大学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 DSDR通过双尺度多样性正则化提升LLM推理中的探索能力,通过全局和局部正则化机制增强路径多样性,提高学习信号稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17053 2026-02-24 cs.AI cs.CL 81%

RFEval: Benchmarking Reasoning Faithfulness under Counterfactual Reasoning Intervention in Large Reasoning Models

RFEval: 在大推理模型中评估推理忠实性下的反事实推理干预基准测试

Yunseok Han, Yejoon Lee, Jaeyoung Do

机构 * AIDAS Laboratory(AIDAS实验室) IPAI ECE(电子工程系) Seoul National University(首尔国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 RFEval通过反事实推理干预评估大推理模型的推理忠实性,发现49.7%的输出不忠实,主要源于立场不一致,强调准确性不能作为忠实性的可靠代理。

Comments Accepted in ICLR 2026 Poster: https://iclr.cc/virtual/2026/poster/10011763

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13370 2026-02-24 cs.MA cs.AI cs.CL 81%

G2CP: A Graph-Grounded Communication Protocol for Verifiable and Efficient Multi-Agent Reasoning

G2CP:一种基于图的可验证和高效的多智能体推理通信协议

Karim Ben Khaled, Davy Monticolo

机构 * University of Lorraine, LORIA(洛林大学,LORIA)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 G2CP通过图操作实现多智能体高效、可验证的推理通信,提升任务准确率并消除幻觉传播。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18493 2026-02-24 cs.LG cs.AI 81%

Learning to Remember: End-to-End Training of Memory Agents for Long-Context Reasoning

学习记忆:为长上下文推理端到端训练记忆代理

Kehao Zhang, Shangtong Gui, Sheng Yang, Wei Chen, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(智能信息处理重点实验室,计算技术研究所,中国科学院) Key Laboratory of AI Safety, Chinese Academy of Sciences(人工智能安全重点实验室,中国科学院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Li Auto Inc.(利亚德公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 UMA通过端到端强化学习框架,整合记忆操作与问答,提升长上下文推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14404 2026-02-17 cs.AI cs.LG cs.NE 81%

Boule or Baguette? A Study on Task Topology, Length Generalization, and the Benefit of Reasoning Traces

面包还是法棍?一项关于任务拓扑、长度泛化和推理轨迹益处的研究

William L. Tong, Ege Cakar, Cengiz Pehlevan

机构 * School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院) Kempner Institute for the Study of Artificial and Natural Intelligence, Harvard University(哈佛大学人工智能与自然智能研究所) Center for Brain Sciences, Harvard University(哈佛大学脑科学中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过PITA数据集探讨推理轨迹在不同任务拓扑和长度泛化中的表现,揭示了RT模型在广度任务中的优势及深度任务的局限性。

Comments 38 pages, 11 figures, code available at https://github.com/wtong98/boule-or-baguette

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14189 2026-02-17 cs.CL cs.AI 81%

Knowing When Not to Answer: Abstention-Aware Scientific Reasoning

知道何时不回答:具有退避意识的科学推理

Samir Abdaljalil, Erchin Serpedin, Hasan Kurban

机构 * Texas A&M University(德克萨斯农工大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种具有退避意识的科学推理框架,通过分解科学主张并利用自然语言推理评估证据,以减少错误风险,强调退避在科学验证中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏