arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45051 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 3033 篇

2607.11338 2026-07-23 cs.AI 版本更新 83%

AutoVSR: Automatic Visual-to-Symbolic Reasoning for Symbolic Expression Generation from Circuit Schematic

AutoVSR:用于从电路原理图生成符号表达式的自动视觉到符号推理

Zhe Xiao, Longfei Li, Xu He, Haoying Wu, Zixing Zhang, Mingyu Liu

机构 * Hunan University, Changsha, China(湖南大学) Wuhan University of Technology, Wuhan, China(武汉理工大学) Huazhong University of Science and Technology, Wuhan, China(华中科技大学)

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 研究旨在解决从电路原理图生成符号表达式的难题,提出AutoVSR框架,利用视觉语言模型,通过重建电路图为可执行中间表示并借助符号求解器推理,引入两项创新提升准确率,在任务中表现优于其他方法,还降低了推理成本和提高了计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16727 2026-07-21 cs.AI cs.CV 新提交 83%

Constraint-Anchored Reasoning Traces

约束锚定推理轨迹

Zehua Cheng, Wei Dai, Jiahao Sun

机构 * University of Oxford(牛津大学)

专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

AI总结 研究自回归多模态大语言模型错误滚雪球问题,提出神经符号框架CART,将自然语言推理与符号约束断言交织,经双管齐下的模块验证约束,防止错误传播,在多基准测试中降低滚雪球率、提高准确率并控制推理开销。

Comments 15 pages, ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04854 2026-07-07 cs.AI 新提交 83%

CARL: Constraint-Aware Reinforcement Learning for Planning with LLMs

CARL:用于大语言模型规划的约束感知强化学习

Qiuyi Qi, Jinjian Zhang, Mutian Bao, Tian Liang, Guocong Li, Dongnan Liu, Wei Zhou, Jie Liu, Ming Kong, Linjian Mo, Feng Zhang, Qiang Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学) College of Artificial Intelligence, Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海高等研究院人工智能学院) School of Earth Sciences, Zhejiang University(浙江大学地球科学学院)

专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 研究大语言模型生成违反任务约束计划的问题,提出约束感知强化学习框架CARL,通过比较不同输入下模型输出分布引入奖励,提升模型约束意识,实验证明其优于基线和现有模型。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29712 2026-06-30 cs.CL 83%

Why Struggle with Continuous Latents? Interpretable Discrete Latent Reasoning via Rendered Compression

为何纠结于连续潜变量?通过渲染压缩实现可解释的离散潜变量推理

Shuochen Chang, Qingyang Liu, Shaobo Wang, Bingjie Gao, Qianli Ma, Haonan Zhao, Yibo Miao, Yulin Sun, Zelin Peng, Jiangtong Li, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出离散潜变量推理(DLR)方法,将连续潜状态转化为离散令牌,通过渲染压缩实现高效、可解释的潜空间推理,在五个基准上优于先前方法并达到20倍压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00215 2026-06-17 cs.CV cs.CL 版本更新 83%

Disentangling Perception and Reasoning in Multimodal LLMs via Reward Design

通过奖励设计解耦多模态大语言模型中的感知与推理

Omar Sharif, Eftekhar Hossain, Nikhil Singh, Patrick Ng

机构 * Department of Computer Science, Dartmouth College(达特茅斯大学计算机科学系) Department of Computer Science, University of Central Florida(中央佛罗里达大学计算机科学系) Independent Researcher(独立研究者)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 研究多模态大模型中感知与推理的瓶颈,发现感知是主要约束,并通过奖励设计提升视觉基础推理,平均提升5.56分。

Comments 24 pages, 15 Figures, 10 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15682 2026-06-16 cs.LG 新提交 83%

ReQAT: Achieving Full-Precision Reasoning Accuracy with 4-bit Floating-Point Quantization-Aware Training

ReQAT: 实现全精度推理精度的4位浮点量化感知训练

Janghwan Lee, Sihwa Lee, Jinseok Kim, Yongjik Kim, Jieun Lim, Jinwook Oh, Jungwook Choi

机构 * Hanyang University(汉阳大学) Samsung Advanced Institute of Technology(三星综合技术院)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 针对大推理模型在低比特量化(W4A4KV4)下推理精度严重下降的问题,提出ReQAT框架,通过迹对齐QAT、选择性熵最小化和量化友好初始化,恢复并超越BF16微调精度,实现最高3.9倍吞吐加速。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12910 2026-06-15 cs.RO cs.AI cs.CV cs.SY eess.SY 新提交 83%

Bounding Boxes as Goals: Language-Conditioned Grasping via Neuro-Symbolic Planning

边界框作为目标:通过神经符号规划实现语言条件抓取

Allison Andreyev, Landon Eum, Nestor Tiglao, Romel Gomez

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出GRASP框架,利用预训练VLM将自然语言查询转化为神经符号目标状态,通过边界框检测实现零样本桌面操作,无需任务特定训练。

Comments Project website: https://allisonandreyev.github.io/grasp.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12578 2026-06-12 cs.CL 新提交 83%

MARD: Mirror-Augmented Reasoning Distillation for Mechanism-Level Drug-Drug Interaction Prediction

MARD: 镜像增强推理蒸馏用于机制级药物-药物相互作用预测

Mohammadreza Riyazat, Vian Lelo, Rameen Jafri, Yumna Khan, Abeer Badawi

机构 * University of Guelph(圭尔夫大学) York University(约克大学) Vector Institute(向量研究所)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

AI总结 提出MARD-7B模型,通过镜像增强推理蒸馏、单token KL散度、PRM加权DPO和机制感知检索通道,在机制级DDI预测中准确率超越GPT-4o 6.7个百分点,且成本仅为1%。

Comments 29 pages, 9 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01075 2026-06-03 cs.CL 83%

On the Generalization Gap in Self-Evolving Language Model Reasoning

自进化语言模型推理中的泛化差距

Zhenting Qi, Susanna Maria Baby, Stefanie Anna Baby, Kan Yuan, Andrew Tomkins, Tu Vu, Da-Cheng Juan, Cyrus Rashtchian

机构 * Google Research(谷歌研究) Harvard University(哈佛大学) Google(谷歌) Virginia Tech(弗吉尼亚理工大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

AI总结 本文研究严格闭环设置下自进化算法与完美监督之间的差距,发现多轮批评-修正策略可接近完美监督性能,但自进化仍存在非平凡差距。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29262 2026-05-29 cs.AI 83%

Harmonizing Real-Time Constraints and Long-Horizon Reasoning: An Asynchronous Agentic Framework for Dynamic Scheduling

协调实时约束与长视距推理:一种用于动态调度的异步智能体框架

Shijie Cao, Yuan Yuan, Jing Liu

机构 * School of Computer Science and Engineering, Beihang University, Beijing 100191, China(北京航空航天大学计算机科学与工程学院) Shenzhen Loop Area Institute, Shenzhen, China(深圳环形区研究所) Qingdao Research Institute, Beihang University(青岛研究院) Hangzhou Innovation Institute, Beihang University(杭州创新研究院) School of Artificial Intelligence, Xidian University, Xi’an 710071, Shaanxi, China(西安电子科技大学人工智能学院) Guangzhou Institute of Technology, Xidian University, Guangzhou 510555, Guangdong, China(广州技术研究所)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 提出RACE-Sched异步智能体框架,通过双流架构解耦策略执行与逻辑推理,利用LLM合成和验证符号启发式规则,在保证实时性的同时提升动态调度质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20946 2026-05-21 cs.CL 83%

Thinking-while-speaking: A Controlled, Interleaved Reasoning Method for Real-Time Speech Generation

思考-言语:一种受控交错推理方法用于实时语音生成

Xuan Du, Qiangyu Yan, Wenshuo Li, Borui Jiang, Changming Xiao, Han Shu, Xinghao Chen

机构 * Huawei Technologies(华为技术)

专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出了一种受控交错推理方法InterRS,用于实时语音生成,通过在自然语音生成过程中插入推理步骤,提高了语音流畅性和推理深度,实验表明其在数学和逻辑基准测试中表现更优,并生成更自然流畅的答案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00876 2026-05-19 cs.AI cs.MA 83%

BioProAgent: Neuro-Symbolic Grounding for Constrained Scientific Planning

BioProAgent:用于受限科学规划的神经符号接地

Yuyang Liu, Jingya Wang, Liuzhenghao Lv, Yonghong Tian

机构 * School of AI for Science, Peking University(科学人工智能学院,北京大学) School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) School of Computer Science, Peking University(计算机科学学院,北京大学)

专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 BioProAgent通过神经符号框架将概率规划锚定在确定性有限状态机中,解决复杂设备模式中的上下文瓶颈,提升物理执行的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14392 2026-05-15 cs.AI 83%

Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis

学习构建环境:通过可验证环境合成实现自我进化推理RL

Yucheng Shi, Zhenwen Liang, Kishan Panaganti, Dian Yu, Wenhao Yu, Haitao Mi

机构 * Tencent HY LLM(腾讯 HY LLM)

专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出通过可验证环境合成实现自我进化推理RL,构建环境而非生成数据,利用环境构造循环提升模型能力,通过稳定的问题-验证不对称性保持奖励信息性。

Comments Tech report, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09678 2026-05-12 cs.AI 83%

Absurd World: A Simple Yet Powerful Method to Absurdify the Real-world for Probing LLM Reasoning Capabilities

荒诞世界:一种简单却强大的方法,用于将现实世界扭曲以探测LLM推理能力

Ryan Albright, Golam Md Muktadir, Zarif Ikram, S M Jubaer, Mehrab Hossain, Dianbo Liu

机构 * The Nueva School(新维学校) University of Southern California(南加州大学) Notre Dame College(诺特大学) Arizona State University(亚利桑那州立大学) National University of Singapore(新加坡国立大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出Absurd World框架,通过扭曲现实世界来测试LLM的推理能力,验证其在简单逻辑任务中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06728 2026-05-11 q-bio.GN cs.AI q-bio.CB 83%

OmicsLM: A Multimodal Large Language Model for Multi-Sample Omics Reasoning

OmicsLM:一种多模态大语言模型用于多样本组学推理

Maciej Sypetkowski, Joanna Krawczyk, Łukasz Smoliński, Remigiusz Kinas, Przemysław Pietrzak, Tomasz Jetka, Rafał Powalski

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 OmicsLM通过整合定量组学数据与自然语言任务,实现多样本组学推理,其在多任务类型上表现优异,尤其在生物语言指导的推理任务中超越专用模型和通用LLM。

Comments 13 pages (main text), 14 pages (appendix), 1 figure, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05048 2026-05-05 cs.AI cs.HC 83%

MINT: Minimal Information Neuro-Symbolic Tree for Objective-Driven Knowledge-Gap Reasoning and Active Elicitation

MINT:最小信息神经符号树用于目标驱动的知识缺口推理和主动提取

Zeyu Fang, Mahdi Imani, Tian Lan

机构 * Department of Electrical and Computer Engineering, George Washington University(乔治华盛顿大学电气与计算机工程系) Department of Electrical and Computer Engineering, Northeastern University(东北大学电气与计算机工程系)

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出MINT用于解决AI代理在目标驱动规划中主动提取人类输入的问题,通过神经符号树和自博弈优化策略,提升规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23330 2026-05-04 cs.CL 83%

Structured In-context Environment Scaling for Large Language Model Reasoning

结构化上下文环境扩展用于大语言模型推理

Peng Yu, Zeyuan Zhao, Shao Zhang, Luoyi Fu, Xinbing Wang, Ying Wen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

AI总结 本文提出SIE框架,通过自动构建结构化数据环境提升大语言模型的推理能力,实现可扩展性、通用性和可验证性,实验显示其在结构化推理和跨领域逻辑推理中的有效性。

Comments Title modified for greater clarity and better alignment with the paper's focus

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23345 2026-04-28 cs.CL cs.HC 83%

Bridging Reasoning and Action: Hybrid LLM-RL Framework for Efficient Cross-Domain Task-Oriented Dialogue

连接推理与行动:一种高效的跨领域任务导向对话混合LLM-RL框架

Yangyang Zhao, Linfan Dai, Li Cai, Bowen Xing, Libo Qin

机构 * School of Computer Science and Technology, Changsha University of Science and Technology(长沙理工大学计算机科学与技术学院) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算与智能研究院) University of Science and Technology Beijing(北京科技大学) Text Computing and Cognitive Intelligence MOE Engineering Research Center, Guizhou University(贵州大学文字计算与智能认知MOE工程研究中心)

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 本文提出VLK-RL框架,通过结合LLM生成约束并验证以提升跨领域任务导向对话的推理与行动效率,实验表明其在长周期任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22062 2026-04-27 cs.CL 83%

Incentivizing Neuro-symbolic Language-based Reasoning in VLMs via Reinforcement Learning

通过强化学习激励基于神经符号语言的视觉语言推理

Karthic Palaniappan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文基于Qwen3-VL-2B-Instruct模型,通过强化学习提升视觉语言模型的神经符号语言推理能力,在数学、科学和常识问题上准确率提升3.33%,推理令牌减少75%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03248 2026-04-24 cs.CL 83%

STReasoner: Empowering LLMs for Spatio-Temporal Reasoning in Time Series via Spatial-Aware Reinforcement Learning

STReasoner: 通过空间感知强化学习赋能LLMs进行时间序列的时空推理

Juntong Ni, Shiyu Wang, Qi He, Ming Jin, Wei Jin

机构 * Emory University(埃默里大学) Microsoft(微软) Griffith University(格里菲斯大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

AI总结 本文提出STReasoner,通过整合时间序列、图结构和文本,提升LLMs的时空推理能力,采用S-GRPO算法增强空间逻辑,实验显示在低成本下取得显著准确率提升。

Comments ACL 2026 Main, we release our code publicly at https://github.com/LingFengGold/STReasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12184 2026-04-15 cs.AI 83%

TRUST Agents: A Collaborative Multi-Agent Framework for Fake News Detection, Explainable Verification, and Logic-Aware Claim Reasoning

TRUST代理:一种用于虚假新闻检测、可解释验证和逻辑感知声明推理的协作多智能体框架

Gautama Shastry Bulusu Venkata, Santhosh Kakarla, Maheedhar Omtri Mohan, Aishwarya Gaddam

机构 * George Mason University(乔治·马歇尔大学)

专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 TRUST代理通过协作多智能体框架提升虚假新闻检测的可解释性和逻辑推理能力,引入分解器、陪审团和逻辑聚合器提升复杂声明的验证效果。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10504 2026-04-14 cs.AI 83%

CARO: Chain-of-Analogy Reasoning Optimization for Robust Content Moderation

CARO:用于鲁棒内容审核的类比推理优化

Bingzhe Wu, Haotian Lu, Yuchen Mou

机构 * National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室) Shenzhen University(深圳大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 CARO通过两阶段训练框架提升LLM的类比推理能力,有效缓解内容审核中的误导性决策短路问题,实验显示其在模糊审核基准上平均F1得分提升24.9%。

Comments Accepted to ACL 2026 findings; under official publication process

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13331 2026-04-14 cs.LG 83%

Mixture of Cognitive Reasoners: Modular Reasoning with Brain-Like Specialization

认知推理的混合:类脑的专业化模块推理

Badr AlKhamissi, C. Nicolò De Sabbata, Greta Tuckute, Zeming Chen, Martin Schrimpf, Antoine Bosselut

机构 * EPFL(瑞士联邦理工学院洛桑) Brain and Cognitive Sciences at MIT(麻省理工学院脑与认知科学系) Kempner Institute at Harvard University(哈佛大学肯普纳研究所)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.LG

AI总结 本文提出MiCRo模型,通过类脑专业化模块实现认知行为,提供可解释的推理模块,支持动态路由并优于基线模型。

Comments ICLR 2026. Project Page at https://cognitive-reasoners.epfl.ch

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06638 2026-03-24 cs.CV cs.AI 83%

StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering

StaR-KVQA:用于隐式知识视觉问答的结构化推理轨迹

Zhihao Wen, Wenkang Wei, Yuan Fang, Xingtong Yu, Hui Zhang, Weicheng Zhu, Xin Zhang

机构 * Ant International, Ant Group(蚂蚁集团国际部,蚂蚁集团) School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) School of Computing and Information Systems, Singapore Management University(新加坡管理学院计算与信息系统学院) Anhui Provincial Key Laboratory of High Performance Computing(安徽省高性能计算重点实验室)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 StaR-KVQA通过引入双路径结构化推理轨迹提升隐式知识视觉问答的准确性与推理透明度,采用自蒸馏方法构建轨迹增强数据集,无需外部检索工具,在OK-VQA基准上实现11.3%的精度提升。

Comments 8+3+3 pages, code: https://github.com/jianyingzhihe/StaR-KVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09268 2026-03-11 cs.AI 83%

Logos: An evolvable reasoning engine for rational molecular design

Logos:一种可进化推理引擎用于理性分子设计

Haibin Wen, Zhe Zhao, Fanfu Wang, Tianyi Xu, Hao Zhang, Chao Yang, Ye Wei

机构 * City University of Hong Kong(香港城市大学) Lanzhou University(兰州大学) Riltide Medicines(Riltide医药公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 Logos是一种集成多步逻辑推理与严格化学一致性的分子推理模型,通过分阶段训练和化学规则优化,在多个基准数据集上实现了结构准确性和化学有效性上的高性能,同时参数量仅为通用语言模型的几分之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03604 2026-03-06 cs.AI 83%

Interleaved Tool-Call Reasoning for Protein Function Understanding

交错工具调用推理用于蛋白质功能理解

Chuanliu Fan, Zicheng Ma, Huanran Meng, Aijia Zhang, Wenjie Du, Jun Zhang, Yi Qin Gao, Ziqiang Cao, Guohong Fu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Institute of Artificial Intelligence, Soochow University(苏州大学人工智能研究院) Changping Laboratory(昌平实验室) School of Software Engineering, USTC(中国科学技术大学软件学院)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 PFUA通过整合领域特定工具和可验证中间证据,提高了蛋白质功能预测的性能,平均提升达103%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21628 2026-03-04 cs.CL 83%

RuCL: Stratified Rubric-Based Curriculum Learning for Multimodal Large Language Model Reasoning

RuCL:基于分层评分标准的课程学习用于多模态大语言模型推理

Yukun Chen, Jiaming Li, Longze Chen, Ze Gong, Jingpeng Li, Zhen Qin, Hengyu Chang, Ancheng Xu, Zhihao Yang, Hamid Alinejad-Rokny, Qiang Qu, Bo Zheng, Min Yang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) School of Biomedical Engineering, UNSW Sydney(新南威尔士大学生物医学工程学院)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

AI总结 RuCL通过分层评分标准课程学习提升多模态大语言模型的推理能力,实现7.83%的准确率提升。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01241 2026-03-03 cs.IR cs.AI 83%

TARSE: Test-Time Adaptation via Retrieval of Skills and Experience for Reasoning Agents

TARSE: 通过检索技能和经验进行测试时适应以实现推理代理

Junda Wang, Zonghai Tao, Hansi Zeng, Zhichao Yang, Hamed Zamani, Hong Yu

机构 * University of Massachusetts Amherst, MA, USA(马萨诸塞大学阿姆赫斯特分校) University of Massachusetts Lowell, MA, USA(马萨诸塞大学洛厄尔分校)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 TARSE通过检索技能和经验实现测试时适应,提升医疗推理代理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01190 2026-03-03 cs.CL 83%

Reasoning or Rationalization? The Role of Justifications in Masked Diffusion Models for Fact Verification

推理还是合理化?在事实验证中的掩码扩散模型中合理化的作用

Jacob Devasier

机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 研究发现,掩码扩散模型在事实验证中,早期结论易受合理化过程影响,导致准确性下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12563 2026-03-03 cs.AI 83%

HardcoreLogic: Challenging Large Reasoning Models with Long-tail Logic Puzzle Games

HardcoreLogic: 用长尾逻辑谜题游戏挑战大型推理模型

Jingcong Liang, Shijun Wan, Xuehai Wu, Yitong Li, Qianglong Chen, Duyu Tang, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) University of Southern California(南加州大学) Huawei Technologies Ltd(华为技术有限公司) Shanghai Innovation Institute(上海创新研究院)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 HardcoreLogic通过长尾逻辑谜题挑战大型推理模型,揭示其在复杂规则和非标准变体上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏