arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-21 至 2026-04-21 共收录 341 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 30 篇

2604.02908 2026-04-21 cs.CV cs.HC cs.MM 50%

SentiAvatar: Towards Expressive and Interactive Digital Humans

SentiAvatar:迈向表达性和互动性的数字人类

Chuhao Jin, Rui Zhang, Qingzhe Gao, Haoyu Shi, Dayu Wu, Yichen Jiang, Yihan Wu, Ruihua Song

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 Gallagher人工智能学院) SentiPulse College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出SentiAvatar框架,通过构建SuSu虚拟角色,解决多模态数据不足、语义到动作映射和动作语调同步问题,实现高精度实时交互。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11988 2026-04-21 cs.CV 50%

CARI4D: Category Agnostic 4D Reconstruction of Human-Object Interaction

CARI4D:类别无关的人-物体交互4D重建

Xianghui Xie, Bowen Wen, Yan Chang, Hesam Rabeti, Jiefeng Li, Ye Yuan, Gerard Pons-Moll, Stan Birchfield

机构 * NVIDIA University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 CARI4D提出了一种无需假设物体类别即可从单目RGB视频中重建人-物体交互的4D模型,通过姿态假设选择算法和渲染-比较方法提升重建精度与物理一致性。

Comments CVPR2026 camera ready version. Project page: https://nvlabs.github.io/CARI4D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00592 2026-04-21 cs.RO 50%

HAVEN: Hierarchical Adversary-aware Visibility-Enabled Navigation with Cover Utilization using Deep Transformer Q-Networks

HAVEN:基于深度变换器Q网络的分层对抗感知可见性导航与覆盖利用

Mihir Chauhan, Damon Conover, Aniket Bera

机构 * IDEAS Lab, Department of Computer Science, Purdue University(IDEAS实验室,计算机科学系,普渡大学) DEVCOM Army Research Laboratory(国防部陆军研究实验室)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出一种分层导航框架,结合深度变换器Q网络作为高层子目标选择器和模块化低层控制器,通过可见性感知候选生成和潜在场控制器提升导航安全性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 22 篇

2604.08299 2026-04-21 cs.CL cs.AI 91%

SeLaR: Selective Latent Reasoning in Large Language Models

SeLaR:大语言模型中的选择性潜在推理

Renyu Fu, Guibo Luo

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸式媒体技术重点实验室) Shenzhen Graduate School, Peking University(北京大学深圳研究生院)

专题命中 测试时计算 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 SeLaR通过引入熵门机制和熵感知对比正则化,解决大语言模型中链式推理的稳定性与探索性问题,优于标准CoT和训练自由方法。

Comments Camera-ready for ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17912 2026-04-21 cs.LG cs.AI 89%

Learning to Correct: Calibrated Reinforcement Learning for Multi-Attempt Chain-of-Thought

学习修正:校准强化学习用于多尝试链式推理

Muhammed Emrullah Ildiz, Halil Alperen Gozeten, Ege Onur Taga, Samet Oymak

机构 * University of Michigan, Ann Arbor(密歇根大学,安娜堡) Google Research(谷歌研究院)

专题命中 测试时计算 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);verifier(abstract)

AI总结 本文提出Calibrated Attempt-Level (CAL) GRPO方法,通过校准每尝试的权重来提升多尝试链式推理的校准效果,实验证明其在合成和真实数据中优于传统GRPO和简单加权方法。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17654 2026-04-21 cs.AI 83%

Poly-EPO: Training Exploratory Reasoning Models

Poly-EPO:训练探索性推理模型

Ifdita Hasan Orney, Jubayer Ibn Hamid, Shreya S Ramanujam, Shirley Wu, Hengyuan Hu, Noah Goodman, Dorsa Sadigh, Chelsea Finn

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.AI

AI总结 本文提出Poly-EPO框架,通过集强化学习提升语言模型的探索与利用协同,增强推理能力与泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16890 2026-04-21 cs.AI 83%

Step-GRPO: Internalizing Dynamic Early Exit for Efficient Reasoning

Step-GRPO:内化动态早期退出以实现高效推理

Benteng Chen, Weida Wang, Shufei Zhang, Mingbao Lin, Min Zhang

机构 * East China Normal University(东华大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Rakuten Singapore(乐天新加坡)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 Step-GRPO通过内化动态早期退出机制,优化推理过程,提升效率与准确性,在不同模型规模上实现更优的准确率与效率平衡。

Comments This paper has been accepted for publication at the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10306 2026-04-21 cs.AI cs.CL 81%

Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context Reasoning

增强证据的策略优化用于长上下文推理

Xin Guan, Zijian Li, Shen Huang, Pengjun Xie, Jingren Zhou, Jiuxin Cao

机构 * Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出EAPO方法,通过引入组相对证据奖励和适应性奖励-策略共演机制,提升长上下文推理中的证据提取质量,从而增强推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02970 2026-04-21 cs.CL cs.LG 81%

Reliability-Aware Adaptive Self-Consistency for Efficient Sampling in LLM Reasoning

可靠性感知的自一致性自适应方法用于LLM推理中的高效采样

Junseok Kim, Nakyeong Yang, Kyungmin Min, Kyomin Jung

机构 * IPAI, Seoul National University(首尔国立大学IPAI)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出ReASC,通过将自适应采样从响应计数转向证据充分性,提升推理可靠性。在五个模型和四个数据集上,ReASC在准确率与成本之间取得最佳平衡,显著提升推理效率。

Comments ACL 2026, Code is available at https://github.com/junseokkim00/ReASC

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11140 2026-04-21 cs.CL cs.AI 81%

Follow the Path: Reasoning over Knowledge Graph Paths to Improve Large Language Model Factuality

跟随路径:通过知识图谱路径推理提升大语言模型事实性

Mike Zhang, Johannes Bjerva, Russa Biswas

机构 * University of Copenhagen(哥本哈根大学) Aalborg University(奥尔堡大学) Pioneer Centre for Artificial Intelligence(先锋人工智能中心)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出fs1方法,通过收集大推理模型的推理轨迹并将其锚定在知识图谱路径上,提升大语言模型的事实性,在六个复杂开放领域问答基准测试中表现优异。

Comments Accepted at ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18464 2026-04-21 cs.LG 79%

Semantic Step Prediction: Multi-Step Latent Forecasting in LLM Reasoning Trajectories via Step Sampling

语义步预测:通过步采样进行LLM推理轨迹中的多步潜在预测

Yidi Yuan

机构 * Home Team Science and Technology Agency(家庭团队科技机构)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文通过步采样改进语义管预测方法,提升多步潜在预测的准确性,并提出新的评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17884 2026-04-21 cs.AI 79%

SPREG: Structured Plan Repair with Entropy-Guided Test-Time Intervention for Large Language Model Reasoning

SPREG:基于熵引导的测试时干预的结构化计划修复用于大语言模型推理

Xuan Wang, Yu Ming, Xinhao Zhong, Xinyu Yu, Wenjie Wang, Shuai Chen, Wei Lin

机构 * Meituan(美团)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 SPREG通过熵引导的测试时干预,解决大语言模型在长链推理中的逻辑幻觉和随机漂移问题,通过动态修复机制提升推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17609 2026-04-21 cs.CL cs.LG 73%

Agents Explore but Agents Ignore: LLMs Lack Environmental Curiosity

智能体探索但忽视环境:大语言模型缺乏环境好奇心

Leon Engländer, Sophia Althammer, Ahmet Üstün, Matthias Gallé, Tom Sherborne

机构 * Cohere Poolside

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.LG

AI总结 研究发现当前大语言模型缺乏环境好奇心,无法有效利用意外但相关的信息。通过三个基准测试发现,尽管智能体发现了解决方案,但很少主动利用。研究指出可用工具、计算资源和训练数据分布是影响因素,优化配置能提升性能,但智能体仍主要依赖环境获取预期信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23542 2026-04-21 cs.CL cs.AI cs.LG 67%

On the Shelf Life of Fine-Tuned LLM-Judges: Future-Proofing, Backward-Compatibility, and Question Generalization

大语言模型判官的保质期:未来证明、向后兼容性和问题泛化

Janvijay Singh, Austin Xu, Yilun Zhou, Yefan Zhou, Dilek Hakkani-Tur, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Dartmouth College(达特茅斯学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了细调判官模型在现实部署中的挑战,探讨了未来证明、向后兼容性和问题泛化三个核心问题,并通过实验发现持续学习在适应响应分布变化方面表现更优。

Comments Updated after ICLR 2026 Acceptance; 29 pages;

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18327 2026-04-21 cs.AI cs.CL 62%

PARM: Pipeline-Adapted Reward Model

PARM:流水线适应的奖励模型

Xingyu Fan, Wei Shao, Jiacheng Liu, Linqi Song, Pheng Ann Heng

机构 * Graduate Student Member, IEEE(IEEE研究生会员) Member, IEEE(IEEE会员) Senior Member, IEEE(IEEE高级会员)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对多阶段LLM流水线中奖励指导不足的问题,提出PARM模型,通过整合奖励模型到 formulation 和 solution 阶段,提升代码生成质量与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19880 2026-04-21 cs.LG cs.AI 62%

What If Consensus Lies? Selective-Complementary Reinforcement Learning at Test Time

如果共识是谎言呢?测试时的选择性互补强化学习

Dong Yan, Jian Liang, Yanbo Wang, Shuo Lu, Ran He, Tieniu Tan

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SCRL框架,通过选择性正伪标签和熵门控负伪标签减少标签噪声影响,提升测试时强化学习的鲁棒性和泛化能力。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16881 2026-04-21 cs.CL cs.AI 62%

Incentivizing Parametric Knowledge via Reinforcement Learning with Verifiable Rewards for Cross-Cultural Entity Translation

通过可验证奖励的强化学习激励参数知识用于跨文化实体翻译

Jiang Zhou, Xiaohu Zhao, Xinwei Wu, Tianyu Dong, Hao Wang, Yangyang Liu, Heng Liu, Linlong Xu, Longyue Wang, Weihua Luo, Deyi Xiong

机构 * TJUNLP Lab, Tianjin University, China(天津大学TJUNLP实验室) Alibaba Group, China(阿里巴巴集团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EA-RLVR框架,通过可验证奖励信号优化跨文化实体翻译,提升模型在实体翻译准确性和领域外泛化能力,实验表明在7k样本训练下模型性能显著提升。

Comments 23 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16453 2026-04-21 cs.LG cs.AI stat.ML 62%

Sampling for Quality: Training-Free Reward-Guided LLM Decoding via Sequential Monte Carlo

采样以保证质量:通过序列蒙特卡洛方法实现无训练奖励引导的大语言模型解码

Jelena Markovic-Voronov, Wenhui Zhu, Bo Long, Zhipeng Wang, Suyash Gupta, Kayhan Behdin, Bee-Chung Chen, Deepak Agarwal

机构 * LinkedIn

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于概率框架的奖励引导解码方法,通过结合模型转移概率和前缀依赖的奖励势能,改进传统解码方法的序列级质量优化。实验表明,该方法在代码生成和数学推理任务中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09741 2026-04-21 cs.CV cs.LG 57%

Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping

构造性失真:通过注意力引导的图像扭曲改进MLLMs

Dwip Dalal, Gautam Vashishtha, Utkarsh Mishra, Jeonghwan Kim, Madhav Kanda, Hyeonjeong Ha, Svetlana Lazebnik, Heng Ji, Unnat Jain

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Skan AI Texas A&M University(德克萨斯大学阿姆斯特朗分校) University of California, Irvine(加州大学 Irvine 分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 本文提出AttWarp方法,通过注意力引导的图像扭曲增强MLLMs对细节和空间关系的感知能力,提升准确性和推理能力。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17464 2026-04-21 cs.SE cs.AI 57%

Project Prometheus: Bridging the Intent Gap in Agentic Program Repair via Reverse-Engineered Executable Specifications

普罗米修斯计划:通过反向工程可执行规范弥合代理程序修复中的意图差距

Yongchao Wang, Zhiqiu Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出普罗米修斯框架,通过规范推断而非代码生成解决代理程序修复中的意图差距问题,实现了93.97%的正确补丁率和74.4%的救援率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17353 2026-04-21 cs.AI cs.DC 57%

Hive: A Multi-Agent Infrastructure for Algorithm- and Task-Level Scaling

Hive:一种用于算法和任务级扩展的多智能体基础设施

Zizhang Luo, Yuhao Luo, Youwei Xiao, Yansong Xu, Runlin Guo, Yun Liang

机构 * Peking University(北京大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 Hive通过算法和任务级扩展提升智能体系统性能,通过Logits Cache减少冗余计算并提升采样速度,Agent-Aware Scheduling优化资源分配,降低热点缺失率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17271 2026-04-21 cs.CL 57%

HopRank: Self-Supervised LLM Preference-Tuning on Graphs for Few-Shot Node Classification

HopRank: 图上基于自监督的LLM偏好微调用于少样本节点分类

Ziqing Wang, Kaize Ding

机构 * Northwestern University(西北大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出HopRank,通过自监督学习在文本属性图上实现少样本节点分类,利用图拓扑结构编码的类别信息,无需标注数据即可提升分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22297 2026-04-21 cs.AI 57%

Large Language Models as Nondeterministic Causal Models

大型语言模型作为非确定性因果模型

Sander Beckers

机构 * University College London(伦敦大学学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种基于非确定性因果模型的简单方法,用于生成大型语言模型的反事实,该方法无需修改黑盒模型,且能基于其预期语义进行反事实推理。

Comments Accepted at KR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21471 2026-04-21 cs.CL 57%

Scaling External Knowledge Input Beyond Context Windows of LLMs via Multi-Agent Collaboration

通过多智能体协作扩展LLM上下文窗口之外的知识输入

Zijun Liu, Zhennan Wan, Peng Li, Ming Yan, Fei Huang, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) Institute of Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ExtAgents框架,通过多智能体协作提升LLM在不延长上下文窗口的情况下整合外部知识的能力,实验证明其在多跳问答和长文本生成任务中优于现有方法。

Comments Accepted to ACL 2026. 31 pages, 10 figures. Code and data are available at https://github.com/THUNLP-MT/ExtAgents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17187 2026-04-21 cs.SE 50%

React-ing to Grace Hopper 200: Five Open-Weights Coding Models, One React Native App, One GH200, One Weekend

回应格蕾丝·霍普200周年:五个开源权重编码模型,一个React Native应用,一个GH200,一个周末

Alex Potanin

专题命中 测试时计算 :reasoning(abstract)

AI总结 评估五个最先进的开源权重编码语言模型在生成React Native应用任务中的表现,发现Kimi-K2.5在3位量化下表现最佳,揭示了部署中的新发现及硬件层级结构。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 28 篇

2601.03559 2026-04-21 cs.CL 92%

DiffCoT: Diffusion-styled Chain-of-Thought Reasoning in LLMs

DiffCoT:在大语言模型中采用扩散风格的推理链推理

Shidong Cao, Hongzhan Lin, Yuxuan Gu, Ziyang Luo, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 DiffCoT通过扩散风格的推理链框架,改进了大语言模型在多步数学问题解决中的鲁棒性和错误纠正能力,通过迭代去噪过程实现中间步骤的统一生成与回顾性修正。

Comments DiffCoT improves multi-step LLM reasoning by applying diffusion-based iterative denoising to correct intermediate Chain-of-Thought steps

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02001 2026-04-21 cs.CV cs.AI 87%

Generating Findings for Jaw Cysts in Dental Panoramic Radiographs Using a GPT-Based VLM: A Preliminary Study on Building a Two-Stage Self-Correction Loop with Structured Output (SLSO) Framework

利用基于GPT的视觉语言模型生成牙槽囊肿的诊断发现:一种构建具有结构化输出(SLSO)框架的两阶段自校正循环的初步研究

Nanaka Hosokawa, Ryo Takahashi, Tomoya Kitano, Yukihiro Iida, Chisako Muramatsu, Tatsuro Hayashi, Yuta Seino, Xiangrong Zhou, Takeshi Hara, Akitoshi Katsumata, Hiroshi Fujita

专题命中 复杂问题求解 :self-correction(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出SLSO框架,通过整合图像分析、结构化数据生成等步骤,提升牙槽囊肿的AI诊断准确性。实验显示SLSO在牙数识别、牙移动检测等方面优于传统方法,但对多牙病变的识别仍有局限。

Comments Revised manuscript; supplementary materials added. Published in Diagnostics

Journal ref Diagnostics 2026, 16, 1096

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02073 2026-04-21 cs.CV 87%

PLUME: Latent Reasoning Based Universal Multimodal Embedding

PLUME:基于潜在推理的通用多模态嵌入

Chenwei He, Xiangzhao Hao, Tianyu Yang, Yuxiang Ma, Yuheng Jia, Lingxiang Wu, Chaoyang Zhao, Haiyun Guo, Jinqiao Wang

机构 * Southeast University(东南大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 PLUME通过引入潜在推理框架改进通用多模态嵌入,用连续潜在状态的自回归滚动替代显式推理链,减少推理开销并提升效率,优于传统显式推理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21228 2026-04-21 cs.CL cs.AI 84%

ImpRIF: Stronger Implicit Reasoning Leads to Better Complex Instruction Following

ImpRIF:更强的隐式推理导致更好的复杂指令遵循

Yuancheng Yang, Lin Yang, Xu Wang, Chao Tong, Haihua Yang

机构 * ByteDance China(字节跳动中国) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ImpRIF方法,通过构建可验证推理图提升大语言模型对隐式推理指令的理解,从而增强复杂指令遵循能力,在五个基准测试中表现优异。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00514 2026-04-21 cs.AI cs.CL 84%

The Illusion of Insight in Reasoning Models

推理模型中的“顿悟”幻觉

Liv G. d'Aliberti, Manoel Horta Ribeiro

机构 * Princeton University(普林斯顿大学)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨推理模型在推理过程中是否出现突然的顿悟现象,发现此类现象罕见且不提升准确性,但高不确定性下人工触发可提高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏