arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5001 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5001 篇

2605.19748 2026-08-12 cs.AI cs.MA 版本更新 77%

Memory-Augmented Reinforcement Learning Agent for CAD Generation

具有记忆增强的强化学习代理的CAD生成

Yin Xiaolong, Liu Yu, Shen Jiahang, Lu Xingyu, Ni Jingzhe, Fan Fengxiao, Sang Fan

机构 * Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本文提出了一种记忆增强的强化学习框架,用于生成CAD模型,通过引入强化学习进行检索和策略优化,有效避免了检索陷阱,提高了复杂CAD模型生成的成功率和几何一致性。

Comments We are withdrawing this manuscript because we have identified issues in the current analysis that require substantial revision. Until these issues are resolved, we do not consider the present version suitable for citation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02941 2026-08-05 cs.CL 新提交 77%

Aligned in Form, Not in Meaning: The Comprehension - Containment Decoupling of LLM Safety in Low-Resource Bangla Derogatory Speech

形式对齐而非意义对齐:低资源孟加拉语贬损言论中大型语言模型(LLM)安全的理解-遏制解耦

Shadab Bin Habib, A K M Ferdous Reza Habib, Subarno Neel, Adib Sakhawat

机构 * Islamic University of Technology(伊斯兰科技大学)

专题命中 复杂问题求解 :chain-of-thought(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 该研究针对5个前沿LLM,在6种协议下对孟加拉语贬损言论审计,验证了LLM安全的理解-遏制解耦假设,发现高资源基准无法保障低资源安全,需基于意义的遏制。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01930 2026-08-04 cs.CV cs.AI 新提交 77%

Recompute or Reuse? Diagnosing and Mitigating Textual Shortcuts in VLM Self-Reflection

重新计算还是复用?诊断与缓解视觉语言模型自反思中的文本捷径

Wenxiao Fan, Jingling Fu, Fang Li, Luohang Liu, Yu He, Lichen Ma, Zhiyang Yu, Weishan Bi, Junshi Huang, Yan Li, Gu Simiu, Kan Li

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI

AI总结 该研究针对VLM自反思中存在的文本捷径问题,通过反事实分析诊断其特性,提出无需训练的FSAF干预,显著提升视觉更新率、降低先前答案率,为缓解VLM的文本复用偏差提供了有效方案。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02490 2026-07-03 cs.CL cs.CV 新提交 77%

Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning

基于强化学习的视觉语言模型视觉接地自反思

Liyan Tang, Fangcong Yin, Greg Durrett

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) New York University(纽约大学)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 提出VRRL框架,通过随机掩码轨迹前缀和缓冲回滚机制,增强视觉语言模型在分布外场景下的视觉接地自反思能力,显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15237 2026-05-18 cs.AR cs.AI 77%

A3D: Agentic AI flow for autonomous Accelerator Design

A3D: 基于代理AI的自主加速器设计流程

Abinand Nallathambi, Christopher Knight, Shantanu Ganguly, Wilfried Haensch, Anand Raghunathan

机构 * Purdue University(普渡大学) Argonne National Laboratory(阿贡国家实验室) University of Chicago(芝加哥大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);verifier(abstract);分类 cs.AI

AI总结 A3D通过代理AI实现端到端的硬件加速器设计自动化,自动分析工作负载、识别性能瓶颈、生成微架构并探索速度-面积权衡空间,利用LLM和EDA工具提升复杂应用的加速器设计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10690 2026-04-14 cs.AI 77%

Do LLMs Build Spatial World Models? Evidence from Grid-World Maze Tasks

大型语言模型构建空间世界模型了吗?基于网格世界迷宫任务的证据

Weijiang Li, Yilin Zhu, Rajarshi Das, Parijat Dube

机构 * University of Notre Dame(圣母大学) Columbia University(哥伦比亚大学) MQube Cognition(MQube认知实验室)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI

AI总结 本文通过迷宫任务评估LLM的空间理解能力,发现其空间推理依赖于表示形式而非任务类型,表明LLM缺乏稳健的空间世界模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08339 2026-04-14 cs.CL 77%

What Factors Affect LLMs and RLLMs in Financial Question Answering?

影响LLMs和RLLMs在金融问答中的因素是什么?

Peng Wang, Xuesi Hu, Jiageng Wu, Yuntao Zou, Qiancheng Zhang, Dagang Li

机构 * School of Computer Science and Engineering, Macau University of Science and Technology, China(澳门科技大学计算机科学与工程学院) SKLPlanets, Macau University of Science and Technology, China(澳门科技大学月球与行星科学国家重点实验室) School of Economics, Anhui University, China(安徽大学经济学院) School of Energy and Power Engineering, Huazhong University of Science and Technology, China(华中科技大学能源与动力工程学院)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 研究探讨了提示方法、代理框架和多语言对齐方法对LLMs和RLLMs在金融问答任务中的影响,发现提示方法和代理框架能提升LLMs性能,而RLLMs自身具备Long CoT能力,传统方法对其提升有限。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02398 2026-04-06 cs.SE cs.AI 77%

Improving MPI Error Detection and Repair with Large Language Models and Bug References

利用大语言模型和Bug参考改进MPI错误检测与修复

Scott Piersall, Yang Gao, Shenyang Liu, Liqiang Wang

机构 * Dept. of Computer Science, University of Central Florida(中佛罗里达大学计算机科学系)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出结合Few-Shot Learning、Chain-of-Thought和Retrieval Augmented Generation技术,提升大语言模型在MPI错误检测与修复中的准确性,实验结果显示错误检测准确率从44%提升至77%。

Comments 41 pages, 8 figures

Journal ref Journal of Parallel and Distributed Computing, Volume 213, 2026, 105255, ISSN 0743-7315

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00261 2026-04-03 cs.CL 77%

Can Large Language Models Self-Correct in Medical Question Answering? An Exploratory Study

大语言模型能否在医疗问答中自我纠正?一项探索性研究

Zaifu Zhan, Mengyuan Cui, Rui Zhang

机构 * Department of Electrical and Computer Engineering, University of Minnesota(明尼苏达大学电气与计算机工程系) Division of Computational Health Sciences, Department of Surgery, University of Minnesota(明尼苏达大学外科学系计算健康科学部) Department of Software Engineering, University of St. Thomas(圣托马斯大学软件工程系)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文探讨大语言模型在医疗问答中的自我反思能力,通过比较标准Co-T提示与迭代自我反思循环,发现自我反思并不总能提升准确性,且效果依赖于数据集和模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01529 2026-04-03 cs.AI cs.MA 77%

A Role-Based LLM Framework for Structured Information Extraction from Healthy Food Policies

基于角色的LLM框架用于从健康食品政策中提取结构化信息

Congjing Zhang, Ruoxuan Bao, Jingyu Li, Yoav Ackerman, Shuai Huang, Yanfang Su

机构 * University of Washington(华盛顿大学) Shanghai University(上海大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出基于角色的LLM框架,通过分配专门角色提升健康食品政策信息提取的准确性与透明度,对比零样本、少样本和推理链基线,展现更优的复杂推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02939 2026-03-04 cs.AI 77%

ShipTraj-R1: Reinforcing Ship Trajectory Prediction in Large Language Models via Group Relative Policy Optimization

ShipTraj-R1: 通过群体相对策略优化在大型语言模型中强化船舶轨迹预测

Yang Zhan, Yunhao Li, Zhang Chao, Yuxu Lu, Yan Li

机构 * School of Artificial Intelligence, Optics, and Electronics (iOPEN)(人工智能、光学与电子学院) Northwestern Polytechnical University(西北工业大学) Department of Logistics and Maritime Studies(物流与海洋研究系) The Hong Kong Polytechnic University(香港理工大学) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing(测绘遥感信息工程国家重点实验室) Wuhan University(武汉大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 ShipTraj-R1通过群体相对策略优化在大型语言模型中强化船舶轨迹预测,利用动态提示和规则奖励机制提升预测准确性。

Comments Accepted by the 30th Pacific-Asia Conference on Knowledge Discovery and Data Mining (PAKDD2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02954 2026-01-12 cs.CL 77%

DQ-LoRe: Dual Queries with Low Rank Approximation Re-ranking for In-Context Learning

DQ-LoRe:双查询与低秩近似重排序用于上下文学习

Jing Xiong, Zixuan Li, Chuanyang Zheng, Zhijiang Guo, Yichun Yin, Enze Xie, Zhicheng Yang, Qingxing Cao, Haiming Wang, Xiongwei Han, Jing Tang, Chengming Li, Xiaodan Liang

机构 * Sun Yat-Sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Huawei Noah’s Ark Lab(华为诺亚实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) MBZUAI The Hong Kong University of Science and Technology(香港科学与技术大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学) DarkMatter AI Research(DarkMatter AI研究)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 DQ-LoRe通过双查询与低秩近似重排序方法提升GPT-4上下文学习性能,实现94.2%的性能提升。

Comments Accepted in ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22568 2025-12-30 cs.AI physics.bio-ph q-bio.NC 77%

Lessons from Neuroscience for AI: How integrating Actions, Compositional Structure and Episodic Memory could enable Safe, Interpretable and Human-Like AI

从神经科学中汲取教训:如何通过整合动作、组合结构和事件记忆来实现安全、可解释和类人的人工智能

Rajesh P. N. Rao, Vishwas Sathish, Linxing Preston Jiang, Matthew Bryan, Prashant Rangarajan

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 通过整合动作、组合结构和事件记忆,改进基础模型以实现安全、可解释和类人的人工智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13979 2025-12-17 cs.AI 77%

ReflCtrl: Controlling LLM Reflection via Representation Engineering

ReflCtrl: 通过表征工程控制LLM的反思

Ge Yan, Chung-En Sun, Tsui-Wei, Weng

机构 * CSE, UCSD(计算机科学与工程系,加州大学圣塔克鲁兹分校) HDSI, UCSD(人类-数字系统研究所,加州大学圣塔克鲁兹分校)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 ReflCtrl通过表征工程控制LLM的反思行为,减少冗余推理并提升效率。

Comments Spotlight in NeurIPS 25 MI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04680 2025-12-05 cs.SE cs.AI cs.HC 77%

Generative AI for Self-Adaptive Systems: State of the Art and Research Roadmap

生成式人工智能在自适应系统中的应用:现状与研究路线图

Jialong Li, Mingyue Zhang, Nianyu Li, Danny Weyns, Zhi Jin, Kenji Tei

机构 * Waseda University(早稻田大学) Southwest University(西南大学) Zhongguancun Laboratory(中关村实验室) Peking University(北京大学) Tokyo Institute of Technology(东京技术大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文探讨生成式人工智能在自适应系统中的应用现状与研究方向,分析其提升系统自主性和人机交互的潜力及挑战。

Comments Accepted by ACM Transactions on Autonomous and Adaptive Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12143 2025-11-14 cs.AI 77%

Small Models Struggle to Learn from Strong Reasoners

Yuetai Li, Xiang Yue, Zhangchen Xu, Fengqing Jiang, Luyao Niu, Bill Yuchen Lin, Bhaskar Ramasubramanian, Radha Poovendran

机构 * University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Western Washington University(西雅图华盛顿大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23182 2025-10-28 cs.CL 77%

SI-Bench: Benchmarking Social Intelligence of Large Language Models in Human-to-Human Conversations

Shuai Huang, Wenxuan Zhao, Jun Gao

机构 * Hello Group(Hello集团)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21853 2025-10-28 cs.CL 77%

Policy Optimization Prefers The Path of Least Resistance

Debdeep Sanyal, Aakash Sen Sharma, Dhruv Kumar, Saurabh Deshpande, Murari Mandal

机构 * Birla AI Labs(Birla人工智能实验室) InvideoAI BITS Pilani(比斯·皮尔尼学院) Kalinga Institute of Industrial Technology(卡林加工业技术学院)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments 21 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11588 2025-10-14 cs.AI 77%

Analyzing and Internalizing Complex Policy Documents for LLM Agents

Jiateng Liu, Zhenhailong Wang, Xiaojiang Huang, Yingjie Li, Xing Fan, Xiang Li, Chenlei Guo, Ruhi Sarikaya, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07880 2025-10-14 cs.CL 77%

Do LLMs Really Need 10+ Thoughts for "Find the Time 1000 Days Later"? Towards Structural Understanding of LLM Overthinking

Xinliang Frederick Zhang, Anhad Mohananey, Alexandra Chronopoulou, Pinelopi Papalampidi, Somit Gupta, Tsendsuren Munkhdalai, Lu Wang, Shyam Upadhyay

机构 * University of Michigan(密歇根大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments 30 pages, 41 figures, 10 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23633 2025-09-30 cs.CL 77%

Fast Thinking for Large Language Models

Haoyu Zheng, Zhuonan Wang, Yuqian Yuan, Tianwei Lin, Wenqiao Zhang, Zheqi Lv, Juncheng Li, Siliang Tang, Yueting Zhuang, Hongyang He

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05741 2025-09-09 cs.CL 77%

Enhancing Factual Accuracy and Citation Generation in LLMs via Multi-Stage Self-Verification

Fernando Gabriela García, Qiyang Shi, Zilin Feng

机构 * Autonomous University of Nuevo León(新莱昂自治大学) Minnan Normal University(闽南师范大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16729 2025-08-26 cs.CL 77%

Error Reflection Prompting: Can Large Language Models Successfully Understand Errors?

Jason Li, Lauren Yraola, Kevin Zhu, Sean O'Brien

机构 * Algoverse AI Research(Algoverse AI 研究所)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Accepted to Insights @ NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08525 2025-07-14 cs.CV cs.AI 77%

GTR: Guided Thought Reinforcement Prevents Thought Collapse in RL-based VLM Agent Training

Tong Wei, Yijun Yang, Junliang Xing, Yuanchun Shi, Zongqing Lu, Deheng Ye

机构 * Tsinghua University(清华大学) Tencent(腾讯) Peking University(北京大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21211 2025-06-27 cs.SE cs.AI 77%

$T^3$: Multi-level Tree-based Automatic Program Repair with Large Language Models

Quanming Liu, Xupeng Bu, Zhichao Yan, Ru Li

机构 * School of Computer and Information Technology(计算机与信息科技学院) Shanxi University(山西大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08991 2025-06-10 cs.LG stat.ML 77%

Task Generalization With AutoRegressive Compositional Structure: Can Learning From $D$ Tasks Generalize to $D^{T}$ Tasks?

Amirhesam Abedsoltan, Huaqing Zhang, Kaiyue Wen, Hongzhou Lin, Jingzhao Zhang, Mikhail Belkin

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03038 2025-06-10 cs.CL 77%

Towards Analyzing and Understanding the Limitations of VAPO: A Theoretical Perspective

Jintian Shao, Yiming Cheng

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Bad experiments, lacking sufficient references

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05358 2025-06-09 cs.CV cs.AI cs.CR 77%

Can ChatGPT Perform Image Splicing Detection? A Preliminary Study

Souradip Nath

机构 * Arizona State University(亚利桑那州立大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14183 2025-05-21 cs.CL 77%

ThinkSwitcher: When to Think Hard, When to Think Fast

Guosheng Liang, Longguang Zhong, Ziyi Yang, Xiaojun Quan

机构 * School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03418 2025-05-07 cs.LG 77%

Knowledge Augmented Complex Problem Solving with Large Language Models: A Survey

Da Zheng, Lun Du, Junwei Su, Yuchen Tian, Yuqi Zhu, Jintian Zhang, Lanning Wei, Ningyu Zhang, Huajun Chen

机构 * Ant Group(蚂蚁集团) The University of Hong Kong(香港大学) Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏