arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-12 至 2026-05-12 共收录 878 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 154 篇

2510.18184 2026-05-12 cs.LG cs.AI 85%

ActivationReasoning: Logical Reasoning in Latent Activation Spaces

ActivationReasoning: 在潜在激活空间中的逻辑推理

Lukas Helff, Ruben Härle, Wolfgang Stammer, Felix Friedrich, Manuel Brack, Antonia Wüst, Hikaru Shindo, Patrick Schramowski, Kristian Kersting

机构 * TU Darmstadt(图恩-达姆施塔特大学) Lab1141(Lab1141实验室) Aleph Alpha Research(Aleph Alpha研究) MPI-Inf, SIC(马克斯·普朗克研究所(MPI-Inf)) Meta FAIR Adobe Applied Research(Adobe应用研究) DFKI(DFKI研究所) CERTAIN, Germany(德国CERTAIN)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ActivationReasoning框架,通过在LLM的潜在空间中嵌入显式逻辑推理,提升模型的推理能力、可控性和对齐性,验证了在多跳推理、抽象与鲁棒性、自然语言推理及安全任务中的有效性。

Comments Proceedings of the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09920 2026-05-12 cs.LG cs.AI 85%

Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward

通过内在梯度-范数奖励实现无需验证器的LLM强化学习

Xuexiang Wen, Hang Yu, Linchao Zhu, Gaoang Wang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 推理与问题求解 :LLM(title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出VIGOR,一种无需外部验证器的强化学习奖励机制,通过内在偏好信号提升政策优化效果,在数学推理和代码基准测试中表现优于现有方法。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09806 2026-05-12 cs.LG cs.AI 85%

LEAD: Length-Efficient Adaptive and Dynamic Reasoning for Large Language Models

LEAD:高效适应性与动态推理用于大语言模型

Songtao Wei, Yi Li, Zhikai Li, Xu Hu, Yuede Ji, Guanpeng Li, Feng Chen, Carl Yang, Zhichun Guo, Bingzhe Li

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Emory University(埃默里大学) Individual Researcher(独立研究员) University of Texas at Arlington(德克萨斯大学阿灵顿分校) University of Florida(佛罗里达大学)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 LEAD通过动态校准正确性与效率的权衡,提升大语言模型的推理效率与准确性,实现更短的输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08625 2026-05-12 cs.LG cs.AI 85%

Reasoning-Aware Training for Time Series Forecasting

面向时间序列预测的推理感知训练

Md Atik Ahamed, Mihir Parmar, Palash Goyal, Chun-Liang Li, Qiang Cheng, Tomas Pfister, Jinsung Yoon

机构 * Google(谷歌) University of Kentucky(肯塔基大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出STRIDE框架,通过将LLM推理注入到时间序列基础模型的连续嵌入空间中,提升数值预测的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26574 2026-05-12 cs.AI cond-mat.other cs.CL hep-th quant-ph 85%

Probing the Critical Point (CritPt) of AI Reasoning: a Frontier Physics Research Benchmark

探测人工智能推理的临界点(CritPt):一个前沿物理研究基准

Minhui Zhu, Minyang Tian, Xiaocheng Yang, Tianci Zhou, Lifan Yuan, Penghao Zhu, Eli Chertkov, Shengyan Liu, Yufeng Du, Ziming Ji, Indranil Das, Qingzhi Chen, Junyi Cao, Yufeng Du, Jiabin Yu, Peixue Wu, Jinchen He, Yifan Su, Yikun Jiang, Yujie Zhang, Chang Liu, Ze-Min Huang, Weizhen Jia, Yunkai Wang, Farshid Jafarpour, Yong Zhao, Xinan Chen, Jessie Shelton, Aaron W. Young, John Bartolotta, Wenchao Xu, Yue Sun, Anjun Chu, Victor Colussi, Chris Akers, Nathan Brooks, Wenbo Fu, Jinchao Zhao, Marvin Qi, Anqi Mu, Yubo Yang, Allen Zang, Yang Lyu, Peizhi Mai, Christopher Wilson, Xuefei Guo, Juntai Zhou, Daniel Inafuku, Chi Xue, Luyu Gao, Ze Yang, Yaïr Hein, Yonatan Kahn, Kevin Zhou, Di Luo, John Drew Wilson, Jarrod T. Reilly, Dmytro Bandak, Ofir Press, Liang Yang, Xueying Wang, Hao Tong, Nicolas Chia, Eliu Huerta, Hao Peng

机构 * Argonne National Laboratory(阿贡国家实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Virginia Tech(弗吉尼亚理工大学) Ohio State University(俄亥俄州立大学) Independent(独立) Northeastern University(东北大学) Caltech(加州理工学院) University of Florida(佛罗里达大学) University of Waterloo(滑铁卢大学) University of Maryland, College Park(马里兰大学学院公园分校) Columbia University(哥伦比亚大学) Perimeter Institute for Theoretical Physics(理论物理研究所) University of Connecticut(康涅狄格大学) University of Cologne(科隆大学) The Chinese University of Hong Kong(香港中文大学) Utrecht University(乌得勒支大学) Harvard University(哈佛大学) ETH Zürich(苏黎世联邦理工学院) Paul Scherrer Institute(保罗·谢尔研究所)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CritPt基准,用于测试LLM在未发表的科研级推理任务中的能力,涵盖现代物理多个领域,发现当前LLM在复杂科研挑战中表现有限,仅能实现5.7%的准确率。

Comments 40 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10831 2026-05-12 cs.LG cs.AI cs.CE cs.CL 85%

SLIM: Sparse Latent Steering for Interpretable and Property-Directed LLM-Based Molecular Editing

SLIM:稀疏潜在引导用于可解释和属性导向的基于大语言模型的分子编辑

Mingxu Zhang, Yuhan Li, Lujundong Li, Dazhong Shen, Hui Xiong, Ying Sun

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The 63rd Research Institute, National University of Defense Technology, Nanjing(国防科技大学第六三研究所,南京)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SLIM通过稀疏潜在特征空间提升分子编辑效果,实现属性导向的可解释编辑,实验显示在多个分子属性上提升达42.4个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19995 2026-05-12 cs.CL cs.AI cs.LG 85%

Schoenfeld's Anatomy of Mathematical Reasoning by Language Models

语言模型的数学推理解剖:Schoenfeld的推理结构

Ming Li, Chenrui Fan, Yize Cheng, Soheil Feizi, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过Schoenfeld的事件理论,提出ThinkARM框架,解剖语言模型的推理过程,揭示推理与非推理模型在结构上的差异,并通过案例研究展示探索步骤与正确性及效率方法的影响。

Comments ACL2026, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10224 2026-05-12 cs.AI 84%

Hypothesis-Driven Deep Research with Large Language Models: A Structured Methodology for Automated Knowledge Discovery

基于大语言模型的假设驱动深度研究:一种用于自动化知识发现的结构化方法论

Michael Chin

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.AI

AI总结 本文提出假设驱动深度研究方法论,通过结构化流程实现自动化知识发现,提升事实密度和准确性,实验显示在事实密度、主体匹配精度等方面有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07436 2026-05-12 cs.CV cs.AI cs.ET 84%

Prompt to Protection: A Comparative Study of Multimodal LLMs in Construction Hazard Recognition

提示到保护:多模态大语言模型在建筑危险识别中的比较研究

Nishi Chaudhary, S M Jamil Uddin, Sathvik Sharath Chandra, Anto Ovid, Alex Albert

机构 * Department of Construction Management, Colorado State University(科罗拉多州立大学建设管理系) Department of Civil, Construction, and Environmental Engineering, North Carolina State University(北卡罗来纳州立大学土木、建设与环境工程系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文比较了五种先进多模态大语言模型在建筑危险识别中的表现,发现提示策略显著影响性能,CoT提示效果最佳,GPT-4.5和GPT-o3表现突出,强调了提示设计在提升建筑安全应用准确性中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08404 2026-05-12 cs.CL cs.AI cs.CV cs.ET 84%

Built Environment Reasoning from Remote Sensing Imagery Using Large Vision--Language Models

利用大视觉-语言模型从遥感图像中推导建成环境

Dongdong Wang, Deepak Balakrishnan, Ravi Srinivasan, Shenhao Wang

机构 * Department of Urban and Regional Planning, University of Florida(佛罗里达大学城市与区域规划系)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型在智慧城市中的应用,通过多尺度遥感图像输入多模态语言模型,评估其对建成环境推理的影响,并比较了InternVL和Qwen等先进模型在生成建成环境建议中的准确性和可靠性。

Comments Published in the International Conference on Industrialized Construction 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20829 2026-05-12 cs.LG cs.AI cs.CL 83%

Training Reasoning Models on Saturated Problems via Failure-Prefix Conditioning

通过失败前缀条件训练饱和问题的推理模型

Minwu Kim, Safal Shrestha, Anubhav Shrestha, Keith Ross

机构 * New York University Abu Dhabi(纽约大学阿布扎赫分校)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出失败前缀条件方法,通过引导探索失败易发的推理状态,解锁饱和问题中的学习信号,提升模型恢复能力,实现性能提升并增强鲁棒性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10410 2026-05-12 cs.LG 83%

Equilibrium Residuals Expose Three Regimes of Matrix-Game Strategic Reasoning in Language Models

均衡残差揭示语言模型在矩阵博弈战略推理中的三种模式

Wenhua Nie, Binhan Luo, Zijie Meng, Jyh-Shing Roger Jang, Ching-Wen Ma

机构 * National Taiwan University(国立台湾大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 研究揭示语言模型在矩阵博弈中存在三种战略推理模式,通过实验发现残差奖励在不同矩阵规模下表现差异,证明残差训练在收益变化时具有转移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09292 2026-05-12 cs.AI cs.CY 83%

Beyond Accuracy: Evaluating Strategy Diversity in LLM Mathematical Reasoning

超越准确性:评估大语言模型数学推理中的策略多样性

Xia Yang, Xuanyi Zhang, Hao Hu, Feng Ji

机构 * University of Toronto(多伦多大学) Upper Canada College(上加拿大学院) East China Normal University(华东师范大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了大语言模型在数学推理中策略多样性与准确性之间的关系,发现策略多样性是评估数学推理的重要补充维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14785 2026-05-12 cs.LG cs.AI 82%

Exploring the In-Context Learning Capabilities of LLMs for Money Laundering Detection in Financial Graphs

探索LLMs在金融图谱中反洗钱检测中的情境学习能力

Erfan Pirmorad

机构 * The Vanguard Group, Inc.(先锋集团)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了LLMs在金融图谱中进行反洗钱检测的能力,通过提取局部子图并利用少量样本进行情境学习,展示LLMs在识别可疑行为和生成解释方面的潜力。

Comments Accepted at AI4FCF-ICDM 2025

Journal ref 2025 IEEE International Conference on Data Mining Workshops (ICDMW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09184 2026-05-12 cs.AI cs.CL cs.DB 82%

Open Ontologies: Tool-Augmented Ontology Engineering with Stable Matching Alignment

开放本体:基于稳定匹配对齐的工具增强本体工程

Fabio Rovai

机构 * The Tesseract Academy, London, United Kingdom(泰斯拉学院,伦敦,英国)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Open Ontologies系统,结合LLM驱动构建与形式OWL推理及本体对齐,发现稳定1对1匹配是本体对齐质量关键,且工具增强访问优于纯LLM解析。

Comments 10 pages, 6 tables. Code: https://github.com/fabio-rovai/open-ontologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08646 2026-05-12 cs.LG cs.CL cs.DC 82%

PAAC: Privacy-Aware Agentic Device-Cloud Collaboration

PAAC:隐私感知的代理设备-云协作

Liangqi Yuan, Wenzhi Fang, Shiqiang Wang, Christopher G. Brinton

机构 * Purdue University(普渡大学) University of Exeter(埃克塞特大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 PAAC框架通过设备-云边界对齐规划-执行分解,使角色专业化成为隐私机制,提升隐私与准确性的平衡,平均准确率提升15-36%,泄漏减少2-6倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18111 2026-05-12 cs.CV 82%

When Large Vision-Language Models Meet Person Re-Identification

当大视觉-语言模型遇见人重识别

Qizao Wang, Bin Li, Xiangyang Xue

机构 * School of Computer Science, Fudan University, Shanghai, China(复旦大学计算机科学学院,上海,中国)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract)

AI总结 本文提出LVLM-ReID框架,利用大视觉-语言模型的生成能力提升人重识别的准确性,通过语义引导交互模块生成关键外观语义特征,无需额外标注即可在多个基准上取得竞争性结果。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10013 2026-05-12 cs.HC cs.CR 82%

When Are LLM Inferences Acceptable? User Reactions and Control Preferences for Inferred Personal Information

当大语言模型的推断何时是可接受的?用户对推断个人信息的反应及对控制的偏好

Kyzyl Monteiro, Minjung Park, Alexander Ioffrida, Angelina Sanna, Hao-Ping, Lee, Niloofar Mireshghallah, Yang Wang, Sauvik Das

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 研究探讨了用户对大语言模型推断个人信息的反应及控制偏好,发现用户对推断信息的接受度受内容和上下文规范影响,而非单纯内容本身。

Comments 20 pages including appendix; 14 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10698 2026-05-12 cs.MA cs.AI 81%

The Bystander Effect in Multi-Agent Reasoning: Quantifying Cognitive Loafing in Collaborative Interactions

多智能体推理中的旁观者效应:量化协作互动中的认知惰性

Dahlia Shehata, Ming Li

机构 * University of Waterloo(滑铁卢大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究揭示多智能体系统中社交压力引发的认知惰性现象,通过评估22500条轨迹发现模型在协作中逻辑主权崩溃,揭示了主权缺口与对齐幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10327 2026-05-12 quant-ph cs.AI cs.SC 81%

SCALAR: A Neurosymbolic Framework for Automated Conjecture and Reasoning in Quantum Circuit Analysis

SCALAR:用于量子电路分析中自动猜想和推理的神经符号框架

Sean Feeney, Pooja Rao, Andreas Klappenecker, Reuben Tate, Yuri Alexeev, Stefano Mensa, Elica Kyoseva, Stephan Eidenbenz

机构 * 1Department of Computer Science, Texas A\&M University, College Station, USA 2NVIDIA Corporation, Santa Clara, USA Artificial Intelligence Division (CAI-3), Los Alamos National Laboratory, Los Alamos, USA

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 SCALAR框架结合量子模拟、符号猜想生成和LLM解释,通过CUDA-Q平台分析量子电路,生成优化QAOA参数与图不变量的关系猜想,并识别图结构特征与优化景观属性的关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15599 2026-05-12 cs.AI 81%

Autonomous Business System via Neuro-symbolic AI

通过神经符号AI实现自主业务系统

Cecil Pang, Hiroki Sayama

机构 * School of Systems Science and Industrial Engineering, Binghamton University, State University of New York(宾夕法尼亚州立大学布林顿分校系统科学与工业工程学院) AI Engineering, USA TODAY Co., Inc.(USA TODAY公司人工智能工程部) Binghamton Center of Complex Systems, Binghamton University, State University of New York(宾夕法尼亚州立大学布林顿复杂系统中心) Waseda Innovation Lab, Waseda University(早稻田大学创新实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出自主业务系统AUTOBUS,结合大语言模型、谓词逻辑编程和企业数据,构建神经符号架构以执行端到端业务任务,通过人机协作提升业务处理的确定性和适应性。

Comments IEEE SysCon 2026

Journal ref 2026 IEEE International Systems Conference (SysCon), Halifax, NS, Canada, 2026, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09314 2026-05-12 cs.AI 81%

How LLMs Are Persuaded: A Few Attention Heads, Rerouted

大语言模型如何被说服:几个被重定向的注意力头

Xiangkun Sun, Lingkai Kong, Aoqi Zhang, Liang Zeng, Tonghan Wang

机构 * Northeastern University(东北大学) Harvard University(哈佛大学) Tsinghua University(清华大学) Skywork AI

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);language model(abstract);分类 cs.AI

AI总结 研究揭示大语言模型在被说服时,少量中间层注意力头决定答案,通过重定向注意力产生事实性错误,该机制在开源LLM和现实攻击场景中均有效。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06483 2026-05-12 cs.AI cs.RO cs.SY eess.SY 81%

ReasonSTL: Bridging Natural Language and Signal Temporal Logic via Tool-Augmented Process-Rewarded Learning

ReasonSTL:通过工具增强的过程奖励学习桥接自然语言与信号时间逻辑

Bowen Ye, Zhijian Li, Junyue Huang, Junkai Ma, Xiang Yin

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出ReasonSTL框架,通过工具增强和过程奖励学习,解决自然语言到信号时间逻辑(STL)的转换难题,提供透明、低成本且隐私保护的正式规范起草方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00371 2026-05-12 cs.CL cs.CY cs.SE 81%

Reasoning Trajectories for Socratic Debugging of Student Code: From Misconceptions to Contradictions and Updated Beliefs

为学生代码进行苏格拉底调试的推理轨迹:从误解到矛盾与更新信念

Erfan Al-Hossami, Razvan Bunescu

机构 * University of North Carolina at Charlotte(北卡罗来纳州夏洛特大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出推理轨迹生成任务,通过标注的调试问题数据集探讨生成推理轨迹和基于LLM的苏格拉底对话方法,实验显示LLM能生成91%正确的推理轨迹和98.7%有效的对话内容。

Comments 25 pages, 2 tables, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09079 2026-05-12 cs.AI 81%

CauSim: Scaling Causal Reasoning with Increasingly Complex Causal Simulators

CauSim:通过日益复杂的因果模拟器扩展因果推理

Nicolás Astorga, Anita Kriz, Mihaela van der Schaar

机构 * DAMTP, University of Cambridge, Cambridge, UK(剑桥大学 DAMTP 实验室,剑桥,英国)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CauSim通过构建日益复杂的因果模拟器,将因果推理从稀缺标签问题转化为可扩展的监督学习问题,实现跨表示的泛化和因果推理能力的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08817 2026-05-12 cs.AI 81%

How You Begin is How You Reason: Driving Exploration in RLVR via Prefix-Tuned Priors

如何开始就是如何推理:通过前缀微调先验驱动RLVR探索

Yifan Xu, Junren Chen, Yifan Chen

机构 * Hong Kong Baptist University(香港 Baptist 大学) University of Maryland, College Park(马里兰大学 College Park 分校)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出IMAX框架,通过训练软前缀来重塑基础模型的推理轨迹先验,以解决RLVR中探索不足的问题,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08686 2026-05-12 cs.AI 81%

Iterative Critique-and-Routing Controller for Multi-Agent Systems with Heterogeneous LLMs

迭代批评与路由控制器用于异构大语言模型的多智能体系统

Wenzhi Fang, Liangqi Yuan, Guangchen Lan, Dong-Jun Han, Christopher G. Brinton

机构 * Purdue University(普渡大学) Yonsei University(延世大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种迭代批评与路由控制器,通过将多智能体协调视为序列决策问题,改进多智能体系统的协调效率,实验表明其在多个异构系统和七个推理基准中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08467 2026-05-12 cs.LG 81%

CUDAHercules: Benchmarking Hardware-Aware Expert-level CUDA Optimization for LLMs

CUDAHercules:用于LLM的硬件感知专家级CUDA优化基准测试

Shiyang Li, Zijian Zhang, Guangyan Sun, Yuebo Luo, Winson Chen, Yanzhi Wang, Mingyi Hong, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学) Northeastern University(东北大学)

专题命中 推理与问题求解 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 CUDAHercules基准测试评估生成CUDA代码与人类专家级优化的差距,揭示自动化CUDA编程在硬件感知和优化策略上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01191 2026-05-12 cs.AI cs.CL cs.LG 81%

Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lens

大语言模型的链式推理是否是一种幻象?一种数据分布视角

Chengshuai Zhao, Zhen Tan, Pingchuan Ma, Dawei Li, Bohan Jiang, Yancheng Wang, Yingzhen Yang, Huan Liu

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理与问题求解 :language model(abstract,comments);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过数据分布视角探讨了大语言模型链式推理的有效性,揭示其在分布差异下的脆弱性,提出DataAlchemy环境验证了推理能力受训练分布影响的结论。

Comments Accepted by the Association for Computational Linguistics (ACL) 2026 and Foundations of Reasoning in Language Models (FoRLM) at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01345 2026-05-12 cs.CV cs.AI cs.LG 81%

The Perceptual Bandwidth Bottleneck in Vision-Language Models: Active Visual Reasoning via Sequential Experimental Design

视觉语言模型中的感知带宽瓶颈:通过顺序实验设计实现主动视觉推理

Anjie Liu, Ziqin Gong, Yan Song, Yuxiang Chen, Xiaolong Liu, Hengtong Lu, Kaike Zhang, Chen Wei, Jun Wang

机构 * The Hong Kong University of Science(香港科学与技术大学) University College London, London, United Kingdom(伦敦大学学院, 英国伦敦) ShanghaiTech University, Shanghai, China(上海科技大学, 中国上海) AI Lab, The Yangtze River Delta, China(人工智能实验室, 长江三角洲, 中国)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过顺序贝叶斯最优实验设计实现主动视觉推理,解决视觉语言模型中感知带宽瓶颈问题,提升高分辨率视觉推理能力。

Comments 27 pages, 5 figures, accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏