arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-05 至 2026-05-05 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 7 篇

2605.00914 2026-05-05 cs.MA cs.AI 83%

The Cost of Consensus: Isolated Self-Correction Prevails Over Unguided Homogeneous Multi-Agent Debate

共识的成本:孤立自我修正胜过无指导的同质多智能体辩论

Blaž Bertalanič, Carolina Fortuna

机构 * Jo z ef Stefan Institute Ljubljana Slovenia Jo z ef Stefan Institute

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 研究探讨了同质多智能体辩论中共识失败的机制,发现孤立自我修正在成本与准确性上优于无指导的同伴交流,尤其在参数规模7-8B时效果更佳。

Comments 19 pages, ACM Conference on AI and Agentic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01495 2026-05-05 cs.CL cs.AI 81%

FT-RAG: A Fine-grained Retrieval-Augmented Generation Framework for Complex Table Reasoning

FT-RAG:一种面向复杂表格推理的细粒度检索增强生成框架

Zebin Guo, Weidong Geng, Ruichen Mao

机构 * Georgia Institute of Technology(佐治亚理工学院) Zhejiang University(浙江大学) Zhejiang Lab(浙江实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 FT-RAG通过细粒度检索和多模态融合提升表格推理能力,引入多表RAG库增强训练数据,实现表格和单元格命中率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00815 2026-05-05 cs.AI 79%

Resource-Efficient Reinforcement for Reasoning Large Language Models via Dynamic One-Shot Policy Refinement

通过动态单次策略细化实现大规模语言模型推理的资源高效强化学习

Yunjian Zhang, Sudong Wang, Yang Li, Peiran Xu, Conghao Zhou, Xiaoyue Ma, Jianing Li, Yao Zhu

机构 * UCAS(中国科学院大学) HKUST(GZ)(香港科技大学(广州)) Tsinghua University(清华大学) Sun Yat-Sen University(中山大学) Xidian University(西安电子科技大学) George Mason University(乔治·梅森大学) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出动态单次策略细化方法,通过减少训练样本数量和计算开销,提升大规模语言模型推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01471 2026-05-05 cs.SE cs.AI 74%

Practical Limits of Autonomous Test Repair: A Multi-Agent Case Study with LLM-Driven Discovery and Self-Correction

自主测试修复的实践极限:基于LLM驱动发现与自我校正的多智能体案例研究

Hyukjoo Lee

机构 * Independent Researcher(独立研究者)

专题命中 复杂问题求解 :self-correction(title);分类 cs.AI

AI总结 本文通过多智能体系统在企业UI测试中的应用,探讨自主测试的限制,发现受限自主性能提升系统稳定性与可靠性,需结合验证边界和人工监督。

Comments Industrial case study; submitted for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00891 2026-05-05 cs.CV cs.AI 57%

X2SAM: Any Segmentation in Images and Videos

X2SAM:图像和视频中的任意分割

Hao Wang, Limeng Qiao, Chi Zhang, Lin Ma, Guanglu Wan, Xiangyuan Lan, Xiaodan Liang

机构 * Sun Yat-Sen University(中山大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 X2SAM是一种统一的分割多模态大语言模型,能够将图像分割能力扩展到视频,结合LLM和Mask Memory模块,支持通用、开放词汇、指称、推理、基于视觉的对话生成及交互式分割。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00880 2026-05-05 cs.CV cs.AI 57%

Adversarial Flow Matching for Imperceptible Attacks on End-to-End Autonomous Driving

对抗流匹配用于端到端自动驾驶中的不可察觉攻击

Xinyu Zeng, Xiangkun He, Lei Tao, Chen Lv, Hong Cheng

机构 * Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(深圳先进研究院,电子科技大学) School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) School of Mechanical and Electrical Engineering, University of Electronic Science and Technology of China(电子科技大学机械与电气工程学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出对抗流匹配(AFM)框架,通过利用Transformer结构漏洞生成高效且视觉不可察觉的对抗样本,有效降级VLA和模块化自动驾驶代理性能,同时保持先进的视觉不可察觉性及跨模型迁移能力。

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01158 2026-05-05 cs.CY 50%

The Hidden Cost of Thinking: Energy Use and Environmental Impact of LMs Beyond Pretraining

思考的隐性成本:语言模型的能耗与环境影响(超出预训练阶段)

Jacob Morrison, Noah A. Smith, Emma Strubell

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 研究分析了语言模型全开发流程的环境影响,发现推理模型在数据中心能耗上是指令模型的17倍,开发成本占总计算量的82.2%,整体能耗达12.3GWh,排放4251吨CO2eq,水耗15887千升,需纳入环境报告标准。

详情

展开后加载摘要…

URL PDF HTML 收藏