arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-06 至 2026-08-06 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 13 篇

2608.04771 2026-08-06 cs.AI 新提交 87%

Fewer Tokens, Smaller Cache: Reward-Coordinated Efficient Reasoning

更少Token,更小缓存:奖励协调的高效推理

Qiyuan Zhu, Dezhi Li, Pengyu Cheng, Tianle Chen, Jiacheng Wang, Ruijie Shen, Hao Gu, Sida Lin, Zirui Liu, Jiacheng Liu, Sirui Han

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 针对大型推理模型过度思考导致的高推理成本问题,提出奖励协调压缩框架ReCo,通过奖励自适应缓存压缩等组件,减少生成Token并降低延迟,同时保持准确率。

Comments Work in progress, revisions ongoing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04444 2026-08-06 cs.CL cs.AI 新提交 81%

D$^2$F-ReAG: Dynamic Decomposition and Filtering for Multi-Hop Reasoning-Augmented Generation

D²F-ReAG:面向多跳推理增强生成的动态分解与过滤

Jiaoyang Li, Junhao Ruan, Shengwei Tang, Kaiyan Chang, Zhengtao Yu, Tong Xiao, Jingbo Zhu

机构 * Northeastern University(东北大学) Kunming University of Science and Technology(昆明理工大学) NiuTrans Research(NiuTrans研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对现有检索增强生成(RAG)处理多跳问题时缺乏动态分解与有效过滤的缺陷,提出D²F-ReAG范式,通过判断根级推理可靠性自适应控制推理深度,经实验验证其处理复杂多跳问题的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04385 2026-08-06 cs.CV 新提交 78%

ReGround: Restoring Visual Grounding in Multi-Step Reasoning through Self-Diagnosis and Visual Re-Examination

ReGround:通过自诊断与视觉重检验恢复多步推理中的视觉接地

Lei Peng, Shuai Lv, Wei Hu

机构 * University of Science and Technology of China(中国科学技术大学) School of Artificial Intelligence and Data Science(人工智能与数据科学学院) State Key Laboratory of Precision and Intelligent Chemistry(精准与智能化学国家重点实验室)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 ReGround是无需架构修改或外部工具的两阶段框架,通过自诊断与视觉重检验解决VLMs多步推理中的视觉接地丢失问题,在八个基准上获一致增益且推理开销适度。

Comments Accepted to ACM Multimedia 2026 (MM '26). 8 pages main text, 4 figures, plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23054 2026-08-06 cs.CL cs.AI cs.LG 版本更新 67%

DeepImagine: Clinical Trial Outcome Prediction via Stepwise Local Counterfactual Imaginations

DeepImagine: 通过连续反事实想象学习生物医学推理

Youze Zheng, Jianyou Wang, Yuhan Chen, Matthew Feng, Longtian Bao, Hanyuan Zhang, Maxim Khan, Aditya K. Sehgal, Christopher D. Rosin, Umber Dube, Ramamohan Paturi

机构 * Laboratory for Emerging Intelligence, University of California, San Diego(新兴智能实验室,加州大学圣地亚哥分校) Department of Dermatology, University of California, San Diego(皮肤科系,加州大学圣地亚哥分校) University of Chicago(芝加哥大学) Elsevier(艾尔斯特出版社)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DeepImagine框架,通过连续反事实想象训练语言模型进行生物医学推理,利用反事实对偶和强化学习提升临床试验预测性能,展示模型在生物医学领域的可解释性改进。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10599 2026-08-06 cs.CL cs.AI cs.LG 版本更新 67%

Emergence of Hierarchical Emotion Organization in Large Language Models

大型语言模型中层级情感组织的涌现

Maya Okawa, Bo Zhao, Eric J. Bigelow, Rose Yu, Tomer Ullman, Ekdeep Singh Lubana, Hidenori Tanaka

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Washington(华盛顿大学) University of Tokyo(东京大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 受情感轮理论启发,分析大型语言模型输出中情感状态间的概率依赖关系,发现模型自然形成与人类心理模型一致的层级情感树,且更大模型发展出更复杂的层级结构,同时揭示社会经济角色在情感识别中的系统性偏差。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06506 2026-08-06 cs.CL cs.AI cs.LG cs.MA 版本更新 67%

Pun Intended: Multi-Agent Translation of Wordplay with Contrastive Learning and Phonetic-Semantic Embeddings for CLEF JOKER 2025 Task 2

并非双关:结合对比学习与音义嵌入的多智能体双关语翻译方法,用于CLEF JOKER 2025任务2

Russell Taylor, Benjamin Herbert, Michael Sana

机构 * Georgia Institute of Technology(佐治亚理工学院) Peoples' Friendship University of Russia (RUDN University)(俄罗斯人民友谊大学) Joint Institute for Nuclear Research(联合核子研究中心) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Skövde(斯德哥尔摩大学)

专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对跨语言双关语翻译难题,提出结合对比学习、音义嵌入与多智能体生成器-判别器框架的三阶段方法,在CLEF JOKER 2025任务2竞赛中获第一、第二名,推动了双关语翻译研究。

Journal ref CEUR Workshop Proceedings, Vol-4038, pp. 2870-2888, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04018 2026-08-06 cs.CY cs.AI 新提交 57%

Governing Execution Risk in Agentic AI Systems: A Trajectory-Guided Framework for Red Teaming

管控智能体AI系统的执行风险:一种基于轨迹的红队测试框架

Zhihao Zhu, Yi Yang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出基于轨迹的红队测试框架TrajRed和运行时管控层TrajGuard,在AgentDojo实验中,TrajRed识别的漏洞更强,TrajGuard可将攻击成功率降至近零且保留任务效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03079 2026-08-06 cs.CL 版本更新 57%

Learning to Diagnose and Correct Moral Errors: Beyond Shallow Heuristics in Moral Alignment

学习诊断和纠正错误:大型语言模型中的道德敏感性获取

Bocheng Chen, Xi Chen, Han Zi, Haitao Mao, Zimo Qi, Xitong Zhang, Kristen Johnson, Guangliang Liu

机构 * University of Mississippi(密西根州立大学) Nanyang Technological University(南洋理工大学) Northeastern University(东北大学) AWS AI Labs(AWS AI实验室) Johns Hopkins University(约翰霍普金斯大学) Qualcomm(高通) Michigan State University(密西根州立大学) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出一种实用推理方法,通过让大型语言模型诊断和纠正道德错误来获取道德敏感性,并在多个任务上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04214 2026-08-06 cs.DB cs.AI cs.PL 版本更新 57%

On The Suitability of Differential Dataflow For Datalog Interpretation In Highly Dynamic Settings

差分数据流在高度动态场景下 Datalog 解释的适用性研究

Bruno Rucy Carneiro Alves de Lima, Merlin Kramer, Kalmer Apinis

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文研究差分数据流在高度动态场景下 Datalog 解释的适用性,通过对比三种 Datalog 实现的物化效率,为增强动态数据环境中 Datalog 驱动的计算提供了路线图。

Comments 8 pages, AICCC 2023

Journal ref Proceedings of the 2023 6th Artificial Intelligence and Cloud Computing Conference (AICCC 2023), Kyoto, Japan, December 2023, pp. 218-225. ACM, New York, NY, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04533 2026-08-06 cs.CV 新提交 50%

EgoAfford: Task-Oriented Affordance Grounding via Egocentric Referring Segmentation

EgoAfford:基于自我中心指称分割的面向任务的可供性定位

Xinyuan Guan, Feifan Chen, Xinyu Zhan, Fu-Cheng Zhang, Cewu Lu, Lixin Yang

专题命中 复杂问题求解 :planning(abstract)

AI总结 针对部件级可供性定位难以适配复杂多步桌面任务的问题,提出基准EgoAfford及参考模型EgoLens,验证了下一步推理与动作角色条件部件定位的互补挑战,为感知与规划联合研究提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04436 2026-08-06 cs.CV 新提交 50%

ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

ToolArtist:用于智能体图像生成的工具使用统一多模态模型

Jiahao Zhao, Xiaomin Yu, Zhongxiang Sun, Fengwei Teng, Chengwei Qin, Xiaobin Hu, Jun Xu, Shuicheng Yan

机构 * RUC(中国人民大学) HKUST(GZ)(香港科技大学(广州)) NUS(新加坡国立大学) UCD(加州大学戴维斯分校)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出ToolArtist,一种全智能体图像生成模型,通过后训练UMM实现,采用RAD-GRPO方法优化,将完整开放世界图像生成过程置于智能体控制下,性能优于部分控制方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04166 2026-08-06 cs.HC 新提交 50%

Enacting Constructive Conflicts with AI Agents to Enhance Reconsideration among Novice Interaction Designers

借助AI智能体构建建设性冲突以提升新手交互设计师的重新考量能力

Howard Ziyu Han, Nikolas Martelaro

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 该研究构建受对抗性设计理论启发的AI智能体,通过45名设计学生的实验发现,该智能体实施的建设性冲突可提升新手交互设计师的重新考量能力,推动设计改进与创意拓展。

Comments 8 pages, 4 figures, conditionally accepted to Human-Agent Interaction 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25465 2026-08-06 cs.SE 版本更新 50%

BloomAPR: A Bloom's Taxonomy-based Framework for Assessing the Capabilities of LLM-Powered APR Solutions

BloomAPR:基于布鲁姆教育目标分类学的框架,用于评估大语言模型驱动的自动程序修复(APR)方案的能力

Yinghang Ma, Jiho Shin, Leuson Da Silva, Zhen Ming, Jiang, Song Wang, Foutse Khomh, Shin Hwei Tan

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 BloomAPR是基于布鲁姆教育目标分类学的动态评估框架,评估了ChatRepair、CigaR等APR方案在不同LLM及布鲁姆分类层级下的漏洞修复能力,发现其存在性能差异并指出基准演进的必要性。

Comments 22 pages, 7 figures, Manuscript submitted to ACM Transactions on Software Engineering and Methodology

详情

展开后加载摘要…

URL PDF HTML 收藏