arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-08 至 2026-07-08 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 9 篇

2607.05911 2026-07-08 cs.CV 新提交 82%

Progressive Reasoning with Primitive Correction for Compositional Zero-Shot Learning

基于原始校正的渐进推理用于组合零样本学习

Ziyi Chen, Haoyan Shi, Sunhan Xu, Congyan Lang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Key Laboratory of Big Data & Artificial Intelligence in Transportation (Ministry of Education)(交通运输大数据与人工智能教育部重点实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 研究组合零样本学习问题,提出PRPC框架,通过逐步推理明确建模属性和对象间双向依赖性,对原语相互校正,将其公式化为结构化推理过程并结合强化学习后训练,在基准测试中达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05428 2026-07-08 cs.DL cs.AI 新提交 76%

CHARLIE: An On-Premise Multi-Agent Retrieval-Augmented Generation System for Evidential Reasoning in Forensic Science

CHARLIE:用于法医学证据推理的本地多智能体检索增强生成系统

Leandro D. Carneiro, Andre L. S. Meirelles, Juliano de A. Gomes, Rafael C. A. Cabral

机构 * Forensic Institute, Civil Police of Federal District, Brazil(巴西联邦区刑事研究所) University of Brasília, Brazil(巴西巴西利亚大学)

专题命中 复杂问题求解 :reasoning(title,comments);分类 cs.AI

AI总结 介绍用于法医学证据推理的本地多智能体检索增强生成系统CHARLIE,通过结合多种机制应对取证挑战,在机构内运行维护数据主权等,经案例研究验证其能支持证据工作流程,为高风险取证环境部署AI系统提供蓝图。

Comments 10 pages, 1 figure. Archival version of a paper presented at RELAF 2026: 1st Workshop on Reasoning with Evidence in Law Enforcement and Forensics, co-located with ICAIL 2026, Singapore, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06544 2026-07-08 cs.AI cs.CL 新提交 62%

Rethinking Indic AI from a Lens of Cultural Heritage Preservation

从文化遗产保护视角重新思考印度人工智能

Aparna Madva, Sharath Srivatsa, Srinath Srinivasa, Tulika Saha

机构 * International Institute of Information Technology, Bengaluru(班加罗尔国际信息技术学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文从文化遗产保护角度探讨人工智能对印度语言文化的影响,通过纵向调查自然语言处理技术演变、分析印度语言特征及基础模型作用,提出‘文化感知’方向,为印度自然语言处理下一阶段研究及基础模型发展提供指引。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06445 2026-07-08 cs.CV cs.AI 新提交 57%

Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders

代理分析:作为条件编码器的视觉语言模型中的定位信号

Yoav Baron, Sara Dorfman, Roni Paiss, Daniel Cohen-Or, Or Patashnik

机构 * Tel Aviv University, Tel Aviv, Israel(特拉维夫大学) Google DeepMind(谷歌DeepMind)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究视觉语言模型(VLMs)作条件编码器时编辑管道定位性能差的问题,引入代理分析框架,通过训练代理模型分析VLM中间表示来揭示编码定位信息的表示,发现现有条件提取策略缺陷,为条件架构设计提供新思路。

Comments Accepted as a Spotlight at the ICML 2026 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05465 2026-07-08 cs.CV cs.AI 新提交 57%

CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration

CanvasAgent:通过视觉工具编排实现复杂图像创建和编辑

Hairui Zhu, Yiying Yang, Tengjin Weng, Ziyu Lu, Xiao Yao, Xiaoyang Ye, Lin Ma, Wenhao Jiang

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究复杂图像创建编辑问题,提出CanvasAgent代理,通过多轮交互编排异构视觉工具,先经监督微调学习轨迹,再用广义信赖域策略优化器结合多种信号优化,结合CanvasCraft数据集进行实验,证明其对复杂多工具图像创建工作流程有效。

Comments 18pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19771 2026-07-08 cs.AI 版本更新 57%

Beyond Reactivity: Measuring Proactive Problem Solving in LLM Agents

超越反应性:衡量大语言模型智能体中的主动解决问题能力

Gil Pasternak, Dheeraj Rajagopal, Julia White, Dhruv Atreja, Matthew Thomas, George Hurn-Maloney, Ash Lewis

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究旨在衡量大语言模型智能体的主动解决问题能力。提出PROBE方法,将主动性分解为三个核心能力。应用该方法评估领先模型和框架,发现即使最先进的模型表现也不佳,GPT-5和Claude Opus-4.1最佳端到端性能为40%,突出局限并揭示未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19458 2026-07-08 cs.AI cond-mat.mtrl-sci 版本更新 57%

VASP Agent: An Agentic Framework for Autonomous First-principles Calculations

VASP智能体:一种用于自主第一性原理计算的智能框架

Zeyu Xia, Jinzhe Ma, Congjie Zheng, Zhongyao Wang, Shufei Zhang, Yuqiang Li, Hang Su, P. Hu, Changshui Zhang, Xingao Gong, Wanli Ouyang, Lei Bai, Dongzhan Zhou, Mao Su

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Computer Science and Technology(计算机科学与技术系) School of Physical Science and Technology(物理科学与技术学院) Department of Automation(自动化系) Beijing National Research Center for Information Science and Technology (BNRist)(北京信息科学与技术国家研究中心) School of Chemistry and Chemical Engineering(化学与化工学院) Key Laboratory of Computational Physical Sciences (Ministry of Education)(计算物理科学重点实验室) The Chinese University of Hong Kong(香港中文大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究针对第一性原理材料计算对自主性的高要求,提出VASP智能体系统,结合多种技能和工具执行多步VASP计算,经多任务评估,其计算结果更优,还能诊断并恢复计算错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20342 2026-07-08 cs.HC cs.AI cs.CY 版本更新 57%

Narrative-Centered Emotional Reflection: An Early Prototype for AI-Supported Emotional Self-Reflection

以叙事为中心的情感反思:人工智能支持的情感自我反思的早期原型

Shou-Tzu Han

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 该研究以Reflexion为早期原型,通过整合情感检测、分层反思提示和隐喻故事生成等方法,探索结构化情感自我反思,支持用户超越基本情感分类进行自主情感探索,记录了理论驱动的情感计算方向。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06403 2026-07-08 cs.RO 新提交 50%

From Foundation to Application: Improving VLA Models in Practice

从基础到应用:在实践中改进VLA模型

Wei Wu, Fangjing Wang, Fan Lu, He Sun, Shi Liu, Yunnan Wang, Yibin Yan, Yong Wang, Shuailei Ma, Xinyang Wang, Yibin Liu, Shuai Yang, Tianxiang Zhou, Kejia Zhang, Lei Zhou, Cheng Su, Nan Xue, Bin Tan, Han Zhang, Youchao Zhang, Fei Liao, Xing Zhu, Yujun Shen, Kecheng Zheng

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 针对VLA模型实验室与实际应用差距问题,提出LingBot-VLA 2.0。通过改进数据处理、扩展动作空间及预测动力学建模等方法,经GM-100基准测试验证,提升了模型跨实体长距离移动操作能力。

Comments Website: https://technology.robbyant.com/lingbot-vla-v2, Github: https://github.com/robbyant/lingbot-vla-v2, Checkpoints: https://huggingface.co/collections/robbyant/lingbot-vla-v2

详情

展开后加载摘要…

URL PDF HTML 收藏