arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-12 至 2026-06-12 共收录 42 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3 篇

2510.16380 2026-06-12 cs.CL cs.AI cs.CY cs.HC cs.LG 版本更新 82%

MoReBench: Evaluating Procedural and Pluralistic Moral Reasoning in Language Models, More than Outcomes

MoReBench:评估语言模型中的程序性和多元道德推理,超越结果

Yu Ying Chiu, Michael S. Lee, Rachel Calcott, Brandon Handoko, Paul de Font-Reaulx, Raphaël Millière, Paula Rodriguez, Chen Bo Calvin Zhang, Ziwen Han, Udari Madhushani Sehwag, Yash Maurya, Christina Q Knight, Harry R. Lloyd, Florence Bacus, Conor Downey, Mantas Mazeika, Bing Liu, Yejin Choi, Mitchell L Gordon, Sydney Levine

机构 * University of Washington(华盛顿大学) New York University(纽约大学) Scale AI Harvard University(哈佛大学) University of Michigan(密歇根大学) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Center for AI Safety(人工智能安全中心) Stanford University(斯坦福大学) MIT(麻省理工学院) University of Oxford(牛津大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MoReBench基准,包含1000个道德场景和超过2.3万条标准,用于评估语言模型在道德推理中的程序性推理能力,发现现有基准无法预测模型表现,且模型对特定道德框架存在偏好。

Comments 46 pages, 8 figures, 10 tables. Published in ICLR 2026. Accepted at CHAI workshop and SPP 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25450 2026-06-12 cs.AI 版本更新 70%

Cross-Model Disagreement as a Label-Free Correctness Signal

跨模型分歧作为无标签正确性信号

Matt Gorbett, Suman Jana

机构 * Independent Researcher(独立研究者) Department of Computer Science Columbia University(计算机科学系哥伦比亚大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 提出跨模型分歧作为无标签正确性指标,通过验证模型对生成模型答案的困惑度或熵来检测错误,无需训练或标签,在多个基准上优于模型内不确定性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21563 2026-06-12 cs.AI 版本更新 70%

Counterfactual Credit Policy Optimization for Multi-Agent Collaboration

多智能体协作的反事实信用策略优化

Zhongyi Li, Wan Tian, Jinju Chen, Huiming Zhang, Yang Liu, Yikun Ban, Fuzhen Zhuang

机构 * Beihang University(北航) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 针对多智能体大语言模型协作中信用分配难题,提出CCPO框架,通过反事实信用估计和验证器锚定的自评估两种分配器,将团队奖励转化为个体学习信号,提升数学推理任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2605.02249 2026-06-12 cs.AI 版本更新 70%

A Study of Belief Revision Postulates in Multi-Agent Systems (Extended Version)

多智能体系统中信念修正公设的研究(扩展版)

Michael Thielscher, Tran Cao Son

机构 * University of New South Wales(新南威尔士大学) New Mexico State University(新墨西哥州立大学)

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究认知规划中的信念修正问题,将经典AGM信念修正公设推广到多智能体环境,提出广义全交多智能体信念修正算子,并讨论迭代修正公设的推广及事件模型修正算子。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27628 2026-06-12 cs.AI cs.CY cs.ET cs.MA cs.SY eess.SY 版本更新 57%

Intelligence as Managed Autonomy: Failure, Escalation, and Governance for Agentic AI Systems

智能作为受管自主:代理型AI系统的失败、升级与治理

Srini Ramaswamy

机构 * DNRS.ai USA(DNRS.ai美国公司)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SMARt模型,通过形式化能力检测认知漂移、暂停推理、尝试恢复并在可靠性下降时放弃控制,以解决自主AI系统中的幻觉和持续不合理行为问题。

Comments This peer-reviewed paper is to appear in the Journal of Intelligent and Robotic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 5 篇

2606.04474 2026-06-12 cs.CL eess.AS 版本更新 90%

Entity Binding Failures in Speech LLM Reasoning: Diagnosis and Chain-of-Thought Intervention

语音大模型推理中的实体绑定失败:诊断与思维链干预

Ming-Hao Hsu, Xiaohai Tian, Jun Zhang, Zhizheng Wu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(1 数据科学学院,香港中文大学(深圳)) ByteDance, China(2 字节跳动,中国)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 本文通过诊断语音大模型在逻辑推理中的实体绑定失败问题,提出实体感知思维链方法,显著提升推理准确率。

Comments INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20306 2026-06-12 cs.HC 版本更新 78%

Structured Visualization Design Knowledge for Grounding Generative Reasoning and Situated Feedback

结构化可视化设计知识:用于基础生成推理和情境反馈

Péter Ferenc Gyarmati, Dominik Moritz, Torsten Möller, Laura Koesten

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 提出一种结构化方案,将可视化设计知识编码为带语义元数据的自然语言指南,支持专家编写、机器查询,并嵌入向量空间以分析冲突和跨领域原则,弥补符号系统与生成模型之间的鸿沟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05972 2026-06-12 cs.DC 版本更新 78%

DWM-RO: Decentralized World Models with Reasoning Offloading for SWIPT-enabled Satellite-Terrestrial HetNets

DWM-RO:面向支持SWIPT的卫星-地面异构网络的去中心化世界模型与推理卸载

Guangyuan Liu, Yinqiu Liu, Ruichen Zhang, Nan Ma, Jiawen Kang, Sumei Sun, Abbas Jamalipour, Ping Zhang

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 针对SWIPT卫星-地面异构网络中多智能体强化学习样本效率低和协调性差的问题,提出去中心化世界模型与推理卸载框架,通过想象策略训练和边缘协调机制实现快速收敛、高谱效和低约束违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11479 2026-06-12 cs.LG cs.AI cs.MA 版本更新 62%

Grammar of the Wave: Towards Explainable Multivariate Time Series Event Detection via Neuro-Symbolic VLM Agents

波的语法:通过神经符号VLM智能体实现可解释的多变量时间序列事件检测

Sky Chenwei Wan, Yifei Y. Wang, Tianjun Hou, Xiqing Chang, Aymeric Jan

机构 * AI Lab, SLB(SLB人工智能实验室) Télécom Paris, Institut Polytechnique de Paris, France(巴黎电信学院,巴黎高等理工学院,法国)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出语言引导的时间序列事件检测(TSED)任务,通过事件逻辑树(ELT)将文本描述转化为结构化时序逻辑,并构建神经符号VLM智能体SELA,实现零/少样本事件检测与可解释推理。

Comments 8 pages (main text), 28 pages total including appendix. 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02274 2026-06-12 q-bio.QM cs.AI 版本更新 57%

Contextual Invertible World Models: A Neuro-Symbolic Agentic Framework for Colorectal Cancer Drug Response

上下文可逆世界模型:用于结直肠癌药物反应的神经符号智能框架

Christopher Baker, Tianyu Ren, Karen Rafferty, Hui Wang

机构 * School of Electronics, Electrical Engineering and Computer Science(电子工程与计算机科学学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 提出上下文可逆世界模型(CIWM),结合机器学习模拟器与大语言模型推理层,通过逆推理进行CRISPR扰动,揭示KRAS突变在5-氟尿嘧啶耐药中的主导作用及PIK3CA修复的意外效应。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 3 篇

2604.11009 2026-06-12 cs.HC 版本更新 78%

From Planning to Revision: How AI Writing Support at Different Stages Alters Ownership

从规划到修订:不同阶段的人工智能写作支持如何改变所有权感

Katy Ilonka Gero, Tao Long, Carly Schnitzler, Paramveer Dhillon

专题命中 规划推理 :planning(title,abstract)

AI总结 研究AI写作支持在规划、起草和修订阶段对作者所有权感的影响,发现任何AI辅助都会降低所有权感,但规划阶段影响最小,起草阶段影响最大,且AI贡献的文本和想法越多,所有权感越低。

Journal ref In Designing Interactive Systems Conference (DIS 26). June 13-17, 2026, Singapore, Singapore

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29906 2026-06-12 cs.LG 版本更新 57%

Plan, Don't Pose: Long Composite Motion Generation with Text-Aligned BFM

计划,而非摆姿势:基于文本对齐的BFM的长复合运动生成

Nikolay Shvetsov, Maksim Bobrin, Nazar Buzun, Anton Bozhedarov, Dmitry V. Dylov

机构 * AvaCapo Potsdam University(波茨坦大学) Applied AI Institute(应用人工智能研究所) Computational Imaging Lab(计算成像实验室) AXXX Innopolis University(因诺波利斯大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 提出Text2BFM框架,通过将自然语言与预训练行为基础模型对齐,在潜在策略空间中实现长复合运动生成,无需端到端运动生成器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04888 2026-06-12 cs.LG 版本更新 57%

Retrieval-Augmented Foundation Models for Water Level Prediction in the Everglades

用于大沼泽地水位预测的检索增强基础模型

Rahuul Rangaraj, Jimeng Shi, Rajendra Paudel, Giri Narasimhan, Yanzhao Wu

机构 * Florida International University(佛罗里达国际大学) Everglades National Park(大沼泽地国家公园)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 针对大沼泽地水位预测,提出检索增强机制,利用统计相似性或互信息检索历史水文事件,提升预训练时序基础模型的长期预测性能,尤其在极端事件中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 8 篇

2603.06652 2026-06-12 cs.CV cs.AI 版本更新 79%

PaLMR: Towards Faithful Visual Reasoning via Multimodal Process Alignment

PaLMR: 通过多模态过程对齐实现忠实视觉推理

Yantao Li, Qiang Hui, Chenyang Yan, Kanzhi Cheng, Fang Zhao, Chao Tan, Huanling Gao, Jianbing Zhang, Kai Wang, Xinyu Dai, Shiguo Lian

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Data Science & Artificial Intelligence Research Institute, China Unicom(中国unicom数据科学与人工智能研究院) Unicom Data Intelligence, China Unicom(中国unicom数据智能)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出PaLMR框架,通过感知对齐数据层和过程对齐优化层,减少推理幻觉并提升视觉推理忠实度,在多个基准上取得最优结果。

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08983 2026-06-12 cs.RO 版本更新 78%

AssemLM: A Spatial Reasoning Multimodal Large Language Model for Robotic Assembly

AssemLM: 用于机器人装配的空间推理多模态大语言模型

Zhi Jing, Jinbin Qiao, Ouyang Lu, Jicong Ao, Shuang Qiu, Huazhe Xu, Yu-Gang Jiang, Chenjia Bai

机构 * Fudan University(复旦大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) Tianjin University(天津大学) Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学) City University of Hong Kong(香港城市大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出AssemLM,一种融合装配手册、点云和文本指令的多模态大语言模型,通过专用点云编码器提取几何与旋转特征,实现精确的6D装配位姿推理,并构建含90万样本的AssemBench基准,在真实机器人装配任务中取得最优性能。

Comments Project Page: https://assemlmhome.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03896 2026-06-12 cs.CV cs.RO 版本更新 67%

GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert

GAE: 利用可泛化动作专家释放VLM的物理潜力

Mingyu Liu, Zheng Huang, Xiaoyi Lin, Muzhi Zhu, Canyu Zhao, Yating Wang, Haoyi Zhu, Hao Chen, Chunhua Shen

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 提出通用动作专家(GAE),通过稀疏几何接口将VLM的高层意图转化为连续动作轨迹,采用动作预训练-点云微调(APPF)方案解耦动作动力学与几何基础,实现跨视觉域、视角和指令的强泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07106 2026-06-12 cs.CV cs.AI cs.CL 版本更新 62%

Ex-Omni: Enabling 3D Facial Animation Generation for Omni-modal Large Language Models

Ex-Omni:为全模态大语言模型赋能3D面部动画生成

Haoyu Zhang, Zhipeng Li, Yiwen Guo, Tianshu Yu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) LIGHTSPEED Independent Researcher(独立研究员)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出Ex-Omni模型,通过混合形状感知语音单元生成器和解码器解耦语义推理与时间生成,并引入统一令牌查询门控融合机制,实现全模态大语言模型同步生成语音和3D面部动画。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16713 2026-06-12 cs.CV cs.AI 版本更新 57%

GeoWorld-VLM: Geometry from World Models for Vision-Language Models

GeoWorld-VLM:从世界模型中获取几何结构用于视觉-语言模型

Renjie Gu, Kaichen Zhou, Yan Luo, Mengyu Wang

机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室) Kempner Institute for the Study of Natural and Artificial Intelligence(凯普纳自然与人工智能研究 institute) Harvard University(哈佛大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 GeoWorld-VLM通过将冻结的摄像机条件视频世界模型的几何结构转移到视觉-语言模型中,提升空间关系推理能力,实验显示在两个不同架构上均提升了约4%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01621 2026-06-12 cs.CV cs.RO 版本更新 50%

Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation

Goal2Pixel: 将目标锚定到像素以实现视觉语言导航

Muyi Bao, Yuxin Cai, Hang Xu, Zongtai Li, Jinxi He, Jingfan Tang, Chen Lv, Ji Zhang, Yaqi Xie, Wenshan Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出Goal2Pixel范式,通过将连续环境中的视觉语言导航(VLN-CE)重新定义为可导航像素锚定,利用图像平面作为统一空间接口,预测可见导航像素并反投影为3D航点,结合可见性感知关键帧记忆和坐标感知辅助损失,在减少VLM调用次数的同时实现竞争性性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17221 2026-06-12 cs.CV cs.RO 版本更新 50%

QueryOcc: Query-based Self-Supervision for 3D Semantic Occupancy

QueryOcc:基于查询的3D语义占据自监督方法

Adam Lilja, Ji Lan, Junsheng Fu, Lars Hammarstrand

机构 * Chalmers University of Technology(查尔姆斯理工大学) Zenseact

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出QueryOcc,一种基于查询的自监督框架,通过相邻帧的4D时空查询直接学习连续3D语义占据,利用视觉基础模型或激光雷达数据提供监督,并引入收缩场景表示以在恒定内存下实现远程监督,在Occ3D-nuScenes基准上语义RayIoU提升26%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05430 2026-06-12 cs.RO 版本更新 50%

Active Semantic Perception

主动语义感知

Huayi Tang, Pratik Chaudhari

机构 * General Robotics, Automation, Sensing and Perception (GRASP) Laboratory(通用机器人、自动化、传感与感知实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出一种基于紧凑多层场景图和大语言模型的主动语义感知方法,用于高效探索未知环境,在仿真和真实机器人上验证了优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 4 篇

2507.08794 2026-06-12 cs.LG cs.CL 版本更新 62%

One Token to Fool LLM-as-a-Judge

一个令牌就能欺骗LLM裁判

Yulai Zhao, Haolin Liu, Dian Yu, Sunyuan Kung, Meijia Chen, Haitao Mi, Dong Yu

机构 * Princeton University(普林斯顿大学) University of Virginia(弗吉尼亚大学) Tencent AI Lab(腾讯人工智能实验室) Rutgers University(罗格斯大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 发现基于参考的生成式奖励模型易受奖励黑客攻击,表面输入(如非词符号或通用推理开头)能持续引发假阳性奖励,提出使用截断模型输出作为对抗性负例的数据增强策略,构建鲁棒的Master奖励模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26940 2026-06-12 cs.CL 版本更新 57%

Select to Think: Unlocking SLM Potential with Local Sufficiency

Select to Think: 利用局部充分性解锁小语言模型潜力

Wenxuan Ye, Yangyang Zhang, Xueli An, Georg Carle, Yunpu Ma

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 提出Select to Think (S2T)方法,通过将大语言模型角色从生成转为选择,并蒸馏选择逻辑到小语言模型,使其在推理时无需依赖大模型,显著提升性能。

Comments Accepted to ICML 2026. Code is available at https://github.com/YeRona/Select-to-Think

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25787 2026-06-12 cs.CV 版本更新 50%

Self-Evolving Vision-Language Models for Image Quality Assessment via Voting and Ranking

自进化视觉语言模型用于图像质量评估:基于投票与排序

Wen Wen, Tianwu Zhi, Kanglong Fan, Yang Li, Xinge Peng, Yabin Zhang, Yiting Liao, Junlin Li, Li Zhang

机构 * City University of Hong Kong(香港城市大学) ByteDance Inc.(字节跳动公司)

专题命中 测试时计算 :reasoning(abstract)

AI总结 提出EvoQuality框架,通过自一致性生成伪标签,利用群体相对策略优化迭代提升VLM的图像质量感知能力,无监督下在多个IQA基准上超越监督方法。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21561 2026-06-12 cs.CV 版本更新 50%

Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning

通过逐步偏好调优的多模态智能体迭代工具使用探索

Pengxiang Li, Zhi Gao, Bofei Zhang, Yapeng Mi, Xiaojian Ma, Chenrui Shi, Tao Yuan, Yuwei Wu, Yunde Jia, Song-Chun Zhu, Qing Li

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) Harbin Institute of Technology(哈尔滨工业大学) Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University(广东机器感知与智能计算实验室,深圳MSU-BIT大学) Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 测试时计算 :verifier(abstract)

AI总结 提出SPORT方法,通过任务合成、步骤采样、步骤验证和偏好调优的迭代循环,使多模态智能体无需预收集数据即可自主探索和优化工具使用策略,在GTA和GAIA基准上分别提升6.41%和3.64%。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 复杂问题求解 3 篇

2604.27960 2026-06-12 cs.AI 版本更新 88%

LLMs as ASP Programmers: Self-Correction Enables Task-Agnostic Nonmonotonic Reasoning

LLMs 作为 ASP 程序员:自我纠正实现任务无关的非单调推理

Adam Ishay, Joohyung Lee

机构 * Arizona State University(亚利桑那州立大学) Samsung Research(三星研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(title,abstract);分类 cs.AI

AI总结 提出 LLM+ASP 框架,通过自我纠正循环将自然语言转化为回答集程序,实现无需任务特定工程的非单调推理,在多个基准上优于 SMT 方法。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18307 2026-06-12 cs.CL 版本更新 79%

Reasoning Models Know What's Important, and Encode It in Their Activations

推理模型知道什么重要,并在其激活中编码

Yaniv Nikankin, Martin Tutek, Tomer Ashuach, Jonathan Rosenfeld, Yonatan Belinkov

机构 * Technion(技术离子大学) University of Zagreb, FER(扎格雷布大学,FER) MIT(麻省理工学院) Kempner Institute, Harvard(哈佛大学凯普纳研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 通过分析模型激活而非仅依赖推理链文本,发现激活能更有效识别关键推理步骤,且模型在生成后续步骤前已内部编码步骤重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21570 2026-06-12 cs.AI cs.RO 版本更新 57%

From Digital to Physical: Digital Agents as Autonomous Coaches for Physical Intelligence

从数字到物理:数字代理作为物理智能的自主教练

Zixing Lei, Genjia Liu, Yuanshuo Zhang, Qipeng Liu, Yuzhu Cai, Sixiang Chen, Jixian Wu, Yunhong Wang, Weixin Li, Chuan Wen, Bo Zhao, Shanghang Zhang, Wenzhao Lian, Siheng Chen

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) Zhongguancun Academy, Beijing, China(中关村学院) School of Integrated Circuits, Shanghai Jiao Tong University, Shanghai, China(上海交通大学集成电路学院) School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院多媒体信息处理国家重点实验室)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 提出EmboCoach-Bench基准,评估LLM代理自主设计具身策略的能力,通过迭代调试和优化,代理在平均成功率上超越人工基线26.5%,并具备自我修正能力。

Comments 53 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 推理评测 11 篇

2602.14367 2026-06-12 cs.CL cs.AI cs.IR cs.LG 版本更新 82%

InnoEval: On Research Idea Evaluation as a Knowledge-Grounded, Multi-Perspective Reasoning Problem

InnoEval:将研究思路评估视为基于知识的多视角推理问题

Shuofei Qiao, Yunxiang Wei, Xuehai Wang, Bin Wu, Boyang Xue, Ningyu Zhang, Hossein A. Rahmani, Yanshan Wang, Qiang Zhang, Keyan Ding, Jeff Z. Pan, Huajun Chen, Emine Yilmaz

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出InnoEval框架,通过异构深度知识检索和多视角评审委员会,实现基于知识的多维度解耦评估,在点对点、成对和分组评估任务中优于基线方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02627 2026-06-12 cs.AI 版本更新 79%

DecompSR: A dataset for decomposed analyses of compositional multihop spatial reasoning

DecompSR:用于组合多跳空间推理分解分析的数据集

Lachlan McPheat, Navdeep Kaur, Robert Blackwell, Alessandra Russo, Anthony G. Cohn, Pranava Madhyastha

机构 * The Alan Turing Institute(艾伦·图灵研究所) Imperial College London(帝国理工学院伦敦分校) The University of Leeds(利兹大学) City St George’s University of London(伦敦城市圣乔治大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出DecompSR数据集(超500万数据点),通过程序化生成独立控制组合性的多个方面(如推理深度、语言变异性),用于细粒度评估大语言模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏