arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-04 至 2026-08-04 共收录 99 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 10 篇

2512.10739 2026-08-04 cs.CL cs.AI 版本更新 88%

Intern-S1-MO: Long-horizon Reasoning Agent for Olympiad?Level Mathematical Problem Solving

长周期推理代理用于竞赛级数学问题求解

Yuzhe Gu, Songyang Gao, Zijian Wu, Lingkai Kong, Wenwei Zhang, Zhongrui Cai, Fan Zheng, Tianyou Ma, Junhao Shen, Haiteng Zhao, Duanyang Zhang, Huilun Zhang, Kuikun Liu, Chengqi Lyu, Yanhui Duan, Chiyu Chen, Ningsheng Ma, Jianfei Gao, Han Lyu, Dahua Lin, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) MMLab The Chinese University of Hong Kong(香港中文大学) ICMAT Spanish National Research Council(西班牙国家科研 council) The High School Affiliated to Renmin University of China(中国人民大学附属高中) Ren Hui Academy of Beijing(北京润辉学院)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Intern-S1-MO,通过多轮分层推理和OREAL-H框架,突破IMO级数学问题的上下文限制,实现26/35分的优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21600 2026-08-04 cs.AI 版本更新 79%

CORE: Collaborative Reasoning via Cross Teaching

CORE:通过交叉教学实现协同推理

Kshitij Mishra, Mirat Aubakirov, Martin Takac, Nils Lukas, Salem Lahlou

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 CORE通过交叉教学实现协同推理,利用模型互补性提升推理性能,无需扩大模型规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26644 2026-08-04 cs.AI 版本更新 70%

When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling

何时投票,何时重写:基于分歧的策略路由用于测试时扩展

Zhimin Lin, Yixin Ji, Jinpeng Li, Yu Luo, Dong Li, Junhua Fang, Juntao Li, Min Zhang

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Department of Foundation Model, 2012 Labs, Huawei(华为2012实验室基础模型部门) Harbin Institute of Technology, Shenzhen (HITSZ)(哈尔滨工业大学深圳(哈工大深圳))

专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本文提出基于输出分歧的策略路由方法,通过动态选择不同扩展策略提升数学推理任务的准确性,减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20639 2026-08-04 cs.CL cs.AI cs.LG 版本更新 67%

Latent Collaboration in Multi-Agent Systems

多智能体系统中的潜在协作

Jiaru Zou, Ruizhong Qiu, Gaotang Li, Xiyuan Yang, Katherine Tieu, Pan Lu, Ke Shen, Hanghang Tong, Yejin Choi, Jingrui He, James Zou, Mengdi Wang, Ling Yang

机构 * University of Washington(华盛顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LatentMAS框架,使LLM智能体在连续潜在空间直接协作,无需文本中介,实现更高精度、更低开销和更快推理。

Comments ICML2026 Spotlight, Project: https://github.com/Gen-Verse/LatentMAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07725 2026-08-04 cs.CL cs.AI 版本更新 62%

SOD: Step-wise On-policy Distillation for Small Language Model Agents

SOD:分步式在线蒸馏用于小型语言模型代理

Qiyong Zhong, Mao Zheng, Mingyang Song, Xin Lin, Jie Sun, Houcheng Jiang, Xiang Wang, Junfeng Fang

机构 * Zhejiang University(浙江大学) Large Language Model Department, Tencent(腾讯大语言模型部门) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对小型语言模型中工具集成推理的稳定性问题,提出SOD分步式在线蒸馏框架,通过动态调整蒸馏强度缓解教师信号误导,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07475 2026-08-04 cs.CL cs.LG 版本更新 62%

A Comparative analysis of Layer-wise Representational Capacity in AR and Diffusion LLMs

对AR和扩散LLM中逐层表示能力的比较分析

Raghavv Goel, Risheek Garrepalli, Sudhanshu Agrawal, Chris Lott, Mingu Lee, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文比较了AR和扩散LLM的表示能力,发现扩散模型产生更全局的表示,而AR模型产生紧密耦合的局部表示,扩散训练引入深度冗余以实现原理性压缩。

Comments v4: improving writing and adding Qwen2.5-Instruct results with all v3 changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11133 2026-08-04 cs.LG cs.CL 版本更新 62%

Just on Time: Token-Level Early Stopping for Diffusion Language Models

准时完成:扩散语言模型的标记级早期停止

Zakhar Kohut, Severyn Shykula, Mykola Vysotskyi, Serhii Dmytryshyn, Dmytro Khamula, Michal Zakrzewski, Damian Rynczak, Jacek Małecki, Taras Rumezhak, Volodymyr Karpiv

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种无需训练的标记级早期停止方法,通过动态确定标记收敛点,减少扩散步骤并提升生成效率。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26246 2026-08-04 cs.LG 版本更新 57%

Weak-to-Strong On-Policy Distillation

弱到强在线策略蒸馏

Fangxu Yu, Weijia Xu, Michael Xu, Tianyi Zhou, Zinan Lin

机构 * University of Maryland(马里兰大学) Microsoft Research(微软研究院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出W2S-OPD框架,从多个弱模型蒸馏提升强学生模型,在数学、代码基准测试中优于OPD,可让学生超越领域教师,监督源更弱时仍能提升性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22186 2026-08-04 cs.AI 版本更新 57%

Deconstructing Off-Policy Ratios: Entropy-Scaled Trust Regions for Asynchronous Reinforcement Learning

解构离策略比率:用于异步强化学习的熵缩放信任区域

Guanqun Zhao, Zijun Xie, Binbin Zheng, Enlei Gong, Jiafeng Lu, Yehan Yang, Aoqi Hu, Zeyu Chen

机构 * Baidu(百度)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究异步强化学习中离策略数据问题,提出熵缩放信任区域(ESTR)方法,通过令牌局部熵缩放离策略偏差,无需辅助前向传递等,在多任务和基准测试中优于现有异步方法,提升训练-推理一致性与速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21994 2026-08-04 cs.LG 版本更新 57%

Prefix-Guided On-Policy Distillation: Mining Golden Trajectories from Rollouts

前缀引导的在线策略蒸馏:从轨迹中挖掘黄金轨迹

Qingfei Zhao, Huan Song, Shuyu Tian, Jiawei Shao, Xuelong Li

机构 * TeleAI Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 针对在线策略蒸馏在长程数学推理中效率低、噪声大的问题,提出前缀引导的在线策略蒸馏,通过前缀长度估计轨迹价值,仅对高重叠候选继续生成长轨迹,在多个基准上提升准确率并减少训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2605.13077 2026-08-04 cs.MA cs.AI 版本更新 79%

Counterfactual Reasoning for Causal Responsibility Attribution in Probabilistic Multi-Agent Systems

反事实推理在概率多智能体系统中的因果责任归因

Chunyan Mu, Muhammad Najib

机构 * University of Aberdeen(阿伯丁大学) Heriot-Watt University(赫瑞瓦特大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出基于反事实推理的因果责任归因方法,利用Shapley值确保公平性和一致性,构建了支持责任感知多智能体系统验证与策略推理的框架,并通过纳什均衡计算稳定策略配置。

Comments Accepted at IJCAI 2026. This is the full version containing all proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09806 2026-08-04 cs.DL cond-mat.mtrl-sci cs.AI 版本更新 57%

An Autonomous Scientific Knowledge Generation Framework for AI-Driven Scientific Discovery

一种用于人工智能驱动科学发现的自主科学知识生成框架

Dibakar Datta

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出自主科学知识生成框架,整合多种技术将科学出版物转化为适用于人工智能的知识库,以电光材料为例进行验证,实现从文献到知识库的转变,为人工智能驱动的科学发现提供了可扩展、领域独立的基础。

Comments 32 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 4 篇

2606.11385 2026-08-04 cs.CV 版本更新 75%

DeceptionX: From Multimodal Evidence to Explainable Deception Detection

DeceptionX: 基于多模态大语言模型的可解释欺骗检测

Jiayu Zhang, Shuo Ye, Jiajian Huang, Yawen Cui, Taorui Wang, Wei Xia, Zeheng Wang, Haowen Tang, Yelin Wang, Hui Ma, Zitong Yu

机构 * Great Bay University(大湾区大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract)

AI总结 提出DeceptionX框架,将欺骗检测从黑箱分类转变为可解释的观察-思考-总结推理过程,通过构建DeceptChain数据集和三阶段训练管道,在标准基准上超越现有方法,同时提供专家级可解释推理路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10880 2026-08-04 cs.CV 版本更新 71%

Chart Specification: Structural Representations for Incentivizing VLM Reasoning in Chart-to-Code Generation

图表规范:用于促进VLM在图表到代码生成中推理的结构表示

Minggui He, Mingchen Dai, Jian Zhang, Yilun Liu, Shimin Tao, Pufan Zeng, Osamu Yoshie, Yuya Ieiri

机构 * Waseda University(早稻田大学) University of Science and Technology of China(中国科学技术大学) NanKai University(南开大学)

专题命中 逻辑推理 :reasoning(title)

AI总结 本文提出图表规范,通过结构化中间表示提升VLM在图表到代码生成中的结构保真度,实验显示其在数据效率和性能上优于现有方法。

Comments Accepted by Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17999 2026-08-04 cs.AI cs.CV 版本更新 57%

Do Maps Still Matter for Machines: Revisiting the Role of Choropleth Maps in Foundation Model Spatial Understanding

地图对机器来说仍然重要吗:重新审视分级统计图在基础模型空间理解中的作用

Zhiwei Wei, Yonghe Sun, Zhenjia Liu, Wenjia Xu, Chao He, Weihua Dong, Chunbo Liu, Hua Liao

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨分级统计图对基础模型空间理解的作用,引入ChoroplethMap-Bench基准,在三种输入条件下评估22个模型,发现地图能显著提升空间推理,尤其结合符号数据及高层次空间模式理解任务时,证明地图是基础模型空间推理的重要外部表示。

Comments 34 pages, 4 figures, and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01132 2026-08-04 cs.CL 版本更新 57%

Don't Judge a Book by its Cover: Testing LLMs' Robustness Under Logical Obfuscation

不要只看封面判断一本书:测试LLMs在逻辑混淆下的鲁棒性

Abhilekh Borah, Shubhra Ghosh, Kedar Joshi, Aditya Kumar Guru, Kripabandhu Ghosh

机构 * Manipal University Jaipur(马纳普大学贾普尔分校) Indian Institute of Technology, Patna(印度理工学院帕坦分校) Indian Institute of Science Education and Research, Kolkata(印度科学教育与研究学院科钦分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出Logifus框架和LogiQAte基准,测试LLMs在逻辑混淆下的鲁棒性,发现混淆显著降低模型性能,揭示当前LLMs缺乏深度理解。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 21 篇

2607.17082 2026-08-04 cs.AI cs.CL cs.LG 版本更新 85%

OTAP: Structure-Aware Optimal Transport for Evaluating Planning and Execution in Agent Trajectories

Otap:用于评估智能体轨迹中规划与执行的结构感知最优传输

Babak Barazandeh, Subhabrata Majumdar, George Michailidis

专题命中 规划推理 :planning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究智能体轨迹评估问题,将其重新定义为执行图与有效解决方案图的距离,通过不平衡融合Gromov-Wasserstein传输问题实例化得到\otap{}分数,该分数可区分有效与无效轨迹,对保持依赖的重新排序不变且对冗余步骤有界敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03270 2026-08-04 cs.RO cs.AI 版本更新 83%

Grounded Vision-Language Interpreter for Long-Horizon Bimanual Task and Motion Planning

用于长 horizon 双臂任务与运动规划的接地视觉语言解释器

Jeremy Siburian, Keisuke Shirai, Cristian C. Beltran-Hernandez, Masashi Hamaya, Michael Görner, Atsushi Hashimoto

机构 * OMRON SINIC X Corporation(OMRON SINIC X公司) The University of Tokyo(东京大学) University of Hamburg(汉堡大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 针对现有视觉语言机器人规划框架的黑箱缺陷与双臂任务探索不足问题,提出混合规划框架 ViLaIn-TAMP,经烹饪领域任务及实际双臂机器人系统验证,其性能优于基准方法。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12244 2026-08-04 cs.RO 版本更新 82%

Any House Any Task: Scalable Long-Horizon Planning for Abstract Human Tasks

任何房屋任何任务:为抽象人类任务的可扩展长周期规划

Zhihong Liu, Yang Li, Rengming Huang, Cewu Lu, Panpan Cai

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 AHAT是一种优化长周期规划的家庭任务规划器,通过结合LLM和TGPO算法,在复杂家庭任务中实现高效规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03519 2026-08-04 cs.CL cs.AI 版本更新 81%

TS-Reasoner: Aligning Time Series Foundation Models with LLM Reasoning

TS-Reasoner:将时间序列基础模型与大语言模型推理能力对齐

Fangxu Yu, Hongyu Zhao, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 TS-Reasoner通过两阶段训练将时间序列基础模型与大语言模型对齐,在多个基准上性能优于同类模型且数据效率更高,解决了时间序列模型推理能力不足的问题。

Comments Accepted to Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08876 2026-08-04 cs.LG 版本更新 79%

OTora: A Unified Red Teaming Framework for Reasoning-Level Denial-of-Service in LLM Agents

OTora:一种用于LLM代理推理层面拒绝服务攻击的统一红队框架

Xinyu Li, Ronghui Mu, Lin Li, Tianjin Huang, Gaojie Jin

机构 * Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系) Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 OTora是首个统一的两阶段红队框架,用于实现推理层面拒绝服务攻击,通过优化对抗触发器和生成代理感知的推理负载,提升推理token数量和延迟,同时保持任务准确性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02104 2026-08-04 cs.RO 版本更新 78%

ACDC: Adaptive Curriculum Planning with Dynamic Contrastive Control for Goal-Conditioned Reinforcement Learning in Robotic Manipulation

ACDC:基于动态对比控制的自适应课程规划用于机器人操控的面向目标强化学习

Xuerui Wang, Guangyu Ren, Tianhong Dai, Bintao Hu, Shuangyao Huang, Wenzhang Zhang, Hengyan Liu

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出ACDC方法,结合自适应课程规划与动态对比控制,提升机器人操控任务中的样本效率和任务成功率。

Comments Withdrawn by the authors after identifying inconsistencies between the described adaptive curriculum and the implementation used to generate the reported experiments, particularly in the success-rate feedback mechanism and replay-weight schedule. These issues require the experiments and conclusions to be reevaluated

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06716 2026-08-04 cs.AI cs.CL cs.CR 版本更新 73%

SIEVE: Selective Integrity Verification and Escalation for Defending LLM Agents against Indirect Prompt Injection

认知控制架构(CCA):一种用于鲁棒对齐AI代理的生命周期监督框架

Zhibo Liang, Tianze Hu, Zaiye Chen, Mingjie Tang

机构 * Sichuan University(四川大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出认知控制架构(CCA),通过全生命周期认知监督框架,有效应对复杂IPI攻击,实现安全、功能与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23590 2026-08-04 cs.AI 版本更新 70%

Co-ReAct: Rubrics as Step-Level Collaborators for ReAct Agents

Co-ReAct:作为ReAct智能体逐步协作者的评分准则

Jiazheng Kang, Bowen Zhang, Zixin Song, Jiangwang Chen, Xiao Yang, Da Zhu, Guanjun Jiang

机构 * Qwen Applications Business Group of Alibaba(阿里巴巴文勤应用业务组) Tsinghua University(清华大学)

专题命中 规划推理 :reasoning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 提出Co-ReAct框架,通过训练专用评分准则生成器,在推理时逐步指导ReAct智能体的行动选择,显著提升搜索密集型多步推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05110 2026-08-04 cs.CY cs.AI 版本更新 70%

ApplE: A Modular Ontology of Applied Ethics and Event Context for Ethical Decision Modeling

ApplE:用于伦理决策建模的应用伦理与事件上下文模块化本体

Aisha Aijaz, Raghava Mutharaju, Manohar Kumar

专题命中 规划推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 该研究提出模块化应用伦理本体ApplE,采用改进SAMOD构建,结合伦理理论与事件上下文,经医疗用例验证,遵循FAIR原则,可用于伦理AI系统等的建模资源。

Comments Accepted at ER2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15671 2026-08-04 cs.RO 版本更新 67%

Long-Term Memory for VLA-based Agents in Open-World Task Execution

基于VLA的智能体长期记忆在开放世界任务执行中的应用

Xu Huang, Weixin Mao, Yinhao Li, Hua Chen, Jiabao Zhao

机构 * Nanjing University(南京大学) LimX Dynamics(LimX 动态)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出ChemBot框架,通过双层记忆和MCP服务器提升复杂化学实验中的任务执行效率与安全性。

Comments Added references

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15395 2026-08-04 cs.RO 版本更新 67%

Foundation Models in Robotics: A Comprehensive Review of Methods, Models, Datasets, Challenges and Future Research Directions

机器人中的基础模型:方法、模型、数据集、挑战及未来研究方向的全面综述

Aggelos Psiris, Vasileios Argyriou, Evangelos K. Markakis, Panagiotis Sarigiannidis, Efstratios Gavves, Kostas Bekris, Arash Ajoudani, Georgios Th. Papadopoulos

机构 * Department of Informatics and Telematics, Harokopio University of Athens(信息与电信系,哈罗科比欧大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文综述了机器人中基础模型的发展,涵盖方法、模型、数据集、挑战及未来方向,分析了不同阶段的研究演变及关键方面。

Journal ref Transactions on Machine Learning Research (TMLR), 07/2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17218 2026-08-04 cs.LG cs.AI 版本更新 62%

Learning Graph-Indexed Trajectory Patterns for Stochastic On-Time Arrival Routing

基于历史感知决策变换器的通用策略梯度用于图信号上的可靠路由

Yuanhang Wang, Xing Wei, Duoxiang Zhao, Zezhou Zhang, Hao Qin, Yuqi Ouyang

机构 * Sichuan University-Pittsburgh Institute(四川大学匹兹堡研究院) Sichuan University(四川大学) College of Computer Science(计算机科学学院) University College Dublin(都柏林大学) School of Electrical and Electronic Engineering(电子与电气工程学院) School of Electronics and Information Engineering(电子与信息工程学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GPG-HT框架,通过整合决策变换器和通用策略梯度优化,解决随机交通网络中考虑不确定和相关旅行时间的问题,提升可靠路由性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10226 2026-08-04 cs.LG cs.AI 版本更新 62%

Self-Evolving Recommendation System: End-To-End Autonomous Model Optimization With LLM Agents

自进化推荐系统:基于LLM代理的端到端自主模型优化

Haochen Wang, Yi Wu, Daryl Chang, Li Wei, Lukasz Heldt

机构 * Google Inc(谷歌公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于LLM代理的自进化推荐系统,通过端到端自动化流程自主优化模型,提升开发效率和性能。

Comments RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13084 2026-08-04 cs.LG cs.AI 版本更新 62%

Belief-Contraction-Driven Active Inverse Source Localization and Characterization

基于信念收缩的主动逆源定位与表征

Yiwei Shi, Mengyue Yang, Qi Zhang, Cunjia Liu, Weinan Zhang, Weiru Liu

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对动态场主动逆源定位与表征问题,提出信念收缩驱动的ATT-PFRL方法,统一推断、停止与控制,在多场景下较基线方法实现更高完成度、更快收敛与更准定位。

详情

展开后加载摘要…

URL PDF HTML 收藏