arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 2976 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 909 篇

2511.23276 2026-07-15 cs.LG cs.MA 版本更新 70%

Auditable Context-Aware HFMD Forecasting with Structured LLM Agents

基于结构化大语言模型代理的可审计上下文感知手足口病预测

Joongwon Chae, Runming Wang, Chen Xiong, Gong Yunhan, Lian Zhang, Ji Jiansong, Dongmei Yu, Peiwu Qin

机构 * Institute of Biomedicine and Health Engineering, Tsinghua Shenzhen International Graduate School (SIGS), Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院生物医学与健康工程学院) The Fifth Affiliated Hospital of Wenzhou Medical University, Lishui 323000, China(温州医科大学第五附属医院) Hengqin Laboratory, Zhuhai, China(横琴实验室) The First Hospital of Hebei Medical University, Shijiazhuang, China(河北医科大学第一医院)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.LG

AI总结 研究针对手足口病预测,提出双代理神经符号框架,由基于大语言模型的事件解释器和预测生成器组成,通过摄取异构信号并结合历史病例数进行预测,在两个数据集评估中实现有竞争力的点准确性、可靠区间及可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09322 2026-07-14 cs.AI 版本更新 70%

LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making

LongMedBench:用于长期临床决策的医疗智能体基准测试

Zihan Xu, Yanzhen Chen, Xiaocheng Zhang, Zhiting Fan, Weiqi Zhai, Hongxia Xu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Transvascular Implantation Devices Research Institute(血管内植入装置研究所)

专题命中 规划决策 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 介绍基于EHR的LongMedBench基准,用于长期临床决策。构建含多患者多事件数据集,提出评估分类法。实验表明大语言模型在隐式时间推理有挑战,RAG和智能体记忆系统对信息检索有帮助,决策任务性能依赖模型即时上下文。

Comments Submitted manuscript prior to peer review in MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11678 2026-07-14 cs.CL 版本更新 70%

Can AI Reason Like an Urban Planner? Benchmarking Large Language Models Against Professional Judgment

AI能像城市规划师一样推理吗?基于专业判断的大语言模型基准测试

Yijie Deng, He Zhu, Wen Wang, Junyou Su, Minxin Chen, Wenjia Zhang

机构 * School of Architecture and Urban Planning, Shenzhen University(深圳大学建筑与城市规划学院) Shenzhen Key Laboratory of Urban Spatial Information and Intelligent Modeling(深圳市城市空间信息与智能建模重点实验室) Department of Urban Planning and Design, The University of Hong Kong(香港大学城市规划与设计系)

专题命中 规划决策 :planning(abstract,abstract_cn);分类 cs.CL

AI总结 提出UPBench框架,通过4×5知识支柱与认知水平矩阵评估25个LLM,发现模型在分析任务上优于事实回忆和综合判断,揭示了规划知识的制度依赖性。

Comments This paper has been withdrawn by the authors because the current version requires substantial revision and further validation before it can be considered a reliable representation of the work

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00860 2026-07-08 cs.LG 版本更新 70%

Policy Improvement Reinforcement Learning

策略改进强化学习

Huaiyang Wang, Xiaojie Li, Xiaohan Wang, Zhixia Zhang, Xiaodong Lu, Zixuan Huang, Jiajun Chai, Guojun Yin, Deqing Wang, Haoyi Zhou, Yaodong Yang, Jianxin Li, Yikun Ban

机构 * Beihang University(北航) Peking University(北京大学)

专题命中 规划决策 :agent(abstract);tool-use(abstract);分类 cs.LG

AI总结 提出策略改进强化学习(PIRL)框架,通过最大化跨迭代的累积策略改进来替代替代奖励最大化,并基于此设计策略改进策略优化(PIPO)算法,实现闭环优化,在数学推理基准上提升稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17649 2026-07-08 cs.CV cs.AI cs.RO 版本更新 70%

SWITCH: Benchmarking Modeling and Handling of Tangible Interfaces in Long-horizon Embodied Scenarios

SWITCH:在长时程具身场景中评估和处理具象接口的基准测试

Juntao Cheng, Wanyue Zhang, Zhiwei Yu, Shuo Ren, Zheqi He, Shaoxuan Xie, Guocai Yao, Jieru Lin, Börje F. Karlsson, Jiajun Zhang

专题命中 规划决策 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 SWITCH基准测试通过1170个时间交互视频,评估具象接口在真实第一人称环境中的闭环交互推理,揭示多模态模型在细粒度视觉-时间感知、结果验证和错误恢复方面的不足。

Comments The dataset is available at https://huggingface.co/datasets/BAAI-Agents/SWITCH

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26720 2026-07-07 cs.RO cs.AI 版本更新 70%

SutureFormer: Learning Surgical Trajectories via Goal-conditioned Offline RL in Pixel Space

SutureFormer: 通过像素空间中的目标引导离线强化学习学习手术轨迹

Huanrong Liu, Chunlin Tian, Tongyu Jia, Tailai Zhou, Qin Liu, Yu Gao, Yutong Ban, Yun Gu, Guy Rosman, Xin Ma, Qingbiao Li

机构 * University of Macau(澳门大学) The Chinese PLA General Hospital(中国人民解放军总医院) Duke University(杜克大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出SutureFormer,一种基于目标引导的离线强化学习框架,通过稀疏标注到密集奖励信号的插值,有效学习手术针轨迹预测,减少平均位移误差58.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18558 2026-06-29 cs.CV cs.AI 版本更新 70%

HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering

HiMu: 面向长视频问答的分层多模态帧选择

Dan Ben-Ami, Gabriele Serussi, Kobi Cohen, Chaim Baskin

机构 * INSIGHT Lab, Ben-Gurion University of the Negev, Israel(本-古里安内盖夫大学INSIGHT实验室,以色列) Ben-Gurion University of the Negev, Israel(本-古里安内盖夫大学,以色列)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出HiMu框架,通过文本LLM将查询分解为层次逻辑树,由视觉和音频专家处理原子谓词,经模糊逻辑算子组合生成连续帧满意度曲线,在16帧预算下达到帧选择方法的最优精度,并作为即插即用模块提升多种MLLM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07883 2026-06-16 cs.AI 版本更新 70%

ToolSelf: Unifying Task Execution and Self-Reconfiguration via Tool-Driven Emergent Adaptation

ToolSelf: 通过工具驱动的涌现适应统一任务执行与自我重构

Jingqi Zhou, Sheng Wang, Dezhao Deng, Junwen Lu, Junwei Su, Qintong Li, Jiahui Gao, Hao Wu, Jiyue Jiang, Lingpeng Kong, Dunhong Jin, Chuan Wu

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出ToolSelf框架,将配置更新抽象为标准化工具接口,统一任务执行与自我重构,并采用配置感知两阶段训练(CAT)实现涌现适应性,在多种基准测试中平均超越静态配置基线28.8分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17640 2026-06-09 stat.AP cs.SE 版本更新 70%

huff: A Python package for Market Area Analysis

huff:用于市场区域分析的Python包

Thomas Wieland

专题命中 规划决策 :planning(abstract);workflow(abstract);分类 cs.SE

AI总结 huff包提供市场区域分析的完整流程,包括数据导入、OD矩阵构建、模型分析、参数估计和可视化,适用于经济地理学和健康地理学研究。

Comments v1.2.1; added references, update of scientific usage and PyPI usage statistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20936 2026-08-14 physics.soc-ph nlin.AO 版本更新 67%

Empathy Modeling in Active Inference Agents for Perspective-Taking and Alignment

主动推断代理中的共情建模:用于视角转换与对齐

Mahault Albarracin, Hongju Pae, Philip Wilson, Anna Mikeda, Alejandro Jimenez-Rodriguez, Sanjeev V. Namjoshi, Harshil Shah

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 该研究提出了一种基于主动推断的共情框架,通过视角转换实现稳定合作,揭示了共情结构对社会协调的关键作用。

Comments Code and data: https://doi.org/10.5281/zenodo.21908008

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04923 2026-08-13 cs.LG cs.AI cs.CL 版本更新 67%

Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning

基于评分标准的强化学习中的奖励黑客行为的复现、分析与检测

Xuekang Wang, Zhuoyuan Hao, Shuo Hou, Hao Peng, Juanzi Li, Xiaozhi Wang

机构 * Tsinghua University(清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Xi’an Jiaotong University(西安交通大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出可控黑客环境CHERRL,通过注入已知偏见复现奖励黑客行为,分析其可发现性与可利用性,并探索基于智能体的自动检测方法。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21412 2026-08-12 cs.AI cs.CL cs.SE 版本更新 67%

Euclid-MCP: A Model Context Protocol Server for Deterministic Logical Reasoning via Prolog

欧几里得-MCP:一个通过Prolog进行确定性逻辑推理的模型上下文协议服务器

Bartolomeo Bogliolo

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 研究针对大型语言模型多步逻辑推理不可靠问题,提出开源的欧几里得-MCP服务器,通过引入欧几里得-IR及支持特定循环的工具接口实现确定性逻辑推理,经评估在处理大问题时效果优于LLMs,可作稳定推理基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15777 2026-08-12 cs.HC 版本更新 67%

UXCascade: Scalable Usability Testing with Simulated User Agents

UXCascade: 可扩展的可用性测试与模拟用户代理

Steffen Holter, Eunyee Koh, Mustafa Doga Dogan, Gromit Yeuk-Yin Chan

专题命中 规划决策 :agent(abstract);workflow(abstract)

AI总结 UXCascade通过多级分析工作流程,帮助从业者在早期界面开发中实现迭代反馈,通过提取、汇总和展示代理生成的可用性反馈,支持可操作的设计改进。

Comments 10 pages, 7 figures, accepted at UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02311 2026-08-11 econ.EM q-fin.RM q-fin.ST 版本更新 67%

AI Governance for Institutional Readiness in Finance

金融领域机构准备状态的AI治理

Irene Aldridge, Steve Krawciw

专题命中 规划决策 :agentic(abstract,abstract_cn)

AI总结 针对金融领域智能体AI治理滞后于部署的问题,本文提出四层可计算AI治理框架,通过实证研究验证其有效性并给出90天实施序列,明确跨主体风险控制的可转移措施。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15596 2026-08-11 cs.CR 版本更新 67%

From Neural Intent to Cryptographic Authorization: Securing AI-Driven Enterprise Workflows

从神经意图到加密授权:管理智能代理工作流程

Jiasi Weng, Jian Weng, Minrong Chen, Ming Li, Jia-Nan Liu, Zhi Li, Yue Zhang

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 研究人工智能驱动的智能代理工作流程中的安全问题,提出神经加密服务(NCS),通过神经符号设计,在大语言模型代理和特权工具间构建安全治理平面,经实验评估,能大幅降低攻击成功率,转变代理安全验证方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00376 2026-08-11 cs.AI cs.CL cs.LG 版本更新 67%

The Deterministic Horizon: When Extended Reasoning Fails and Tool Delegation Becomes Necessary

确定性视界:当扩展推理失败时工具委托变得必要

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文通过注意力瓶颈定理和确定性视界概念,证明解码器-only注意力在确定性状态追踪任务中存在信息论容量限制,导致扩展推理性能退化,并指出当视界超过19-31时工具委托成为必要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11522 2026-08-10 cs.HC 版本更新 67%

Asymmetric Trust Effects of Corrective AI in Expert Advisory Workflows under Epistemic Dependence

人工智能参与对专家咨询工作流中信任的影响

Dennis Kim, Roya Daneshi, Bruce Draper, Sarath Sreedharan

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 研究探讨人工智能在专家咨询工作流中对用户信任的影响,发现人类专家使用AI的方式会影响用户对专业知识的信任。

Comments Revised version. Accepted to AIES 2026. Includes technical appendices and additional analyses

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00028 2026-08-10 cs.CL cs.AI cs.LG cs.SI 版本更新 67%

Harnessing the Synergy between LLM Agents and Knowledge Graphs for Urban Socioeconomic Prediction

利用大语言模型智能体与知识图谱的协同作用进行城市社会经济预测

Zhilun Zhou, Jingyang Fan, Yu Liu, Fengli Xu, Depeng Jin, Yong Li

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究提出LLM智能体与知识图谱的协同框架,结合二者优势完成城市社会经济预测,经实验验证该协同设计可提升预测效果,为跨任务信息共享提供思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18124 2026-07-31 physics.ao-ph 版本更新 67%

Long-range near-surface wake signatures of offshore wind farm clusters revealed by satellite observations

卫星观测揭示海上风电场集群的远距离近地面尾流特征

Rui Li, Jincheng Zhang, Xiaowei Zhao

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 该研究利用7122幅Sentinel-1A/B SAR图像,揭示海上风电场近地面尾流可超100公里、平均降速0.990 m/s,还观测到跨国界尾流相互作用,为尾流特征提供大规模观测表征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13431 2026-07-30 cs.SD 版本更新 67%

Text2Score: Generating Sheet Music From Textual Prompts

Text2Score:从文本提示生成乐谱

Keshav Bhandari, Sungkyun Chang, Abhinaba Roy, Francesca Ronchini, Emmanouil Benetos, Dorien Herremans, Simon Colton

机构 * Queen Mary University of London(伦敦女王学院) Singapore University of Technology and Design(新加坡科技设计大学) Politecnico di Milano(米兰理工大学) EmotionWave(情绪波)

专题命中 规划决策 :planning(abstract);agentic(abstract)

AI总结 本文提出Text2Score框架,通过规划和执行阶段生成乐谱,利用符号XML数据直接生成监督信号,优于其他方法。

Comments 9 pages including references, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16497 2026-07-28 cs.LG cs.AI cs.CL 版本更新 67%

daVinci-kernel: Co-Evolving Skill Selection, Summarization, and Utilization via RL for GPU Kernel Optimization

daVinci-kernel:通过强化学习协同进化技能选择、总结与利用的GPU内核优化

Dayuan Fu, Mohan Jiang, Tongyu Wang, Dian Yang, Jiarui Hu, Liming Liu, Jinlong Hou, Pengfei Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出daVinci-kernel框架,通过强化学习联合训练技能选择、策略生成和技能总结三个智能体,共享LLM骨干,实现GPU内核优化,在KernelBench上超越先前最优模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15591 2026-07-27 cs.IR 版本更新 67%

RecGPT-V3 Technical Report

RecGPT-V3技术报告

Bowen Zheng, Chao Yi, Dian Chen, Gaoyang Guo, Han Zhu, Jiakai Tang, Jian Wu, Mao Zhang, Wen Chen, Yifan Lu, Yujie Luo, Yuning Jiang, Zhujin Gao, Bo Zheng, Chenchi Zhang, Dixuan Wang, Hao Fang, Jiancai Liu, Jing Yu, Junjun Zheng, Ke Chen, Kewei Zhu, Mengyan Li, Mingke Xu, Wenjun Yang, Xiangheng Kong, Xinming Zhang, Xunke Xi, Zile Zhou

专题命中 规划决策 :agent(abstract);multi-agent(abstract)

AI总结 研究针对大规模运行RecGPT的挑战,提出RecGPT-V3这一有状态混合模态推荐系统。通过内存中心、混合模态基础模型和潜在意图推理等方法,在淘宝“猜你喜欢”推荐中取得多指标提升及资源消耗降低的成果。

Comments Technique Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03920 2026-07-21 cs.RO 版本更新 67%

LH-AVLN: A Benchmark for Long-Horizon Audio-Visual-Language Navigation

LH-AVLN:长距离视听语言导航基准测试

Rufeng Chen, Yue Chang, Zili Shao, Zhaofan Zhang, Li Chen, Hechang Chen, Hui Xiong, Sihong Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Jilin University(吉林大学)

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 介绍长距离视听语言导航基准LH-AVLN,结合多目标任务执行等。提出免训练参考智能体PAG-Nav,可维护语义地图并规划。实验表明现有智能体完成任务有困难,PAG-Nav提供更强诊断基线。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19541 2026-07-21 cs.MA cs.HC 版本更新 67%

FOCAL: Filtered On-device Continuous Activity Logging for Efficient Personal Desktop Summarization

FOCAL:过滤的本地连续活动日志用于高效的个人桌面摘要

Haoran Yin, Zhiyuan Wen, Jiannong Cao, Bo Yuan, Ruosong Yang

专题命中 规划决策 :agent(abstract);multi-agent(abstract)

AI总结 FOCAL通过多代理系统实现高效的本地桌面流摘要,减少资源消耗并提升任务召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04020 2026-07-20 cs.CV 版本更新 67%

Paired Uterine Whole-Slide Images and Pathology Reports for Multimodal Computational Pathology

用于多模态计算病理学的配对子宫全切片图像和病理报告

Han Li, Jingsong Liu, Ayako Ura, Junlin Hou, Zhengyang Xu, Azar Kazemi, Oskar Thaeter, Christian Grashei, Fabian Gülhan, Reza Nasirigerdeh, Xun Ma, Rui Yan, Hao Chen, S. Kevin Zhou, Nassir Navab, Carolin Mogler, Peter Schüffler

机构 * Institute of Pathology, Technical University of Munich(慕尼黑工业大学病理研究所) Computer Aided Medical Procedures (CAMP), Technical University of Munich(慕尼黑工业大学计算机辅助医疗程序(CAMP)) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Department of Human Pathology, Juntendo University Graduate School of Medicine(顺天堂大学医学研究生院人体病理学部) The Hong Kong University of Science and Technology(香港科技大学) Munich Data Science Institute (MDSI)(慕尼黑数据科学研究所)

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 研究子宫疾病病理诊断,针对全切片图像与病理报告配对数据集稀缺问题,引入TUM-Uteria数据集,含多对病例及切片级配对,经验证,为计算病理学研究提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17253 2026-07-15 cs.AR 版本更新 67%

PDAGENT-BENCH: Characterizing, Grounding, and Architecting LLM/VLM Agents for VLSI Physical Design

PDAGENT-BENCH: 用于VLSI物理设计的LLM代理的特征化、基础化与架构化

Qiufeng Li, Rongqian Chen, Quan Cheng, Chengxuan Wang, Sizhe Tang, Chia-Tung Ho, David Z. Pan, Tian Lan, Weidong Cao

专题命中 规划决策 :workflow(abstract);agentic(abstract)

AI总结 提出PDAGENT-BENCH基准,用于评估LLM/VLM代理在VLSI物理设计中的能力,涵盖任务级和工作流级评估,揭示模型在工具执行和长程推理上的局限,并验证人类技能增强工作流的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16726 2026-07-15 cs.MA 版本更新 67%

Bridging Individual and Collective Realism in LLM-Based Human Mobility Simulation via Mobility Scaling-Law Guidance

通过共享数据中的移动度量引导基于LLM的人群移动模拟

Hua Yan, Heng Tan, Yu Yang

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 M2LSimu通过共享数据中的移动度量引导多提示调整,有效提升基于LLM的人群移动模拟的群体协调与真实性

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19954 2026-07-07 cs.AI cs.CL cs.LG 版本更新 67%

On the Ability of Transformers to Verify Plans

Transformer 在验证计划能力上的表现

Yash Sarrof, Yupei Du, Katharina Stein, Alexander Koller, Sylvie Thiébaux, Michael Hahn

机构 * Saarland University(萨尔兰大学) Australian National University(澳大利亚国立大学) University of Toulouse / LAAS-CNRS(图卢兹大学 / LAAS-CNRS)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究分析了解码器-only模型验证计划的能力,提出C*-RASP框架以保证序列长度和词汇量增长时的泛化能力,发现某些经典规划领域中Transformer能有效学习验证长计划。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28805 2026-07-02 cs.RO 版本更新 67%

Physics Models for Sim-to-Real Transfer in Professional-Level Robot Table Tennis

面向专业级机器人乒乓球的仿真到现实迁移的物理模型

Christian Conti, Bilan Yang, Alexander Sigrist, Lorenzo Miele, Yamen Saraiji, Peter Dürr, Naoya Takahashi

机构 * Sony AI, Tokyo, Japan(索尼人工智能,东京,日本) Sony AI, Zürich, Switzerland(索尼人工智能,苏黎世,瑞士)

专题命中 规划决策 :agent(abstract);AI agent(abstract)

AI总结 提出空气动力学、球桌碰撞和球拍接触的物理模型,精确捕捉高速高旋球行为,首次训练出能与专业选手对战的机器人乒乓球AI智能体。

Comments 8 pages, 7 figures, additional information: https://ace.ai.sony/, Submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23946 2026-06-23 cs.LG cs.AI cs.CL stat.ML 版本更新 67%

Explore-Execute Chain: Towards an Efficient Structured Reasoning Paradigm

探索-执行链:迈向高效的结构化推理范式

Kaisen Yang, Tinghe Zhang, Rushi Shah, Kaicheng Yang, Qinwei Ma, Dianbo Liu, Alex Lamb

机构 * Qizhi Institute(启智研究院) Dept. of Computer Science, Tsinghua University(清华大学计算机科学系) College of AI, Tsinghua University(清华大学人工智能学院) Engineering Department, National University of Singapore(新加坡国立大学工程系) Dept. of Automation, Shanghai Jiao Tong University(上海交通大学自动化系) IIIS, Tsinghua University(清华大学人工智能研究院) College of Software, Northeastern University(东北大学软件学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出探索-执行链(E²C),将推理分为随机探索阶段(生成简洁高层计划)和确定性执行阶段(忠实执行计划),通过因果SFT和RL训练分离,在AIME'2024上以更少token超越思维树,并支持轻量领域适应。

详情

展开后加载摘要…

URL PDF HTML 收藏