arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-28 至 2026-07-28 共收录 109 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 7 篇

2505.12650 2026-07-28 cs.CV cs.AI 版本更新 86%

AutoMat: Enabling Automated Crystal Structure Reconstruction from Microscopy via Agentic Tool Use

AutoMat:通过智能工具使用实现从显微镜图像自动重建晶体结构

Yaotian Yang, Yiwen Tang, Yizhe Chen, Xiao Chen, Jiangjie Qiu, Hao Xiong, Haoyu Yin, Zhiyao Luo, Yifei Zhang, Sijia Tao, Wentao Li, Qinghua Zhang, Yuqiang Li, Wanli Ouyang, Bin Zhao, Xiaonan Wang, Fei Wei

专题命中 工具调用 :agentic(title,abstract);tool use(title);分类 cs.AI

AI总结 研究旨在从有噪声的STEM投影重建晶体结构,提出AutoMat智能控制器,通过闭环验证和多模块组合实现。引入基准数据集评估,结果显示其性能优于现有方法,建立了从微观到原子尺度建模的途径。

Comments The code and dataset are publicly available at https://github.com/yyt-2378/AutoMat and https://huggingface.co/datasets/yaotianvector/STEM2Mat

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09515 2026-07-28 cs.CL 版本更新 83%

SERM: Self-Evolving Relevance Model with Agent-Driven Learning from Massive Query Streams

SERM:具有代理驱动学习的自演化相关性模型

Chenglong Wang, Canjia Li, Xingzhao Zhu, Yifu Huo, Huiyu Wang, Weixiong Lin, Yun Yang, Qiaozhi He, Tianhua Zhou, Xiaojia Chang, Jingbo Zhu, Tong Xiao

机构 * Northeastern University, Shenyang, China(东北大学,沈阳,中国) ByteDance(字节跳动) Peking University(北京大学)

专题命中 工具调用 :agent(title,abstract);multi-agent(abstract);分类 cs.CL

AI总结 针对大规模查询流中相关性模型泛化能力不足的问题,SERM通过多代理模块检测分布偏移并生成可靠标签,实现迭代自演化提升性能。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05382 2026-07-28 cs.CV cs.AI 版本更新 79%

Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation

超越可教内容的搜索:拓展智能体视觉生成的知识边界

Haozhe Wang, Weijia Feng, Jinpeng Yu, Che Liu, Ping Nie, Fangzhen Lin, Jiaming Liu, Ruihua Huang, Jimmy Lin, Wenhu Chen, Cong Wei

机构 * Hong Kong University of Science and Technology(香港科技大学) University of Waterloo(滑铁卢大学) Qwen Applications(通义千问应用) Imperial College London(帝国理工学院)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 针对视觉生成器的世界知识瓶颈,构建专用数据集与基准,提出教-搜协同训练框架定位动态知识边界,实现知识驱动的可迭代视觉生成性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13653 2026-07-28 cs.CV cs.RO 版本更新 75%

Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation

探索性、交流性和可部署性:用于开放世界移动操作的视觉驱动具身智能体

Boyu Mi, Mengchen Ma, Yifei Yao, Xing Gao, Junting Chen, Yangzi Li, Zihou Zhu, Guohao Li, Zhenfei Yin, Tai Wang, Yao Mu, Jiangmiao Pang, Hanqing Wang

专题命中 工具调用 :agent(abstract);tool-use(abstract);agentic(abstract)

AI总结 研究针对具身智能体现实部署难题,提出REAL框架,通过建立一致环境API、设计任务组合优化性能,引入REAL - Bench评估。实验显示其智能体在交互式任务中表现出色,在物理机器人上也实现高成功率,弥合现实差距。

Comments Accepted to ECCV 2026. 57 pages. Code available at https://github.com/InternRobotics/REAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18037 2026-07-28 cs.AI cs.CL cs.MA 版本更新 62%

ProvenanceGuard: Source-Aware Factuality Verification for MCP-Based LLM Agents

ProvenanceGuard: 基于MCP的LLM智能体的源感知事实性验证

Ander Alvarez, Santhiya Rajan, Samuel Mugel, Román Orús

机构 * Multiverse Computing Parque Cientifico y Tecnológico de Gipuzkoa(吉普斯夸科技园) Centre for Social Innovation(社会创新中心) Donostia International Physics Center(多诺斯蒂亚国际物理中心) Ikerbasque Foundation for Science(伊克尔巴斯克科学基金会)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出ProvenanceGuard,一种源感知验证器,通过追踪MCP工具调用、分解声明并路由到特定源,检测跨源混淆错误,在医疗领域数据集上优于源无关基线。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04560 2026-07-28 cond-mat.stat-mech 版本更新 50%

Control protocols for harmonically confined run-and-tumble particles

谐振约束跑- tumble 粒子的控制协议

Marco Baldovin, Alessandro Manacorda

专题命中 工具调用 :agent(abstract)

AI总结 研究通过谐振约束下的跑- tumble 粒子模型,提出时变控制协议以实现系统状态转换,并分析最小工作量的最优策略。

Comments 14 pages, 9 figures

Journal ref Phys. Rev. E 114, 014112 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15132 2026-07-28 cs.DC 版本更新 50%

Black Hole Search by Scattered Agents in Dynamic Rings

动态环中分散智能体的黑洞搜索

Giuseppe Antonio Di Luna, Paola Flocchini, Giuseppe Prencipe, Nicola Santoro

专题命中 工具调用 :agent(abstract)

AI总结 研究在动态1 - 区间连通环中用移动石子通信的分散智能体搜索黑洞问题,证明三个智能体足以在\(O(n^2)\)步内识别黑洞,此数量最优且复杂度边界紧,即便有更强通信机制也需\(\Omega(n^2)\)步。

Comments arXiv admin note: text overlap with arXiv:2005.07453

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 34 篇

2509.06278 2026-07-28 cs.AI 版本更新 89%

TableMind: An Autonomous Programmatic Agent for Tool-Augmented Table Reasoning

TableMind: 一种用于工具增强表格推理的自主程序化代理

Chuang Jiang, Mingyue Cheng, Xiaoyu Tao, Qingyang Mao, Jie Ouyang, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 规划决策 :agent(title,abstract);autonomous agent(abstract);tool-use(abstract);planning(abstract)

AI总结 TableMind通过两阶段训练策略提升表格推理能力,实现自主程序化代理的高效推理与代码生成。

Comments Comments: 10 pages, 6 figures. Submitted to WSDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06550 2026-07-28 cs.CR cs.AI 版本更新 86%

SkillSieve: A Hierarchical Triage Framework for Detecting Malicious AI Agent Skills

SkillSieve:一种用于检测恶意AI代理技能的分层分流框架

Yinghan Hou, Zongyou Yang

机构 * Department of Earth Science and Engineering(地球科学与工程系) Imperial College London(帝国理工学院伦敦分校) Department of Computer Science(计算机科学系) University College London(伦敦大学学院) Lingban Technology Co., Ltd.(灵伴科技有限公司) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 规划决策 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 提出SkillSieve三层检测框架,通过启发式评分、LLM子任务分析和多LLM陪审团辩论,高效检测恶意AI代理技能,在390个技能基准上达到F1=0.920。

Comments 10 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22083 2026-07-28 cs.AI cs.CL 版本更新 86%

Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model

南贝格4.2 - 3B:以紧凑模式解锁智能体能力

Nanbeige Lab, :, Chen Yang, Chengrui Huang, Fufeng Lan, Hanhui Chen, Hao Zhou, Huatong Song, Jiaqi Cao, Jiaying Zhu, Jinlin Niu, Kai Wang, Lisheng Huang, Qiliang Liang, Ran Le, Ruixiang Feng, Shuang Sun, Tao Gu, Tao Zhang, Tianyu Luo, Yang Song, Yun Xing, Yuntao Wen, Ziyao Xu, Zongchao Chen, Zongqiang Li

机构 * Nanbeige LLM Lab(南北贝大语言模型实验室)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 介绍南贝格4.2 - 3B紧凑通用智能体模型,通过特定预训练方式构建,利用多种强化学习方法提升质量与效率,在多任务和基准测试中表现出色,优于更大模型,有潜力成为紧凑本地个人助手。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21013 2026-07-28 cs.AI cs.CV 版本更新 85%

EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization

EmoAgent-R1:基于强化学习的动态智能体专业化实现多模态情感理解

Lihuang Fang, Yuchen Zou, kebing Jin, Jinghui Qin

机构 * Guangdong University of Technology(广东工业大学) Southern University of Science and Technology(南方科技大学) Xi’an Jiaotong University(西安交通大学) Guizhou Provincial Laboratory of Big Data, State Key Laboratory of Public Big Data, Guizhou University(贵州大学大数据省级重点实验室、公共大数据国家重点实验室)

专题命中 规划决策 :agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 研究针对现有多模态情感识别方法忽视情感源动态性和复杂性的问题,提出基于强化学习的动态智能体专业化框架EmoAgent-R1,采用冷启动策略和两步智能体工作流程训练,并用P-GRPO优化,实验证明其在情感推理性能和优化稳定性上更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19182 2026-07-28 cs.DC 版本更新 82%

ARBITER: Guarded Agentic Control for SLO-Oriented Kubernetes Remediation

ARBITER:面向服务水平目标的Kubernetes修复的受保护代理控制

Pooyan Habibi, Alberto Leon-Garcia

专题命中 规划决策 :agentic(title,abstract);planning(abstract)

AI总结 研究在Kubernetes微服务上维护SLO的难题,提出ARBITER受保护控制平面,构建因果资源图等,分离规划与执行,支持多种规划方式。通过实验评估其在选择修复操作和下游目标等方面的效果,展示了优于HPA/仅资源控制的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10547 2026-07-28 eess.SY cs.SY math.OC 版本更新 82%

Semi-on-Demand Off-Peak Transit Services with Shared Autonomous Vehicles -- Service Planning, Simulation, and Analysis in Munich, Germany

基于共享自动驾驶车辆的半按需非高峰公交服务——德国慕尼黑的服务规划、模拟与分析

Max T. M. Ng, Roman Engelhardt, Florian Dandl, Vasileios Volakakis, Hani S. Mahmassani, Klaus Bogenberger

专题命中 规划决策 :planning(title,abstract);agent(abstract)

AI总结 研究基于共享自动驾驶车辆的半按需非高峰公交服务,结合分析建模与模拟方法,探讨德国慕尼黑十条公交线路的服务规划等关键问题,发现SAV可提高服务质量,验证了分析模型,明确最佳SoD设置及过渡阶段的情况。

Comments 38 pages, 10 figures, accepted for publication in Transportation Research Part C: Emerging Technologies. A previous version was presented at the 104th Transportation Research Board Annual Meeting, Washington, D.C

Journal ref Transportation Research Part C: Emerging Technologies, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22465 2026-07-28 cs.AI cs.LG cs.MA 版本更新 81%

TRACE-ROUTER: Task-Consistent and Adaptive Online Routing for Agentic AI

TRACE-ROUTER:用于智能AI的任务一致且自适应的在线路由

Ritik Raj, Souvik Kundu, Sarbartha Banerjee, Dheemanth Joshi, Ishita Vohra, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院) Intel(英特尔公司) Texas A&M University(德克萨斯农工大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对企业AI中现有路由决策与智能应用任务级结果不匹配问题,提出TRACE-Router任务级路由框架,利用上下文博弈、终端奖励更新策略,在多基准测试中改善准确性-延迟权衡,取得较好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03383 2026-07-28 cs.AI 版本更新 79%

GeoDecider: An Evidence-Grounded Agent for Geological Interpretation via Deliberative Reasoning

GeoDecider:一种通过审慎推理进行地质解释的基于证据的智能体

Xiaoyu Tao, Mingyue Cheng, Jiahao Wang, Yitong Zhou, Qingyang Mao, Yimin Dou, Qi Liu, Shijin Wang, Enhong Chen

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 针对地质解释任务中不同地下单元测井响应相似、准确解释依赖多因素且现有方法固定流程的问题,提出GeoDecider智能体,先数值预测,再对困难区间工具辅助推理,经构建证据概况等流程,实验证明其优于基线,凸显相关方法的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18080 2026-07-28 cs.CV cs.AI 版本更新 79%

Sparse Evidence Can Suffice: Agentic Evidence Seeking for Multimodal Video Misinformation Detection

稀疏证据就足够了:用于多模态视频错误信息检测的智能证据搜索

Haochen Zhao, Yongxiu Xu, Xinkui Lin, Dong Xie, Jiarui Lu, Yuqi Qian, Yubin Wang, Hongbo Xu, Gaopeng Gou

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.AI

AI总结 研究多模态视频错误信息检测,提出SIEVE框架,通过智能体探索多模态证据构建证据包,由验证器判断真实性。智能体经特殊训练,实验表明该框架性能优于基线,能提供可检查证据线索,提升检测透明度与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05387 2026-07-28 cs.CV cs.LG 版本更新 79%

Parallel Swin Transformer-Enhanced 3D MRI-to-CT Synthesis for MRI-Only Radiotherapy Planning

并行Swin Transformer增强的3D MRI到CT合成用于仅MRI放疗规划

Zolnamar Dorjsembe, Hung-Yi Chen, Furen Xiao, Hsing-Kuo Pao

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 本文提出并行Swin Transformer增强的Med2Transformer架构,通过结合卷积编码与双Swin Transformer分支,提高MRI到CT合成的图像质量和几何精度,实现仅MRI的放疗规划。

Comments This preprint has been accepted for publication in the proceedings of the IEEE 23rd International Symposium on Biomedical Imaging (ISBI 2026). The final published version is available at https://doi.org/10.1109/ISBI61048.2026.11515734. The copyright for this work has been transferred to IEEE

Journal ref Proceedings of the 23rd IEEE International Symposium on Biomedical Imaging (ISBI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06989 2026-07-28 cs.RO cs.SY eess.SY 版本更新 78%

Ace! Motion Planning of Professional-Level Table Tennis Serves with a Robot Arm

王牌!用机器人手臂进行专业水平乒乓球发球的运动规划

Guillem Torrente, Guilherme Jorge Maeda, Divij Grover, Megumu Tsukamoto, Hamdi Sahloul, Peter Dürr

机构 * Sony AI, Tokyo, Japan(索尼人工智能,东京,日本) Sony AI, Zürich, Switzerland(索尼人工智能,苏黎世,瑞士) Sony Group Corporation, Tokyo, Japan(索尼集团公司,东京,日本)

专题命中 规划决策 :planning(title,abstract)

AI总结 研究乒乓球机器人发球问题,结合运动原语、模型预测控制和贝叶斯优化方法,实现符合官方规则发球,自旋高达550rad/s,速度达6.7m/s,表现与精英球员相当甚至更优。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26017 2026-07-28 cs.RO 版本更新 78%

G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance

G2DP: 基于时空网格引导的扩散规划

Hang Yu, Ye Jin, Alessandro Canevaro, Julian Schmidt, Julian Jordan, Peizheng Li, Marc Kaufeld, Silvan Lindner, Johannes Betz, Wilhelm Stork

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) TU Munich(慕尼黑工业大学) University of Tübingen(图宾根大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 针对自动驾驶扩散规划器随机性导致的安全与路线保持问题,提出G2DP,通过可微时空代价体积在去噪过程中注入密集梯度,实现无碰撞与路径最优的轨迹生成,在nuPlan等基准上取得最优性能。

Comments 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05863 2026-07-28 math.OC 版本更新 78%

Bus Fleet Electrification Planning Through Logic-Based Benders Decomposition and Restriction Heuristics

通过逻辑-贝纳茨分解和限制启发式进行公交车队电气化规划

Robin Legault, Filipe Cabral, Xu Andy Sun

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出了一种多期优化框架,结合逻辑-贝纳茨分解和限制启发式,用于公交车队电气化规划,实现高效决策和高质量解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04763 2026-07-28 cs.LG cs.AI cs.CL stat.ML 版本更新 75%

Multi-Turn On-Policy Distillation with Prefix Replay

基于前缀重放的多轮在线策略蒸馏

Baohao Liao, Hanze Dong, Christof Monz, Xinxing Xu, Li Dong, Furu Wei

机构 * Microsoft Research(微软研究院) University of Amsterdam(阿姆斯特丹大学)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究用于智能体任务的在线策略蒸馏,提出重放前缀在线策略蒸馏方法,复用预收集教师轨迹作重放前缀,解决多轮在线策略蒸馏的前缀陷阱问题,提高效率且保持或提升精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20790 2026-07-28 math.OC 版本更新 71%

Charge Schedule Optimization and Infrastructure Planning for Solar-Integrated Electric Bus Transit Systems

太阳能集成电动公交系统的充电计划优化与基础设施规划

Rito Brata Nath, Madhusudan Baldua, Vivek Vasudeva, Tarun Rambha

专题命中 规划决策 :planning(title)

AI总结 研究城市太阳能集成电动公交系统的充电计划与基础设施规划问题,提出考虑多种因素的两阶段多场景模型,用Benders分解法求解,经实际数据验证,能有效节省成本并更好适应季节变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00031 2026-07-28 cs.SE 版本更新 70%

Git Context Controller: Manage the Context of LLM-based Agents like Git

Git Context Controller: 管理基于LLM的代理的上下文像Git一样

Junde Wu, Minhao Hu, Jiayuan Zhu, Jiazhen Pan, Yuyuan Liu, Min Xu, Yueming Jin

专题命中 规划决策 :agent(abstract);tool use(abstract);分类 cs.SE

AI总结 Git-Context-Controller通过版本化文件系统管理LLM代理上下文,提升多轨迹问题解决能力,在SWE-Bench等基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16497 2026-07-28 cs.LG cs.AI cs.CL 版本更新 67%

daVinci-kernel: Co-Evolving Skill Selection, Summarization, and Utilization via RL for GPU Kernel Optimization

daVinci-kernel:通过强化学习协同进化技能选择、总结与利用的GPU内核优化

Dayuan Fu, Mohan Jiang, Tongyu Wang, Dian Yang, Jiarui Hu, Liming Liu, Jinlong Hou, Pengfei Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出daVinci-kernel框架,通过强化学习联合训练技能选择、策略生成和技能总结三个智能体,共享LLM骨干,实现GPU内核优化,在KernelBench上超越先前最优模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24625 2026-07-28 cs.LG cs.AI 版本更新 62%

AutoFed: Personalized Federated Traffic Prediction via Adaptive Prompt

AutoFed: 通过自适应提示实现个性化联邦交通预测

Zijian Zhao, Yitong Shang, Sen Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AutoFed框架,通过自适应提示学习实现个性化联邦交通预测,解决传统联邦学习在非独立同分布数据下的不足,无需手动调参,提升交通预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11912 2026-07-28 cs.LG cs.AI 版本更新 62%

How Transformers Learn to Plan via Multi-Token Prediction

Transformer 如何通过多令牌预测学习规划

Jianhao Huang, Zhanpeng Zhou, Renqiu Xia, Baharan Mirzasoleiman, Weijie Su, Wei Huang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) University of Pennsylvania(宾夕法尼亚大学) RIKEN Center for Advanced Intelligence Project(日本理化学研究院先进智能项目中心) The Institute of Statistical Mathematics(统计数学研究所)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究多令牌预测如何促进推理,特别是规划,通过实验和理论分析展示其优于单令牌预测的性能及背后的机制。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01348 2026-07-28 cs.CL cs.LG 版本更新 62%

Does Faithfulness-Guided Alignment Hurt Accuracy? Unlocking Accurate and Faithful Post-Retrieval Reasoning

CRAFT: 通过强化学习进行多跳问答的校准推理与答案忠实轨迹

Yu Liu, Wenxiao Zhang, Diandian Guo, Cong Cao, Fangfang Yuan, Qiang Sun, Yanbing Liu, Jin B. Hong, Zhiyuan Ma

专题命中 规划决策 :planning(abstract);分类 cs.CL、cs.LG

AI总结 CRAFT通过强化学习框架提升多跳问答的推理准确性和答案忠实度,结合确定性奖励和判官奖励,增强推理轨迹的可审计性与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22496 2026-07-28 cs.LG cs.AI 版本更新 62%

Action-Sufficient Goal Representations

动作充分的目标表示

Jinu Hyeon, Woobin Park, Hongjoon Ahn, Taesup Moon

机构 * Department of Electrical and Computer Engineering (ECE), Seoul National University(电子与计算机工程系,首尔国立大学) Interdisciplinary Program in Artificial Intelligence (IPAI), Seoul National University(人工智能交叉项目,首尔国立大学) ASRI / INMC, Seoul National University(ASRI/INMC,首尔国立大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出动作充分性概念,通过信息论框架改进目标表示,使动作学习更有效,实验表明其在离散环境中优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22430 2026-07-28 cs.LG 版本更新 57%

On the Identifiability of Controlled World Models

关于受控世界模型的可识别性

Xiangteng Zhang, Yang Guan, Bo Zhang, Hongyang Li, Ya-Qin Zhang, Shengbo Eben Li

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究受控世界模型的可识别性问题,建立在状态依赖高斯行为策略下的联合可识别性理论,识别出两个条件,证明满足条件时JEPA目标的全局极小值可识别潜在状态和受控转移,推导定量界限并通过实验验证理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21340 2026-07-28 cs.CL 版本更新 57%

Capital Markets LLM Reliability Score (CM-LRS): From Plausible to Bankable

资本市场大语言模型可靠性评分(CM-LRS):从似是而非到可信赖

Prerit Ahuja

专题命中 规划决策 :workflow(abstract);分类 cs.CL

AI总结 研究资本市场大语言模型输出的可信赖问题,提出CM-LRS从七个维度评估工作流程输出,通过五个工作流程对四个模型与四位评判者评分,发现前沿闭源模型聚类近,差距集中在检索合成,决策有用性离散度大且评判者一致性高。

Comments 23 pages. Rubrics, prompts, and demonstration tasks are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏