arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-24 至 2026-07-24 共收录 145 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 10 篇

2607.20536 2026-07-24 cs.AI cs.CL cs.LG cs.MA 新提交 89%

AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use

AppWorld-UL:用于工具使用的多样化智能体-用户交互基准测试

Junzhi Chen, Harsh Trivedi, Jane Pan, Michael JQ Zhang, Tejas Srinivasan, Niranjan Balasubramanian, Ashish Sabharwal

专题命中 工具调用 :agent(title,abstract);tool-use(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究针对当前智能体-用户交互基准测试不足,引入 AppWorld-UL 基准测试,基于 AppWorld 框架及模拟应用构建多样任务,用大型语言模型模拟用户行为,评估显示其难度大,能推动回路中工具使用智能体研究。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14257 2026-07-24 cs.CL cs.AI 版本更新 84%

Student-Centered Distillation Narrows the Agentic Gap Between Small and Large LLMs

以学生为中心的蒸馏缩小了小型和大型语言模型之间的智能差距

Yuanjie Lyu, Chengyu Wang, Jun Huang, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 工具调用 :agentic(title,abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 研究旨在缩小大小语言模型智能差距,提出SCoRe框架,让学生生成训练轨迹,教师纠正最早错误,经微调与短视距强化学习,提升学生解决问题能力,在12个基准测试中,70亿参数学生模型缩小了与720亿参数教师模型的性能差距

Comments Accepted to ICML 2026. The title has been changed from "From Correction to Mastery: Reinforced Distillation of Large Language Model Agents" to "Student-Centered Distillation Narrows the Agentic Gap Between Small and Large LLMs"; the camera-ready version has been uploaded

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20668 2026-07-24 cs.CL cs.AI 新提交 81%

From Agent Failures to Text Policies: What Works and What Breaks

从智能体失败到文本策略:可行与不可行之处

Jaideep Ray, Ankit Goyal

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 研究智能体中TextGrad应用问题,通过区分遵循与学习策略能力来研究。发现两者有差距,人工编写策略能提升智能体表现,而从轨迹生成的策略无法可靠超越固定提示,主要挑战是从经验中生成和选择策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10230 2026-07-24 cs.LG cs.SD eess.AS 版本更新 79%

Encode Once, Decode Never: Reusing Audio LM Internals for Efficient Temporal Localization

帧级内部工具使用用于音频语言模型中的时序定位

Joseph An, Phillip Keung, Jiaqi Wang, Orevaoghene Ahia, Noah A. Smith

专题命中 工具调用 :tool use(title,abstract);分类 cs.LG

AI总结 本文提出帧级内部工具使用方法,通过二元分类器和IHP损失提升音频语言模型的时序定位能力,实现50倍加速和鲁棒长度泛化。

Comments To appear in COLM 2026. Refer to https://github.com/inkitori/taudio/ for the codebase

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21361 2026-07-24 cs.MA 新提交 75%

FedAgentKE: Federated Semantic Knowledge Evolution for Heterogeneous Agents

FedAgentKE:异构智能体的联邦语义知识演化

Weihao Li, Jun Bai, Ziyang Song

专题命中 工具调用 :agent(abstract);tool use(abstract);workflow(abstract)

AI总结 研究异构智能体孤立运行问题,提出 FedAgentKE 框架,通过语义知识蒸馏、聚合和Adapt实现联邦语义知识演化,实验验证其在跨框架和跨任务设置下能改进智能体协作,为未来协作智能体生态系统发展提供潜力。

Comments 9 pages (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13026 2026-07-24 cs.LG cs.CR 版本更新 70%

PISmith: Reinforcement Learning-based Red Teaming for Prompt Injection Defenses

PISmith: 基于强化学习的提示注入防御红队测试

Chenlong Yin, Runpeng Geng, Yanting Wang, Jinyuan Jia

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 工具调用 :autonomous agent(abstract);agentic(abstract);分类 cs.LG

AI总结 本文提出PISmith框架,通过强化学习评估现有提示注入防御的鲁棒性,发现标准GRPO在攻击强防御时表现不佳,引入自适应熵正则化和动态优势加权以提升探索能力,实验表明最新防御仍易受适应性攻击影响。

Comments To appear in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21459 2026-07-24 econ.GN q-fin.EC 新提交 67%

The Evolution of Digital Search: From Blue Links to Delegated Decision-Making

数字搜索的演变:从蓝色链接到委托决策

David M. Rothschild, Nicole Immorlica, Brendan Lucier, Markus Mobius, Aleksandrs Slivkins

专题命中 工具调用 :agent(abstract);agentic(abstract)

AI总结 研究数字搜索从传统模式到人工智能原生模式的转变,指出小设计选择影响重大,未来搜索发展不由算法和界面改进决定,而是取决于开放透明有竞争力的代理系统设计,揭示多领域交叉的重大挑战。

Comments 4 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19321 2026-07-24 cs.NE 版本更新 67%

Learning to Sample in Variable Neighborhood Search Algorithm for Urban Cable Routing Optimization

城市电缆路由优化的可变邻域搜索算法中的采样学习

Wei Liu, Rui Wang, Chenhui Lin, Kaiwen Li, Wenhua Li, Tao Zhang

专题命中 工具调用 :agent(abstract);multi-agent(abstract)

AI总结 针对城市电缆路由优化这一大规模双层组合优化问题,提出学习辅助可变邻域搜索(L-VNS)算法,该算法集成四个关键组件,经实验验证其相比其他方法有优越性,能有效降低建设成本,且具有有效性和鲁棒性。

Comments Accepted by Swarm and Evolutionary Computation

Journal ref Swarm and Evolutionary Computation; Volume 106, June 2026, 102432

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20430 2026-07-24 cs.CL cs.AI 新提交 62%

LLM-INSTRUCT at UZH Shared Task 2026: Constraint-Aware Retrieval and Selective Debate for Paragraph-Level Argument Mining

LLM-INSTRUCT在UZH 2026共享任务中的应用:用于段落级论证挖掘的约束感知检索和选择性辩论

Phuong Huu Vu Tran, Long Minh Vo, Son Nguyen Minh Le, Hoang Van

机构 * Vietnamese-German University(越南-德国大学) RMIT University Vietnam(皇家墨尔本理工大学越南分校) VANGIA INNOVATIONS(VANGIA创新公司)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文介绍了在UZH 2026共享任务中用于段落级论证挖掘的获胜系统LLM-INSTRUCT,通过元数据感知检索、约束解码等方法缩小决策空间,提高了准确性和提交稳健性,在官方排行榜上取得优异成绩。

Comments Accepted to the 13th Workshop on Argument Mining (ArgMining 2026) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16059 2026-07-24 astro-ph.IM astro-ph.CO 版本更新 50%

OpenCosmo: Community Portal and Analysis Framework for Flagship Cosmological Simulations

OpenCosmo:旗舰级宇宙学模拟的社区门户与分析框架

Patrick R. Wells, Michael Buelhmann, Patricia Larsen, William M. Hicks, Manpreet Dhillon, Idunnuoluwa A. Adeniji, Katrin Heitmann, Salman Habib, Benoit Côté, Thomas Uram, Gideon McFarland, Andrew Hearin, Ezar Shinabro, Michael E. Papka

专题命中 工具调用 :agent(abstract)

AI总结 OpenCosmo项目旨在为大型宇宙学模拟数据集提供灵活访问和分析模式,通过网络数据门户和分析库,结合现有设施支持多层次交互,基于Globus Compute的架构可扩展,助力宇宙学数据共享与计算结合。

Comments 18 pages, 6 figures. To be submitted

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 36 篇

2606.20515 2026-07-24 cs.CV 版本更新 93%

S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence

S-Agent:空间工具使用激发空间智能推理

Yalun Dai, Hao Li, Shulin Tian, Runmao Yao, Yuhao Dong, Fangzhou Hong, Zhaoxi Chen, Fangfu Liu, Tao Wang, Kim-Hui Yap, Ziwei Liu

机构 * NTU(南洋理工大学) THU(清华大学) ByteDance(字节跳动) NWPU(西北工业大学)

专题命中 规划决策 :agent(title,title_cn);tool-use(title,abstract);agentic(abstract)

AI总结 提出S-Agent空间工具使用智能体范式,通过时空证据积累和层次化工具集,将VLM作为语义规划器,实现连续多视图图像和视频的空间推理,在无训练下提升开源和闭源VLM性能,并基于S-300K轨迹微调得到紧凑空间智能体S-Agent-8B。

Comments Project Page : https://Ropedia.github.io/S-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13621 2026-07-24 cs.LO cs.AI 86%

Decentralized Planning Using Probabilistic Hyperproperties

基于概率超属性的去中心化规划

Francesco Pontiggia, Filip Macák, Roman Andriushchenko, Michele Chiari, Milan Češka

机构 * Brno University of Technology(布拉格技术大学)

专题命中 规划决策 :planning(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出利用概率超属性和MDP进行去中心化规划,扩展了规划技术的规范能力,并建立了与特定Dec-MDPs规划的联系。

Comments 11 pages, 1 figure, 2 tables. Accepted at AAMAS 2025: the 24th International Conference on Autonomous Agents and Multiagent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23340 2026-07-24 cs.AI cs.CL cs.HC 84%

Planning Ahead with RSA: Efficient Signalling in Dynamic Environments by Projecting User Awareness across Future Timesteps

基于RSA的前瞻性规划:通过跨未来时间步投影用户意识实现动态环境中的高效信号传递

Anwesha Das, John Duff, Jörg Hoffmann, Vera Demberg

机构 * Saarland University(萨尔兰大学)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.CL;autonomous agent(journal_ref)

AI总结 本文提出基于RSA的前瞻性规划方法,通过跨未来时间步投影用户意识,优化动态环境中的人机协作效率。

Comments 11 pages, 3 figures

Journal ref Proc. of the 25th Int. Conf. on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20743 2026-07-24 cs.RO cs.AI cs.LG 新提交 81%

Self-Supervised Bio-Inspired Robotic Trajectory Planning with Obstacle Avoidance

具有避障功能的自监督生物启发式机器人轨迹规划

Miroslav Krupa, Miroslav Cibula, Kristína Malinovská

机构 * Faculty of Mathematics, Physics and Informatics, Comenius University Bratislava(布拉迪斯拉发夸美纽斯大学数学、物理与信息学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究机器人轨迹规划问题,提出基于自监督学习框架,利用正反模型作监督机制,在含障碍物环境下规划轨迹,实验证明方法可行,针对规划器问题提出并评估了额外训练机制和缓解策略。

Comments 12 pages, 3 figures. To be published in 2026 International Conference on Artificial Neural Networks (ICANN) proceedings. This research was supported by the Slovak Research and Development Agency, project APVV-21-0105

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20582 2026-07-24 cs.LG cs.AI cs.MA 新提交 81%

Bayesian uncertainty estimation improves clinical decision making in medical AI agents

贝叶斯不确定性估计改善医学人工智能代理中的临床决策

Frederik Hauke, Patrick Wienholt, Christiane Kuhl, Dyke Ferber, Jakob Nikolas Kather, Sven Nebelung, Daniel Truhn

机构 * University Hospital RWTH Aachen(亚琛工业大学附属医院) Heidelberg University Hospital(海德堡大学医院) TU Dresden(德累斯顿工业大学) TUD Dresden University of Technology(德累斯顿工业大学)

专题命中 规划决策 :AI agent(title);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究针对医学图像分析机器学习模型缺乏置信度度量问题,采用蒙特卡洛随机失活获取认知不确定性信号,添加到点预测提高错误检测AUROC,在临床决策支持代理实验中,以特定形式传达该信号可降低误诊率,凸显其对决策的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21437 2026-07-24 cs.AI 新提交 79%

Agent-Guided Relational Concept Discovery: Toward Interpretable Surgical Margin Assessment

代理引导的关系概念发现:迈向可解释的手术切缘评估

Nooshin Maghsoodi, Amoon Jamzad, Robert Policelli, Mohammad Farahmand, Dilakshan Srikanthan, Martin Kaufmann, Kevin Y. M. Ren, Shaila Merchant, Sonal Varma, Ross Walker, Doug McKay, John Rudan, Gabor Fichtinger, Parvin Mousavi

机构 * Queen’s University(女王大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 针对深度学习模型用于手术切缘评估时面临的泛化难及黑箱问题,提出代理引导的概念发现框架,直接从数据学习概念,经推理代理和知识图谱完善调整,在相关数据集和术中病例中提升了评估效果。

Comments This paper is accepted to MICCAI 2026, and this is the submission version, not the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21414 2026-07-24 cs.AI 新提交 79%

Logical Regression for Planning with Axioms

基于公理的规划逻辑回归

Connor Little, Christian Muise

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 研究含公理领域中动作的逻辑回归,提出近似方法,将条件限制在部分状态以避免公理重算。该方法可泛化部分状态,减少执行监控变量,增强执行监控在意外变化环境中的恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21354 2026-07-24 cs.AI 新提交 79%

SPORD: A Simulation-Propose-then-OR-Dispose Approach for Supply Chain Planning

SPORD:一种用于供应链规划的模拟-提出-然后-优化-处置方法

Jiayin He, Yutong Pan, Sen Yang, Ningxuan Kang, Yongzhi Qi, Jianshen Zhang, Wei Qi, Zuo-Jun Max Shen

机构 * Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) College of Engineering, UC Berkeley(加州大学伯克利分校工程学院) Faculty of Business and Economics, University of Hong Kong(香港大学经管学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 针对电商供应链规划中孤立项目及面临的难题,提出模拟-提出-然后-优化-处置方法(SPORD)及NetSim平台,通过解耦实现加速模拟与操作闭环,应用后提升服务质量、降低履约率并实现碳减排,推动模拟用于主动规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21209 2026-07-24 cs.LO cs.AI 新提交 79%

Explainability Framework for Policy-Aware Autonomous Agents

策略感知自主智能体的可解释性框架

Heather Merhout, Daniela Inclezan

机构 * Miami University(迈阿密大学)

专题命中 规划决策 :autonomous agent(title);agent(abstract);分类 cs.AI

AI总结 针对策略感知自主智能体,借鉴社会科学见解,用回答集编程语言结合Python实现可解释性框架,利用违反策略的惩罚创建对比性解释,并通过调查评估框架。

Comments In Proceedings ICLP 2026, arXiv:2607.17707

Journal ref EPTCS 450, 2026, pp. 515-528

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05704 2026-07-24 cs.CR cs.AI 版本更新 79%

SafeHarbor: Defining Precise Decision Boundaries via Hierarchical Memory-Augmented Guardrail for LLM Agent Safety

SafeHarbor:用于LLM智能体安全的分层记忆增强防护栏

Zhe Liu, Zonghao Ying, Wenxin Zhang, Quanchen Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Hao Peng

机构 * School of Cyber Science and Technology, Beihang University, Beijing, China(北京航空航天大学网络安全学院) Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) AI Security Lab, Beijing, China(360人工智能安全实验室)

专题命中 规划决策 :agent(title);autonomous agent(abstract);分类 cs.AI

AI总结 提出SafeHarbor框架,通过分层记忆系统和信息熵自进化机制,在保持高安全拒绝率的同时提升对良性请求的响应能力。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22057 2026-07-24 cs.CL 版本更新 79%

FlyRoute: Self-Evolving Agent Profiling via Data Flywheel for Adaptive Task Routing

FlyRoute: 通过数据飞轮实现自进化代理配置以实现适应性任务路由

Rongjun Li, Ziyu Zhou, Yihang Wu

机构 * IT Innovation and Research Center, Huawei Technologies(华为技术有限公司信息技术创新与研究中心)

专题命中 规划决策 :agent(title,abstract);分类 cs.CL

AI总结 本文提出FlyRoute,一种自进化配置框架,通过真实流量增长能力证据,提高适应性任务路由的性能。

Comments 13 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19178 2026-07-24 cs.RO cs.AI 版本更新 79%

Vision-Language-Policy Model for Dynamic Robot Task Planning

用于动态机器人任务规划的视觉-语言-策略模型

Jin Wang, Kim Tien Ly, Jacques Cloete, Jin Jin, Nikos Tsagarakis, Ioannis Havoutis

机构 * Dynamic Robot Systems Group, Oxford Robotics Institute, University of Oxford(牛津大学机器人研究所动态机器人系统组) Humanoids and Human-Centered Mechatronics (HHCM), Istituto Italiano di Tecnologia(意大利技术研究所人形与以人为中心的机电系统)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 针对机器人在非结构化环境中自然语言命令与自主执行衔接难题,提出基于视觉-语言模型的VLP框架,能解释指令、整合推理生成行为策略,还可动态调整策略,实验证明其有强大规划自主性和跨实体泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20772 2026-07-24 cs.RO 新提交 78%

Socially Consistent Multi-Robot Navigation Using Decoupled Planning and Trajectory Coordination

使用解耦规划和轨迹协调的社会一致多机器人导航

Matthew M. Sato, Kincho H. Law

专题命中 规划决策 :planning(title,abstract)

AI总结 研究多机器人在人类环境中的导航,通过解耦规划与轨迹协调,改进A*规划器嵌入社会规范构建社会图,转化轨迹协调为凸规划,实现可预测、符合社会规范的路径规划,简化多机器人协调。

Comments Submitted to Civil Engineering Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13496 2026-07-24 eess.SY cs.SY 版本更新 78%

Identification of Technical Design Constraints and Considerations for Transmission Grid Expansion Planning Projects

输电网络扩展规划项目的技术设计约束识别与考量

Giacomo Bastianel, Clement Hardy, Nils Charels, Dirk Van Hertem, Hakan Ergun

专题命中 规划决策 :planning(title,abstract)

AI总结 针对可再生能源大规模部署所需的输电网络扩展规划项目,识别并分类相关技术设计约束与考量,涵盖七个关键领域,给出分层分类及领域间依赖性,为运营商和政策制定者提供规划投资的结构化基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20827 2026-07-24 cs.AI 新提交 74%

Auditing Provenance Sensitivity in LLM Agent Action Selection

审计大语言模型智能体动作选择中的溯源敏感性

Junchi Liao

专题命中 规划决策 :agent(title);分类 cs.AI

AI总结 研究大语言模型智能体动作选择中的溯源敏感性,引入针对特定目标的授权审计,通过改变命题源权威等测试行为,发现可信和不可信变体在部分案例中产生不同动作,模型对线索有反应但不可信证据仍影响行动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20470 2026-07-24 cs.AI 新提交 74%

PlanE: Meta Planning of Data, Tuning, and Inference for Extractive-based LLMs

PlanE:基于抽取式大语言模型的数据、调优和推理的元规划

Jiacheng Wang, Weiyan Zhang, Guangya Yu

机构 * Ant Group(蚂蚁集团) School of Information Science and Engineering, East China University of Science and Technology(华东理工大学信息科学与工程学院)

专题命中 规划决策 :planning(title);分类 cs.AI

AI总结 针对大语言模型特定任务能力提升中数据标注成本高及缺乏优化方法的问题,提出PlanE框架,含数据分解等,引入DTI规划器,实验验证了该框架及规划器在不同场景下的有效性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20982 2026-07-24 cs.AI 新提交 70%

GuardianAgentBench: Where Agents Fail and How to Guard Them

GuardianAgentBench:智能体何处失败及如何防范

Vishal Ishwar Naik, Chenyu Xu, Donna Dong, Hussein Hassan, Abhishek Pradhan, Ofer Mendelevitch, Tallat Shafat, Humayun Irshad

机构 * Vectara, Inc.(Vectara公司) Anthropic(Anthropic公司) OpenAI(OpenAI公司) Google DeepMind(谷歌DeepMind) DeepSeek-AI(DeepSeek人工智能公司)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 研究大语言模型智能体安全可靠行为问题,提出GuardianAgentBench基准测试,含多阶段验证和攻击模式。实验发现模型有两种失败模式,性能随工具集和轮次深度下降。护栏实现优于系统提示防御,证明执行时结构干预可提升安全性且不影响正确行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21913 2026-07-24 physics.med-ph cs.AI 版本更新 70%

Equivariant Conditional Diffusion Model for Head and Neck CT Image Synthesis from CBCT

用于从CBCT合成头颈CT图像的等变条件扩散模型

Alzahra Altalib, Chunhui Li, Alessandro Perelli

专题命中 规划决策 :planning(abstract);workflow(abstract);分类 cs.AI

AI总结 针对CBCT图像有伪影、CT图像难捕捉治疗中解剖变化的问题,提出EqDiff-CT模型,基于扩散概率模型和群等变条件U-Net主干,从CBCT合成高质量CT图像,经实验验证在多方面有显著提升,为CBCT改进提供框架。

Comments 43 pages, 9 figures, 6 tables, accepted in Medical Physics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20459 2026-07-24 cs.CL cs.AI 新提交 62%

THOR: A Theta-Gamma Hierarchical Oscillatory Reasoning Framework for Multi-hop QA

THOR:用于多跳问答的θ-γ分层振荡推理框架

Ziyang Ling, Ronald X. Xu, Mingzhai Sun

机构 * Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学生命科学与医学部生物医学工程学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 针对多跳问答中注意力衰减和错误积累问题,提出受大脑启发的θ-γ分层振荡推理框架THOR,经实验验证,该框架能提高答案准确性和鲁棒性,减轻相关限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21262 2026-07-24 cs.AI cs.CL 版本更新 62%

ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents

ARCO: 基于自适应规则与协同进化的多步LLM智能体

Zihang Tian, Jingsen Zhang, Rui Li, Xiaohe Bo, Yuanzi Li, Xu Chen

机构 * Renmin University of China(中国人民大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出ARCO框架,通过同尺度模型的双头结构(生成头与评分头)实现步骤级规则生成与奖励分配,结合轨迹分解约束和策略协同进化,在多个多跳QA任务上取得最优EM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏