arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-17 至 2026-04-17 共收录 138 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 16 篇

2604.14520 2026-04-17 cs.CV 50%

Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs

模态链:从静态融合到动态编排在多模态大语言模型中

Ziyang Luo, Nian Liu, Junwei Han

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 工作流自动化 :agentic(abstract)

AI总结 本文提出CoM框架,通过动态编排解决多模态融合的静态融合问题,提升模型在不同任务中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14737 2026-04-17 physics.chem-ph 50%

Reproducible Orchestration of Best Practices for Reaction Path Optimization with the Nudged Elastic Band

可重复的最优实践 orchestration 用于反应路径优化的 nudged elastic band

Rohit Goswami

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出一个自动化流程,结合机器学习势能和 eOn 软件,实现反应路径优化的可重复性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 4 篇

2604.14399 2026-04-17 cs.RO cs.AI cs.SY eess.SY 79%

SpaceMind: A Modular and Self-Evolving Embodied Vision-Language Agent Framework for Autonomous On-orbit Servicing

SpaceMind:一种模块化且自我进化的具身视觉-语言代理框架,用于自主在轨服务

Aodi Wu, Haodong Han, Xubo Luo, Ruisuo Wang, Shan He, Xue Wan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 本文提出SpaceMind框架,通过模块化和自我进化机制,实现自主在轨服务中的视觉感知、三维空间推理和多阶段任务执行,验证了其在不同环境下的鲁棒性和适应性。

Comments 23 pages, 6 figures, 7 tables. Code available at https://github.com/wuaodi/SpaceMind

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14317 2026-04-17 cs.CR cs.AI 79%

Challenges and Future Directions in Agentic Reverse Engineering Systems

代理反工程系统中的挑战与未来方向

Salem Radey, Jack West, Kassem Fawaz

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI

AI总结 本文探讨了基于大语言模型的代理系统在二进制反工程中的表现,分析了静态、动态和混合代理的局限性,指出token限制、反编译困难和缺乏程序防护等挑战,并提出未来发展方向。

Comments 7 pages, 1 figure, accepted at SAGAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15075 2026-04-17 cs.SE cs.LG 62%

Atropos: Improving Cost-Benefit Trade-off of LLM-based Agents under Self-Consistency with Early Termination and Model Hotswap

Atropos:通过早期终止和模型热切换提升基于LLM的代理在自一致性下的成本效益权衡

Naryeong Kim, Shin Yoo

机构 * KAIST(韩国明知大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.LG、cs.SE

AI总结 本文提出Atropos技术,通过预测早期终止和模型热切换提升基于LLM的代理在自一致性下的成本效益权衡,实验表明其能将性能提升至闭合LLM的74.35%,成本降低至23.9%。

Comments Will appear at ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14709 2026-04-17 cs.AI 57%

HWE-Bench: Benchmarking LLM Agents on Real-World Hardware Bug Repair Tasks

HWE-Bench:在真实世界硬件Bug修复任务上评估LLM代理的基准测试

Fan Cui, Hongyuan Hou, Zizhang Luo, Chenyun Yin, Yun Liang

机构 * Peking University(北京大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 HWE-Bench是首个大规模仓库级基准,用于评估LLM代理在真实世界硬件Bug修复任务中的表现,通过417个任务实例验证代理在不同项目中的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与网页智能体 3 篇

2604.15093 2026-04-17 cs.AI cs.CL cs.CV cs.HC 62%

OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis

OpenMobile: 通过任务和轨迹合成构建开放移动代理

Kanzhi Cheng, Zehao Li, Zheng Ma, Nuo Chen, Jialin Cao, Qiushi Sun, Zichen Ding, Fangzhi Xu, Hang Yan, Jiajun Chen, Anh Tuan Luu, Jianbing Zhang, Lewei Lu, Dahua Lin

机构 * Nanjing University(南京大学) SenseTime(秒速) Nanyang Technological University(南洋理工大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Xi’an Jiaotong University(西安交通大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出OpenMobile框架,通过可扩展的任务合成管道和策略切换策略生成高质量任务指令和轨迹,实现移动代理在AndroidWorld等基准测试中取得显著成绩。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13315 2026-04-17 cs.CV cs.LG 57%

The Spectrascapes Dataset: Street-view imagery beyond the visible captured using a mobile platform

Spectrascapes数据集:使用移动平台捕捉超出可见光范围的街道视图影像

Akshit Gupta, Joris Timmermans, Filip Biljecki, Remko Uijlenhoet

机构 * TU Delft(代尔夫特理工大学) National University of Singapore(新加坡国立大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.LG

AI总结 本文提出首个公开的多光谱地面视图数据集,通过自行车搭载RGB、近红外和热成像传感器,在荷兰不同城市形态中采集17718张高分辨率多光谱图像,克服传统方法的局限,应用于城市规划和遥感领域。

Comments Submitted, under-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14872 2026-04-17 cs.HC 50%

SkillDroid: Compile Once, Reuse Forever

SkillDroid: 一次编译,永久复用

Qijia Chen, Andrea Bellucci, Zhida Sun, Giulio Jacucci

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 SkillDroid通过编译成功的人工智能引导GUI轨迹为参数化技能模板,实现无需LLM调用的复用,显著提升任务成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 记忆与上下文管理 4 篇

2601.03236 2026-04-17 cs.AI 86%

MAGMA: A Multi-Graph based Agentic Memory Architecture for AI Agents

MAGMA:一种基于多图的代理记忆架构用于AI代理

Dongming Jiang, Yi Li, Guanpeng Li, Bingzhe Li

机构 * Department of Computer Science, The University of Texas at Dallas(德克萨斯大学达拉斯分校计算机科学系) Department of Electrical and Computer Engineering, University of Florida(佛罗里达大学电气与计算机工程系)

专题命中 记忆与上下文管理 :agentic(title,abstract);AI agent(title);分类 cs.AI

AI总结 MAGMA通过多图结构实现记忆表示,提升长时序推理任务的性能,提供透明推理路径和细粒度检索控制。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13671 2026-04-17 cs.CV 82%

AgentIAD: Agentic Industrial Anomaly Detection via Adaptive Memory Augmentation

AgentIAD: 通过自适应记忆增强的代理工业异常检测

Junwen Miao, Penghui Du, Yingying Fan, Yi Liu, Yu Wang, Runze He, Lida Huang, Yan Wang

机构 * AIR, Tsinghua University(清华大学AIR) Etude AI Stony Brook University(石溪大学)

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract)

AI总结 本文提出AgentIAD框架,通过统一的动作空间实现迭代工业检测,利用视觉记忆和检索记忆进行多轮感知-行动推理,提升异常检测准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14362 2026-04-17 cs.CL cs.AI cs.IR 81%

APEX-MEM: Agentic Semi-Structured Memory with Temporal Reasoning for Long-Term Conversational AI

APEX-MEM: 基于时序推理的代理半结构化记忆用于长期对话AI

Pratyay Banerjee, Masud Moshtaghi, Shivashankar Subramanian, Amita Misra, Ankit Chadha

机构 * Amazon(亚马逊)

专题命中 记忆与上下文管理 :agentic(title);agent(abstract);分类 cs.AI、cs.CL

AI总结 APEX-MEM通过结合属性图、只追加存储和多工具检索代理,解决大语言模型在长期对话记忆中的可靠性问题,实现88.88%的LOCOMO问答准确率和86.2%的LongMemEval表现。

Comments Accepted to ACL 2026 Mains

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14268 2026-04-17 cs.CV 50%

HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds

HY-World 2.0:一个多模态世界模型用于重建、生成和模拟3D世界

Team HY-World, Chenjie Cao, Xuhui Zuo, Zhenwei Wang, Yisu Zhang, Junta Wu, Zhenyang Liu, Yuning Gong, Yang Liu, Bo Yuan, Chao Zhang, Coopers Li, Dongyuan Guo, Fan Yang, Haiyu Zhang, Hang Cao, Jianchen Zhu, Jiaxin Lin, Jie Xiao, Jihong Zhang, Junlin Yu, Lei Wang, Lifu Wang, Lilin Wang, Linus, Minghui Chen, Peng He, Penghao Zhao, Qi Chen, Rui Chen, Rui Shao, Sicong Liu, Wangchen Qin, Xiaochuan Niu, Xiang Yuan, Yi Sun, Yifei Tang, Yifu Sun, Yihang Lian, Yonghao Tan, Yuhong Liu, Yuyang Yin, Zhiyuan Min, Tengfei Wang, Chunchao Guo

机构 * Tencent(腾讯)

专题命中 记忆与上下文管理 :planning(abstract)

AI总结 HY-World 2.0通过多模态输入生成高保真3D场景,改进了先前版本,引入了多项创新以提升全景真实性、3D场景理解和规划能力,并升级了WorldStereo和WorldMirror模型,实现了3D世界交互探索。

Comments Project Page: https://3d-models.hunyuan.tencent.com/world/ ; Code: https://github.com/Tencent-Hunyuan/HY-World-2.0

详情

展开后加载摘要…

URL PDF HTML 收藏

5. Agent评测 34 篇

2604.14455 2026-04-17 cs.AI 89%

AIBuildAI: An AI Agent for Automatically Building AI Models

AIBuildAI: 一个用于自动构建AI模型的AI代理

Ruiyi Zhang, Peijia Qin, Qi Cao, Li Zhang, Pengtao Xie

机构 * Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) Department of Medicine, University of California San Diego(加州大学圣地亚哥分校医学系)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);tool use(abstract);分类 cs.AI

AI总结 AIBuildAI通过分层代理架构自动构建AI模型,超越传统AutoML,实现端到端自动化,展示出在Kaggle风格任务中63.1%的获奖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10866 2026-04-17 cs.CL 85%

OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation

OccuBench:通过语言环境模拟评估AI代理在真实世界专业任务中的表现

Xiaomeng Hu, Yinger Zhang, Fei Huang, Jianhong Tu, Yang Su, Lianghao Deng, Yuxuan Liu, Yantao Liu, Dayiheng Liu, Tsung-Yi Ho

机构 * Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 OccuBench通过语言环境模拟评估AI代理在100个真实世界专业任务场景中的表现,涵盖10个行业类别和65个专业领域,发现大模型、新版本和高推理能力提升性能,但强代理不等于强环境模拟器。

Comments 23 pages, 8 figures, 2 tables. Project page: https://gregxmhu.github.io/OccuBench-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14509 2026-04-17 cs.SE cs.AI cs.CL 83%

E2Edev: Benchmarking Large Language Models in End-to-End Software Development Task

E2EDev:端到端软件开发任务中大语言模型的基准测试

Jingyao Liu, Chen Huang, Zhizhao Guan, Wenqiang Lei, Yang Deng

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) CHAT NLP Group, Singapore Management University(新加坡国立管理大学CHAT NLP组) Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education, China(教育部长机器学习与产业智能工程研究中心)

专题命中 Agent评测 :agent(abstract,abstract_cn);multi-agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出E2EDev基准,基于行为驱动开发原则,通过模拟真实用户交互评估端到端软件开发框架的能力,揭示现有方法在解决复杂任务中的不足。

Comments Accepted to ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14583 2026-04-17 cs.LG 83%

From Risk to Rescue: An Agentic Survival Analysis Framework for Liquidation Prevention

从风险到救援:一种用于防止清算的代理生存分析框架

Fernando Spadea, Oshani Seneviratne

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院)

专题命中 Agent评测 :agentic(title);agent(abstract);autonomous agent(abstract);分类 cs.LG

AI总结 本文提出一种基于生存分析的代理框架,通过预测和执行干预主动防止清算,引入返回期指标和趋势分数以优化资本效率,验证结果表明其能有效预防高风险场景下的清算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14160 2026-04-17 cs.AI 83%

NuHF Claw: A Risk Constrained Cognitive Agent Framework for Human Centered Procedure Support in Digital Nuclear Control Rooms

NuHF Claw:一种面向数字核控制室的人本流程支持的风险约束认知代理框架

Xingyu Xiao, Jiejuan Tong, Jun Sun, Zhe Sui, Peng Chen, Jingang Liang, Haitao Wang

机构 * Institute of Nuclear and New Energy Technology, Tsinghua University(清华大学核能与新能源技术研究院) National Key Laboratory of Human Factors Engineering(人因工程国家重点实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出NuHF Claw框架,通过风险约束代理运行时,将认知状态推断与概率安全评估结合,实现实时自主系统行为调控,提升核控制室操作安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09643 2026-04-17 cs.ET cs.AI 83%

MM-tau-p$^2$: Persona-Adaptive Prompting for Robust Multi-Modal Agent Evaluation in Dual-Control Settings

MM-tau-p$^2$: 人格自适应提示用于双控制设置中多模态代理的鲁棒性评估

Anupam Purwar, Aditya Choudhary

机构 * Sprinklr AI

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出MM-tau-p$^2$基准,通过12个新指标评估多模态代理在双控制环境中的鲁棒性,结合用户输入解决查询,并展示即使使用前沿LLM,多模态鲁棒性等指标仍需考虑。

Comments A benchmark for evaluating multimodal both voice and text LLM agents in dualcontrol settings. We introduce persona adaptive prompting and 12 new metrics to assess robustness safety efficiency and recovery in customer support scenarios

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14216 2026-04-17 cs.MM cs.AI cs.CL cs.CV cs.GR cs.LG 82%

Neuro-Oracle: A Trajectory-Aware Agentic RAG Framework for Interpretable Epilepsy Surgical Prognosis

Neuro-Oracle:一种具有轨迹意识的代理RAG框架用于可解释性癫痫手术预后

Aizierjiang Aiersilan, Mohamad Koubeissi

机构 * The George Washington University(乔治华盛顿大学)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出Neuro-Oracle框架,通过三维Siamese对比编码器提取术前术后MRI变化,检索历史相似手术轨迹,并利用量化Llama-3-8B推理代理生成自然语言预后,验证了轨迹意识检索架构的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27420 2026-04-17 cs.RO 82%

Towards a Multi-Embodied Grasping Agent

迈向多体 grasping agent

Roman Freiberg, Alexander Qualmann, Ngo Anh Vien, Gerhard Neumann

机构 * Bosch Corporate Research(博世企业研究) Autonomous Learning Robots Lab(自主学习机器人实验室) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 Agent评测 :agent(title,title_cn)

AI总结 本文提出一种高效、基于流的 equivariant grasping 架构,能够处理不同自由度的抓取器,通过抓取器和场景几何信息推导出底层运动学模型,提升学习效率和性能。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19168 2026-04-17 econ.GN cs.MA q-fin.EC 82%

Implications of zero-growth economics analysed with an agent-based model

零增长经济学的含义通过基于代理的模型进行分析

Dylan C. Terry-Doyle, Adam B. Barrett

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文通过基于代理的模型研究零增长经济学的稳定性,发现零增长情景在经济指标上更具稳定性,但伴随更高的通胀率和经济危机风险。

Comments 51 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15915 2026-04-17 cs.LG cs.CL 81%

AccelOpt: A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization

AccelOpt:一种自我改进的LLM代理系统,用于AI加速器内核优化

Genghan Zhang, Shaowei Zhu, Anjiang Wei, Zhenyu Song, Allen Nie, Zhen Jia, Nandita Vijaykumar, Yida Wang, Kunle Olukotun

机构 * Anonymous Authors(匿名作者)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL、cs.LG

AI总结 AccelOpt通过迭代生成探索内核优化空间,利用优化记忆库提升AI加速器内核性能,实验证明其能力随时间提升,且成本效益高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14220 2026-04-17 cs.IR cs.AI 79%

Knowledge Graph RAG: Agentic Crawling and Graph Construction in Enterprise Documents

知识图谱RAG:企业文档中的代理爬取与图谱构建

Koushik Chakraborty, Koyel Guha

机构 * Google AI, Global Services Delivery(谷歌AI,全球服务交付)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出基于递归爬取的代理知识图谱,解决复杂企业文档语义检索的局限性,提升法规查询的准确率。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14683 2026-04-17 cs.AI 77%

DR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research Evaluation

DR$^{3}$-Eval: 向真实和可重复的深度研究评估迈进

Qianqian Xie, Qingheng Xiong, He Zhu, Tiantian Xia, Xueming Han, Fanyu Meng, Jiakai Wang, Zhiqi Bai, Chengkang Jiang, Zhaohui Wang, Yubin Guo, Yuqing Wen, Jiayang Mao, Zijie Zhang, Shihao Li, Yanghai Wang, Yuxiang Ren, Junlan Feng, Jiaheng Liu

机构 * Nanjing University(南京大学) M-A-P Jiutian Research(九天研究) National University of Singapore(新加坡国立大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出DR$^{3}$-Eval基准,用于评估多模态多文件报告生成的深度研究代理,通过真实用户材料和静态研究沙盒语料结合,引入多维评估框架,验证其与人类判断的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14261 2026-04-17 cs.CL cs.AI 73%

ReviewGrounder: Improving Review Substantiveness with Rubric-Guided, Tool-Integrated Agents

ReviewGrounder:通过规则引导和工具集成代理提升评审的实质内容

Zhuofeng Li, Yi Lu, Dongfu Jiang, Haoxiang Zhang, Yuyang Bai, Chuan Li, Yu Wang, Shuiwang Ji, Jianwen Xie, Yu Zhang

机构 * Texas A&M University(德克萨斯A&M大学) University of Waterloo(滑铁卢大学) UC San Diego(南加州大学) Lambda University of Oregon(俄勒冈大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出ReviewGrounder框架,通过规则引导和工具集成提升AI会议评审的实质内容,实验表明其在8个维度上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14495 2026-04-17 cs.CE cs.AI cs.CR 70%

Decoupling Identity from Utility: Privacy-by-Design Frameworks for Financial Ecosystems

分离身份与效用:面向金融生态系统的设计隐私框架

Ifayoyinsola Ibikunle, Tyler Farnan, Senthil Kumar, Mayana Pereira

机构 * Capital One

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出通过差分隐私合成数据解决金融机构在最大化数据效用与缓解传统匿名化方法重新识别风险之间的矛盾,探讨了两种生成范式并展示了其在动态市场行为建模中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14254 2026-04-17 cs.AI cs.LO 70%

Formalizing Kantian Ethics: Formula of the Universal Law Logic (FULL)

规范康德伦理学:普遍律令逻辑(FULL)

Taylor Olson

机构 * Taylor Olson(塔勒尔·奥尔森)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出一种多排序量化模态逻辑FULL,用于规范康德伦理学,通过无需内置道德直觉的背景知识评估代理行为,提升AI代理的鲁棒性和自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07338 2026-04-17 cs.CL 70%

Beyond Literal Mapping: Benchmarking and Improving Non-Literal Translation Evaluation

超越字面映射:非字面翻译评估的基准测试与改进

Yanzhi Tian, Cunxiang Wang, Zeming Liu, Heyan Huang, Wenbo Yu, Dawei Song, Jie Tang, Yuhang Guo

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Zhipu AI(智谱AI) The Knowledge Engineering Group (KEG), Tsinghua University(清华大学知识工程组) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出RATE框架,通过反思核心代理动态调用专用子代理,提升非字面翻译评估的准确性,实验显示其在系统和段级相关性上比现有方法提高至少3.2分。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16024 2026-04-17 cs.CV 67%

Speak, Segment, Track, Navigate: An Interactive System for Video-Guided Skull-Base Surgery

说话、分割、跟踪、导航:一种用于视频引导的颅底手术交互系统

Jecia Z. Y. Mao, Francis X. Creighton, Russell H. Taylor, Manish Sahu

机构 * IEEE

专题命中 Agent评测 :agent(abstract);workflow(abstract)

AI总结 本文提出一种基于语音引导的嵌入式代理框架,用于视频引导的颅底手术,通过实时视觉感知和图像引导任务响应外科医生的查询,提高手术流程整合性和部署速度。

详情

展开后加载摘要…

URL PDF HTML 收藏