arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-03 至 2026-07-03 共收录 205 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 9 篇

2607.01460 2026-07-03 cs.CY cs.SI 新提交 50%

Social-Annotate: Self-Healing Browser Extension to Annotate and Collect Social Media Data

Social-Annotate: 用于标注和收集社交媒体数据的自愈浏览器扩展

Ali Najafi, Ismail Uluturk, Onur Varol

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出Social-Annotate浏览器扩展,通过注入可定制表单实现在线平台直接数据收集,并集成大语言模型驱动的自愈代理以应对界面变化,支持12个平台,降低数据收集和维护成本。

Comments 13 pages, 3 figures, 1 SI-table, 2 SI-figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01454 2026-07-03 cs.RO 新提交 50%

SE(2) Navigation Mesh

SE(2)导航网格

Shuyang Shi, Kaixian Qu, Changan Chen, Ines Kast, Yuntao Ma, Marco Hutter

机构 * Robotic Systems Lab, ETH Zurich(苏黎世联邦理工学院机器人系统实验室)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出SE(2)导航网格,通过编码偏航依赖的可通行性,支持非圆形机器人在复杂多层环境中的高效路径规划,并开发了A*-拉绳-A*分层路径搜索策略。

Comments Project page: https://se2-navmesh.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18803 2026-07-03 cs.RO 版本更新 50%

Learning to Localize Reference Trajectories in Image-Space for Visual Navigation

学习在图像空间中定位参考轨迹用于视觉导航

Finn Lukas Busch, Matti Vahs, Quantao Yang, Jesús Gerardo Ortega Peimbert, Yixi Cai, Jana Tumova, Olov Andersson

机构 * Division of Robotics, Perception, and Learning(机器人、感知与学习 division) KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出LoTIS模型,通过定位参考轨迹在机器人当前视图中的图像坐标,实现无需相机标定、位姿或机器人特定训练的跨实体视觉导航,在正向导航中成功率提升20-50个百分点,达到94-98%。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 记忆与上下文管理 10 篇

2607.01919 2026-07-03 cs.AI cs.CR 新提交 85%

ElephantAgent: Contextual State Continuity in Agentic Systems

ElephantAgent: 智能体系统中的上下文状态连续性

Jiankai Jin, Xiangzheng Zhang, Zhao Liu, Wenzhuo Xu, Dongdong Yang, Deyue Zhang, Quanchen Zou

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI

AI总结 针对工具和记忆投毒攻击,提出ElephantAgent协议,通过强制上下文状态连续性防御状态篡改,并利用历史可追溯性实现事后审计与恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08998 2026-07-03 cs.AI cs.CY econ.GN q-fin.EC 新提交 83%

The Token Not Taken: Sampling, State, and the Stochasticity of AI Agents

未被选取的令牌:采样、状态与AI智能体输出的变异性

Muhammad Zia Hydari, Raja Iqbal

机构 * University of Pittsburgh(匹兹堡大学) Ejento.ai

专题命中 记忆与上下文管理 :AI agent(title);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文分析AI智能体系统输出变异性的来源,区分令牌采样的内在随机性与环境、数据等外在因素,并讨论在匹配条件下变异性的可复现性及确定性执行在部署中未必导致相同行为的原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01071 2026-07-03 cs.IR cs.AI 新提交 79%

MemSyco-Bench: Benchmarking Sycophancy in Agent Memory

MemSyco-Bench:智能体记忆中的谄媚基准测试

Zhishang Xiang, Zerui Chen, Yunbo Tang, Zhimin Wei, Ruqin Ning, Yujie Lin, Qinggang Zhang, Jinsong Su

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 提出MemSyco-Bench基准,评估LLM智能体因记忆引发的谄媚问题,涵盖拒绝记忆、尊重适用范围、解决冲突、跟踪更新和个性化使用五个任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02079 2026-07-03 cs.CL cs.CR cs.LG 新提交 62%

HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety

HaloGuard 1.0:一种用于多语言AI安全的开放权重宪法分类器

Navaneeth Sangameswaran, Preetham S, Ashmiya Lenin

机构 * Astroware AI Karunya Institute of Technology and Sciences(卡鲁尼亚理工学院和科学学院)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 提出HaloGuard 1.0,一种基于宪法分类器范式的输入安全模型,在英语和多语言提示安全基准上以约十分之一于当前领先模型的参数规模达到最先进性能,通过自然语言宪法驱动合成数据生成、一对一反事实对、两层无害设计及多语言平衡实现。

Comments 30 pages, 7 figures, 20 Tables, Link: https://huggingface.co/collections/astroware/haloguard-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01988 2026-07-03 cs.AI cs.RO 新提交 57%

Episodic-to-Semantic Consolidation Without Identity Drift

无身份漂移的情景到语义巩固

Xue Qin, Simin Luan, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 针对长期运行自适应智能体中知识巩固与身份完整性之间的张力,提出将巩固作为情景记忆上的确定性函数,输出可单独寻址的语义知识层,保持代理加密身份不变,实验证明平均减少79.82%无效规划尝试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01831 2026-07-03 cs.DC cs.LG 新提交 57%

Lynx: Progressive Speculative Quantization for accelerating KV Transfer in Long-Context Inference

Lynx: 渐进式推测量化加速长上下文推理中的KV传输

Wenchen Han, Gingfung Matthew Yeung, Marco Barletta, William Toner, Amory Hoste, Adam Barker

机构 * University College London(伦敦大学学院) Huawei(华为)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.LG

AI总结 针对长上下文推理中KV缓存传输延迟问题,提出Lynx系统,通过将KV缓存分为高优先级Anchor流和低优先级Residual流,实现渐进式传输和推测解码,在降低首令牌延迟的同时保持高精度。

Comments 15 pages, 12 figures. This manuscript was originally submitted to SIGCOMM '26 in February 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03315 2026-07-03 cs.AI 版本更新 57%

Memora: A Harmonic Memory Representation Balancing Abstraction and Specificity

Memora: 一种平衡抽象与特异性的和谐记忆表示

Menglin Xia, Xuchao Zhang, Shantanu Dixit, Paramaguru Harimurugan, Rujia Wang, Victor Ruhle, Robert Sim, Chetan Bansal, Saravan Rajmohan

机构 * Microsoft(微软)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 提出Memora记忆表示,通过主抽象和线索锚点平衡抽象与特异性,结合检索策略实现高效上下文感知检索,在LoCoMo和LongMemEval基准上达到新最优。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02497 2026-07-03 cs.CV 新提交 50%

Seek to Segment: Active Perception for Panoramic Referring Segmentation

寻求分割:全景指代分割的主动感知

Song Tang, Shuming Hu, Xincheng Shuai, Henghui Ding, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 提出主动全景指代分割任务,通过记忆增强智能体PanoSeeker结合视觉语言模型与空间记忆,实现高效搜索与分割。

Comments ECCV 2026, Project Page: https://henghuiding.com/APRS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02171 2026-07-03 cond-mat.stat-mech cond-mat.soft 新提交 50%

Theory of collective learning in populations of adaptive agents

自适应智能体群体中的集体学习理论

Gerhard Jung, Johann Asnacios, Misaki Ozawa, Olivier Dauchot, Eric Bertin

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 通过扩展动力学理论,研究同质活性智能体群体通过交换策略和记忆进行分散式学习以实现宏观目标的过程,推导出策略分布的演化方程,并揭示有效奖励函数的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04101 2026-07-03 cs.CV 版本更新 50%

NEARL: Interacted Query Adaptation with Orthogonal Regularization for Medical Vision-Language Understanding

NEARL: 基于正交正则化的交互式查询自适应用于医学视觉-语言理解

Zelin Peng, Yichen Zhao, Yu Huang, Piao Yang, Feilong Tang, Zhengqin Xu, Xiaokang Yang, Wei Shen

机构 * MoE Key Lab of Artificial Intelligence(人工智能MOE实验室) AI Institute(人工智能研究院) School of Computer Science(计算机科学学院) Shanghai Jiao Tong University(上海交通大学) Department of Radiology(放射科) The First Affiliated Hospital(第一附属医院) School of Medicine(医学院) Zhejiang University(浙江大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) State Key Laboratory of Infrared Physics(红外物理国家重点实验室) Shanghai Institute of Technical Physics(上海技术物理研究所) Chinese Academy of Science(中国科学院)

专题命中 记忆与上下文管理 :planning(abstract)

AI总结 提出NEARL框架,通过统一协同嵌入变换器(USEformer)和正交交叉注意力适配器(OCA)实现双向跨模态交互,仅引入1.46M参数,在三个医学影像数据集上取得最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Agent评测 39 篇

2602.19127 2026-07-03 cs.CL 版本更新 91%

AgenticRAGTracer: A Hop-Aware Benchmark for Diagnosing Multi-Step Retrieval Reasoning in Agentic RAG

AgenticRAGTracer:用于诊断Agentic RAG中多步检索推理的跳数感知基准

Qijie You, Wenkai Yu, Wentao Zhang

机构 * University of Science and Technology Beijing(北京科技大学) Peking University(北京大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京市数据智能与安全重点实验室(北京大学))

专题命中 Agent评测 :agentic(title,title_cn);agent(abstract);分类 cs.CL

AI总结 提出首个由大语言模型自动构建的Agentic RAG基准AgenticRAGTracer,包含1305个跨领域数据点,支持逐跳验证,揭示模型在多步推理中推理链扭曲的问题。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20950 2026-07-03 cs.AI cs.SY eess.SY 新提交 88%

Power Systems Agent Benchmark: Executable Evaluation of AI Agents in Electric Power Engineering

电力系统智能体基准测试:电力工程中AI智能体的可执行评估

Sergei Trashchenkov

机构 * Electric Power Engineering(电力工程)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 提出电力系统智能体基准测试,通过确定性评估器对智能体在电力工程任务中的结构化解决方案进行可执行评估,涵盖41个任务族,并采用私有种子按需生成保留案例以防止数据污染。

Comments 19 pages, 1 figure, 2 tables. Code and data: https://github.com/trashchenkov/power-systems-agent-benchmark ; archived at https://doi.org/10.5281/zenodo.20753046 v2: fixed unresolved citations and three missing references in Section 2, reference capitalization, Table 1 caption

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27898 2026-07-03 cs.AI 版本更新 87%

A Unified Framework for the Evaluation of LLM Agentic Capabilities

LLM 代理能力评估的统一框架

Pengyu Zhu, Lijun Li, Yaxing Lyu, Qianxin Luo, Jingyi Yang, Yi Liu, Tingfeng Hui, Xinyu Yuan, Li Sun, Sen Su, Jing Shao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Chongqing University of Posts and Telecommunications(重庆邮电大学) North China Electric Power University(华北电力大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出一个统一框架,通过标准化配置、固定 ReAct 架构和离线设置,分离框架与环境效应,实现 LLM 代理能力的公平评估,并在 7 个基准、24 个领域、15 个模型上进行了大规模实证分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04532 2026-07-03 cs.CL cs.AI 版本更新 86%

Multilingual Prompt Localization for Agent-as-a-Judge: Language and Backbone Sensitivity in Requirement-Level Evaluation

多语言提示本地化用于法官-代理系统:在需求级评估中的语言与骨干敏感性

Alhasan Mahmood, Samir Abdaljalil, Hasan Kurban

机构 * Hamad Bin Khalifa University(哈马德·本·哈利法大学) Texas A&M University(德克萨斯农工大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究探讨了多语言提示在法官-代理系统评估中的影响,发现语言与骨干模型的交互作用显著,不同语言下不同模型表现各异,强调语言应作为评估变量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01874 2026-07-03 cs.AI cs.CL 新提交 84%

SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use

SkillCoach: 用于评估和增强智能体技能使用的自演化评分准则

Jiayin Zhu, Kelong Mao, Yudong Guo, Dengbo He, Sulong Xu, Simiu Gu, Yutao Yue

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 提出SkillCoach框架,通过自演化过程评分准则从技能选择、遵循、组合和反思四维度评估智能体轨迹,并利用演化准则筛选高质量训练数据,提升技能使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04390 2026-07-03 cs.AI cs.SE 版本更新 84%

A Dual-Helix Governance Approach Towards Reliable Agentic Artificial Intelligence for WebGIS Development

面向可靠WebGIS开发的代理人工智能双螺旋治理方法

Boyuan Guan, Wencong Cui, Levente Juhasz

机构 * Geographic Information Systems Center, Florida International University(佛罗里达国际大学地理信息系统中心) Geospatial Analytics, Technology and Open Research Lab, University of Florida(佛罗里达大学地理空间分析、技术与开放研究实验室)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 针对代理AI在WebGIS开发中的不可靠问题,提出双螺旋治理框架,通过知识-行为-技能三轨架构和持久知识图谱外化事实与协议,实验证明能降低代码复杂度、减少输出方差并防止制图错误。

Comments Paper submitted to and under review in Transactions in GIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30970 2026-07-03 cs.AI 新提交 83%

Behavioral Governance for Autonomous AI Agents: The AgentBound Framework

AgentBound: 自主AI智能体的可验证行为治理

Anuj Kaul, Qianlong Lan, Pranay Gupta

机构 * eBay Inc.(eBay公司)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出AgentBound框架,通过委托授权、行为宪法和站点行动合同三权独立评估,结合形式化决策模型实现AI智能体行为的可验证治理,并生成加密可验证的治理收据以支持独立重放验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22737 2026-07-03 cs.AI cs.CL cs.SE 新提交 82%

GroundEval: A Deterministic Replacement for LLM-as-Judge in Stateful Agent Evaluation

GroundEval:有状态智能体评估中LLM评判的确定性替代方案

Jeffrey Flynt

机构 * Independent Researcher(独立研究员)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 提出GroundEval框架,通过记录智能体搜索、获取、引用和访问的证据轨迹,以确定性方式评估其回答,解决LLM评判无法检测的证据路径失效问题。

Comments Streamlined entry point into framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02141 2026-07-03 cs.AI 新提交 79%

A$^{2}$utoLPBench: An Auto-Generated, Agent-Friendly LP Benchmark via Inverse-KKT Construction

A$^{2}$utoLPBench:通过逆KKT构造自动生成的、智能体友好的线性规划基准

Shuo Ren, Yaohui Han, Yifan Shi, Libo Shen, Haodong Lu, Dongfang Wu, Rongliang Fu, Bei Yu, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出A$^{2}$utoLPBench,一种通过逆KKT条件自动生成线性规划文本问题的基准,提供无限新问题、难度可控、答案正确且防数据泄露。

Comments 25 pages and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01846 2026-07-03 cs.AI 新提交 79%

CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training

CLAP:领域智能体后训练的闭环训练、评估与发布控制

Fangfei Li, Chenyang Zhao, Long Wang, Feng Tian, Zhiyue Zheng, Lv Guo

机构 * MatrixOrigin(矩阵起源)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出CLAP闭环方法,通过数据验证、奖励/KL诊断、离线门控和应用链回放,在制造场景中评估后训练效果,发现仅部分批次提升且存在KL风险,支持集成循环管理。

Comments 6 pages, 1 figure. Accepted to CRAE 2026; to appear in SPIE Proceedings. Best Poster Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01415 2026-07-03 cs.LG cs.DC 新提交 79%

The Rollout Infrastructure Tax in Coding-Agent Reinforcement Learning

编码智能体强化学习中的回滚基础设施开销

Daniel Thi Graviet, Lovre Pesut, Ivan Dagelic, Vedran Jukic, Ivan Burazin

机构 * Daytona

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 研究四种执行环境(单容器、托管沙箱、Kubernetes编排容器、云虚拟机)在编码智能体RL中的冷启动延迟和工人工时差异,发现优化执行基础设施可显著提升训练效率。

Comments Preprint. 6 pages, 6 figures, 2 tables. Submitted to ACM SoCC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23128 2026-07-03 cs.HC cs.AI cs.MA 版本更新 79%

It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents

这是一个陷阱!面向网络代理的任务重定向说服基准

Karolina Korgul, Yushi Yang, Arkadiusz Drohomirecki, Piotr Błaszczyk, Will Howard, Lukas Aichberger, Chris Russell, Philip H. S. Torr, Adam Mahdi, Adel Bibi

机构 * University of Cambridge(剑桥大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出TRAP基准,评估大型语言模型驱动的网络代理在动态网页中易受提示注入攻击的程度,发现平均25%的任务中代理被重定向,揭示了心理驱动的系统漏洞。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01709 2026-07-03 cs.AI cs.LG 新提交 79%

COMFYCLAW: Self-Evolving Skill Harnesses for Image Generation Workflows

COMFYCLAW:面向图像生成工作流的自进化技能工具包

Zongxia Li, Dawei Liu, Fuxiao Liu, Yuhang Zhou, Xiyang Wu, Jingxi Chen, Jing Xie, Xiaomin Wu, Lichao Sun

机构 * University of Maryland(马里兰大学) University of Pennsylvania(宾夕法尼亚大学) Nvidia(英伟达) Lehigh University(里海大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出COMFYCLAW框架,通过类型化图编辑、区域级VLM验证器和渐进式技能库进化,提升ComfyUI工作流构建的代理可靠性和性能,在多个基准上取得最佳平均评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10687 2026-07-03 cs.MA cs.AI cs.CL cs.GT 版本更新 76%

Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents

谁获得奖励 & 谁受到责备?面向多LLM智能体的评估对齐训练信号

Chih-Hsuan, Yang, Tanwi Mallick, Le Chen, Krishnan Raghavan, Amal Gueroudji, Ian T. Foster, Rajeev Thakur

机构 * Argonne National Laboratory(阿贡国家实验室) University of Chicago(芝加哥大学)

专题命中 Agent评测 :agent(abstract,comments);multi-agent(abstract);分类 cs.AI、cs.CL;planning(comments)

AI总结 提出一个理论框架,结合合作博弈归因与过程奖励建模,将系统级评估转化为智能体信用和消息级信号,用于多LLM智能体训练。

Comments Accepted at the NeurIPS 2025 Workshop on Bridging Language, Agent, and World Models for Reasoning and Planning (LAW 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02469 2026-07-03 cs.SE cs.AI cs.CL 新提交 75%

TestEvo-Bench: An Executable and Live Benchmark for Test and Code Co-Evolution

TestEvo-Bench:一个可执行且动态的测试与代码协同演化基准

Jiale Amber Wang, Kaiyuan Wang, Pengyu Nie

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE

AI总结 提出TestEvo-Bench基准,包含测试生成和更新两类任务,基于真实提交历史并支持执行指标,评估自动化代理在代码变更后同步调整测试的能力。

Comments TestEvo-Bench leaderboard and data explorer are hosted at https://www.testevo-bench.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00920 2026-07-03 cs.CV 新提交 75%

GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images

GMO-E$^2$DIT:面向电商图像的接地多操作编辑

Zipeng Guo, Xiaoan Liu, Lichen Ma, Cheng Wang, Yu He, Xiaolong Fu, Jingling Fu, Xinyuan Shan, Shaojie Guo, Luohang Liu, Junshi Huang, Yan Li

机构 * Wuhan University(武汉大学) Xi’an Jiaotong University(西安交通大学) Sun Yat-sen University(中山大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract)

AI总结 提出GMO-E$^2$DIT框架,通过VLM代理构建区域接地编辑议程,结合掩码条件图像编辑器和反思循环,实现多操作、可审计的电商图像编辑,在指令准确性和编辑保真度上超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01813 2026-07-03 cs.CV cs.AI 新提交 70%

MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models

MMBench-Live:一个持续演进的多模态模型基准

Yuanzhi Liu, Shousheng Zhao, Bo Zhou, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) PRIS-CV

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出MMBench-Live,一个通过多智能体自动化流水线构建的持续演进多模态基准,解决静态基准的时效性、数据污染和维护成本问题,采用分布一致性更新策略,每次更新成本约30美元。

详情

展开后加载摘要…

URL PDF HTML 收藏