arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1095 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1095 篇

2606.06546 2026-06-08 cs.LG 新提交 70%

Elmes*: Automated Construction of Fine-Grained Evaluation Rubrics for Large Language Models in Long-Tail Educational Scenarios

Elmes*:面向长尾教育场景的大语言模型细粒度评估量规自动构建

Tao Liu, Ye Lu, Ruohua Zhang, Siyu Song, Wentao Liu, Aimin Zhou, Hao Hao

机构 * Shanghai Institute of AI for Education, East China Normal University(上海人工智能教育研究院,东华师范大学) School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,东华师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 提出Elmes*框架,自动构建细粒度场景特定量规,用于评估大语言模型在教育场景中的多维教学能力,构建Edu-330基准并揭示模型差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12860 2026-08-14 cs.RO 新提交 67%

HumanoidVLN: A Physics-Grounded Simulator and Benchmark for Vision-Language Navigation Across Diverse Humanoid Embodiments

HumanoidVLN:面向多种人形机器人形态的基于物理的视觉语言导航模拟器与基准

Quan-Dung Pham, Anh Dao, The-Anh Nguyen, Minh Nguyen-Dinh, Phuong Nam Dang, Tri Pham, Hung Tran, Bach Dao, Tuyen P. Le, Truong Nguyen, Quan Nguyen

机构 * VinMotion, Inc.(VinMotion公司) University of Southern California(南加州大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本研究针对人形机器人VLN的物理约束与形态差异问题,提出基于NVIDIA Isaac Sim的HumanoidVLN模拟器与基准,验证其与多种模型、机器人的兼容性,实验揭示了VLN模型、控制器与人形形态的交互关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12127 2026-08-13 cs.CV 新提交 67%

SCOPE-Router: Cost-Aware Open-Set VLM Routing for Execution-Oriented Tasks

SCOPE-Router:面向执行导向任务的成本感知开放集视觉语言模型路由

Tao Yu, Yifei Qu, Zhiqing Cui, Pengfei Zhou, Zhongtian Luo, Yujia Yang, Shenghua Chai, Haopeng Jin, Zhenghao Zhang, Xinming Wang, Hongzhu Yi, Wangbo Zhao, Zhenglin Wan, Yan Huang, Yeshani, Jinwen Luo, Yang You

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学院大学) NUS(新加坡国立大学) Tencent(腾讯)

专题命中 Agent评测 :agentic(abstract,abstract_cn)

AI总结 本文提出SCOPE-Router与CRM+RCCR,构建执行导向VLM路由基准VLM-ExecRouterBench,解决现有VLM路由局限,在多基准上取得更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09573 2026-08-11 cs.CV 新提交 67%

VideoVIBE: A Video-Grounded Diagnostic Benchmark for One-Shot Interactive Website Generation

VideoVIBE:用于一次性交互式网站生成的基于视频的诊断基准

Jiajun Xu, Yanghao Zhou, Jingyun Liao, Yu Bai, Jinxing Zhou, Chengliang Liu, Changsen Yuan, Bo Wang, Qian Liu

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 针对现有一次性交互式网站生成质量评估的不足,提出VideoVIBE基准与V2Lens多智能体系统,实验显示V2Lens可提升Video MLLM的评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09312 2026-08-11 cs.NI 新提交 67%

Automated Synthesis of Deterministic Cross-Domain Interfaces

确定性跨域接口的自动合成

Konstantinos Christodoulopoulos, Antonis Selentis-Boulntadakis

专题命中 Agent评测 :agent(abstract,abstract_cn)

AI总结 该研究提出框架,利用LLM实现智能体与处理程序模块,自动合成跨域确定性网络的静态、动态契约,经实验验证其动态契约性能优于静态配置,且分工模式可保障模型可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04653 2026-08-06 cs.CV cs.RO 新提交 67%

Overcoming Statistical Bias in Action-Controllable World Models

克服动作可控世界模型中的统计偏差

Yuhong Shi, Zhenhao Chu, Jie Wei, Jun Hao, Jianyi Liu, Jingwen Fu

专题命中 Agent评测 :agent(abstract);planning(abstract)

AI总结 该研究针对动作可控世界模型的统计偏差问题,提出CoCo反事实一致性框架,结合ARC、DE评估指标及Mini-SSMB数据集,在多项任务上提升了动作可控性与视频预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03874 2026-08-05 cs.AI cs.CL cs.LG 新提交 67%

ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?

ContinualSkillBench:大语言模型智能体真的能发展其能力吗?

Tianyi Guan, Yiding Wang, Haotong Yang, Siyuan Cao, Shirui Liu, Yi Hu, Jiaqi Li, Muhan Zhang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究提出动态评估框架ContinualSkillBench,发现大语言模型智能体顺序执行可提升任务性能,上下文学习与显式技能维护效果相当,弱模型易积累零散技能,当前机制仍难整合经验为稳健可迁移技能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00964 2026-08-04 cs.CY 新提交 67%

Copyright Is the Headline; Capability Is the Blind Spot: AI Technology in the Book-Publishing Trade Press, November 2025--August 2026

版权是头条,能力是盲区:2025年11月—2026年8月图书出版行业媒体中的人工智能技术

Fred Zimmerman

专题命中 Agent评测 :agent(abstract);workflow(abstract)

AI总结 本研究通过分析多国行业媒体的89篇文章,指出图书出版领域AI报道存在能力盲区,提出设立常设AI报道板块等改进建议。

Comments 7 pages, 2 figures. 15-page Supplemental Information, coded 89-item corpus, crosstabs, BibTeX database, and citation audit included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00012 2026-08-04 cs.CL cs.AI cs.CY cs.LG 新提交 67%

Obshazard-bench: Benchmarking Multimodal Foundation Models for Real-Time Disaster Intelligence from Raw Earth Observation Streams

Obshazard-bench:面向原始地球观测流的实时灾害情报多模态基础模型基准测试

Fengxiang Wang, Qiuyang Yu, Yueying Li, Mingshuo Chen, Chengchi Fei, Kaiyi Xu, Lixin Gu, Wangxu Wei, Junchao Gong, Lipeng Ma, Jiong Wang, Fenghua Ling, Wenlong Zhang, Xue Yang, Wenjing Yang, Ben Fei, Long Lan

机构 * National University of Defense Technology(国防科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究推出Obshazard-bench基准测试,评估多模态基础模型的实时灾害情报能力,发现现有模型在将原始多通道物理观测转化为符合决策需求的灾害推理方面存在显著局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27288 2026-07-31 cs.CR 新提交 67%

Open Security Benchmark: Towards Autonomous Enterprise Cyber Defense

开放安全基准:面向自主企业网络防御

Gal Engelberg, Michael Arenzon, Leon Goldberg

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 该研究针对自主企业网络防御智能体AI的环境数据缺口,提出Open Security Benchmark框架,通过冻结环境等设计实现端到端评估,还规划了框架的扩展方向。

Comments 14 pages, 3 tables. Code: https://github.com/OpenSecurityAI/osb ; datasets: https://huggingface.co/OpenSecurityAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26115 2026-07-30 cs.CR cs.AI cs.CL cs.LG 新提交 67%

GPT-Red: Automated Red Teaming via Self-Play at Scale

GPT-Red:基于大规模自博弈的自动化红队测试

Eric Wallace, Christopher A. Choquette-Choo, Nikhil Kandpal, Sam Toyer, Dylan Hunn, Stephanie Lin, Yuxin Wen, Xiangyu Qi, Christopher Wolff, Zizhao Wang, Milad Nasr, Sicheng Zhu, Chuan Guo, Juan Felipe Cerón Uribe, Kaiwen Wang, Aiden Low, Kai Xiao, Kai Chen

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究推出GPT-Red,一种基于大规模自博弈的自动化红队测试智能体,可发现新型提示注入攻击、攻破过往模型且泛化能力强,用于提升LLM鲁棒性并形成自我改进飞轮。

Comments 28 pages.13 main pages and 13 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24866 2026-07-29 cs.CR 新提交 67%

The Missing Layer: Specification Infrastructure for AI Oversight

缺失的层次:人工智能监督的规范基础设施

Satyam Kumar, Saurabh Jha

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 研究指出人工智能安全监督存在协调差距,提出两轴分类法。针对规范层缺乏成熟学科标志的问题,给出六项设计原则,以CARMA为例展示如何让规范可组合,助独立团队构建缺失部分实现有效监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20645 2026-07-24 cs.CL cs.AI cs.LG 新提交 67%

Frontier Financial Judgement: Can agents tell what might move a stock?

前沿金融判断:智能体能否判断哪些因素会推动股票走势?

Joshua Harris

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究引入前沿金融判断基准,结合多种文章创建评估项目,让智能体区分金融信息。最强智能体匹配率仅52.4%,智能体在误报率等方面有显著差异,且在多方面存在权衡,阻碍新闻流过滤在实践中的可靠部署。

Comments 19 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21533 2026-07-24 quant-ph 新提交 67%

Benchmarking Agents for Proving Theorems in Quantum Algorithms and Quantum Information

量子算法和量子信息定理证明智能体的基准测试

Lei Zhang, Yusheng Zhao, Yimeng Cao, Ranyiliu Chen, Mingrui Jing, Jizhe Lai, Ziao Tang, Jingu Xie, Hongshun Yao, Xuanqiang Zhao, Guocheng Zhen, Chengkai Zhu, Xin Wang

专题命中 Agent评测 :AI agent(abstract);agentic(abstract)

AI总结 研究人工智能智能体在量子算法和信息定理证明的能力,引入两个Lean 4基准测试,在通用框架下评估四个模型,发现LAD可提升性能,揭示智能体证明弱点及模型成本差异,为开发更优证明智能体提供基线。

Comments 22 pages, including appendix; 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16831 2026-07-21 cs.DC 新提交 67%

Technical Report: AI-Assisted Gated DeltaNet Optimization on NVIDIA Blackwell

技术报告:NVIDIA Blackwell上的人工智能辅助门控DeltaNet优化

Hyunjun Shin, Jiseung Jang, Jaewoo Maeng, Hyunjun Kim

专题命中 Agent评测 :agent(abstract,abstract_cn)

AI总结 研究以MSInfer团队提交给MLSys 2026 FlashInfer竞赛的作品为例,探讨人工智能辅助GPU编程。该作品优化门控DeltaNet解码和预填充,在NVIDIA B200/Blackwell上实现1.58倍加速,揭示竞赛级优化需考虑多方面,将其视为端到端系统问题。

Comments 10 pages, 5 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16215 2026-07-21 cs.AI cs.CL cs.SE 新提交 67%

RAIL Guard: Closing the Evaluation-to-Remediation Gap in Responsible AI for LLM Agents

RAIL Guard:弥合大语言模型智能体负责任人工智能中评估与修复的差距

Sumit Verma, Pritam Prasun, Pritish Kumar

机构 * Responsible AI Labs(负责任人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 研究针对大语言模型智能体评估与修复差距问题,提出RAIL Guard闭环负责任人工智能管道,在多维度评估输出并迭代修复。实验表明其闭环修复收敛率高,能减少不安全执行,还区分了可修复与结构维度问题,系统开源。

Comments 15 pages, 10 figures, 4 tables. Code: https://github.com/Responsible-AI-Labs/rail-score-sdk (Python). Benchmark: https://huggingface.co/datasets/responsible-ai-labs/rail-guard-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13465 2026-07-16 cs.CL cs.AI cs.HC cs.MA cs.SE 新提交 67%

DevicesWorld: Benchmarking Cross-Device Agents in Heterogeneous Environments

DevicesWorld:异构环境中跨设备智能体的基准测试

Huatao Li, Xinwei Geng, Yuheng Wang, Yutong Li, Runde Yang, Hantao Chen, Shu Yao, Jingru Fan, Xuhui Ren, Yuanyuan Zhao, Fei Huang, Chen Qian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Honor Device Co., Ltd(荣耀终端有限公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 研究针对智能体跨设备协同操作难评估的问题,引入DevicesWorld基准测试,整合多类设备环境及众多任务,通过固定评估集评估五个前沿智能体系统,发现成功率低,为可靠跨设备智能体研究提供了可执行、可重现及有诊断作用的评估。

Comments https://github.com/AgenticOrgLab/DevicesWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13190 2026-07-16 physics.ed-ph 新提交 67%

Reliable isomorphic physics problem generation with large language models

基于大语言模型的可靠同构物理问题生成

Xian Wu, Lindim Ismaili

专题命中 Agent评测 :agent(abstract);workflow(abstract)

AI总结 研究利用大语言模型代理工作流程生成同构物理问题,通过结合提示链等技术,在公共网站实现。开发评分标准并测试,89%生成问题可直接用,虽有局限,但显示出基于LLM系统在教学问题生成上的潜力与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11632 2026-07-14 cs.AI cs.CL cs.LG cs.SI physics.soc-ph 新提交 67%

Reproducing human biases in route choice using large language models: Toward scalable behavioral modeling

使用大语言模型在路径选择中重现人类偏差:迈向可扩展的行为建模

Jiangtao Han, Shoufeng Ma, Shuxian Xu, Geng Li, Shuai Ling, Ning Jia, Zhengbing He

机构 * Laboratory of Computation and Analytics of Complex Management Systems (CACMS), Tianjin University, China(复杂管理系统的计算与分析实验室,天津大学,中国) College of Management and Economics, Tianjin University, China(管理与经济学院,天津大学,中国) Faculty of Science and Engineering, University of Nottingham Ningbo China(科学与工程学院,诺丁汉大学宁波校区,中国)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究探讨大语言模型能否在不明确前景理论参数时重现人类路径选择行为偏差,设计行为评估框架并比较,发现其能重现偏差及展现相关决策行为,为人类决策建模及相关研究提供可扩展替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04688 2026-07-07 cs.LG cs.AI cs.CE cs.CL 新提交 67%

URSA: Chemistry-Aware Benchmark for Utilitarian Retrosynthesis Assessment

URSA:用于功利性逆合成评估的化学感知基准测试

Bogdan Zagribelnyy, Ivan Ilin, Nikita Bondarev, Anton Morgunov, Arkadii Lin, Maksim Kuznetsov, Rim Shayakhmetov, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

机构 * Insilico Medicine AI Limited(Insilico Medicine AI有限公司) Independent researcher(独立研究者) Insilico Medicine Canada Inc.(Insilico Medicine加拿大公司) Insilico Medicine Hong Kong Ltd.(Insilico Medicine香港有限公司)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究针对药物发现中合成规划任务,介绍URSA评估框架,能从形式和化学合理性角度评估合成路线,全面评估传统及基于大语言模型的逆合成解决方案,发现大语言模型在解决合成规划任务上不如专业模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04542 2026-07-07 cs.LG cs.AI cs.SE 新提交 67%

Auto: The AGI Compiler

自动:通用人工智能编译器

Jaber Jaber, Osama Jaber

机构 * RightNow AI(即时人工智能)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 研究提出通用人工智能编译器Auto,通过记录智能体行为,提取确定性部分转化为程序或专家,生成带保障的认知二进制文件。在基准测试中表现良好,还量化了失败模式,强调校准和参考保真度对正确性的决定作用。

Comments 10 pages, 4 figures, 3 tables, 1 algorithm. Code: https://github.com/RightNow-AI/auto

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31270 2026-07-01 cs.CV cs.AI cs.CL cs.CY cs.LG 新提交 67%

Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents

从失败中学习:计算机使用代理的推理时自我改进

Xueqiao Sun, Xiaohan Wang, Ludwig Schmidt, Serena Yeung-Levy, Yuhui Zhang

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出失败驱动的自我改进循环,利用LLM诊断失败模式并生成代码补丁,在OSWorld基准上将OpenCUA-72B模型成功率从42.3%提升至48.9%,无需额外训练成本。

Comments Published in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31213 2026-07-01 cs.CL cs.AI cs.LG 新提交 67%

Can LLMs Imagine Moral Alternatives Beyond Binary Dilemmas?

LLMs能否想象超越二元困境的道德替代方案?

Jongchan Choi, Nari Yang, Sung Soo Park, Jaemin Cho, Han Seoyoung, Haerin Shin, Jun-Hyung Park

机构 * Korea University(高丽大学) XenoStep AI Hankuk University of Foreign Studies(韩国外国语大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对LLMs在道德困境中缺乏替代方案想象能力的问题,提出MoralAltDataset数据集,通过引入妥协和重构替代方案,发现LLMs倾向于选择替代方案,且生成的替代方案在质量和伦理标准上优于人类。

Comments "23 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28277 2026-06-29 cs.LG cs.AI cs.CL cs.CY 新提交 67%

Towards Automating Scientific Review with Google's Paper Assistant Tool

迈向自动化科学评审:谷歌论文助手工具

Rajesh Jayaram, Drew Tyler, David Woodruff, Corinna Cortes, Yossi Matias, Vahab Mirrokni, Vincent Cohen-Addad

机构 * Google Research USA(谷歌美国研究)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出四层AI-人类协作分类法,并介绍论文助手工具(PAT),通过推理缩放技术实现深度科学评审,在SPOT基准上数学错误召回率提升34%,并在STOC和ICML会议中成功识别关键错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26479 2026-06-26 cs.CR cs.AI cs.CL cs.LG 新提交 67%

Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents

LLM智能体中针对提示注入的带外防御的自适应评估

Praneeth Narisetty, Shiva Nagendra Babu Kore, Uday Kumar Reddy Kattamanchi, Jayaram Kumarapu

机构 * LaunchSafe Research(LaunchSafe研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文组织带外防御(如CaMeL、Progent)为经典完整性保护与引用监视实例,并在AgentDojo上对Qwen2.5-7B代理进行自适应评估,结果显示Progent将攻击成功率从25.8%降至4.2%,手工自适应攻击未提升成功率。

Comments 12 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23127 2026-06-23 cs.AI cs.CL cs.SE 新提交 67%

Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation

管理LLM智能体中的程序性记忆:控制、适应与评估

Julia Belikova, Rauf Parchiev, Evgeny Egorov, Grigorii Davydenko, Gleb Gusev, Andrey Savchenko, Maksim Makarenko

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 提出AFTER基准(382个企业任务,22种程序性技能),评估技能在任务、角色和模型间的迁移,实验表明程序性记忆可提升3.7-6.7点性能,跨模型准确率达73.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20661 2026-06-23 cs.AI cs.CL cs.LG 新提交 67%

From Knowing to Acting: Benchmarking Self-Awareness Capability of LLM Agents

从知道到行动:基准测试LLM代理的自我意识能力

Yifan Li, Shengbin Yue, Boyu Feng, Jinhu Qi, Bo Ke, Zixing Song, Hongru Wang, Zhongyu Wei, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) University of Edinburgh(爱丁堡大学) Tencent(腾讯) University of Bristol(布里斯托大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出KAPRO框架和KAware数据集,通过解耦元认知判断与自主执行,评估LLM代理的自我意识能力,发现其与任务成功强相关但在内部能力场景中下降,开源模型易过度使用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18550 2026-06-18 cs.CR 新提交 67%

The Gate Is Only as Honest as Its Contracts: ContractGuard for the Contract Layer of Risk-Aware Causal Gating

门仅与其合约一样诚实:面向风险感知因果门控合约层的ContractGuard

Laxmipriya Ganesh Iyer, Rahul Suresh Babu

专题命中 Agent评测 :agent(abstract);tool use(abstract)

AI总结 针对工具增强型LLM代理的间接提示注入,提出ContractGuard,通过验证合约完整性(而非风险标签)来防御攻击,在基准测试中实现零注入成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16849 2026-06-18 cs.NE cs.GR cs.HC 新提交 67%

Evolution & Foundation: AI Shares Creative Control

进化与基础模型:AI共享创意控制

Dylan Banarse, Stephen Todd, William Latham, Frederic Fol Leymarie

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 提出一种结合遗传算法与多模态AI基础模型的框架,实现自动化设计3D有机形态,将艺术家角色从直接选择转变为系统设计,加速创意探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18250 2026-06-17 cs.CV 新提交 67%

Future Dynamic 3D Reconstruction: A 3D World Model with Disentangled Ego-Motion

未来动态3D重建:一种具有解耦自运动的3D世界模型

Nils Morbitzer, Jonathan Evers, Artem Savkin, Thomas Stauner, Nassir Navab, Federico Tombari, Stefano Gasperini

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract)

AI总结 提出FR3D世界模型,通过解耦场景3D演化与智能体轨迹,利用教师-学生蒸馏策略实现从单目观测到未来动态3D重建的几何一致性和零样本泛化。

Comments ICML 2026. Project page: https://fr3d-wm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏