arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

2026-05-13 至 2026-05-13 共收录 9
2605.12481 2026-05-13 cs.AI

ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents

ToolCUA:迈向计算机使用代理的最优GUI工具路径协调

Xuhao Hu, Xi Zhang, Haiyang Xu, Kyle Qiao, Jingyi Yang, Xuanjing Huang, Jing Shao, Ming Yan, Jieping Ye

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文提出ToolCUA,通过分阶段训练范式学习最优GUI-工具路径选择,利用交互式轨迹缩放管道和工具引导的GUI RFT提升关键切换点决策,实验显示其在OSWorld-MCP上准确率达46.85%,优于基线模型66%,证明了有效的GUI-工具协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12357 2026-05-13 cs.AI

$δ$-mem: Efficient Online Memory for Large Language Models

$δ$-mem: 高效的大型语言模型在线内存

Jingdi Lei, Di Zhang, Junxian Li, Weida Wang, Kaixuan Fan, Xiang Liu, Qihan Liu, Xiaoteng Ma, Baian Chen, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Mind Lab Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出$δ$-mem机制,通过紧凑的在线状态与注意力计算直接耦合,提升模型在长文本任务中的表现,无需全微调或替换backbone。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12167 2026-05-13 cs.RO cs.CV

From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation

从想象的未来到可执行的动作:用于机器人操作的潜在动作混合

Yajie Li, Bozhou Zhang, Chun Gu, Zipei Ma, Jiahui Zhang, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

AI总结 本文提出MoLA,一种面向控制的接口,将想象的未来视频转化为可执行的表示,通过混合预训练的逆动力学模型,提升机器人操作的稳定性和通用性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12090 2026-05-13 cs.RO cs.CL cs.CV

World Action Models: The Next Frontier in Embodied AI

世界动作模型:具身AI的下一个前沿

Siyin Wang, Junhao Shi, Zhaoyang Fu, Xinzhe He, Feihong Liu, Chenchen Yang, Yikang Zhou, Zhaoye Fei, Jingjing Gong, Jinlan Fu, Mike Zheng Shou, Xuanjing Huang, Xipeng Qiu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学)

AI总结 本文探讨了具身AI中的世界动作模型(WAMs),通过整合环境动态预测模型,统一预测状态建模与动作生成,提出结构化分类体系并分析数据生态,为该领域提供系统性综述。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03061 2026-05-13 cs.CV

Can Nano Banana 2 Replace Traditional Image Restoration Models? An Evaluation of Its Performance on Image Restoration Tasks

Nano Banana 2能否替代传统图像修复模型?对其在图像修复任务上的性能评估

Weixiong Sun, Xiang Yin, Chao Dong

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) Fudan University(复旦大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院)

AI总结 本文评估了Nano Banana 2在图像修复任务中的性能,发现提示设计至关重要,简洁提示和显式保真约束能平衡重建与感知质量。模型在全参考性能上表现竞争,用户研究中表现优异,但在感知质量与修复保真度之间存在差距,需改进可控性与保真度评估。

Comments Accepted by CVPR 2026 Workshop AAVM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03853 2026-05-13 cs.CV

UGround: Towards Unified Visual Grounding with Unrolled Transformers

UGround: 向统一视觉接地迈进的展开变换

Rui Qian, Xin Yin, Chuanhang Deng, Zhiyuan Peng, Jian Xiong, Wei Zhai, Dejing Dou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Zhejiang University(浙江大学)

AI总结 UGround通过引入Policy-Prompted Masking机制,动态选择展开变换层作为掩码提示,解决传统方法依赖固定最后一层和隐式投影的问题,统一了从传统参照表达分割到新提出的推理分割等多种视觉接地任务。

Comments This work has been accepted to ICML 2026, please refer to https://github.com/rui-qian/UGround

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11762 2026-05-13 cs.RO

NavOL: Navigation Policy with Online Imitation Learning

NavOL:基于在线模仿学习的导航策略

Xiaofei Wei, Chun Gu, Li Zhang

机构 * Shanghai Innovation Institute(上海创新研究院) School of Data Science, Fudan University(复旦大学数据科学学院)

AI总结 NavOL通过在线模仿学习在仿真环境中训练导航策略,利用预训练的扩散策略和全局规划器,提升学习效率并减少分布偏移,实现在50个场景中每小时生成2000多条轨迹。

Comments Project page: https://logosroboticsgroup.github.io/NavOL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10984 2026-05-13 cs.CV

Principle-Guided Supervision for Interpretable Uncertainty in Medical Image Segmentation

基于原则的可解释不确定性监督在医学图像分割中

An Sui, Yuzhu Li, Gunter Schumann, Fuping Wu, Xiahai Zhuang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑启发智能科学研究院) National Heart and Lung Institute, Imperial College London(伦敦帝国理工学院国家心脏和肺研究所)

AI总结 本文提出PriUS框架,通过原则指导提升医学图像分割中不确定性的可解释性,实验表明其在保持分割性能的同时提升了不确定性估计的一致性。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10956 2026-05-13 cs.SE cs.AI

Project-Level C-to-Rust Translation via Pointer Knowledge Graphs

基于指针知识图谱的项目级C到Rust翻译

Zhiqiang Yuan, Wenjun Mao, Zhuo Chen, Xiyue Shang, Chong Wang, Yiling Lou, Xin Peng

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出基于指针知识图谱的项目级C到Rust翻译方法PtrTrans,通过增强代码依赖图的指针语义,提升生成Rust代码的安全性和正确性,实验表明其在安全性与功能性上均优于现有方法。

Comments Accepted by FSE'26

详情

展开后加载摘要…

URL PDF HTML 收藏