arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

2026-06-03 至 2026-06-03 共收录 8
2606.03682 2026-06-03 cs.RO

GN0: Toward a Unified Paradigm for Generation, Evaluation, and Policy Learning in Visual-Language Navigation

GN0:迈向视觉语言导航中生成、评估与策略学习的统一范式

Xinhai Li, Xiaotao Zhang, Yuehao Huang, Jiankun Dong, Tianhang Wang, Sunyao Zhou, Yunzi Wu, Chengnuo Sun, Yunfei Ge, Qizhen Weng, Chi Zhang, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom(人工智能研究院,中国电信) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Tongji University(同济大学) Fudan University(复旦大学) Jiangsu University(江苏大学)

AI总结 提出GN0统一框架,通过自动生成大规模导航数据集GN-Matrix、基于3DGS的高保真仿真平台和BEV基准GN-Bench,结合RL驱动的导航基础模型BAE,在VLN任务上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03509 2026-06-03 cs.CV

EvoMemNav: Efficient Self-Evolving Fine-Grained Memory for Zero-Shot Embodied Navigation

EvoMemNav: 用于零样本具身导航的高效自进化细粒度记忆

Zuhao Ge, Xiaosong Jia, Chao Wu, Yuchen Zhou, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI (TEAI), Fudan University(可信具身人工智能研究院,复旦大学) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

AI总结 提出EvoMemNav框架,通过构建视觉-语义记忆图并采用预算驱动的粗到细策略,结合反射驱动写回机制,实现零样本具身导航中高效、自进化的细粒度记忆,提升多实例区分和停止验证性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03203 2026-06-03 cs.AI

MedCUA-Bench: A Screenshot-Only Benchmark for Clinical Computer-Use Agents

MedCUA-Bench: 一个仅基于截图的临床计算机使用代理基准测试

Jia Yu, Zilong Wang, Xinyang Jiang, Dongsheng Li, Shuo Wang

机构 * Microsoft Research Asia(微软亚洲研究院) Digital Medical Research Center, School of Basic Medical Sciences, Fudan University(复旦大学基础医学院数字医学研究中心) Shanghai Key Laboratory of MICCAI(上海MICCAI重点实验室)

AI总结 提出 MedCUA-Bench,一个覆盖10个医学领域18个临床场景的交互式基准,通过确定性检查器评估任务完成和五个临床安全维度,揭示当前代理在真实临床软件上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03168 2026-06-03 cs.CV

JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation

JAVEDIT: 联合音频-视觉指令引导视频编辑与智能体数据策展

Yinan Chen, Chuming Lin, Zhennan Chen, Yuxiang Zeng, Junwei Zhu, Yali Bi, Xijie Huang, Chengming Xu, Donghao Luo, Zhucun Xue, Xiaobin Hu, Chengjie Wang, Yong Liu, Jiangning Zhang, Shuicheng Yan

机构 * Zhejiang University(浙江大学) Tencent Youtu Lab(腾讯优图实验室) Nanjing University(南京大学) University of Auckland(奥克兰大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学)

AI总结 针对联合音频-视觉编辑缺乏数据集和基准的问题,提出首个大规模高质量数据集JAVEdit-100k、基准JAVEditBench以及基线模型JAVEdit,在六项指标中五项超越所有基线。

Comments Equal contributions from first two authors. Project page: https://ryanchenyn.github.io/projects/JAVEdit Code: https://github.com/RyanChenYN/JAVEdit Dataset: https://huggingface.co/datasets/Coraxor/JAVEdit-100k

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02739 2026-06-03 cs.SD cs.AI eess.AS

EntangleCodec: A Unified Discrete Audio Tokenizer via Semantic-Acoustic Entanglement

EntangleCodec:通过语义-声学纠缠的统一离散音频分词器

Hui Li, Yangfan Gao, Junlin Shang, Changhao Jiang, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学)

AI总结 提出EntangleCodec,一种通过将音频与丰富标题对齐学习语义-声学联合表示的统一离散音频分词器,在紧凑令牌流中捕获语言内容、说话人身份、情感、韵律和声学场景,并通过流匹配扩散解码器实现高质量重建,在音频理解和生成任务上均取得领先性能。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01166 2026-06-03 cs.CR cs.CL

BraveGuard: From Open-World Threats to Safer Computer-Use Agents

BraveGuard: 从开放世界威胁到更安全的计算机使用代理

Yunhao Feng, Xiaohu Du, Xinhao Deng, Yifan Ding, Ming Wen, Yixu Wang, Yuxiang Xie, Baihui Zheng, Yingshui Tan, Yige Li, Yutao Wu, Kerui Cao, Wenke Huang, Yanming Guo, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Ant Group(蚂蚁集团) Hunan Institute of Advanced Technology(湖南高级技术研究所) Alibaba Group(阿里巴巴集团) Singapore Management University(新加坡管理大学) Deakin University(德肯大学) Nanyang Technological University(南洋理工大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 提出BraveGuard框架,通过从开放世界威胁信号和真实代理轨迹中训练防护模型,实现轨迹级别的安全检测,显著提升计算机使用代理的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08173 2026-06-03 cs.AI

The Agent's First Day: Benchmarking Learning, Exploration, and Scheduling in the Workplace Scenarios

Agent 的第一天:在工作场景中基准测试学习、探索和调度

Daocheng Fu, Jianbiao Mei, Rong Wu, Xuemeng Yang, Jia Xu, Ding Wang, Pinlong Cai, Yong Liu, Licheng Wen, Botian Shi

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对多模态大语言模型在动态工作场景中面临的任务调度、主动探索和持续学习三大挑战,提出动态评估环境 EvoEnv,实验表明现有 agent 在这些方面存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08726 2026-06-03 math.OC cs.LG

Decentralized Stochastic Nonconvex Optimization under the $(L_0,L_1)$-Smoothness

$(L_0,L_1)$-光滑条件下的去中心化随机非凸优化

Luo Luo, Xue Cui, Tingkai Jia, Cheng Chen

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) East China Normal University(华东师范大学)

AI总结 针对满足$(L_0,L_1)$-光滑条件的非凸函数,提出去中心化归一化随机梯度下降算法,实现每个局部智能体达到ε-稳定点,并给出样本复杂度和通信复杂度的上界。

详情

展开后加载摘要…

URL PDF HTML 收藏