arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

共收录 1936
2604.05484 2026-04-08 cs.RO cs.CV

CoEnv: Driving Embodied Multi-Agent Collaboration via Compositional Environment

CoEnv:通过组合环境驱动具身体验多智能体协作

Li Kang, Yutao Fan, Rui Li, Heng Zhou, Yiran Qin, Zhemeng Zhang, Songtao Huang, Xiufeng Song, Zaibin Zhang, Bruno N. Y. Chen, Zhenfei Yin, Dongzhan Zhou, Wangmeng Zuo, Lei Bai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology of China(中国科学技术大学) CUHK-Shenzhen(香港中文大学(深圳)) Fudan University(复旦大学) Dalian University of Technology(大连理工大学) Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学)

AI总结 本文提出CoEnv框架,通过模拟与现实结合的组合环境,实现多智能体协作的高效执行与安全部署,提升任务成功率和效率。

Comments 31 pages, 8 figures, including supplementary material. Project page: https://faceong.github.io/CoEnv/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05076 2026-04-08 cs.MA cs.MM cs.SD

GLANCE: A Global-Local Coordination Multi-Agent Framework for Music-Grounded Non-Linear Video Editing

GLANCE:一种用于音乐引导非线性视频编辑的全局-局部协调多智能体框架

Zihao Lin, Haibo Wang, Zhiyang Xu, Siyao Dai, Huanjie Dong, Xiaohan Wang, Yolo Y. Tang, Yixin Wang, Qifan Wang, Lifu Huang

机构 * Fudan University(复旦大学) Stanford University(斯坦福大学) University of Rochester(罗切斯特大学) Meta AI

AI总结 GLANCE提出一种全局-局部协调多智能体框架,通过双环架构实现视频编辑任务的长期规划与分段处理,引入新的协调机制和评估框架,实验表明其在视频生成质量上优于现有方法。

Comments 14 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26788 2026-04-08 cs.RO cs.CV

ReMemNav: A Rethinking and Memory-Augmented Framework for Zero-Shot Object Navigation

ReMemNav:一种重新思考和记忆增强的零样本物体导航框架

Feng Wu, Wei Zuo, Wenliang Yang, Jun Xiao, Yang Liu, Xinhua Zeng

机构 * Fudan University(复旦大学) Tongji University(同济大学)

AI总结 ReMemNav通过整合全景语义先验和事件记忆,改进了零样本物体导航中的空间推理和决策,提升了成功率和探索效率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03181 2026-04-08 cs.RO eess.SP

Robotic Grasping and Placement Controlled by EEG-Based Hybrid Visual and Motor Imagery

基于EEG的混合视觉和运动想象的机器人抓取与放置控制

Yichang Liu, Tianyu Wang, Ziyi Ye, Yawei Li, Yu-Gang Jiang, Shouyan Wang, Yanwei Fu

机构 * Institute of Science and Technology for Brain-inspired Intelligence (ISTBI), Fudan University(复旦大学类脑智能科学与技术研究院) School of Data Science, Fudan University(复旦大学大数据学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身智能重点实验室) Shanghai Innovation Institute(上海创新研究院) ETH Zürich(苏黎世联邦理工学院)

AI总结 本文提出一种整合EEG视觉和运动想象与机器人控制的框架,实现实时意图驱动的抓取与放置。系统通过离线预训练解码器在在线流式管道中零样本方式实现神经信号与物理控制的连接,实现视觉意图到机器人动作的转换,验证了纯想象基BCI范式在实际人机协作中的灵活性。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04570 2026-04-08 cs.CV cs.CL

Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm

通过视频思考:视频生成作为一种有前途的多模态推理范式

Jingqi Tong, Yurong Mou, Hangcheng Li, Mingzhe Li, Yongzhuo Yang, Ming Zhang, Qiguang Chen, Tianyi Liang, Xiaomeng Hu, Yining Zheng, Xinchi Chen, Jun Zhao, Xuanjing Huang, Xipeng Qiu

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究所) Shanghai Innovation Institute(上海创新研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) The Chinese University of Hong Kong(香港中文大学) Central South University(中南大学) Fudan University(复旦大学)

AI总结 本文提出'通过视频思考'范式,利用视频生成模型实现多模态推理,通过VideoThinkBench评估显示Sora-2在视觉和文本任务中均表现出色,证明视频生成模型在统一多模态理解与生成中的潜力。

Comments 34 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04215 2026-04-07 cs.CL

DARE: Diffusion Large Language Models Alignment and Reinforcement Executor

DARE:扩散大语言模型对齐与强化执行器

Jingyi Yang, Yuxian Jiang, Xuhao Hu, Shuang Cheng, Biqing Qi, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 DARE框架整合了监督微调、参数高效微调、偏好优化和强化学习,为扩散大语言模型提供统一的执行栈,支持多种模型家族,实现算法覆盖、可重复评估和实际加速。

Comments 14 pages,3 figures,5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08659 2026-04-07 cs.CL

CODA: Difficulty-Aware Compute Allocation for Adaptive Reasoning

CODA:面向自适应推理的难度感知计算分配

Siye Wu, Jian Xie, Yikai Zhang, Yanghua Xiao

机构 * Fudan University(复旦大学)

AI总结 本文提出CODA,通过难度感知信号动态分配计算资源,实现自适应推理。在易任务中降低token成本,在难任务中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22776 2026-04-07 cs.AI

TSPO: Breaking the Double Homogenization Dilemma in Multi-turn Search Policy Optimization

TSPO:突破多轮搜索策略优化中的双重均质化困境

Shichao Ma, Zhiyuan Ma, Ming Yang, Xiaofan Li, Xing Wu, Jintao Du, Yu Cheng, Weiqiang Wang, Qiliang Liu, Zhengyang Zhou, Yang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Tiansuan Lab, Ant Group Co., Ltd.(天算实验室,蚂蚁集团) Fudan University(复旦大学) East China Normal University(华东师范大学) Central South University(中南大学)

AI总结 本文提出TSPO方法,通过引入首次出现潜在奖励机制,解决多轮搜索策略优化中的过程均质化和组内均质化问题,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18052 2026-04-07 cs.CL cs.CY

The PIMMUR Principles: Ensuring Validity in Collective Behavior of LLM Societies

PIMMUR 原则:确保 LLM 社会集体行为的有效性

Jiaxu Zhou, Jen-tse Huang, Xuhui Zhou, Man Ho Lam, Xintao Wang, Hao Zhu, Wenxuan Wang, Maarten Sap

机构 * Chinese University of Hong Kong(香港中文大学) Johns Hopkins University(约翰斯·霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学) Fudan University(复旦大学) Stanford University(斯坦福大学) Renmin University of China(中国人民大学)

AI总结 本文通过审计39项研究,识别出六个普遍缺陷,指出89.7%的研究违反至少一个原则,导致模拟有效性受损。通过复现实验发现,当遵循PIMMUR原则时,报告的集体现象往往消失或反转,表明许多'涌现'行为可能是方法学伪影而非真实社会动态。

Comments 13 pages, 9 figures, 3 tables; add more papers in our systematic audit (39 in total)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04055 2026-04-07 cs.CV cs.RO

DINO-VO: Learning Where to Focus for Enhanced State Estimation

DINO-VO:用于增强状态估计的聚焦学习

Qi Chen, Guanghao Li, Sijia Hu, Xin Gao, Junpeng Ma, Xiangyang Xue, Jian Pu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 DINO-VO通过可微适应性补丁选择器提升单目视觉里程计的性能,实现跨多样数据集的强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03941 2026-04-07 cs.CV

SafeCtrl: Region-Aware Safety Control for Text-to-Image Diffusion via Detect-Then-Suppress

SafeCtrl: 通过检测-然后抑制方法实现区域感知的安全控制

Lingyun Zhang, Yu Xie, Zhongli Fang, Yu Liu, Ping Chen

机构 * School of Computer Science and Technology, Fudan University(复旦大学计算机科学技术学院) Institute of Big Data, Fudan University(复旦大学大数据研究院) Nanjing University of Information Science and Technology(南京信息工程大学)

AI总结 SafeCtrl通过检测-然后抑制方法实现区域感知的安全控制,精准定位风险区域并局部抑制有害内容,提升安全性与生成质量。

Comments 6 pages, 5 figures, accepted to 2026 IEEE International Conference on Multimedia and Expo (ICME)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03581 2026-04-07 cs.RO cs.CV

HAD: Combining Hierarchical Diffusion with Metric-Decoupled RL for End-to-End Driving

HAD:结合分层扩散与度量解耦RL的端到端驾驶

Wenhao Yao, Xinglong Sun, Zhenxin Li, Shiyi Lan, Zi Wang, Jose M. Alvarez, Zuxuan Wu

机构 * Fudan University(复旦大学) NVIDIA(英伟达)

AI总结 HAD提出一种端到端规划框架,结合分层扩散策略与度量解耦RL,通过结构保持轨迹扩展生成真实轨迹并提升驾驶目标优化效果,实验表明在NAVSIM和HUGSIM上取得新突破。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01756 2026-04-07 cs.CV

NeuroSymb-MRG: Differentiable Abductive Reasoning with Active Uncertainty Minimization for Radiology Report Generation

NeuroSymb-MRG:基于主动不确定性最小化的可微推断推理用于放射科报告生成

Rong Fu, Yiqing Lyu, Chunlei Meng, Muge Qi, Yabin Jin, Qi Zhao, Li Bao, Juntao Gao, Fuqian Shi, Nilanjan Dey, Wei Luo, Simon Fong

机构 * University of Macau(澳门大学) Tsinghua University(清华大学) Fudan University(复旦大学) Peking University(北京大学) The First People’s Hospital of Foshan(佛山市第一人民医院) Capital Medical University(首都医科大学) Rutgers Cancer Institute, NJ, USA(罗格斯癌症研究所(美国新泽西州);纽约大学朗格尼健康中心(美国纽约州)) and NYU Langone Health, NY, USA(Techno国际新城(印度加尔各答)) Techno International New Town, Kolkata, India

AI总结 本文提出NeuroSymb-MRG框架,结合神经符号推断与主动不确定性最小化,生成结构化且临床可靠的报告。通过图像特征到概率临床概念的映射,构建可微推理链,并通过检索和约束语言模型编辑优化文本输出。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03666 2026-04-07 cs.CV cs.AI

ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos

ToG-Bench:面向任务的时空接地在第一人称视频中

Qi'ao Xu, Tianwen Qian, Yuqian Fu, Kailing Li, Yang Jiao, Jiacheng Zhang, Xiaoling Wang, Liang He

机构 * East China Normal University(华东师范大学) Fudan University(复旦大学)

AI总结 本文提出ToG-Bench,首个面向任务的时空视频接地基准,通过任务导向的接地、显式-隐式双接地和一对一多接地特性,评估多对象和显式-隐式对象接地性能,揭示任务导向时空视频接地的挑战与性能差距。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03092 2026-04-06 cs.RO

Flash-Mono: Feed-Forward Accelerated Gaussian Splatting Monocular SLAM

Flash-Mono: 基于前馈加速的高斯点云单目SLAM

Zicheng Zhang, Ke Wu, Xiangting Meng, Keyu Liu, Jieru Zhao, Wenchao Ding

机构 * Fudan University(复旦大学) ShanghaiTech University(上海科技大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 Flash-Mono通过前馈预测前端和高效隐藏状态模块,解决了单目高斯点云SLAM在时间效率、几何精度和多视角一致性方面的不足,实现10倍速度提升和高质量渲染。

Journal ref International Conference on Learning Representations, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03069 2026-04-06 cs.CV

SparseSplat: Towards Applicable Feed-Forward 3D Gaussian Splatting with Pixel-Unaligned Prediction

SparseSplat: 向可应用的前馈3D高斯点划法迈进:像素不齐预测

Zicheng Zhang, Xiangting Meng, Ke Wu, Wenchao Ding

机构 * Fudan University(复旦大学) ShanghaiTech University(上海科技大学)

AI总结 本文提出SparseSplat,首个可适应场景结构和局部区域信息丰富度的前馈3D高斯点划法模型,生成紧凑的3DGS地图,实验表明其在22%和1.5%的高斯数量下均能获得优异渲染质量。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02947 2026-04-06 cs.AI

AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents

AgentHazard:用于评估计算机使用代理有害行为的基准

Yunhao Feng, Yifan Ding, Yingshui Tan, Xingjun Ma, Yige Li, Yutao Wu, Yifeng Gao, Kun Zhai, Yanming Guo

机构 * Alibaba Group(阿里巴巴集团) Fudan University(复旦大学) Hunan Institute of Advanced Technology(湖南先进技术研究院) Deakin University(迪肯大学) Singapore Management University(新加坡管理大学)

AI总结 AgentHazard基准通过2653个实例评估计算机使用代理的有害行为,揭示了模型在连续上下文和工具使用中识别安全风险的能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02934 2026-04-06 cs.CV

PolyReal: A Benchmark for Real-World Polymer Science Workflows

PolyReal:一个用于现实世界聚合物科学工作流程的基准

Wanhao Liu, Weida Wang, Jiaqing Xie, Suorong Yang, Jue Wang, Benteng Chen, Guangtao Mei, Zonglin Yang, Shufei Zhang, Yuchun Mo, Lang Cheng, Jin Zeng, Houqiang Li, Wanli Ouyang, Yuqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学) Tongji University(同济大学) The University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 PolyReal是一个新的多模态基准,用于评估大规模语言模型在聚合物实验全流程中的能力,揭示了模型在实践任务上的不足,填补了评估空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02345 2026-04-06 cs.LG cs.AI

UI-Oceanus: Scaling GUI Agents with Synthetic Environmental Dynamics

UI-Oceanus:通过合成环境动态扩展GUI代理

Mengzhou Wu, Yuzhe Guo, Yuan Cao, Haochuan Lu, Songhe Zhu, Pingzhe Qu, Xin Chen, Kang Qin, Zhongpu Wang, Xiaode Zhang, Xinyi Wang, Wei Dai, Gang Cao, Yuetang Deng, Zhi Gong, Dezhi Ran, Linyi Li, Wei Yang, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(高可信软件技术教育部重点实验室(北京大学);北京大学计算机学院) School of Computer Science, Peking University(北京通明湖信息技术应用创新中心) Beijing Tongming Lake Information Technology Application Innovation Center(腾讯微信) WeChat, Tencent Inc.(西蒙菲莎大学) Simon Fraser University(德克萨斯大学达拉斯分校) University of Texas at Dallas(复旦大学系统与先进计算研究所) Fudan University Institute of Systems for Advanced Computing(上海开放计算系统研究所) Shanghai Institute of Systems for Open Computing

AI总结 本文提出UI-Oceanus框架,通过地面真实环境反馈掌握交互物理,解决GUI代理扩展中的数据瓶颈问题,实验表明其在离线和在线导航中均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10419 2026-04-06 cs.LG cs.AI

Equivariant Evidential Deep Learning for Interatomic Potentials

等变证据深度学习用于原子间势能

Zhongyao Wang, Taoyong Cui, Jiawen Zou, Shufei Zhang, Bo Yan, Wanli Ouyang, Weimin Tan, Mao Su

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) The Chinese University of Hong Kong(香港中文大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

AI总结 本文提出等变证据深度学习框架,用于提升原子间势能预测的准确性和可靠性,通过等变协方差张量实现旋转不变性,提高计算效率和数据利用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16672 2026-04-06 cs.CV

ReWeaver: Towards Simulation-Ready and Topology-Accurate Garment Reconstruction

ReWeaver:面向仿真准备和拓扑准确的服装重建

Ming Li, Hui Shan, Kai Zheng, Chentao Shen, Siyu Liu, Yanwei Fu, Zhen Chen, Xiangru Huang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Fudan University(复旦大学) Adobe Xidian University(西安电子科技大学)

AI总结 ReWeaver通过稀疏多视角图像实现拓扑准确的3D服装和缝纫图案重建,提升仿真和机器人应用的精度与一致性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03127 2026-04-06 cs.CV cs.AI

Unified Thinker: A General Reasoning Modular Core for Image Generation

统一思考者:一种通用图像生成的推理模块核心

Sashuai Zhou, Qiang Zhou, Jijin Hu, Hanqing Yang, Yue Cao, Junpeng Ma, Yinchao Ma, Jun Song, Tiezheng Ge, Cheng Yu, Bo Zheng, Zhou Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Nanjing University(南京大学) Fudan University(复旦大学)

AI总结 本文提出统一思考者,一种通用图像生成的推理模块核心,旨在通过可执行推理解决生成模型中的推理-执行差距,提升图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19090 2026-04-06 cs.CL

Debating Truth: Debate-driven Claim Verification with Multiple Large Language Model Agents

辩论真相:基于多个大语言模型代理的辩论驱动声明验证

Haorui He, Yupeng Li, Dacheng Wen, Yang Chen, Reynold Cheng, Donglong Chen, Francis C. M. Lau

机构 * Department of Interactive Media, Hong Kong Baptist University(香港浸会大学互动媒体系) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院) Shenzhen Institute of Advanced Technology(深圳先进技术研究院)

AI总结 本文提出DebateCV框架,通过多代理辩论和调解提升复杂声明验证的准确性与说服力。

Comments Accepted by the ACM Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02093 2026-04-03 cs.CV

GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding

GroundVTS:多模态大语言模型中的视频时间定位视觉标记采样

Rong Fan, Kaiyan Xiao, Minghao Zhu, Liuyi Wang, Kai Dai, Zhao Yang

机构 * Newcapec AI Research(新开普人工智能研究院) Fudan University(复旦大学) Tongji University(同济大学)

AI总结 本文提出GroundVTS,通过细粒度查询引导机制筛选视觉标记,提升视频时间定位的时空信息保留与时间连贯性,实验表明其在三个标准基准上优于现有方法。

Comments Published as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01826 2026-04-03 cs.CV

SafeRoPE: Risk-specific Head-wise Embedding Rotation for Safe Generation in Rectified Flow Transformers

SafeRoPE: 针对Rectified Flow Transformers中安全生成的头部嵌入旋转

Xiang Yang, Feifei Li, Mi Zhang, Geng Hong, Xiaoyu You, Min Yang

机构 * Fudan University(复旦大学) East China University of Science and Technology(华东理工大学)

AI总结 本文提出SafeRoPE,通过头部嵌入旋转和风险评分抑制MMDiT生成中的危险内容,保持生成质量。

Comments CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01705 2026-04-03 cs.CL cs.AI

Development and multi-center evaluation of domain-adapted speech recognition for human-AI teaming in real-world gastrointestinal endoscopy

开发与多中心评估用于真实世界胃肠道内窥镜中人类-人工智能协作的领域适应语音识别

Ruijie Yang, Yan Zhu, Peiyao Fu, Te Luo, Zhihua Wang, Xian Yang, Quanlin Li, Pinghong Zhou, Shuo Wang

机构 * Zhejiang University(浙江大学) Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海高等研究院) Shanghai Key Laboratory of MICCAI(上海市MICCAI重点实验室) Digital Medical Research Center, School of Basic Medical Sciences, Fudan University(复旦大学基础医学院数字医学研究中心) Endoscopy Center and Endoscopy Research Institute, Zhongshan Hospital, Fudan University(复旦大学附属中山医院内镜中心及内镜研究所) Shanghai Collaborative Innovation Center of Endoscopy(上海市内镜协同创新中心) Alliance Manchester Business School, The University of Manchester(曼彻斯特大学联盟曼彻斯特商学院)

AI总结 本文提出EndoASR,通过合成内窥镜报告开发两阶段适应策略,提升内窥镜流程中的语音识别准确率和临床实用性,经多中心验证其在异质真实世界条件下的鲁棒性。

Comments Under review at npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01669 2026-04-03 cs.CV cs.AI

Robust Embodied Perception in Dynamic Environments via Disentangled Weight Fusion

通过解耦权重融合实现动态环境中的鲁棒具身感知

Juncen Guo, Xiaoguang Zhu, Jingyi Wu, Jingyu Zhang, Jingnan Cai, Zhenghao Niu, Liang Song

机构 * Fudan University(复旦大学) University of California, Davis(加州大学戴维斯分校)

AI总结 本文提出一种无需领域ID和示例的增量学习框架,通过解耦表示机制和权重融合策略,提升具身多媒体系统在动态环境中的鲁棒性与泛化能力。

Comments Accepted by ICME2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16219 2026-04-03 cs.CR cs.AI

SentinelNet: Safeguarding Multi-Agent Collaboration Through Credit-Based Dynamic Threat Detection

SentinelNet:通过基于信用的动态威胁检测保障多智能体协作

Yang Feng, Xudong Pan

机构 * The University of Edinburgh(爱丁堡大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 SentinelNet通过基于信用的动态威胁检测机制,主动识别并缓解多智能体协作中的恶意行为,实现高检测率和系统恢复率。

Comments Accepted at The ACM Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12957 2026-04-03 cs.CV

Adaptive Reinforcement for Open-ended Medical Reasoning via Semantic-Guided Reward Collapse Mitigation

通过语义引导的奖励崩溃缓解实现自适应的开放性医疗推理

Yizhou Liu, Dingkang Yang, Zizhi Chen, Minghao Han, Xukun Zhang, Keliang Liu, Jingwei Wei, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Fysics Intelligence Technologies Co., Ltd. (Fysics AI)(菲斯克智能科技有限公司(菲斯克AI)) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本文提出ARMed框架,通过监督微调和强化优化提升开放性医疗VQA的推理一致性和事实准确性,实验表明其在六个医疗VQA基准上显著提升准确性和泛化能力。

Comments Accept to 2026 CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01053 2026-04-02 cs.CV

PHASOR: Anatomy- and Phase-Consistent Volumetric Diffusion for CT Virtual Contrast Enhancement

PHASOR:基于解剖和相位一致的体积扩散用于CT虚拟对比增强

Zilong Li, Dongyang Li, Chenglong Ma, Zhan Feng, Dakai Jin, Junping Zhang, Hao Luo, Fan Wang, Hongming Shan

机构 * Shanghai Key Lab of Intelligent Information Processing, School of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院上海市智能信息处理重点实验室) Institute of Science and Technology for Brain-inspired Intelligence and MOE Frontiers Center for Brain Science, Fudan University(复旦大学类脑智能科学与技术研究院及教育部脑科学前沿中心) Shanghai Center for Brain Science and Brain-inspired Technology(上海脑科学与类脑研究中心) Department of Radiology, First Affiliated Hospital of College of Medical Science, Zhejiang University(浙江大学医学院附属第一医院放射科) Alibaba DAMO Academy(阿里巴巴达摩院)

AI总结 本文提出PHASOR框架,通过体积扩散模型提升CT虚拟对比增强质量,引入解剖路由混合专家和强度-相位意识表示对齐模块,解决解剖异质性和空间偏移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏