arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Fudan University(复旦大学)

2026-04-03 至 2026-04-03 共收录 6
2604.02093 2026-04-03 cs.CV

GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding

GroundVTS:多模态大语言模型中的视频时间定位视觉标记采样

Rong Fan, Kaiyan Xiao, Minghao Zhu, Liuyi Wang, Kai Dai, Zhao Yang

机构 * Newcapec AI Research(新开普人工智能研究院) Fudan University(复旦大学) Tongji University(同济大学)

AI总结 本文提出GroundVTS,通过细粒度查询引导机制筛选视觉标记,提升视频时间定位的时空信息保留与时间连贯性,实验表明其在三个标准基准上优于现有方法。

Comments Published as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01826 2026-04-03 cs.CV

SafeRoPE: Risk-specific Head-wise Embedding Rotation for Safe Generation in Rectified Flow Transformers

SafeRoPE: 针对Rectified Flow Transformers中安全生成的头部嵌入旋转

Xiang Yang, Feifei Li, Mi Zhang, Geng Hong, Xiaoyu You, Min Yang

机构 * Fudan University(复旦大学) East China University of Science and Technology(华东理工大学)

AI总结 本文提出SafeRoPE,通过头部嵌入旋转和风险评分抑制MMDiT生成中的危险内容,保持生成质量。

Comments CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01705 2026-04-03 cs.CL cs.AI

Development and multi-center evaluation of domain-adapted speech recognition for human-AI teaming in real-world gastrointestinal endoscopy

开发与多中心评估用于真实世界胃肠道内窥镜中人类-人工智能协作的领域适应语音识别

Ruijie Yang, Yan Zhu, Peiyao Fu, Te Luo, Zhihua Wang, Xian Yang, Quanlin Li, Pinghong Zhou, Shuo Wang

机构 * Zhejiang University(浙江大学) Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海高等研究院) Shanghai Key Laboratory of MICCAI(上海市MICCAI重点实验室) Digital Medical Research Center, School of Basic Medical Sciences, Fudan University(复旦大学基础医学院数字医学研究中心) Endoscopy Center and Endoscopy Research Institute, Zhongshan Hospital, Fudan University(复旦大学附属中山医院内镜中心及内镜研究所) Shanghai Collaborative Innovation Center of Endoscopy(上海市内镜协同创新中心) Alliance Manchester Business School, The University of Manchester(曼彻斯特大学联盟曼彻斯特商学院)

AI总结 本文提出EndoASR,通过合成内窥镜报告开发两阶段适应策略,提升内窥镜流程中的语音识别准确率和临床实用性,经多中心验证其在异质真实世界条件下的鲁棒性。

Comments Under review at npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01669 2026-04-03 cs.CV cs.AI

Robust Embodied Perception in Dynamic Environments via Disentangled Weight Fusion

通过解耦权重融合实现动态环境中的鲁棒具身感知

Juncen Guo, Xiaoguang Zhu, Jingyi Wu, Jingyu Zhang, Jingnan Cai, Zhenghao Niu, Liang Song

机构 * Fudan University(复旦大学) University of California, Davis(加州大学戴维斯分校)

AI总结 本文提出一种无需领域ID和示例的增量学习框架,通过解耦表示机制和权重融合策略,提升具身多媒体系统在动态环境中的鲁棒性与泛化能力。

Comments Accepted by ICME2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16219 2026-04-03 cs.CR cs.AI

SentinelNet: Safeguarding Multi-Agent Collaboration Through Credit-Based Dynamic Threat Detection

SentinelNet:通过基于信用的动态威胁检测保障多智能体协作

Yang Feng, Xudong Pan

机构 * The University of Edinburgh(爱丁堡大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 SentinelNet通过基于信用的动态威胁检测机制,主动识别并缓解多智能体协作中的恶意行为,实现高检测率和系统恢复率。

Comments Accepted at The ACM Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12957 2026-04-03 cs.CV

Adaptive Reinforcement for Open-ended Medical Reasoning via Semantic-Guided Reward Collapse Mitigation

通过语义引导的奖励崩溃缓解实现自适应的开放性医疗推理

Yizhou Liu, Dingkang Yang, Zizhi Chen, Minghao Han, Xukun Zhang, Keliang Liu, Jingwei Wei, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Fysics Intelligence Technologies Co., Ltd. (Fysics AI)(菲斯克智能科技有限公司(菲斯克AI)) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本文提出ARMed框架,通过监督微调和强化优化提升开放性医疗VQA的推理一致性和事实准确性,实验表明其在六个医疗VQA基准上显著提升准确性和泛化能力。

Comments Accept to 2026 CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏