arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

共收录 1936
2603.15154 2026-03-18 eess.IV cs.CV

Vision-Language Model Based Multi-Expert Fusion for CT Image Classification

基于视觉-语言模型的多专家融合用于CT图像分类

Jianfa Bai, Kejin Lu, Runtian Yuan, Qingqiu Li, Jilan Xu, Junlin Hou, Yuejie Zhang, Rui Feng

机构 * College of Computer Science and Artificial Intelligence, Shanghai Key Laboratory of Intelligent Information Processing, Fudan University(复旦大学计算机科学与人工智能学院,上海智能信息处理重点实验室) University of Oxford(牛津大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出一种三阶段源感知多专家框架,通过构建肺部感知3D专家、开发MedSigLIP基专家和训练源分类器,提升多源CT图像中新冠检测的鲁棒性,实验结果显示在不同阶段模型在宏F1、ACC和AUC指标上均取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16363 2026-03-18 cs.CV

Advancing Visual Reliability: Color-Accurate Underwater Image Enhancement for Real-Time Underwater Missions

提升视觉可靠性:用于实时水下任务的精确色彩水下图像增强

Yiqiang Zhou, Yifan Chen, Zhe Sun, Jijun Lu, Ye Zheng, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) College of Computer and Control Engineering, Northeast Forestry University(东北林业大学计算机与控制工程学院) College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) School of Artificial Intelligence, Optics and Electronics (iOPEN), Northwestern Polytechnical University(西北工业大学人工智能、光学与电子学院(iOPEN)) Fujian Ocean Innovation Center, Xiamen(福建海洋创新中心,厦门)

AI总结 本文提出一种实时水下图像增强框架,通过自适应加权通道补偿模块、多分支重参数化扩张卷积和统计全局色彩调整模块,实现高精度色彩恢复,提升水下任务的视觉可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16196 2026-03-18 cs.RO

PanguMotion: Continuous Driving Motion Forecasting with Pangu Transformers

PanguMotion: 基于Pangu Transformer的连续驾驶运动预测

Quanhao Ren, Yicheng Li, Nan Song

机构 * School of Data Science, Fudan University(复旦大学数据科学学院)

AI总结 本文提出PanguMotion框架,利用Pangu-1B的Transformer模块提升连续驾驶场景的运动预测能力,通过Argoverse 2数据集的RealMotion策略生成连续序列以提升预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16189 2026-03-18 cs.CV

Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning

通过多任务多奖励强化学习实现SVG-LLMs的可靠推理

Haomin Wang, Qi Wei, Qianli Ma, Shengyuan Ding, Jinhui Yin, Kai Chen, Hongjie Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Nanjing University(南京大学)

AI总结 本文提出CTRL-S框架,通过多任务多奖励优化提升SVG生成的结构连贯性和视觉保真度,实验表明其在任务成功率和SVG代码质量上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16161 2026-03-18 cs.AI

SQL-ASTRA: Alleviating Sparse Feedback in Agentic SQL via Column-Set Matching and Trajectory Aggregation

SQL-ASTRA: 缓解代理SQL中的稀疏反馈 via 列集匹配和轨迹聚合

Long Li, Zhijian Zhou, Jiangxuan Long, Peiyang Liu, Weidi Xu, Zhe Wang, Shirui Pan, Chao Qu

机构 * Griffith University(格里菲斯大学) Fudan University(复旦大学) The University of Hong Kong(香港大学) Peking University(北京大学) InFly Shanghai Innovation Institute(上海创新研究院) Shanghai Academy of Artificial Intelligence for Science(上海人工智能科学研究院)

AI总结 本文提出SQL-ASTRA框架,通过列集匹配和轨迹聚合解决代理SQL中的稀疏反馈问题,引入轨迹奖励和列集匹配奖励,提升多轮任务的奖励分配效率与稳定性。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16157 2026-03-18 cs.LG cs.AI

DyJR: Preserving Diversity in Reinforcement Learning with Verifiable Rewards via Dynamic Jensen-Shannon Replay

DyJR: 通过动态Jensen-Shannon回放在强化学习中保持多样性

Long Li, Zhijian Zhou, Tianyi Wang, Weidi Xu, Zuming Huang, Wei Chu, Zhe Wang, Shirui Pan, Chao Qu, Yuan Qi

机构 * Griffith University, Australia(澳大利亚格里菲斯大学) Fudan University, China(复旦大学) Beijing University of Post(北京邮电大学) Shanghai Innovation Institute, China(上海创新研究院) Shanghai Academy of Artificial Intelligence for Science, China(上海人工智能科学研究院)

AI总结 本文提出DyJR方法,通过动态参考分布和Jensen-Shannon散度正则化,在强化学习中保持多样性,提升数学推理和Text-to-SQL任务性能。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16129 2026-03-18 cs.CV

Boosting Quantitive and Spatial Awareness for Zero-Shot Object Counting

提升零样本物体计数的定量与空间意识

Da Zhang, Bingyu Li, Feiyu Wang, Zhiyuan Zhao, Junyu Gao

机构 * Northwestern Polytechnical University(西北工业大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学)

AI总结 本文提出QICA框架,通过引入协同提示策略和成本聚合解码器,提升零样本物体计数的定量感知和空间聚合能力,实验表明其在多个数据集上具有优越的泛化性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15143 2026-03-18 eess.IV cs.CV

Clinical Priors Guided Lung Disease Detection in 3D CT Scans

基于临床先验的3D CT扫描肺部疾病检测

Kejin Lu, Jianfa Bai, Qingqiu Li, Runtian Yuan, Jilan Xu, Junlin Hou, Yuejie Zhang, Rui Feng

机构 * College of Computer Science and Artificial Intelligence, Shanghai Key Laboratory of Intelligent Information Processing, Fudan University(计算机科学与人工智能学院,上海智能信息处理重点实验室,复旦大学) University of Oxford(牛津大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出一种考虑性别因素的两阶段肺部疾病分类框架,通过性别分类器和性别特异性疾病分类器提升少数类疾病识别性能,尤其在鳞状细胞癌上表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01953 2026-03-18 cs.RO cs.AI cs.CV

Closed-Loop Action Chunks with Dynamic Corrections for Training-Free Diffusion Policy

闭环动作块与动态修正的训练无关扩散策略

Pengyuan Wu, Pingrui Zhang, Zhigang Wang, Dong Wang, Bin Zhao, Xuelong Li

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学) Institute of Artificial Intelligence, China Telecom Corp Ltd(中国电信人工智能研究院)

AI总结 本文提出DCDP框架,结合动作块生成与实时修正,提升动态场景下的适应性,无需重新训练,计算量仅增加5%,在动态PushT模拟中适应性提升19%。

Comments Accepted by ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00988 2026-03-18 cs.CV

Few-Shot Video Object Segmentation in X-Ray Angiography Using Local Matching and Spatio-Temporal Consistency Loss

利用局部匹配和时空一致性损失的X射线血管造影中少样本视频目标分割

Lin Xi, Yingliang Ma, Xiahai Zhuang

机构 * University of East Anglia(东安大大学) King’s College London(伦敦国王学院) Fudan University(复旦大学)

AI总结 本文提出了一种新颖的FSVOS模型,通过局部匹配策略限制搜索空间,采用非参数采样机制提升灵活性,并设计监督时空对比学习方案提升特征一致性,实验表明在CADICA、XACV和MOSXAV数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16635 2026-03-18 cs.CV cs.LG

SARMAE: Masked Autoencoder for SAR Representation Learning

SARMAE:用于SAR表示学习的遮蔽自动编码器

Danxu Liu, Di Wang, Hebaixu Wang, Haoyang Chen, Wentao Jiang, Yilin Cheng, Haonan Guo, Wei Cui, Jing Zhang

机构 * School of Information and Electronics, Beijing Institute of Technology, Beijing, China(北京理工大学信息与电子学院,北京,中国) School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院,武汉,中国) School of Electronic Information, Wuhan University, Wuhan, China(武汉大学电子信息学院,武汉,中国) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) School of Data Science, Fudan University, Shanghai, China(复旦大学数据科学学院,上海,中国) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University, Wuhan, China(武汉大学测绘遥感信息工程国家重点实验室,武汉,中国)

AI总结 本文提出SARMAE,通过构建SAR-1M数据集和引入Speckle-Aware Representation Enhancement与Semantic Anchor Representation Constraint,提升SAR图像在多任务中的表现。

Comments The paper is accepted by CVPR 2026! Code and models will be available at https://github.com/MiliLab/SARMAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19117 2026-03-18 cs.CV physics.optics

3M-TI: High-Quality Mobile Thermal Imaging via Calibration-free Multi-Camera Cross-Modal Diffusion

3M-TI: 通过无校准多相机跨模态扩散实现高质量移动热成像

Minchong Chen, Xiaoyun Yuan, Junzhe Wan, Jianing Zhang, Jun Zhang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能联合实验室,人工智能研究院,上海交通大学) School of Computer Science, Shanghai Jiao Tong University(计算机科学学院,上海交通大学) Fudan University(复旦大学) Tsinghua University(清华大学)

AI总结 本文提出3M-TI,一种无需校准的多相机跨模态扩散框架,通过跨模态自注意力模块提升热成像的分辨率和细节,验证其在实际应用中的优越性能。

Comments Accepted by CVPR 2026, Code: https://github.com/work-submit/3MTI, Project page: https://lab.xiaoyunyuan.net/index.html?project=3m-ti

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15398 2026-03-18 cs.CV cs.AI

MARIS: Marine Open-Vocabulary Instance Segmentation with Geometric Enhancement and Semantic Alignment

MARIS: 基于几何增强与语义对齐的海洋开放词汇实例分割

Bingyu Li, Feiyu Wang, Da Zhang, Zhiyuan Zhao, Junyu Gao, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI)) China Telecom(中国电信) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学)

AI总结 本文提出MARIS,首个大规模细粒度水下开放词汇分割基准,通过几何先验增强模块和语义对齐注入机制提升水下场景下的实例分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15679 2026-03-18 cs.CR cs.AI cs.CV

IdentityGuard: Context-Aware Restriction and Provenance for Personalized Synthesis

IdentityGuard: 基于上下文的限制与溯源的个性化合成

Lingyun Zhang, Yu Xie, Ping Chen

机构 * School of Computer Science and Technology, Fudan University(复旦大学计算机科学与技术学院) Institute of Big Data, Fudan University(复旦大学大数据研究院) Purple Mountain Laboratories(紫金山实验室)

AI总结 本文提出IdentityGuard,通过上下文感知的限制和概念特定水印,实现个性化合成的安全控制,防止滥用同时保持模型效用。

Comments 5 pages, 3 figures, Accepted to ICASSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15616 2026-03-17 cs.CV

GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Rendering

GlyphPrinter: 基于区域分组的直接偏好优化用于精确的视觉文本渲染

Xincheng Shuai, Ziye Li, Henghui Ding, Dacheng Tao

机构 * Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University(大数据研究院,计算机科学与人工智能学院,复旦大学) Generative AI Lab, College of Computing and Data Science, Nanyang Technological University(生成式人工智能实验室,计算与数据科学学院,南洋理工大学)

AI总结 本文提出GlyphPrinter,通过区域分组直接偏好优化提升文本渲染的字形准确性,引入区域级字形偏好标注和区域优化目标,有效解决复杂或非领域字符的字形误差问题。

Comments CVPR 2026, Project Page: https://henghuiding.com/GlyphPrinter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15542 2026-03-17 cs.CY cs.AI

InterveneBench: Benchmarking LLMs for Intervention Reasoning and Causal Study Design in Real Social Systems

InterveneBench:用于干预推理和真实社会系统因果研究设计的LLM基准测试

Shaojie Shi, Zhengyu Shi, Lingran Zheng, Xinyu Su, Anna Xie, Bohao Lv, Rui Xu, Zijian Chen, Zhichao Chen, Guolei Liu, Naifu Zhang, Mingjian Dong, Zhuo Quan, Bohao Chen, Teqi Hao, Yuan Qi, Yinghui Xu, Libo Wu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 InterveneBench通过真实社会科学研究评估LLM在干预推理和因果研究设计中的能力,发现现有模型表现不足,并提出STRIDES多智能体框架提升性能。

Comments 35pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15358 2026-03-17 cs.LG cs.AI physics.ao-ph

FuXiWeather2: Learning accurate atmospheric state estimation for operational global weather forecasting

FuXiWeather2: 为操作性全球天气预报学习准确的大气状态估计

Xiaoze Xu, Xiuyu Sun, Songling Zhu, Xiaohui Zhong, Yuanqing Huang, Zijian Zhu, Jun Liu, Hao Li

机构 * Shanghai Academy of Artificial Intelligence for Science(上海人工智能科学研究院) Artificial Intelligence Innovation and Incubation Institute(人工智能创新与孵化院) Fudan University(复旦大学) FuXi Intelligent Computing Technology Co., Ltd.(FuXi智能计算技术有限公司)

AI总结 本文提出FuXiWeather2模型,通过结合真实观测和再分析数据,提升大气状态估计的精度与稳定性,实现分钟级高分辨率全球分析和10天预报,优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15226 2026-03-17 cs.AI

SCAN: Sparse Circuit Anchor Interpretable Neuron for Lifelong Knowledge Editing

SCAN:稀疏电路锚定神经元用于终身知识编辑

Yuhuan Liu, Haitian Zhong, Xinyuan Xia, Qiang Liu, Shu Wu, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(模式识别新实验室(NLPR)、多模态人工智能系统国家重点实验室(MAIS)、自动化研究所、中国科学院) Cuiying Honors College, Lanzhou University(cuiying荣誉学院、兰州大学) Research Institute of Intelligent Complex Systems, Fudan University(智能复杂系统研究院、复旦大学) Zhongguancun Academy(中关村学院)

AI总结 SCAN通过构建稀疏电路实现知识编辑,有效解决连续编辑中的灾难性遗忘问题,保持模型完整性。

Comments 21pages, 7figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15179 2026-03-17 cs.RO

KiRAS: Keyframe Guided Self-Imitation for Robust and Adaptive Skill Learning in Quadruped Robots

KiRAS: 基于关键帧的自我模仿学习用于四足机器人鲁棒且适应性强的技能学习

Xiaoyi Wei, Peng Zhai, Jiaxin Tu, Yueqi Zhang, Yuqi Li, Zonghao Zhang, Hu Zhou, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University, China(复旦大学智能机器人与先进制造学院)

AI总结 KiRAS通过关键帧引导的自我模仿学习,在复杂地形上实现多样技能的获取与过渡,无需专家数据集,提升机器人在无结构环境中的鲁棒性和适应性。

Comments Received by 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15025 2026-03-17 cs.CV

One CT Unified Model Training Framework to Rule All Scanning Protocols

一种统一的CT模型训练框架以适用于所有扫描协议

Fengzhi Xu, Ziyuan Yang, Zexin Lu, Yingyu Chen, Fenglei Fan, Hongming Shan, Yi Zhang

机构 * Sichuan University(四川大学) City University of Hong Kong(香港城市大学) Fudan University(复旦大学)

AI总结 本文提出UMS框架,通过不确定性引导的流形平滑方法,解决不同扫描协议下特征空间的断续问题,提升重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14944 2026-03-17 cs.LG

Ultra-Early Prediction of Tipping Points: Integrating Dynamical Measures with Reservoir Computing

超早期预测临界点:整合动力学指标与回声计算

Xin Li, Qunxi Zhu, Chengli Zhao, Bolin Zhao, Xue Zhang, Xiaojun Duan, Wei Lin

机构 * College of Science, National University of Defense Technology(国防科技大学科学学院) Research Institute of Intelligent Complex Systems(智能复杂系统研究所) MOE Frontiers Center for Brain Science(教育部脑科学前沿中心) Fudan University(复旦大学) School of Mathematical Sciences, SCMS, SCAM, and CCSB(数学科学学院、SCMS、SCAM和CCSB) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文提出一种无需模型的框架,结合动力学系统的稳定性与敏感性指标与回声计算,通过观测时间序列数据预测临界点,实验表明其在动态可解释性、预测稳定性及超早期预测能力上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14886 2026-03-17 cs.CV

PASTE: Physics-Aware Scattering Topology Embedding Framework for SAR Object Detection

PASTE:面向SAR目标检测的物理感知散射拓扑嵌入框架

Jiacheng Chen, Yuxuan Xiong, Haipeng Wang

机构 * Key Laboratory for Information Science of Electromagnetic Waves (MoE), Fudan University(电磁波信息科学国家重点实验室(MoE),复旦大学)

AI总结 本文提出PASTE框架,通过整合散射物理机制,提升SAR目标检测性能,实验表明其在多种检测器上实现2.9%-11.3%的mAP提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14853 2026-03-17 cs.SD

WhispSynth: Scaling Multilingual Whisper Corpus through Real Data Curation and A Novel Pitch-free Generative Framework

WhispSynth:通过真实数据整理和一种新的无音高生成框架扩展多语言Whisper语料库

Tianyi Tan, Jiaxin Ye, Yuanming Zhang, Xiaohuai Le, Xianjun Xia, Chuanzeng Huang, Jing Lu

机构 * Key Laboratory of Modern Acoustics, Nanjing University(南京大学现代声学重点实验室) Fudan University(复旦大学) ByteDance(字节跳动)

AI总结 本文提出WhispSynth,通过新型高保真生成框架构建大规模多语言语料库,利用DDSP基于的无音高方法与TTS模型结合,生成118小时高质量whisper语音,提升文本到whisper研究的鲁棒性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13676 2026-03-17 cs.AI

TheraAgent: Multi-Agent Framework with Self-Evolving Memory and Evidence-Calibrated Reasoning for PET Theranostics

TheraAgent:具有自我进化记忆和证据校准推理的多智能体框架用于PET治疗诊断

Zhihao Chen, Jiahui Wang, Yizhou Chen, Xiaozhong Ji, Xiaobin Hu, Jimin Hong, Wolfram Andreas Bosbach, Axel Rominger, Ali Afshar-Oromieh, Hongming Shan, Kuangyu Shi

机构 * Fudan University(复旦大学) University of Bern(伯尔尼大学) Nanjing University(南京大学) National University of Singapore(新加坡国立大学)

AI总结 TheraAgent通过自我进化记忆和证据校准推理,解决PET治疗诊断中数据稀缺、信息异构和证据推理的问题,实现75.7%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13466 2026-03-17 eess.IV cs.CV

Open World MRI Reconstruction with Bias-Calibrated Adaptation

开放世界MRI重建中的偏置校准适应

Jiyao Liu, Shangqi Gao, Lihao Liu, Junzhi Ning, Jinjie Wei, Junjun He, Xiahai Zhuang, Ningsheng Xu

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) University of Cambridge, Cambridge, United Kingdom(剑桥大学,剑桥,英国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

AI总结 本文提出BiasRecon框架,通过最小干预原则实现开放世界MRI重建,通过频率引导先验校准、基于分数的去噪和自适应正则化,实现鲁棒适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13382 2026-03-17 cs.CV

DINOv3 with Test-Time Calibration for Automated Carotid Intima-Media Thickness Measurement on CUBS v1

DINOv3结合测试时间校准用于CUBS v1上自动颈动脉内膜中层厚度测量

Zhenpeng Zhang, Jinwei Lu, Yurui Dong, Bo Yuan

机构 * School of Basic Medical Sciences, Fudan University, Shanghai 200032, China(复旦大学基础医学学院,上海,中国) Institute of Medical Genetics and Genomics, Fudan University, Shanghai 200032, China(复旦大学医学遗传与基因组学研究院,上海,中国) Fudan University, Shanghai, China(复旦大学,上海,中国)

AI总结 本文提出基于DINOv3的框架,用于颈动脉内膜中层复杂分割及后续CIMT测量,通过测试时间校准提升测量精度,实验结果显示其在CUBS v1数据集上具有较高的Dice和IoU指标,且误差范围在临床相关范围内。

Comments 9 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13292 2026-03-17 cs.LG cs.AI

Pragma-VL: Towards a Pragmatic Arbitration of Safety and Helpfulness in MLLMs

Pragma-VL:迈向多模态大语言模型中安全与助人的务实仲裁

Ming Wen, Kun Yang, Xin Chen, Jingyu Zhang, Dingding Han, Shiwen Cui, Yuedong Xu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团) Zhejiang University(浙江大学) UCLA(加州大学洛杉矶分校) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 Pragma-VL通过引入一种端到端的对齐算法,解决了多模态大语言模型在安全与助人之间的平衡问题,通过增强视觉风险感知和理论保证的奖励模型,在多数多模态安全基准上提升了性能。

Comments 31 pages, ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12826 2026-03-16 cs.CL

Rethinking Multiple-Choice Questions for RLVR: Unlocking Potential via Distractor Design

重新思考用于RLVR的多项选择题:通过干扰项设计解锁潜力

Xu Guo, Qiming Ge, Jian Tong, Kedi Chen, Jin Zhang, Xiaogui Yang, Xuan Gao, Haijun Lv, Zhihui Lu, Yicheng Zou, Qipeng Guo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

AI总结 本文研究了干扰项设计对RLVR的影响,发现选项数量不匹配和强干扰项能有效减少随机猜测,提出IDC框架提升干扰项质量,实验表明在多个基准上显著提升了RLVR训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12648 2026-03-16 cs.CV

From Sparse to Dense: Multi-View GRPO for Flow Models via Augmented Condition Space

从稀疏到密集:通过增强条件空间的多视图GRPO用于流模型

Jiazi Bu, Pengyang Ling, Yujie Zhou, Yibin Wang, Yuhang Zang, Tianyi Wei, Xiaohang Zhan, Jiaqi Wang, Tong Wu, Xingang Pan, Dahua Lin

机构 * Shanghai Jiao Tong University(上海交通大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) Adobe Research(Adobe研究实验室) Stanford University(斯坦福大学) Shanghai Innovation Institute(上海创新研究院) CPII under InnoHK Project(InnoHK项目下的CPII)

AI总结 本文提出多视图GRPO,通过增强条件空间探索样本间关系,提升文本到图像流模型的对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12628 2026-03-16 q-bio.NC cs.AI eess.SP

Towards unified brain-to-text decoding across speech production and perception

迈向跨语音生成与感知的统一脑-文本解码

Zhizhang Yuan, Yang Yang, Gaorui Zhang, Baowen Cheng, Zehan Wu, Yuhao Xu, Xiaoying Liu, Liang Chen, Ying Mao, Meng Li

机构 * Computer Science and Technology(计算机科学与技术) Zhejiang University(浙江大学) Shanghai Institute of Microsystem and Information Technology(上海微系统与信息工程研究所) Chinese Academy of Sciences(中国科学院) Department of Neurosurgery(神经外科部门) Huashan Hospital, Fudan University(复旦大学华山医院)

AI总结 本文提出一种统一的脑-句子解码框架,用于 Mandarin Chinese 的语音生成与感知,通过单字符数据训练实现句子级解码,并通过多模态神经动态比较提升解码性能。

Comments 37 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏