arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

共收录 1936
2510.00060 2026-03-02 cs.CV cs.AI cs.RO

Less is More: Lean yet Powerful Vision-Language Model for Autonomous Driving

少即是多:一种高效而强大的视觉-语言模型用于自动驾驶

Sheng Yang, Tong Zhan, Guancheng Chen, Yanfeng Lu, Jian Wang

机构 * School of Data Science, Fudan University Shanghai, China(复旦大学数据科学学院) Institute of Automation, Chinese Academy of Sciences Beijing, China(中国科学院自动化研究所)

AI总结 本研究提出Max-V1模型,通过端到端视觉-语言方法实现高效自动驾驶,取得nuScenes数据集上的显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23393 2026-03-02 cs.SD cs.CV

Leveraging large multimodal models for audio-video deepfake detection: a pilot study

利用大型多模态模型进行音频视频深度伪造检测:一项试点研究

Songjun Cao, Yuqi Li, Yunpeng Luo, Jianjun Yin, Long Ma

机构 * Tencent Youtu Lab(腾讯优图实验室) Fudan University(复旦大学)

AI总结 本文提出AV-LMMDetect,利用大型多模态模型进行音频视频深度伪造检测,通过监督微调和分阶段训练,在多个数据集上达到新的性能水平。

Comments 5pages,ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23203 2026-02-27 cs.CV cs.AI

ColoDiff: Integrating Dynamic Consistency With Content Awareness for Colonoscopy Video Generation

ColoDiff:整合动态一致性与内容感知用于结肠镜视频生成

Junhu Fu, Shuyu Liang, Wutong Li, Chen Ma, Peng Huang, Kehao Wang, Ke Chen, Shengli Lin, Pinghong Zhou, Zeju Li, Yuanyuan Wang, Yi Guo

机构 * College of Biomedical Engineering, Fudan University(复旦大学生物医学工程学院) Fudan University Shanghai Cancer Center(复旦大学上海肿瘤中心) Endoscopy Center and Endoscopy Research Institute, Zhongshan Hospital, Fudan University(复旦大学中山医院内窥镜中心和内窥镜研究所) Shanghai Collaborative Innovation Center of Endoscopy(上海内窥镜协同创新中心)

AI总结 ColoDiff通过整合动态一致性与内容感知,生成高质量的结肠镜视频,以缓解数据短缺并辅助临床分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22785 2026-02-27 cs.CV

SceneTransporter: Optimal Transport-Guided Compositional Latent Diffusion for Single-Image Structured 3D Scene Generation

SceneTransporter: 基于最优传输的组合潜在扩散模型用于单图像结构化3D场景生成

Ling Wang, Hao-Xiang Guo, Xinzhou Wang, Fuchun Sun, Kai Sun, Pengkun Liu, Hang Xiao, Zhong Wang, Guangyuan Fu, Eric Li, Yang Liu, Yikai Wang

机构 * Xi’an Research Institute of Hi-Tech(西安高新技术研究院) Tsinghua University(清华大学) SkyWork AI Tongji University(同济大学) Fudan University(复旦大学) Beijing Normal University(北京师范大学)

AI总结 SceneTransporter通过最优传输引导的组合潜在扩散模型,提升单图像结构化3D场景生成的实例连贯性和几何保真度。

Comments published at iclr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21058 2026-02-27 cs.CV

Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control

超越像素模拟:通过诊断语义标记和原型控制生成病理图像

Minghao Han, Yichen Liu, Yizhou Liu, Zizhi Chen, Jingqun Tang, Xuecheng Wu, Dingkang Yang, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) Fudan University(复旦大学) Fysics Intelligence Technologies Co., Ltd.(Fysics智能科技有限公司) University of Science and Technology Beijing(北京科技大学) ByteDance(字节跳动) School of Computer Science and Technology(计算机科学与技术学院) Xi’an Jiaotong University(西安交通大学)

AI总结 UniPath通过诊断语义标记和原型控制实现可控的病理图像生成,取得SOTA性能,包括Patho-FID 80.9和98.7%的细粒度语义控制。

Comments accepted by CVPR 2026; 32 pages, 17 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03801 2026-02-27 cs.LG cs.AI

Large Language Model Compression with Global Rank and Sparsity Optimization

大型语言模型压缩与全局秩和稀疏性优化

Changhai Zhou, Qian Qiao, Yuhua Zhou, Yuxin Wu, Shichao Weng, Weizhong Zhang, Cheng Jin

机构 * Fudan University(复旦大学) Soul AILab, OpenWPLab(Soul AILab,OpenWPLab) Zhejiang University(浙江大学) Renmin University of China(中国人民大学)

AI总结 本文提出了一种两阶段LLM压缩方法,通过全局资源分配优化秩和稀疏性,有效提升模型压缩性能。

Comments 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02088 2026-02-27 cs.CV cs.AI

Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation

Dual-IPO: 双迭代偏好优化用于文本到视频生成

Xiaomeng Yang, Mengping Yang, Jia Gong, Luozheng Qin, Zhiyu Tan, Hao Li

机构 * Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院)

AI总结 Dual-IPO通过迭代优化奖励模型和视频生成模型,提升文本到视频生成的质量和人类偏好对齐,无需手动标注即可提高合成效果。

Comments To appear in ICLR 2026, GitHub Code: https://github.com/SAIS-FUXI/IPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22592 2026-02-27 cs.LG cs.CL

pQuant: Towards Effective Low-Bit Language Models via Decoupled Linear Quantization-Aware Training

pQuant:通过解耦线性量化感知训练实现有效的低比特语言模型

Wenzheng Zhang, Bingzheng Liu, Yang Hu, Xiaoying Bai, Wentao Zhang, Bin Cui

机构 * School of Computer Science, Peking University(北京大学计算机学院) College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) Center for Information Research, Academy of Military Sciences(军事科学院信息研究所) Advanced Institute of Big Data(大数据高级研究所) Center of Machine Learning Research, Peking University(北京大学机器学习研究中心)

AI总结 pQuant通过解耦线性层为两个专门分支,提升低比特语言模型的精度与可扩展性。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22298 2026-02-27 cs.LG cs.AI

AviaSafe: A Physics-Informed Data-Driven Model for Aviation Safety-Critical Cloud Forecasts

AviaSafe: 一种融合物理约束的数据驱动模型用于航空安全关键的云预报

Zijian Zhu, Qiusheng Huang, Anboyu Guo, Xiaohui Zhong, Hao Li

机构 * Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) Shanghai Innovation Institute(上海创新研究院) Shanghai Academy of Artificial Intelligence for Science(上海人工智能科学研究院) National Marine Environment Forecasting Center(国家海洋环境预报中心) Department of Atmospheric and Oceanic Sciences, Fudan University(复旦大学大气科学与海洋科学系)

AI总结 AviaSafe通过融合物理约束的神经网络,实现了对航空安全关键的云物种的7天预测,提升了航空路线优化和结冰风险评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22268 2026-02-27 cs.LG

AutoQRA: Joint Optimization of Mixed-Precision Quantization and Low-rank Adapters for Efficient LLM Fine-Tuning

AutoQRA:混合精度量化与低秩适配器的联合优化以实现高效大语言模型微调

Changhai Zhou, Shiyang Zhang, Yuhua Zhou, Qian Qiao, Jun Gao, Cheng Jin, Kaizhou Qin, Weizhong Zhang

机构 * Fudan University(复旦大学) Yale University(耶鲁大学) Zhejiang University(浙江大学) OpenWPLab

AI总结 AutoQRA通过联合优化混合精度量化与低秩适配器,实现高效大语言模型微调,提升性能并降低内存消耗。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21779 2026-02-26 cs.CV cs.AI

Beyond Static Artifacts: A Forensic Benchmark for Video Deepfake Reasoning in Vision Language Models

超越静态伪影:一种用于视觉语言模型中视频深度伪造推理的取证基准

Zheyuan Gu, Qingsong Zhao, Yusong Wang, Zhaohong Huang, Xinqi Li, Cheng Yuan, Jiaowei Shao, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(人工智能研究院,中国电信(TeleAI)) Peking University(北京大学) Fudan University(复旦大学)

AI总结 本文提出FAQ基准,通过多选任务提升视觉语言模型对视频深度伪造的时间推理能力,并通过实验验证其有效性。

Comments 16 pages, 9 figures. Submitted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06034 2026-02-26 cs.CV

V-Retrver: Evidence-Driven Agentic Reasoning for Universal Multimodal Retrieval

V-Retrver: 以证据驱动的代理推理用于通用多模态检索

Dongyang Chen, Chaoyang Wang, Dezhao Su, Xi Xiao, Zeyu Zhang, Jing Xiong, Qing Li, Yuzhang Shang, Shichao Kan

机构 * Tsinghua University(清华大学) University of Central Florida(中央佛罗里达大学) Fudan University(复旦大学) The Australian National University(澳大利亚国立大学) The University of Hong Kong(香港大学) Pengcheng Laboratory(鹏城实验室) Central South University(中南大学)

AI总结 V-Retrver通过引入证据驱动的代理推理机制,提升多模态检索的准确率和推理可靠性。

Comments Project page: https://github.com/chendy25/V-Retrver

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19610 2026-02-26 cs.CV

JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models

JailBound: 视觉语言模型内部安全边界的劫持

Jiaxin Song, Yixu Wang, Jie Li, Rui Yu, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Xuan Tong(宣通) NSFOCUS

AI总结 JailBound通过在视觉语言模型的潜在空间中探索安全边界,提出了一种新的劫持框架,有效提升了白盒和黑盒攻击成功率,揭示了模型的安全风险。

Comments The Thirty-ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05236 2026-02-26 cs.CV

Unified Reward Model for Multimodal Understanding and Generation

多模态理解和生成的统一奖励模型

Yibin Wang, Yuhang Zang, Hao Li, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室)

AI总结 本文提出统一奖励模型,通过联合学习多种视觉任务提升多模态理解和生成的性能。

Comments project page: https://codegoat24.github.io/UnifiedReward/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21631 2026-02-26 cs.CV

UniHand: A Unified Model for Diverse Controlled 4D Hand Motion Modeling

UniHand:一种统一模型,用于多样可控的4D手部运动建模

Zhihao Sun, Tong Wu, Ruirui Tu, Daoguo Dong, Zuxuan Wu

机构 * Institute of Trustworthy Embodied AI (TEAI)(可信具身人工智能研究所) Fudan University(复旦大学) Stanford University(斯坦福大学)

AI总结 UniHand通过统一的扩散框架,将手部运动估计与生成统一为条件运动合成,有效整合异构输入并提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21112 2026-02-26 cs.RO cs.AI

EO-1: An Open Unified Embodied Foundation Model for General Robot Control

EO-1:一个通用机器人控制的开放统一具身基础模型

Delin Qu, Haoming Song, Qizhi Chen, Zhaoqing Chen, Xianqiang Gao, Dong Wang, Xinyi Ye, Qi Lv, Modi Shi, Guanghui Ren, Cheng Ruan, Maoqing Yao, Haoran Yang, Jiacheng Bao, Bin Zhao, Xuelong Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) AgiBot Northwestern Polytechnical University(西北工业大学)

AI总结 EO-1是一个统一的具身基础模型,通过交错视觉-文本-动作预训练实现了在多模态推理和机器人控制中的卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06060 2026-02-26 cs.CL cs.AI

Simple Yet Effective: Extracting Private Data Across Clients in Federated Fine-Tuning of Large Language Models

简单而有效的:在联邦微调大型语言模型中提取客户端私有数据

Yingqi Hu, Zhuo Zhang, Jingyuan Zhang, Jinghua Wang, Qifan Wang, Lizhen Qu, Zenglin Xu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Kuaishou Technology(快手科技) Meta AI Monash University(墨尔本大学) Fudan University(复旦大学) Shanghai Academy of Artificial Intelligence for Science(上海人工智能科学研究院)

AI总结 本文提出三种简单有效的方法,用于在联邦微调大型语言模型中提取客户端私有数据,揭示了FedLLMs中的隐私风险并建立了评估框架。

Comments IJCNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20215 2026-02-25 cs.RO

Vision-Based Reasoning with Topology-Encoded Graphs for Anatomical Path Disambiguation in Robot-Assisted Endovascular Navigation

基于拓扑编码图的视觉推理用于机器人辅助血管内导航中的解歧

Jiyuan Zhao, Zhengyu Shi, Wentong Tian, Tianliang Yao, Dong Liu, Tao Liu, Yizhe Wu, Peng Qi

机构 * Department of Control Science and Engineering, College of Electronics and Information Engineering, and Shanghai Institute of Intelligent Science and Technology, Tongji University(控制科学与工程系,电子与信息工程学院和智能科学与技术上海研究院,同济大学) Department of Electronic Engineering, Faculty of Engineering, The Chinese University of Hong Kong(电子工程系,工程学院,香港中文大学) Shanghai Operation Robot Co., Ltd.(上海操作机器人有限公司) Department of Cardiology, Zhongshan Hospital, Fudan University, Shanghai Institute of Cardiovascular Diseases, National Clinical Research Center for Interventional Medicine(心内科,复旦大学中山医院,上海心血管疾病研究所,介入医学临床研究中心) State Key Laboratory of Cardiovascular Diseases and Medical Innovation Center, Shanghai East Hospital, School of Medicine, Tongji University(心血管疾病国家重点实验室和医学创新中心,上海东医院,同济大学医学院)

AI总结 本文提出SCAR-UNet-GAT框架,通过拓扑编码图实现机器人辅助血管内导航中的路径解歧,显著提升路径规划的准确性和鲁棒性。

Comments This paper has been accepted by IEEE ICRA 2026. 8 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14856 2026-02-25 cs.CV cs.AI

Peering into the Unknown: Active View Selection with Neural Uncertainty Maps for 3D Reconstruction

窥探未知:基于神经不确定性地图的主动视角选择用于3D重建

Zhengquan Zhang, Feng Xu, Mengmi Zhang

机构 * Deep NeuroCognition Lab, Nanyang Technological University, Singapore(深神经认知实验室,南洋理工大学,新加坡) Fudan University, China(复旦大学,中国)

AI总结 本文提出了一种基于神经不确定性地图的主动视角选择方法,通过轻量级神经网络预测视角不确定性,从而提升3D重建的准确性和效率。

Comments 10 pages, 4 figures in the main text. Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19764 2026-02-24 cs.RO

Towards Dexterous Embodied Manipulation via Deep Multi-Sensory Fusion and Sparse Expert Scaling

通过深度多感官融合与稀疏专家扩展实现灵巧的具身体验

Yirui Sun, Guangyu Zhuge, Keliang Liu, Jie Gu, Zhihao xia, Qionglin Ren, Chunxu tian, Zhongxue Ga

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(智能机器人与先进制造学院,复旦大学) School of Information Science and Engineering, Harbin Institute of Technology(信息科学与工程学院,哈尔滨工业大学)

AI总结 DeMUSE通过深度多感官融合与稀疏专家扩展,实现复杂物理互动的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19605 2026-02-24 cs.CV cs.AI cs.MM

CLCR: Cross-Level Semantic Collaborative Representation for Multimodal Learning

CLCR:多模态学习中的跨层语义协作表示

Chunlei Meng, Guanhong Huang, Rong Fu, Runmin Jian, Zhongxue Gan, Chun Ouyang

机构 * Fudan University(复旦大学) Shantou University(汕头大学) University of Macau(澳门大学) Guangzhou Huashang College(广州华商学院)

AI总结 CLCR通过跨层语义协同表示方法,有效解决多模态数据中的语义错位问题,提升多模态学习的表示质量与任务泛化能力。

Comments This study has been Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19585 2026-02-24 cs.MM cs.AI

Tri-Subspaces Disentanglement for Multimodal Sentiment Analysis

三子空间解耦用于多模态情感分析

Chunlei Meng, Jiabin Luo, Zhenglin Yan, Zhenyu Yu, Rong Fu, Zhongxue Gan, Chun Ouyang

机构 * Fudan University(复旦大学) Peking University(北京大学) University of Macau(澳门大学)

AI总结 本文提出三子空间解耦框架,通过分解多模态特征为公共、子模态共享和私人子空间,提升多模态情感分析的性能和鲁棒性。

Comments This study has been Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19225 2026-02-24 cs.AI

Proximity-Based Multi-Turn Optimization: Practical Credit Assignment for LLM Agent Training

基于接近性的多轮优化:LLM代理训练中的实用信用分配

Yangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi, Chang Liu, Peilin Zhao

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Peking University(北京大学) Lanzhou University(兰州大学) Tencent Inc.(腾讯公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 ProxMO通过动态调整梯度强度和连续语义加权,提升LLM代理在多轮训练中的信用分配效率与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19208 2026-02-24 cs.LG cs.AI

How to Allocate, How to Learn? Dynamic Rollout Allocation and Advantage Modulation for Policy Optimization

如何分配,如何学习?动态回放分配与优势调节用于策略优化

Yangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi, Chaowen Hu, Lu Pan, Ke Zeng, Xunliang Cai

机构 * Meituan(美团) Tsinghua University(清华大学) Fudan University(复旦大学) Peking University(北京大学)

AI总结 DynaMO通过动态回放分配和梯度感知优势调节,优化策略学习中的资源分配与梯度更新稳定性,提升数学推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18467 2026-02-24 cs.AI cs.LG

OffSeeker: Online Reinforcement Learning Is Not All You Need for Deep Research Agents

OffSeeker:在线强化学习并非构建深度研究代理的全部需求

Yuhang Zhou, Kai Zheng, Qiguang Chen, Mengkang Hu, Qingfeng Sun, Can Xu, Jingjing Chen

机构 * Fudan University(复旦大学) Tencent Hunyuan(腾讯文言) The University of Hong Kong(香港大学)

AI总结 本文提出OffSeeker,通过离线训练和任务合成框架,无需在线强化学习即可构建高效深度研究代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18773 2026-02-24 cs.AI

LAMMI-Pathology: A Tool-Centric Bottom-Up LVLM-Agent Framework for Molecularly Informed Medical Intelligence in Pathology

LAMMI-Pathology: 一种以工具为中心的自下而上LVLM-智能体框架用于分子信息引导的病理学智能

Haoyang Su, Shaoting Zhang, Xiaosong Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 LAMMI-Pathology提出了一种以工具为中心的自下而上智能体框架,通过分子信息引导的病理学智能提升病理图像分析的证据驱动能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02066 2026-02-24 cs.LG cs.AI cs.CL

MolReasoner: Toward Effective and Interpretable Reasoning for Molecular LLMs

MolReasoner:迈向分子大语言模型的有效且可解释的推理

Guojiang Zhao, Zixiang Lu, Yutang Ge, Sihang Li, Zheng Cheng, Haitao Lin, Lirong Wu, Hanchen Xia, Hengxing Cai, Wentao Guo, Hongshuai Wang, Mingjun Xu, Siyu Zhu, Guolin Ke, Linfeng Zhang, Zhifeng Gao

机构 * DP Technology, Beijing, China(DP技术有限公司) AI for Science Institute, Beijing, China(AI for Science研究院) Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Fudan University, Shanghai, China(复旦大学)

AI总结 MolReasoner通过两阶段框架提升分子大语言模型的推理能力和可解释性,有效减少幻觉并提高生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17680 2026-02-23 cs.LG

BioBridge: Bridging Proteins and Language for Enhanced Biological Reasoning with LLMs

BioBridge: 蛋白质与语言的桥梁:利用大语言模型增强生物推理

Yujia Wang, Jihong Guan, Wengen Li, Shuigeng Zhou, Xuhong Wang

机构 * School of Computer Science and Technology(计算机科学与技术学院) College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 BioBridge结合蛋白质领域知识与通用语言能力,通过领域自适应持续预训练框架提升生物推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02437 2026-02-23 cs.CV cs.AI

UniReason 1.0: A Unified Reasoning Framework for World Knowledge Aligned Image Generation and Editing

UniReason 1.0: 一个统一的推理框架,用于世界知识对齐的图像生成与编辑

Dianyi Wang, Chaofan Ma, Feng Han, Size Wu, Wei Song, Yibin Wang, Zhixiong Zhang, Tianhang Wang, Siyuan Wang, Zhongyu Wei, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) University of Southern California(美国南加州大学)

AI总结 UniReason 1.0通过统一推理框架整合图像生成与编辑,利用世界知识增强文本推理和视觉优化,提升复杂合成任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25867 2026-02-19 cs.LG

Synthesizing High-Quality Visual Question Answering from Medical Documents with Generator-Verifier LMMs

从医学文献合成高质量的视觉问答系统:基于生成-验证框架的大型多模态模型

Xiaoke Huang, Ningsen Wang, Hui Liu, Xianfeng Tang, Yuyin Zhou

机构 * UC Santa Cruz(加州大学圣克ruz分校) Fudan University(复旦大学) Amazon Research(亚马逊研究)

AI总结 MedVLSynther通过生成-验证框架从开放文献合成高质量医学VQA数据,提升六个基准测试的准确率,达到77.57的VQA-RAD表现。

Comments Project page, code, data, and models: https://ucsc-vlaa.github.io/MedVLSynther/ ; Accepted by ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏