arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

共收录 1936
2601.06806 2026-01-13 cs.CV cs.AI cs.RO

SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation

SpatialNav: 利用空间场景图进行零样本视觉-语言导航

Jiwen Zhang, Zejun Li, Siyuan Wang, Xiangyu Shi, Zhongyu Wei, Qi Wu

机构 * Fudan University, Shanghai, China(复旦大学) University of Southern California, Los Angeles, USA(南加州大学) Australian Institute for Machine Learning, Adelaide University, Australia(澳大利亚机器学习研究所) Shanghai Innovation Institute, Shanghai, China(上海创新研究院)

AI总结 SpatialNav通过构建空间场景图,利用全局空间表示提升零样本视觉-语言导航的效率与性能。

Comments 11 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06801 2026-01-13 cs.AI cs.LG

Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy

通过delta思考:通过微分视觉推理策略激励强化学习

Shujian Gao, Yuan Wang, Jiangtao Yan, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学) Wuhan University(武汉大学)

AI总结 通过微分视觉推理策略增强强化学习的视觉理解能力,提升多模态任务性能。

Comments 24 pages, 10 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06666 2026-01-13 cs.CL cs.AI

InFi-Check: Interpretable and Fine-Grained Fact-Checking of LLMs

InFi-Check: 可解释且细粒度的大型语言模型事实核查

Yuzhuo Bai, Shuzheng Si, Kangyang Luo, Qingyi Wang, Wenhao Li, Gang Chen, Fanchao Qi, Maosong Sun

机构 * Tsinghua University(清华大学) DeepLang AI Fudan University(复旦大学)

AI总结 InFi-Check通过可控数据合成和细粒度事实核查框架,提升大型语言模型事实性评估的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04566 2026-01-13 cs.AI cs.CL

BackdoorAgent: A Unified Framework for Backdoor Attacks on LLM-based Agents

BackdoorAgent: 一个统一框架用于针对基于LLM的代理的后门攻击

Yunhao Feng, Yige Li, Yutao Wu, Yingshui Tan, Yanming Guo, Yifan Ding, Kun Zhai, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Singapore Management University(新加坡管理大学) Alibaba Group(阿里巴巴集团) Deakin University(德肯大学) Hunan Institute of Advanced Technology(湖南高级技术研究所)

AI总结 BackdoorAgent提出一个统一框架,分析LLM代理中后门攻击的跨阶段传播和触发器持续性,揭示代理工作流的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03561 2026-01-13 cs.LG

Neural Operators for Biomedical Spherical Heterogeneity

神经运算符用于生物医学球形异质性

Hao Tang, Hao Chen, Hao Li, Chao Li

机构 * University of Dundee(邓迪大学) University of Cambridge(剑桥大学) Fudan University(复旦大学)

AI总结 GSNO通过融合等变、不变和各向异性格林函数运算,有效建模生物医学中的球形异质性和各向异性,提升真实世界系统的适应性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05034 2026-01-12 cs.AI

How to Set the Batch Size for Large-Scale Pre-training?

如何为大规模预训练设置批次大小?

Yunhua Zhou, Junhao Huang, Shuhao Xing, Yechen Zhang, Runyu Peng, Qiping Guo, Xipeng Qiu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai JiaoTong University(上海交通大学)

AI总结 本文提出动态批次大小调度器,通过修订E(S)关系,优化大规模预训练中的批次大小选择,提升训练效率和模型质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05244 2026-01-09 cs.CV

GREx: Generalized Referring Expression Segmentation, Comprehension, and Generation

GREx: 通用指称表达分割、理解和生成

Henghui Ding, Chang Liu, Shuting He, Xudong Jiang, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

AI总结 GREx提出通用指称表达分割、理解和生成框架,扩展至多目标和无目标表达,引入gRefCOCO数据集和ReLA方法,提升复杂关系建模能力。

Comments IJCV, Project Page: https://henghuiding.com/GREx/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05107 2026-01-09 cs.AI

Controllable Memory Usage: Balancing Anchoring and Innovation in Long-Term Human-Agent Interaction

可控的记忆使用:在长期人机交互中平衡锚定与创新

Muzhao Tian, Zisu Huang, Xiaohua Wang, Jingwen Xu, Zhengkang Guo, Qi Qian, Yuanzhe Shen, Kaitao Song, Jiakang Yuan, Changze Lv, Xiaoqing Zheng

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)

AI总结 SteeM通过动态调节记忆依赖程度,在长期人机交互中平衡锚定与创新,提升个性化协作效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05073 2026-01-09 cs.LG

Milestones over Outcome: Unlocking Geometric Reasoning with Sub-Goal Verifiable Reward

几何推理的里程碑:通过子目标可验证奖励解锁几何推理

Jianlong Chen, Daocheng Fu, Shengze Xu, Jiawei Chen, Yuan Feng, Yue Yang, Junchi Yan, Hongyuan Zha, Renqiu Xia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学)

AI总结 本文提出SGVR框架,通过子目标可验证奖励提升多模态大语言模型在几何推理及泛化能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05049 2026-01-09 cs.AI

How to Set the Learning Rate for Large-Scale Pre-training?

如何为大规模预训练设置学习率?

Yunhua Zhou, Shuhao Xing, Junhao Huang, Xipeng Qiu, Qipeng Guo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai JiaoTong University(上海交通大学) Fudan University(复旦大学)

AI总结 本文提出两种范式(拟合与迁移)来解决大规模预训练中学习率设置问题,通过缩放定律和μ迁移扩展,挑战了现有方法的可扩展性并提供实用指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14195 2026-01-09 cs.LG cs.CR

N-GLARE: An Non-Generative Latent Representation-Efficient LLM Safety Evaluator

N-GLARE:一种非生成式、潜在表示高效的大语言模型安全评估器

Zheyu Lin, Jirui Yang, Yukui Qiu, Hengqi Guo, Yubing Bao, Yao Guan

机构 * University of California, Riverside(加州大学河滨分校) Fudan University(复旦大学) South China University of Technology(华南理工大学)

AI总结 N-GLARE通过分析潜在表示动态,提出一种高效无输出的大语言模型安全评估方法,显著降低评估成本并提升诊断效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17722 2026-01-09 cs.CV cs.AI

MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues

MT-Video-Bench: 一个多轮对话中评估多模态大语言模型的综合视频理解基准

Yaning Pan, Qianqian Xie, Guohui Zhang, Zekun Wang, Yongqian Wen, Yuanxing Zhang, Haoxuan Hu, Zhiyu Pan, Yibing Huang, Zhidong Gan, Yonghong Lin, An Ping, Shihao Li, Yanghai Wang, Tianhao Peng, Jiaheng Liu

机构 * Fudan University(复旦大学) NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) University of Science and Technology of China(中国科学技术大学) Kuaishou Technology(快手科技)

AI总结 MT-Video-Bench通过评估多轮对话中多模态大语言模型的6项核心能力,揭示其在处理多轮视频对话任务中的性能差异和局限性。

Comments Project Website: https://github.com/NJU-LINK/MT-Video-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05988 2026-01-09 cs.LG cs.SE

Pruning the Unsurprising: Efficient LLM Reasoning via First-Token Surprisal

剪除无意义的:通过首词意外度实现高效的LLM推理

Wenhao Zeng, Yaoning Wang, Chao Hu, Yuling Shi, Chengcheng Wan, Hongyu Zhang, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) East China Normal University(华东师范大学) Chongqing University(重庆大学)

AI总结 本文提出ASAP方法,通过锚点引导和首词意外度度量实现高效的CoT压缩,提升推理效率并降低训练成本。

Comments Code and model available at https://github.com/Zengwh02/ASAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04785 2026-01-09 cs.CV cs.AI

SRU-Pix2Pix: A Fusion-Driven Generator Network for Medical Image Translation with Few-Shot Learning

SRU-Pix2Pix:一种融合驱动的生成器网络用于医学图像翻译的少样本学习

Xihe Qiu, Yang Dai, Xiaoyu Tan, Sijia Li, Fenghao Sun, Lu Gan, Liang Liu

机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子电气工程学院) Department of Thoracic Surgery, Zhongshan Hospital of Fudan University(复旦大学中山医院胸外科) Clinical Research Unit, Institute of Clinical Science, Zhongshan Hospital of Fudan University(复旦大学中山医院临床科研部) Department of Medical Oncology, Cancer Center, and Fudan Zhangjiang Institute, Zhongshan Hospital of Fudan University(复旦大学中山医院医学肿瘤科、癌症中心及复旦张江研究院)

AI总结 SRU-Pix2Pix通过整合SEResNet和U-Net++提升医学图像翻译的生成质量与结构保真度,实现少样本下的高效翻译

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04620 2026-01-09 cs.AI

AgentDevel: Reframing Self-Evolving LLM Agents as Release Engineering

AgentDevel: 将自演化大语言模型代理重新定义为发布工程

Di Zhang

机构 * Fudan University(复旦大学)

AI总结 AgentDevel将LLM代理改进重新定义为发布工程,通过无实现偏见的批评者、可执行诊断和翻转中心门控,实现稳定改进和可审计的发布流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04607 2026-01-09 cs.CV cs.AI

HUR-MACL: High-Uncertainty Region-Guided Multi-Architecture Collaborative Learning for Head and Neck Multi-Organ Segmentation

HUR-MACL:高不确定性区域引导的多架构协作学习用于头颈多器官分割

Xiaoyu Liu, Siwen Wei, Linhao Qu, Mingyuan Pan, Chengsheng Zhang, Yonghong Shi, Zhijian Song

机构 * Digital Medical Research Center, School of Basic Medical Science, Fudan University, Shanghai 200032, China(复旦大学基础医学研究院数字医学研究中心) Shanghai Key Lab of Medical Image Computing(上海医学图像计算重点实验室) Radiation Oncology Center, Huashan Hospital Affiliated to Fudan University, Shanghai 200032, China(复旦大学附属华山医院放射肿瘤中心)

AI总结 HUR-MACL通过高不确定性区域引导的多架构协作学习,提升头颈多器官分割的准确性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04508 2026-01-09 cs.CL cs.AI cs.SD

WESR: Scaling and Evaluating Word-level Event-Speech Recognition

WESR: 词级事件-语音识别的扩展与评估

Chenchen Yang, Kexin Huang, Liwei Fan, Qian Tu, Botian Jiang, Dong Zhang, Linqi Yin, Shimin Li, Zhaoye Fei, Qinyuan Cheng, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 WESR提出词级事件-语音识别的扩展与评估框架,通过细化分类和专家标注的评估集,实现对非语言事件的精确定位,提升语音识别与处理的准确性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09779 2026-01-09 cs.CV

MoIIE: Mixture of Intra- and Inter-Modality Experts for Large Vision Language Models

MoIIE:多模态专家的混合模型用于大视觉语言模型

Dianyi Wang, Siyuan Wang, Zejun Li, Yikun Wang, Yitong Li, Duyu Tang, Xiaoyu Shen, Xuanjing Huang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institut(上海创新研究院) University of Southern California(南加州大学) Huawei Technologies Co., Ltd(华为技术有限公司) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin, EIT(宁波空间智能与数字衍生关键实验室,数字孪生研究院,EIT)

AI总结 本文提出MoIIE模型,通过混合内模态和跨模态专家提升大视觉语言模型的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02038 2026-01-09 cs.CR cs.LG

Blockchain Powered Edge Intelligence for U-Healthcare in Privacy Critical and Time Sensitive Environment

区块链赋能的边缘智能用于隐私关键和时间敏感的医疗保健

Anum Nawaz, Hafiz Humza Mahmood Ramzan, Xianjia Yu, Zhuo Zou, Tomi Westerlund

机构 * Shanghai Key Laboratory of Intelligent Information Processing Lab, Fudan University, China(上海智能信息处理实验室,复旦大学,中国) Turku Intelligent Embedded and Robotic Systems (TIERS) Lab, Faculty of Technology, University of Turku, Finland(图尔库智能嵌入式与机器人系统(TIERS)实验室,技术学院,图尔库大学,芬兰) Department of Engineering and Architecture, University of Parma, Italy(工程与建筑系,帕尔马大学,意大利) TIERS Lab, University of Turku, Finland(TIERS实验室,图尔库大学,芬兰) School of Information Science and Technology, Fudan University, Shanghai, China(信息科学与技术学院,复旦大学,上海,中国) Robotics and Autonomous Systems at the University of Turku(图尔库大学的机器人与自主系统)

AI总结 本文提出了一种基于区块链和边缘智能的医疗系统,通过自主计算模型和1D-CNN实现隐私保护和实时数据处理,提升医疗保健的效率和可靠性。

Journal ref IEEE Journal of Biomedical and Health Informatics ( Early Access, 06 October 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00416 2026-01-09 cs.LG cs.CR stat.ML

Blockchain-Enabled Privacy-Preserving Second-Order Federated Edge Learning in Personalized Healthcare

基于区块链的隐私保护第二阶联邦边缘学习在个性化医疗中的应用

Anum Nawaz, Muhammad Irfan, Xianjia Yu, Hamad Aldawsari, Rayan Hamza Alsisi, Zhuo Zou, Tomi Westerlund

机构 * Shanghai Key Laboratory of Intelligent Information Processing Lab, Fudan University, China(上海智能信息处理实验室,复旦大学,中国) Turku Intelligent Embedded and Robotic Systems (TIERS) Lab, University of Turku, Finland(图尔库智能嵌入式与机器人系统(TIERS)实验室,图尔库大学,芬兰) TIERS Lab, University of Turku, Finland(TIERS实验室,图尔库大学,芬兰) Department of Electrical Engineering, Islamic University of Madinah, Saudi Arabia(电气工程系,麦加伊斯兰大学,沙特阿拉伯) School of Information Science and Technology, Fudan University, Shanghai, China(信息科学与技术学院,复旦大学,上海,中国) Faculty of Technology, University of Turku, Finland(技术学院,图尔库大学,芬兰)

AI总结 本文提出基于区块链的BFEL框架,通过优化FedCurv实现个性化医疗中的隐私保护第二阶联邦边缘学习,提升模型效率与安全性。

Journal ref IEEE Transactions on Consumer Electronics ( Volume: 71, Issue: 4, November 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02948 2026-01-09 cs.DB cs.CL

Grounding Natural Language to SQL Translation with Data-Based Self-Explanations

通过数据驱动的自我解释实现自然语言到SQL翻译

Yuankai Fan, Tonghui Ren, Can Huang, Zhenying He, X. Sean Wang

机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所)

AI总结 本文提出CycleSQL框架,通过数据驱动的自我解释提升自然语言到SQL翻译的准确性和可解释性。

Comments ICDE2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17144 2026-01-09 cs.DB cs.AI

Metasql: A Generate-then-Rank Framework for Natural Language to SQL Translation

Metasql: 一种自然语言到SQL翻译的生成后排序框架

Yuankai Fan, Zhenying He, Tonghui Ren, Can Huang, Yinan Jing, Kai Zhang, X. Sean Wang

机构 * School of Computer Science, Fudan University, Shanghai, China(计算机科学学院,复旦大学,上海,中国)

AI总结 Metasql通过引入查询元数据和学习排序算法,提升自然语言到SQL翻译的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03986 2026-01-08 cs.CL

Benchmark^2: Systematic Evaluation of LLM Benchmarks

Benchmark^2: 大语言模型评估基准的系统性评估

Qi Qian, Chengsong Huang, Jingwen Xu, Changze Lv, Muling Wu, Wenhao Liu, Xiaohua Wang, Zhenghua Wang, Zisu Huang, Muzhao Tian, Jianhan Xu, Kun Hu, He-Da Wang, Yao Hu, Xuanjing Huang, Xiaoqing Zheng

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Washington University in St. Louis(华盛顿大学圣路易斯分校) Xiaohongshu Inc.(小红书公司)

AI总结 Benchmark^2 提出了一种系统性评估大语言模型评估基准的方法,通过三个互补指标分析基准质量,揭示现有基准的差异并展示选择性构建的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03689 2026-01-08 cs.LG cs.AI physics.chem-ph

A Pre-trained Reaction Embedding Descriptor Capturing Bond Transformation Patterns

基于反应嵌入描述符的预训练模型捕捉键转变模式

Weiqi Liu, Fenglei Cao, Yuan Qi, Li-Cheng Xu

机构 * Artificial Intelligence Innovation and Incubation Institute, Fudan University, Shanghai, China(复旦大学人工智能创新与孵化院) Shanghai Academy of Artificial Intelligence for Science, Shanghai, China(上海人工智能科学研究院) Zhongshan Hospital, Shanghai, China(中山医院)

AI总结 本研究提出RXNEmb,一种基于预训练模型的反应嵌入描述符,用于捕捉键转变模式,通过数据驱动的方法改进反应分类和可视化分析。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03543 2026-01-08 cs.CL

EvolMem: A Cognitive-Driven Benchmark for Multi-Session Dialogue Memory

EvolMem:一种基于认知的多会话对话记忆基准

Ye Shen, Dun Pei, Yiqiu Guo, Junying Wang, Yijin Guo, Zicheng Zhang, Qi Jia, Jun Zhou, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学)

AI总结 EvolMem提出了一种基于认知的多会话对话记忆基准,用于评估LLMs和智能体系统的多会话记忆能力,揭示了不同模型在多维记忆任务中的表现差异。

Comments 14 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22461 2026-01-07 cs.SD cs.AI cs.CL eess.AS

CMDAR: A Chinese Multi-scene Dynamic Audio Reasoning Benchmark with Diverse Challenges

CMDAR:一个包含多样挑战的中文多场景动态音频推理基准

Hui Li, Changhao Jiang, Hongyu Wang, Ming Zhang, Jiajun Sun, Zhixiong Yang, Yifei Cao, Shihan Dou, Xiaoran Fan, Baoyu Fan, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) Shanghai Jiao Tong University(上海交通大学) IEIT Systems Co Ltd(IEIT系统有限公司)

AI总结 CMDAR是一个中文多场景动态音频推理基准,旨在评估模型在复杂音频推理任务中的表现,通过精心设计的问题-答案对和多样化音频片段,揭示现有音频语言模型在复杂推理任务中的局限性。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02386 2026-01-07 cs.IR cs.AI

Tree of Preferences for Diversified Recommendation

偏好树用于多样化推荐

Hanyang Yuan, Ning Tang, Tongya Zheng, Jiarong Xu, Xintong Hu, Renhong Huang, Shunyu Liu, Jiacong Hu, Jiawei Chen, Mingli Song

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Hangzhou City University(杭州市大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出基于偏好树的多样化推荐方法,利用LLMs揭示用户未探索偏好,提升推荐多样性与相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22234 2026-01-07 cs.LG cs.AI

DiRL: An Efficient Post-Training Framework for Diffusion Language Models

DiRL:一种高效的扩散语言模型后训练框架

Ying Zhu, Jiaxin Wan, Xiaoran Liu, Siyang He, Qiqi Wang, Xu Guo, Tianyi Liang, Zengfeng Huang, Ziwei He, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) OpenMoss Team(OpenMoss团队)

AI总结 DiRL是一种高效的扩散语言模型后训练框架,通过整合FlexAttention加速的分块训练与LMDeploy优化的推理,实现了高效的两阶段后训练,提升了在复杂推理任务如数学中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11480 2026-01-06 cs.CV

CADMorph: Geometry-Driven Parametric CAD Editing via a Plan-Generate-Verify Loop

CADMorph: 通过计划-生成-验证循环实现几何驱动的参数化CAD编辑

Weijian Ma, Shizhao Sun, Ruiyu Wang, Jiang Bian

机构 * Fudan University(复旦大学) Microsoft Research, Asia(微软亚洲研究院) University of Toronto(多伦多大学)

AI总结 CADMorph通过计划-生成-验证循环实现几何驱动的参数化CAD编辑,利用预训练模型在数据稀少情况下保持结构、语义和形状保真度,超越现有方法并支持下游应用。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09040 2026-01-06 cs.CV cs.AI cs.CL

Autoregressive Semantic Visual Reconstruction Helps VLMs Understand Better

自回归语义视觉重建有助于VLMs更好地理解

Dianyi Wang, Wei Song, Yikun Wang, Siyuan Wang, Kaicheng Yu, Zhongyu Wei, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) AutoLab, Westlake University(西湖大学AutoLab) Zhejiang University(浙江大学) Shanghai AI Lab(上海人工智能实验室) University of Southern California(美国南加州大学)

AI总结 自回归语义视觉重建通过提升多模态理解能力,改进了VLMs对视觉信息的把握

详情

展开后加载摘要…

URL PDF HTML 收藏