arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

共收录 1920
2605.12090 2026-05-13 cs.RO cs.CL cs.CV

World Action Models: The Next Frontier in Embodied AI

世界动作模型:具身AI的下一个前沿

Siyin Wang, Junhao Shi, Zhaoyang Fu, Xinzhe He, Feihong Liu, Chenchen Yang, Yikang Zhou, Zhaoye Fei, Jingjing Gong, Jinlan Fu, Mike Zheng Shou, Xuanjing Huang, Xipeng Qiu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学)

AI总结 本文探讨了具身AI中的世界动作模型(WAMs),通过整合环境动态预测模型,统一预测状态建模与动作生成,提出结构化分类体系并分析数据生态,为该领域提供系统性综述。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03061 2026-05-13 cs.CV

Can Nano Banana 2 Replace Traditional Image Restoration Models? An Evaluation of Its Performance on Image Restoration Tasks

Nano Banana 2能否替代传统图像修复模型?对其在图像修复任务上的性能评估

Weixiong Sun, Xiang Yin, Chao Dong

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) Fudan University(复旦大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院)

AI总结 本文评估了Nano Banana 2在图像修复任务中的性能,发现提示设计至关重要,简洁提示和显式保真约束能平衡重建与感知质量。模型在全参考性能上表现竞争,用户研究中表现优异,但在感知质量与修复保真度之间存在差距,需改进可控性与保真度评估。

Comments Accepted by CVPR 2026 Workshop AAVM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03853 2026-05-13 cs.CV

UGround: Towards Unified Visual Grounding with Unrolled Transformers

UGround: 向统一视觉接地迈进的展开变换

Rui Qian, Xin Yin, Chuanhang Deng, Zhiyuan Peng, Jian Xiong, Wei Zhai, Dejing Dou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Zhejiang University(浙江大学)

AI总结 UGround通过引入Policy-Prompted Masking机制,动态选择展开变换层作为掩码提示,解决传统方法依赖固定最后一层和隐式投影的问题,统一了从传统参照表达分割到新提出的推理分割等多种视觉接地任务。

Comments This work has been accepted to ICML 2026, please refer to https://github.com/rui-qian/UGround

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11762 2026-05-13 cs.RO

NavOL: Navigation Policy with Online Imitation Learning

NavOL:基于在线模仿学习的导航策略

Xiaofei Wei, Chun Gu, Li Zhang

机构 * Shanghai Innovation Institute(上海创新研究院) School of Data Science, Fudan University(复旦大学数据科学学院)

AI总结 NavOL通过在线模仿学习在仿真环境中训练导航策略,利用预训练的扩散策略和全局规划器,提升学习效率并减少分布偏移,实现在50个场景中每小时生成2000多条轨迹。

Comments Project page: https://logosroboticsgroup.github.io/NavOL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10984 2026-05-13 cs.CV

Principle-Guided Supervision for Interpretable Uncertainty in Medical Image Segmentation

基于原则的可解释不确定性监督在医学图像分割中

An Sui, Yuzhu Li, Gunter Schumann, Fuping Wu, Xiahai Zhuang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑启发智能科学研究院) National Heart and Lung Institute, Imperial College London(伦敦帝国理工学院国家心脏和肺研究所)

AI总结 本文提出PriUS框架,通过原则指导提升医学图像分割中不确定性的可解释性,实验表明其在保持分割性能的同时提升了不确定性估计的一致性。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10956 2026-05-13 cs.SE cs.AI

Project-Level C-to-Rust Translation via Pointer Knowledge Graphs

基于指针知识图谱的项目级C到Rust翻译

Zhiqiang Yuan, Wenjun Mao, Zhuo Chen, Xiyue Shang, Chong Wang, Yiling Lou, Xin Peng

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出基于指针知识图谱的项目级C到Rust翻译方法PtrTrans,通过增强代码依赖图的指针语义,提升生成Rust代码的安全性和正确性,实验表明其在安全性与功能性上均优于现有方法。

Comments Accepted by FSE'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10912 2026-05-12 cs.CL

WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation

WildClawBench: 一个用于真实世界、长周期代理评估的基准测试

Shuangrui Ding, Xuanlang Dai, Long Xing, Shengyuan Ding, Ziyu Liu, Yang JingYi, Penghui Yang, Zhixiong Zhang, Xilin Wei, Xinyu Fang, Yubo Ma, Haodong Duan, Jing Shao, Jiaqi Wang, Dahua Lin, Kai Chen, Yuhang Zang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出WildClawBench,一个包含60个双语多模态任务的原生运行时基准测试,评估代理在真实工具环境中的长周期任务能力,结果显示当前前沿模型在真实运行时表现仍不理想。

Comments Github link: https://github.com/internlm/WildClawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10870 2026-05-12 cs.AI

Remember the Decision, Not the Description: A Rate-Distortion Framework for Agent Memory

记住决策,而非描述:一种面向代理记忆的速率-失真框架

Mingxi Zou, Zhihan Guo, Langzhang Liang, Zhuo Wang, Qifan Wang, Qingsong Wen, Irwin King, Lizhen Qu, Zenglin Xu

机构 * Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Meta AI AI Research Institute, Squirrel Ai Learning(Squirrel Ai Learning人工智能研究院) Monash University(墨尔本大学) Shanghai Academy of AI for Science(上海人工智能科学研究院)

AI总结 本文提出一种以决策为核心的速率-失真框架,用于代理记忆管理,通过优化内存预算与决策质量的权衡,提出DeMem算法在合成数据和对话任务中提升了决策性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10651 2026-05-12 cs.LG cs.AI stat.ML

A Recursive Decomposition Framework for Causal Structure Learning in the Presence of Latent Variables

基于潜在变量的因果结构学习递归分解框架

Zheng Li, Feng Xie, Shenglan Nie, Xichen Guo, Ruxin Wang, Hao Zhang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究院,中国科学院,中国深圳) College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院,中国上海)

AI总结 本文提出DiCoLa框架,通过递归分解和系统重建,在存在潜在变量时提升因果发现效率,理论证明其正确性并实验证明有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10645 2026-05-12 cs.CV

GenMed: A Pairwise Generative Reformulation of Medical Diagnostic Tasks

GenMed:医学诊断任务的成对生成性重述

Hantao Zhang, Weidong Guo, Yuhe Liu, Jiancheng Yang, Sathvik Bhagavan, Danli Shi, Mingda Xu, Pascal Fua

机构 * CVLab, École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL)计算机视觉实验室) Fudan University(复旦大学) Beihang University(北航大学) ELLIS Institute Finland(芬兰ELLIS研究所) Aalto University(艾尔沃斯大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出一种生成性方法,通过扩散模型建模联合分布P(X,Y),在推理时优化输出,支持任意观测组合,实验显示在医学图像分割、少样本分割、退化输入分割、形状补全和零样本应用中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10466 2026-05-12 cs.LG

Self-Attention as a Covariance Readout: A Unified View of In-Context Learning and Repetition

自注意力作为协方差读出:对上下文学习和重复的统一视角

Haoren Xu, Guanhua Fang

机构 * Fudan University(复旦大学)

AI总结 本文探讨了大语言模型中上下文学习和重复生成现象的统一原理,通过自注意力机制推导出协方差读出机制,揭示了其在线性回归和生成过程中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10343 2026-05-12 cs.CV cs.AI

EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant

EvoStreaming: 你的离线视频模型本质上是一个原生流式助手

Zichen Wen, Boxue Yang, Junlong Ke, Jiajie Huang, Chenfei Liao, Junxi Wang, Xuyang Liu, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Fudan University(复旦大学)

AI总结 本文提出EvoStreaming框架,通过自演化方法使离线视频模型适应流式助手任务,仅需1000个自生成样本即可提升RealStreamEval评分,并保持离线性能。

Comments 33 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10129 2026-05-12 cs.CL

Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data

合成预预训练提升语言模型对噪声预训练数据的鲁棒性

Xu Guo, Runyu Peng, Jian Tong, Yunhua Zhou, Haijun Lv, Zhihui Lu, Qipeng Guo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

AI总结 本文研究了基于合成数据的轻量预预训练(PPT)阶段对提升语言模型在预训练阶段对噪声的鲁棒性的作用,实验表明PPT能有效降低噪声影响,尤其在高噪声水平下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10120 2026-05-12 cs.CV cs.AI

MicroWorld: Empowering Multimodal Large Language Models to Bridge the Microscopic Domain Gap with Multimodal Attribute Graph

MicroWorld: 通过多模态属性图赋能多模态大语言模型,弥合微观领域差距

Manyu Li, Ruian He, Chenxi Ma, Weimin Tan, Bo Yan

机构 * Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理关键实验室) School of Computer Science, Fudan University(复旦大学计算机科学学院)

AI总结 MicroWorld通过构建多模态属性图增强多模态大语言模型在微观领域的能力,无需领域微调即可提升推理性能,实验显示在MicroVQA和MicroBench基准上均取得显著提升。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18111 2026-05-12 cs.CV

When Large Vision-Language Models Meet Person Re-Identification

当大视觉-语言模型遇见人重识别

Qizao Wang, Bin Li, Xiangyang Xue

机构 * School of Computer Science, Fudan University, Shanghai, China(复旦大学计算机科学学院,上海,中国)

AI总结 本文提出LVLM-ReID框架,利用大视觉-语言模型的生成能力提升人重识别的准确性,通过语义引导交互模块生成关键外观语义特征,无需额外标注即可在多个基准上取得竞争性结果。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10106 2026-05-12 cs.CV cs.AI

ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models

ViSRA:一种基于视频的空间推理代理用于多模态大语言模型

Tingshu Mou, Jiabo He, Renying Wang, Ce Liu, Hao Yang, Tiehua Zhang, Jingjing Chen, Xingjun Ma

机构 * Fudan University(复旦大学) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI)) Tongji University(同济大学)

AI总结 ViSRA从无训练视角出发,提出一种人类对齐的视频空间推理代理框架,通过显式空间信息探索多模态大语言模型的空间推理机制,实现模块化和可扩展的空间推理,提升3D理解能力并减少训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09449 2026-05-12 cs.CV

SpaceMind++: Toward Allocentric Cognitive Maps for Spatially Grounded Video MLLMs

SpaceMind++:迈向空间感知认知地图的视频多模态大语言模型

Bo Gu, Zhikang Zhang, Zizhuang Wei, Zhenyuan Chen, Lingyun Li, Zhuoyi Song

机构 * Fudan University(复旦大学) Huawei(华为) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 SpaceMind++通过构建体素化认知地图,实现空间一致性的视觉推理,提升视频多模态大语言模型在3D环境中的表现。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09442 2026-05-12 cs.CV cs.AI

SWIFT: Prompt-Adaptive Memory for Efficient Interactive Long Video Generation

SWIFT: 用于高效交互长视频生成的提示自适应内存

Shanwen Tan, Hao Li, Jingtao Zhang, Xiaosong Jia, Xue Yang, Shaofeng Zhang, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Georgia Institute of Technology(佐治亚理工学院) Shanghai Jiao Tong University(上海交通大学)

AI总结 SWIFT提出一种无需训练的多提示长视频生成框架,通过轻量级语义注入缓存和自适应动态窗口实现高效语义切换,保持时间一致性,达到22.6 FPS的高效生成速度。

Comments Code is available at https://github.com/ShanwenTan/SWIFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03648 2026-05-12 cs.LG

SAFA-SNN: Sparsity-Aware On-Device Few-Shot Class-Incremental Learning with Fast-Adaptive Structure of Spiking Neural Network

SAFA-SNN:基于稀疏性的设备端少样本类增量学习与快速自适应的脉冲神经网络结构

Huijing Zhang, Muyang Cao, Linshan Jiang, Xin Du, Di Yu, Changze Lv, Shuiguang Deng

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Southern University of Science and Technology(南方科技大学) Fudan University(复旦大学)

AI总结 本文提出SAFA-SNN,通过稀疏性感知的神经动力学和快速自适应结构,解决设备端少样本类增量学习中的灾难性遗忘问题,实验表明在多个数据集上优于基线方法。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09144 2026-05-12 cs.LG

FedVSSAM: Mitigating Flatness Incompatibility in Sharpness-Aware Federated Learning

FedVSSAM: 缓解联邦学习中sharpness-aware学习的flatness不兼容性

Bingnan Xiao, Yuan Gao, Bingcong Li, Wei Ni, Xin Wang, Tony Q. S. Quek

机构 * Fudan University(复旦大学) ETH Zurich(苏黎世联邦理工学院) Edith Cowan University(埃迪斯科文大学) Singapore University of Technology and Design(新加坡科技设计大学)

AI总结 FedVSSAM通过引入方差抑制的sharpness-aware最小化方法,缓解联邦学习中由于数据异质性和友好对抗现象导致的flatness不兼容性,提升全局模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09012 2026-05-12 cs.AI

Re$^2$Math: Benchmarking Theorem Retrieval in Research-Level Mathematics

Re²Math:研究级数学中的定理检索基准测试

Zicheng Lyu, Wenjie Yang, Shengzhong Zhang, Zengfeng Huang

机构 * Fudan University(复旦大学) Fudan University Shanghai Innovation Institute(复旦大学上海创新研究院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

AI总结 Re²Math基准测试旨在评估从部分数学证明中检索工具的能力,通过构建包含层级上下文和可选泄漏控制锚点提示的实例,评估系统在检索文献支持的数学工具时的准确性与适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08915 2026-05-12 cs.LG

Physics-Informed Neural PDE Solvers via Spatio-Temporal MeanFlow

基于时空均流的物理信息神经PDE求解器

Hanru Bai, Yuncheng Zhou, Difan Zou

机构 * Fudan University(复旦大学) The University of Hong Kong(香港大学)

AI总结 本文提出时空均流求解器,通过将生成速度场替换为物理PDE算子,实现高效预测,同时扩展均流约束到时空域,统一处理时变和静态PDE,实验表明其在精度和效率上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08905 2026-05-12 cs.AI

Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs

Forge:面向NP难优化问题的质量感知强化学习

Xiaozhe Li, Xinyu Fang, Shengyuan Ding, Yang Li, Linyang Li, Haodong Duan, Qingwen Liu, Kai Chen

机构 * Tongji University(同济大学) Shanghai AI Lab(上海人工智能实验室) Zhejiang University(浙江大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Independent(独立)

AI总结 本文提出OPT-BENCH框架,通过质量感知强化学习提升大语言模型在NP难优化问题上的表现,实验表明其在多个任务上均优于现有模型,且任务多样性对泛化能力影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08904 2026-05-12 cs.AI

OPT-BENCH: Evaluating the Iterative Self-Optimization of LLM Agents in Large-Scale Search Spaces

OPT-BENCH:评估大搜索空间中LLM代理的迭代自我优化

Xiaozhe Li, Jixuan Chen, Xinyu Fang, Shengyuan Ding, Haodong Duan, Qingwen Liu, Kai Chen

机构 * Tongji University(同济大学) Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学) Zhejiang University(浙江大学) University of California San Diego(加州大学圣地亚哥分校)

AI总结 OPT-BENCH通过结合20个机器学习任务和10个经典NP难问题,评估LLM代理在大规模搜索空间中通过内在自我反思而非机械工具应用进行适应的能力,揭示更强模型在反馈利用上的优势及基础能力的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08778 2026-05-12 cs.AI cs.LG cs.MA

Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking

并非所有转折都重要:多轮 jailbreak 的信用分配

Zhida He, Xiaoyu Wen, Han Qi, Ziyuan Zhou, Peng Yu, Xingcheng Xu, Dongrui Liu, Xia Hu, Chaochao Lu, Qiaosheng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出 TRACE 框架,通过区分多轮 jailbreak 中不同回合的贡献,提升攻击效果和防御安全。

Comments 41 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08765 2026-05-12 cs.LG cs.AI

Unlearners Can Lie: Evaluating and Improving Honesty in LLM Unlearning

无法学习者可以撒谎:评估和改进LLM去学习中的诚实性

Renjie Gu, Jiazhen Du, Yihua Zhang, Sijia Liu

机构 * Fudan University(复旦大学) Central South University(中南大学) Michigan State University(密歇根州立大学)

AI总结 本文评估并改进LLM去学习中的诚实性,提出正式定义并引入评估指标,实验显示现有方法无法满足标准,提出ReVa方法提升去学习效果和诚实性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08666 2026-05-12 cs.LG

The Cancellation Hypothesis in Critic-Free RL: From Outcome Rewards to Token Credits

无评论强化学习中的取消假设:从结果奖励到令牌信用

Tianhao Cheng, Zeyu Huang, Zihan Qiu, Yu Cheng, Edoardo Ponti, Yinghui Xu, Ivan Titov, Zenglin Xu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The University of Edinburgh(爱丁堡大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Academy of AI for Science(上海人工智能科学研究院) Qwen Team, Alibaba Group(阿里集团Qwen团队) University of Amsterdam(阿姆斯特丹大学)

AI总结 本文从令牌层面研究无评论强化学习,揭示令牌翻转现象,并提出取消假设,解释令牌层面信用分配机制,通过实验验证该假设并提出改进训练的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05611 2026-05-12 cs.SD cs.AI eess.AS

X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning

X-Voice:通过零样本跨语言语音克隆让每个人都能说30种语言

Rixi Xu, Qingyu Liu, Haitao Li, Yushen Chen, Zhikang Niu, Yunting Yang, Jian Zhao, Ke Li, Berrak Sisman, Qinyuan Cheng, Xipeng Qiu, Kai Yu, Xie Chen

机构 * MoE Key Lab of Artificial Intelligence, X-LANCE Lab, Shanghai Jiao Tong University(摩埃人工智能重点实验室、X-LANCE实验室、上海交通大学) Shanghai Innovation Institute(上海创新研究院) Center for Language and Speech Processing, Johns Hopkins University(语言与语音处理中心、约翰霍普金斯大学) Geely(吉利) Dataocean AI(数据海洋人工智能) Zhejiang University(浙江大学) Fudan University(复旦大学)

AI总结 X-Voice通过双阶段训练和多语言语音合成架构,实现零样本跨语言语音克隆,优于现有多语言系统并在性能上接近大规模模型。

Comments 16 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19670 2026-05-12 cs.LG

Load--Reserve Wasserstein Propagation for Isotropic Diffusion Samplers

负载储备Wasserstein传播用于各向同性扩散采样器

Zicheng Lyu, Zengfeng Huang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出了一种针对各向同性反向SDE窗口的适应性传播接口,通过认证学习漂移剖面生成线性尾运输成本,结合反射耦合和Hardy容量量化负载,以改进Wasserstein距离中的收缩率和尾坡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13224 2026-05-12 cs.CV cs.AI

Visual-ERM: Reward Modeling for Visual Equivalence

视觉-ERM:用于视觉等价性的奖励建模

Ziyu Liu, Shengyuan Ding, Xinyu Fang, Xuanlang Dai, Penghui Yang, Jianze Liang, Jiaqi Wang, Kai Chen, Dahua Lin, Yuhang Zang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) CUHK(香港中文大学)

AI总结 本文提出视觉-ERM模型,通过细粒度的视觉反馈提升视觉到代码任务的奖励学习效果,实验显示其在图表到代码、表格和SVG解析任务中均取得显著提升。

Comments Project: https://github.com/InternLM/Visual-ERM

详情

展开后加载摘要…

URL PDF HTML 收藏