arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

2026-05-29 至 2026-05-29 共收录 17
2605.30265 2026-05-29 cs.CV cs.CL

LoMo: Local Modality Substitution for Deeper Vision-Language Fusion

LoMo: 局部模态替换以实现更深的视觉-语言融合

Feng Han, Zhixiong Zhang, Zheming Liang, Yibin Wang, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

AI总结 针对视觉-语言模型在模态替换时性能下降的“载体敏感性”问题,提出局部模态替换(LoMo)数据策展范式,通过将文本片段动态渲染为图像来训练跨模态表示不变性,显著提升多模态推理与融合效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30117 2026-05-29 cs.AI

VLA-Trace: Diagnosing Vision-Language-Action Models through Representation and Behavior Tracing

VLA-Trace: 通过表示与行为追踪诊断视觉-语言-动作模型

Haoyuan Shi, Xiancong Ren, Yingji Zhang, Qinfan Zhang, Jiayu Hu, Haozhe Shan, Han Dong, Jinpeng Lu, Yinda Chen, Yi Zhang, Yong Dai, Xiaozhu Ju

机构 * University of Science and Technology of China(中国科学技术大学) University of Manchester(曼彻斯特大学) Beihang University(北航) Fudan University(复旦大学) University of New South Wales(新南威尔士大学)

AI总结 提出VLA-Trace诊断框架,通过表示演化、因果控制归因和行为表现分析,揭示VLA模型在多模态知识向具身控制转化中的机制,发现不同模型在微调适应、多模态路由和语义遵循上的差异与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30115 2026-05-29 cs.CV

Large Depth Completion Model from Sparse Observations

来自稀疏观测的大深度补全模型

Zhu Yu, Zhengyi Zhao, Runmin Zhang, Lingteng Qiu, Kejie Qiu, Yisheng He, Siyu Zhu, Zilong Dong, Si-Yuan Cao, Hui-Liang Shen

机构 * Zhejiang University(浙江大学) Tongyi Lab, Alibaba Group(阿里云实验室) Fudan University(复旦大学) Ningbo Innovation Center, Zhejiang University(宁波创新中心,浙江大学) NingboTech University(宁波科技学院) Jinhua Institute of Zhejiang University(金华大学浙大研究院)

AI总结 提出LDCM,利用单目基础模型和基于泊松的深度初始化策略,结合点图头回归3D坐标,实现稀疏观测下的度量准确深度补全。

Comments ICLR 2026. Project webpage: https://pkqbajng.github.io/ldcm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29744 2026-05-29 cs.AI cs.CL cs.LG cs.MA

Why Specialist Models Still Matter: A Heterogeneous Multi-Agent Paradigm for Medical Artificial Intelligence

为什么专家模型仍然重要:面向医学人工智能的异构多智能体范式

Yanan Wang, Shuaicong Hu, Jian Liu, Guohui Zhou, Aiguo Wang, Cuiwei Yang

机构 * Fudan University(复旦大学)

AI总结 提出HetMedAgent异构多智能体框架,通过冲突感知证据融合、不确定性驱动的临床医生干预触发和自适应阈值校准,实现通用大语言模型与领域专家模型的协同,在三个临床决策任务中验证了专家模型在模态特定分析中的不可替代价值。

Comments Accepted at ICML 2026. 12 pages main text, 16 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29707 2026-05-29 cs.CL

Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding

Domino: 在推测解码中将因果建模与自回归草稿解耦

Jianuo Huang, Yaojie Zhang, Qituan Zhang, Hao Lin, Hanlin Xu, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) School of Software Engineering, HUST(华中科技大学软件学院) UESTC Fudan University(复旦大学) Huawei(华为公司)

AI总结 提出Domino框架,通过并行草稿骨干和轻量级Domino头解耦因果依赖建模与自回归草稿执行,结合基础锚定训练课程,在Qwen3模型上实现高达5.49倍端到端加速和5.8倍吞吐量加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21621 2026-05-29 cs.LG

Path-Space Mirror Descent for On-Policy Reinforcement Learning under the Generalized Schrödinger Bridge

广义薛定谔桥下在线强化学习的路径空间镜像下降

Yuehu Gong, Zeyuan Wang, Yulin Chen, Shutong Ding, Qingyuan Zhou, Yanwei Fu

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Laboratory for Big Data and Decision, National University of Defense Technology(国防科技大学大数据与决策实验室) ShanghaiTech University(上海科技大学) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai Innovation Institute(上海创新研究院)

AI总结 针对生成式策略在在线策略优化中终端动作密度难处理的问题,提出GSB-MDPO方法,通过将策略优化建模为广义薛定谔桥问题并利用路径空间KL散度作为近端项,实现了无需显式终端似然评估的稳定更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20344 2026-05-29 math.OC cs.LG

A Complete Loss Landscape Analysis of Regularized Deep Matrix Factorization

正则化深度矩阵分解的完整损失景观分析

Po Chen, Rujun Jiang, Peng Wang

机构 * School of Data Science, Fudan University, Shanghai, China(复旦大学数据科学学院,上海,中国) Department of Computer and Information Science, University of Macau, Macau SAR, China(澳门大学计算机与信息科学系,澳门特别行政区,中国)

AI总结 本文通过闭式表征所有临界点并分类其类型,揭示了正则化深度矩阵分解的损失景观,解释了梯度方法几乎总是收敛到局部极小值的原因。

Comments 30 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29562 2026-05-29 cs.RO cs.AI cs.CV

VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models

VLA-Pro:面向视觉-语言-动作模型的跨任务程序性记忆迁移

Shengyu Si, Yuanzhuo Lu, Ruimeng Yang, Ziyi Ye, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) Shanghai Xinzhi Embodied Intelligence Technology Co., Ltd.(上海新智具身智能技术有限公司)

AI总结 提出VLA-Pro框架,通过存储和检索任务相关的LoRA适配器作为程序性记忆,实现跨任务泛化,在仿真和真实任务中成功率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29430 2026-05-29 cs.AI cs.CL

Towards Human-Like Interactive Speech Recognition With Agentic Correction and Semantic Evaluation

迈向具有智能体纠正和语义评估的类人交互式语音识别

Zixuan Jiang, Yanqiao Zhu, Peng Wang, Qinyuan Chen, Xinjian Zhao, Xipeng Qiu, Wupeng Wang, Zhifu Gao, Xiangang Li, Kai Yu, Xie Chen

机构 * College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) X-LANCE Lab, School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院X-LANCE实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Fudan University(复旦大学) Tongyi Fun Team, Alibaba Group(阿里云通义团队)

AI总结 提出Agentic ASR闭环框架,通过多轮交互和语义纠正减少语义错误,并引入句子级语义错误率(S^2ER)作为评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29275 2026-05-29 cs.CL

Prompt-Level Reward Specifications for Open-Ended Post-Training

面向开放式后训练的提示级奖励规范

Zijun Weng, Xiaohui Hu, Shuangyong Song, Yongxiang Li, Kaidong Yu, Xuanjing Huang

机构 * Fudan University(复旦大学) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(星辰AGI实验室,中国电信人工智能技术(北京)有限公司)

AI总结 提出一种提示级奖励规范框架,通过离线构建可复用的任务自适应评分准则和可执行硬约束检查器,在训练前显式化奖励标准,无需人工偏好标注或单独训练奖励模型,在多个开放式基准上提升了离线排序和在线强化学习效果。

Comments 39 pages, 4 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28293 2026-05-29 cs.LG cs.AI

ProRL: Effective Reinforcement Learning for Proactive Recommendation via Rectified Policy Gradient Estimation

ProRL: 通过修正策略梯度估计实现主动推荐的有效强化学习

Hongru Hou, Tiehua Mei, Denghui Geng, Jinhui Huang, Ao Xu, Hengrui Chen, Jiaqing Liang, Deqing Yang

机构 * School of Data Science, Fudan University, Shanghai, China(复旦大学数据科学学院,上海,中国)

AI总结 针对主动推荐系统中策略梯度估计存在的长度依赖偏差和高方差问题,提出ProRL框架,通过逐步奖励中心化和位置特定优势估计两个机制修正梯度,显著提升推荐效果。

Comments Accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25297 2026-05-29 cs.CL cs.AI cs.LG

Eureka: Intelligent Feature Engineering for Enterprise AI Cloud Resource Demand Prediction

Eureka:面向企业AI云资源需求预测的智能特征工程

Hangxuan Li, Renjun Jia, Xuezhang Wu, Yunjie Qian, Zeqi Zheng, Xianling Zhang

机构 * Alibaba Cloud Computing Co. Ltd, Hangzhou, China(阿里云计算有限公司,杭州,中国) School of Computer Science, Fudan University, Shanghai, China(复旦大学计算机学院,上海,中国) School of Computer Science and Technology, Tongji University, Shanghai, China(同济大学计算机科学与技术学院,上海,中国) Independent Researcher, United States(独立研究员,美国)

AI总结 提出Eureka框架,将特征工程视为智能体代码生成问题,通过专家代理、LLM特征工厂和自演化对齐引擎三阶段,自动生成可执行特征代码,在医疗、金融、社交等7个公开基准及阿里云GPU资源需求预测中显著提升性能。

Comments accepted at NeurIPS 2025 Workshop, DASFAA 2026 (International Conference on Database Systems for Advanced Applications)

Journal ref Database Systems for Advanced Applications (DASFAA 2026), Lecture Notes in Computer Science, vol. 16540, pp. 528-540, Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23657 2026-05-29 cs.CL

OpenSkillEval: Automatically Auditing the Open Skill Ecosystem for LLM Agents

OpenSkillEval:自动审计LLM智能体的开放技能生态系统

Jiahao Ying, Boxian Ai, Wei Tang, Siyuan Liu, Yixin Cao

机构 * Singapore Management University(新加坡国立管理学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Joy Future Academy, JD(京东探索研究院)

AI总结 提出自动评估框架OpenSkillEval,通过动态构建真实任务实例和收集社区技能,系统评估技能增强型智能体系统及技能本身,揭示技能可用性不保证有效使用、技能增强收益依赖模型和框架等关键发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06811 2026-05-29 cs.CR cs.AI

SkillTrojan: Backdoor Attacks on Skill-Based Agent Systems

SkillTrojan:基于技能智能体系统的后门攻击

Yunhao Feng, Yifan Ding, Yingshui Tan, Boren Zheng, Yanming Guo, Xiaolong Li, Kun Zhai, Yishan Li, Wenke Huang

机构 * Alibaba Group(阿里巴巴集团) National University of Defense Technology(国防科技大学) Fudan University(复旦大学) Wuhan University(武汉大学)

AI总结 提出SkillTrojan,一种针对技能实现而非模型参数的后门攻击方法,通过将恶意逻辑嵌入看似正常的技能中,利用技能组合重构并执行攻击者指定的负载,在保持良性行为的同时实现高攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06431 2026-05-29 cs.AI

LsrIF: Enhancing Logic-Structured Instruction Following of Large Language Models

LsrIF: 增强大语言模型的逻辑结构化指令遵循能力

Qingyu Ren, Qianyu He, Jingwen Chang, Geng Zhang, Jiajie Zhu, Xingzhou Chen, Zhuofei Shi, Jiaqing Liang, Yanghua Xiao, Han Xia, Zeye Sun, Fei Yu

机构 * Shanghai Key Laboratory of Data Science, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学数据科学重点实验室,计算机科学与人工智能学院) School of Data Science, Fudan University(复旦大学数据科学学院) Ant Group(蚂蚁集团)

AI总结 提出LsrIF框架,通过构建并行、顺序、条件和嵌套结构的原子约束数据,并采用结构感知的奖励聚合方法,提升大语言模型在逻辑结构化指令遵循任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04633 2026-05-29 cs.CL

MAGA-Bench: Machine-Augment-Generated Text via Alignment Detection Benchmark

MAGA-Bench: 通过对齐检测基准的机器增强生成文本

Anyang Song, Ying Cheng, Yiqian Xu, Rui Feng

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Shanghai Key Laboratory of Intelligent Information Processing, Fudan University(复旦大学智能信息处理上海市重点实验室)

AI总结 提出MAGA基准,集成多种对齐方法(从提示构建到生成器-检测器对抗强化学习及推理过程)以增强机器生成文本的人类对齐性,提升检测器的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10398 2026-05-29 cs.CE cs.AI

Are LLMs Socially Adaptive? Contrasting Belief Evolution in Large Language Models and Humans

大型语言模型是否具有社会适应性?对比大型语言模型与人类的信念演化

Yu Lei, Hao Liu, Chengxing Xie, Songjia Liu, Zhiyu Yin, Canyu Chen, Guohao Li, Philip Torr, Zhen Wu

机构 * Tsinghua University(清华大学) Department of Psychological and Cognitive Sciences(心理与认知科学系) College AI(人工智能学院) School of Management(管理学院) Fudan University(复旦大学) Stevens Institute of Technology(史蒂文斯理工学院) Northwestern University(西北大学) University of Oxford(牛津大学)

AI总结 本研究提出基于社会心理学的仿真基准FairMindSim和信念-奖励对齐行为演化模型BREM,通过连续经济游戏对比人类与LLM的决策动态,发现中等能力模型表现出过度惩罚的刚性攻击性,而前沿模型随推理能力提升趋向人类式的克制与宽容。

Comments KDD 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏