arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

共收录 1920
2604.16914 2026-04-23 cs.CV eess.IV

Unified Ultrasound Intelligence Toward an End-to-End Agentic System

统一超声智能:面向端到端代理系统

Chen Ma, Yunshu Li, Junhu Fu, Shuyu Liang, Yuanyuan Wang, Yi Guo

机构 * College of Biomedical Engineering, Fudan University, Shanghai, China(复旦大学生物医学工程学院,上海,中国)

AI总结 本文提出USTri框架,通过三阶段方法实现多器官多任务统一分析,提升跨设备和协议的泛化能力,生成可解释的临床报告。

Comments Accepted by ISBI2026. 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12456 2026-04-23 eess.AS cs.AI

X-VC: Zero-shot Streaming Voice Conversion in Codec Space

X-VC:在编码空间中实现零样本语音转换

Qixi Zheng, Yuxiang Zhao, Tianrui Wang, Wenxi Chen, Kele Xu, Yikang Li, Qinyuan Chen, Xipeng Qiu, Kai Yu, Xie Chen

机构 * Shanghai Jiao Tong University Shanghai China Tianjin University Tianjin China Shanghai Jiao Tong University, Shanghai Innovation Institute Shanghai China State Key Laboratory of Complex \& Critical Software Environment Changsha China Shanghai Innovation Institute Shanghai China Fudan University, Shanghai Innovation Institute Shanghai China Shanghai Jiao Tong University Tianjin University Shanghai Jiao Tong University, Shanghai Innovation Institute State Key Laboratory of Complex \& Critical Software Environment Shanghai Innovation Institute Fudan University, Shanghai Innovation Institute

AI总结 X-VC提出一种在编码空间中进行零样本语音转换的系统,通过双条件声学转换器和自适应归一化技术,在保持语言内容的同时实现高质量低延迟的语音转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20806 2026-04-23 cs.CV cs.AI cs.CL

OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model

OMIBench:用于大型视觉-语言模型在奥林匹克级多图像推理中的基准测试

Qiguang Chen, Chengyu Luan, Jiajun Wu, Qiming Yu, Yi Yang, Yizhuo Li, Jingqi Tong, Xiachong Feng, Libo Qin, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究室) Harbin Institute of Technology(哈尔滨工业大学) Central South University(中南大学) Fudan University(复旦大学) The University of Hong Kong(香港大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Text Computing and Cognitive Intelligence Ministry of Education Engineering Research Center(教育部文本计算与认知智能工程研究中心) Guizhou University(贵州大学)

AI总结 OMIBench旨在评估多图像推理能力,包含生物、化学、数学和物理奥林匹克问题,提供精确和语义答案匹配的评估协议,实验显示现有模型性能存在显著差距。

Comments ACL 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20721 2026-04-23 cs.RO

ALAS: Adaptive Long-Horizon Action Synthesis via Async-pathway Stream Disentanglement

ALAS: 通过异步路径流解构实现自适应长时域动作合成

Yutong Shen, Hangxu Liu, Lei Zhang, Penghui Liu, Yinqi Liu, Liuxiang Yang, Tongtong Feng

机构 * Beijing University of Technology(北京理工大学) Fudan University(复旦大学) University of Hamburg(汉堡大学) Hubei University of Chinese Medicine(湖北中医药大学) Tsinghua University(清华大学)

AI总结 本文提出ALAS框架,通过生物启发的双流解构方法,解决长时域任务中环境与技能耦合问题,提升跨域任务执行效率与成功率。

Comments 10 pages, 7 figures. arXiv admin note: substantial text overlap with arXiv:2508.07842

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01621 2026-04-23 cs.LG q-bio.QM stat.ME stat.ML

Deciphering interventional dynamical causality from non-intervention complex systems

从非干预复杂系统中解码干预性动力学因果性

Jifan Shi, Yang Li, Juan Zhao, Siyang Leng, Rui Bao, Kazuyuki Aihara, Luonan Chen, Wei Lin

机构 * Research Institute of Intelligent Complex Systems & CISOR, Fudan University(智能复杂系统研究所及CISOR,复旦大学) International Research Center for Neurointelligence, The University of Tokyo Institutes for Advanced Study, The University of Tokyo(神经智能国际研究中心,东京大学先进研究所,东京大学) School of Pharmacy, Shanghai University of Traditional Chinese Medicine(上海中医药大学药学院) Institute of AI and Robotics, College of Intelligent Robotics and Advanced Manufacturing, Fudan University(人工智能与机器人研究所,智能机器人与先进制造学院,复旦大学) Frontiers Science Center for Deep Ocean Multispheres and Earth System, Key Laboratory of Marine Chemistry Theory and Technology, Ministry of Education, Ocean University of China(深海多球体与地球系统前沿科学中心,海洋化学理论与技术重点实验室,教育部,中国海洋大学) School of Mathematical Sciences and School of AI, Shanghai Jiao Tong University(数学科学学院和人工智能学院,上海交通大学) Key Laboratory of Systems Health Science of Zhejiang Province, Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Chinese Academy of Sciences(浙江省系统健康科学重点实验室,杭州高级研究所,中国科学院大学,中国科学院)

AI总结 本文提出IntDC框架和IEE算法,通过延迟嵌入空间在不需干预或动力学模型的情况下,从观测数据中解码因果性,验证了其在因果分析中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19485 2026-04-22 cs.LG cs.AI cs.CL

EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training

EVPO:用于大语言模型后训练中自适应批评者利用的解释方差策略优化

Chengjun Pan, Shichun Liu, Jiahang Lin, Dingwei Zhu, Jiazheng Zhang, Shihan Dou, Songyang Gao, Zhenhua Han, Binghai Wang, Rui Zheng, Xuanjing Huang, Tao Gui, Yansong Feng

机构 * Peking University(北京大学) Fudan University(复旦大学) Shanghai Qiji Zhifeng Co., Ltd.(上海启智科技有限公司) Shanghai AI Lab(上海人工智能实验室)

AI总结 本文提出EVPO,通过监控批量方差并自适应切换基于批评者或批量均值估计,证明在每一步都能达到更小的方差。在四个任务中,EVPO优于PPO和GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11913 2026-04-22 cs.CL cs.AI

LSTM-MAS: A Long Short-Term Memory Inspired Multi-Agent System for Long-Context Understanding

LSTM-MAS:一种受长短期记忆启发的多智能体系统用于长上下文理解

Yichen Jiang, Jiakang Yuan, Chongjun Tu, Peng Ye, Tao Chen

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出LSTM-MAS多智能体系统,通过模仿LSTM的层次信息流和门控机制,解决长上下文处理中的误差累积和幻觉传播问题,实验表明在多个问答数据集上取得显著提升。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04237 2026-04-22 cs.AI cs.CL cs.LG

SAGE-32B: Agentic Reasoning via Iterative Distillation

SAGE-32B:通过迭代蒸馏实现代理推理

Basab Jha, Firoj Paudel, Ujjwal Puri, Ethan Henkel, Zhang Yuting, Mateusz Kowalczyk, Mei Huang, Choi Donghyuk, Wang Junhao

机构 * SAGEA Tribhuwan University(特里布文大学) Vedas College(韦达学院) Madan Bhandari Memorial College(马丹·班达里纪念学院) Fudan University(复旦大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 SAGE-32B是一种专注于代理推理和长期规划的320亿参数语言模型,通过迭代蒸馏提升推理能力,在代理推理基准测试中表现出色。

Comments 23 Pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20182 2026-04-22 cs.CL cs.AI

FaithLens: Detecting and Explaining Faithfulness Hallucination

FaithLens:检测并解释忠实性幻觉

Shuzheng Si, Qingyi Wang, Haozhe Zhao, Yuzhuo Bai, Guanqiao Chen, Kangyang Luo, Gang Chen, Fanchao Qi, Minjia Zhang, Baobao Chang, Maosong Sun

机构 * Tsinghua University(清华大学) DeepLang AI Fudan University(复旦大学) University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) Peking University(北京大学)

AI总结 本文提出FaithLens模型,通过合成训练数据和规则强化学习,有效检测并解释大语言模型中的忠实性幻觉,优于GPT-5.2和o3模型,提升可信度与效率。

Comments ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18418 2026-04-21 cs.CV

MedProbeBench: Systematic Benchmarking at Deep Evidence Integration for Expert-level Medical Guideline

MedProbeBench: 在深度证据整合中的系统性基准测试用于专家级医疗指南

Jiyao Liu, Jianghan Shen, Sida Song, Tianbin Li, Xiaojia Liu, Rongbin Li, Ziyan Huang, Jiashi Lin, Junzhi Ning, Changkai Ji, Siqi Luo, Wenjie Li, Chenglong Ma, Ming Hu, Jing Xiong, Jin Ye, Bin Fu, Ningsheng Xu, Yirong Chen, Lei Jin, Hong Chen, Junjun He

机构 * Fudan University(复旦大学) Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Hong Kong(香港大学)

AI总结 本文提出MedProbeBench,首个利用高质量临床指南作为专家级参考的基准,通过1200+任务自适应评估标准和5130+原子性声明验证,评估17种LLM和深度研究代理在证据整合和指南生成中的能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18344 2026-04-21 cs.AI

One Pass for All: A Discrete Diffusion Model for Knowledge Graph Triple Set Prediction

一次完成所有:一种用于知识图谱三元组集预测的离散扩散模型

Jihong Guan, Jiaqi Wang, Wengen Li, Hanchen Yang, Yichao Zhang, Shuigeng Zhou

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) School of Computer Science, Fudan University(复旦大学计算机科学学院)

AI总结 本文提出DiffTSP,一种离散扩散模型,用于知识图谱三元组集预测。通过离散扩散过程生成完整的三元组集,确保预测三元组间的依赖关系,实现一次通过完成预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18133 2026-04-21 cs.AI

Multi-Agent Systems: From Classical Paradigms to Large Foundation Model-Enabled Futures

多智能体系统:从经典范式到基于大基础模型的未来

Zixiang Wang, Mengjia Gong, Qiyu Sun, Jing Xu, Shuai Mao, Xin Jin, Qing-Long Han, Yang Tang

机构 * Key Laboratory of Smart Manufacturing in Energy Chemical Process, Ministry of Education, East China University of Science and Technology, Shanghai 200237, China(能源化学过程智能制造重点实验室,教育部,东华大学,上海200237,中国) School of Information Science and Engineering, East China University of Science and Technology, Shanghai 200237, China(信息科学与工程学院,东华大学,上海200237,中国) School of Electrical Engineering and Automation, Nantong University, Nantong 226019, China(电气工程与自动化学院,南通大学,南通226019,中国) Research Institute of Intelligent Complex Systems, Fudan University, Shanghai 200433, China(智能复杂系统研究院,复旦大学,上海200433,中国) School of Science, Computing and Engineering Technologies, Swinburne University of Technology, Hawthorn VIC 3122, Australia(科学、计算与工程技术学院,斯威本理工大学,澳大利亚霍桑市VIC 3122)

AI总结 本文综述了多智能体系统从经典范式向基于大基础模型的演进,分析了经典多智能体系统与大基础模型多智能体系统的架构、机制、适应性及应用,展望了未来研究方向与挑战。

Comments Accepted by IEEE/CAA Journal of Automatica Sinica

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17876 2026-04-21 cs.RO

OFlow: Injecting Object-Aware Temporal Flow Matching for Robust Robotic Manipulation

OFlow:注入对象感知的时间流匹配以实现稳健的机器人操作

Kuanning Wang, Ke Fan, Chenhao Qiu, Zeyu Shangguan, Yuqian Fu, Yanwei Fu, Daniel Seita, Xiangyang Xue

机构 * Fudan University(复旦大学) University of Southern California(南加州大学)

AI总结 OFlow通过统一时间预测和对象感知推理,提升机器人操作的鲁棒性,实验表明对象感知预测增强了任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17873 2026-04-21 cs.CV

Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models

时空趋炎附势:基于否定的欺骗性在视频大语言模型中的表现

Ziyao Tang, Pengkun Jiao, Bin Zhu, Huiyan Qi, Jingjing Chen, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University Shanghai Key Laboratory of Multimodal Embodied AI(可信具身人工智能研究所,复旦大学上海多模态具身人工智能重点实验室)

AI总结 本文研究视频大语言模型在面对否定性欺骗时的脆弱性,揭示其在时空推理中的错误修正机制,并提出GasVideo-1000基准测试集以评估模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14267 2026-04-21 cs.LG cs.AI

Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization

通过贡献加权群体相对策略优化增强基于LLM的搜索代理

Junzhe Wang, Zhiheng Xi, Yajie Yang, Hao Luo, Shihan Dou, Tao Gui, Qi Zhang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理关键实验室)

AI总结 本文提出CW-GRPO框架,通过整合过程监督与群体相对策略优化,提升搜索代理的信用分配效率,实验表明其在多个知识密集型基准上表现优异。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07794 2026-04-21 cs.CL cs.AI

Emergent Structured Representations Support Flexible In-Context Inference in Large Language Models

涌现的结构化表示支持大型语言模型中的灵活上下文推理

Ningyu Xu, Qi Zhang, Xipeng Qiu, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Fudan University(复旦大学) Shanghai, China(中国上海)

AI总结 研究揭示大型语言模型在上下文推理中通过结构化表示动态构建和利用潜在表示,为灵活适应的计算过程提供新见解。

Comments 36 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06663 2026-04-21 cs.CV

PlanViz: Evaluating Planning-Oriented Image Generation and Editing for Computer-Use Tasks

PlanViz: 评估面向计算机使用任务的图像生成与编辑

Junxian Li, Kai Liu, Leyang Chen, Weida Wang, Zhixin Wang, Jiaqi Xu, Fan Li, Renjing Pei, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Huawei Technologies Ltd(华为技术有限公司)

AI总结 PlanViz旨在评估图像生成与编辑在计算机使用任务中的表现,通过设计日常生活中常见的子任务,如路线规划、工作图示和网页与UI显示,提出任务自适应评分体系PlanScore以评估生成图像的正确性、视觉质量和效率。

Comments The main part of our paper: PlanViz Code is at: https://github.com/lijunxian111/PlanViz Supplementary material is at: https://github.com/lijunxian111/PlanViz/releases/tag/v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06803 2026-04-21 cs.CL cs.CV

Forest Before Trees: Latent Superposition for Efficient Visual Reasoning

森林在树之前:用于高效视觉推理的潜在叠加

Yubo Wang, Juntian Zhang, Yichen Wu, Yankai Lin, Nils Lukas, Yuhan Liu

机构 * MBZUAI Fudan University(复旦大学) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Harvard University(哈佛大学)

AI总结 本文提出Laser方法,通过动态窗口对齐学习实现视觉推理的'森林在树之前'认知层次,提升模型在保持全局特征叠加的同时,实现高效且可解释的视觉推理。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04809 2026-04-21 cs.AI

SCALER:Synthetic Scalable Adaptive Learning Environment for Reasoning

SCALER:合成可扩展自适应学习环境用于推理

Caijun Xu, Changyi Xiao, Zhongyuan Peng, Xinrun Wang, Yixin Cao

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Singapore Management University(新加坡国立大学)

AI总结 SCALER通过自适应环境设计维持有效学习信号,解决RL训练中任务难度与模型能力不匹配及训练模式狭窄的问题,提升推理能力。

Comments 22 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11251 2026-04-21 cs.CR cs.AI cs.LG

CLASP: Training-Free LLM-Assisted Source Code Watermarking via Semantic-Preserving Transformations

CLASP:通过语义保持变换实现无需训练的LLM辅助源代码水印技术

Rui Xu, Jiawei Chen, Weizhi Liu, Zhaoxia Yin, Cong Kong, Xinpeng Zhang

机构 * East China Normal University(华东师范大学) Fudan University(复旦大学)

AI总结 CLASP提出一种无需训练的LLM辅助源代码水印框架,通过语义保持变换嵌入水印位,实现跨语言的高容量水印插入与提取,提升鲁棒性和部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20751 2026-04-21 cs.CV

Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning

Pref-GRPO:基于偏好奖励的GRPO用于稳定文本到图像强化学习

Yibin Wang, Zhimin Li, Yuhang Zang, Yujie Zhou, Jiazi Bu, Chunyu Wang, Qinglin Lu, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Hunyuan, Tencent(腾讯文脉) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出Pref-GRPO方法,通过偏好奖励机制提升文本到图像生成的稳定性,同时引入UniGenBench基准测试评估模型性能。

Comments Project Page: https://codegoat24.github.io/UnifiedReward/Pref-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07160 2026-04-21 cs.CL

GeometryZero: Advancing Geometry Solving via Group Contrastive Policy Optimization

GeometryZero:通过群体对比策略优化推进几何求解

Yikun Wang, Yibin Wang, Dianyi Wang, Zimian Peng, Qipeng Guo, Dacheng Tao, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学)

AI总结 本文提出GeometryZero,通过群体对比策略优化训练小型模型,实现高效的几何推理,实验表明其在Geometry3K和MathVista上优于RL基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19897 2026-04-21 cs.AI cs.CL cs.CV cs.HC

ScienceBoard: Evaluating Multimodal Autonomous Agents in Realistic Scientific Workflows

ScienceBoard: 评估多模态自主代理在真实科学工作流中的表现

Qiushi Sun, Zhoumianze Liu, Chang Ma, Zichen Ding, Fangzhi Xu, Zhangyue Yin, Haiteng Zhao, Zhenyu Wu, Kanzhi Cheng, Zhaoyang Liu, Jianing Wang, Qintong Li, Xiangru Tang, Tianbao Xie, Xiachong Feng, Xiang Li, Ben Kao, Wenhai Wang, Biqing Qi, Lingpeng Kong, Zhiyong Wu

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Peking University(北京大学) Nanjing University(南京大学) East China Normal University(华东师范大学) Yale University(耶鲁大学)

AI总结 ScienceBoard通过真实多领域环境和169个高质量任务评估多模态自主代理在科学工作流中的能力,发现现有代理在复杂任务中仅达到15%的成功率,揭示了改进设计原则的必要性。

Comments ICLR 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21248 2026-04-21 cs.CL cs.AI cs.CE

ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition

ResearchBench: 通过基于灵感的任务分解对LLM在科学发现中的基准测试

Yujie Liu, Zonglin Yang, Tong Xie, Jinjie Ni, Ben Gao, Yuqiang Li, Shixiang Tang, Wanli Ouyang, Erik Cambria, Dongzhan Zhou

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) National University of Singapore(新加坡国立大学) Wuhan University(武汉大学)

AI总结 本文提出ResearchBench,首个评估LLM在科学发现子任务中的基准,包含灵感检索、假设生成和排序,通过自动化框架提取跨12学科论文的关键信息,验证其准确性,并展示LLM在非分布任务中表现优异。

Comments Accepted by ACL 2026 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17814 2026-04-21 cs.CR cs.AI

Understanding Secret Leakage Risks in Code LLMs: A Tokenization Perspective

理解代码大语言模型中的秘密泄露风险:从分词角度出发

Meifang Chen, Zhe Yang, Huang Nianchen, Yizhan Huang, Yichen Li, Zihan Li, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) University of Southern California(南加州大学) Fudan University(复旦大学)

AI总结 研究揭示代码大语言模型中因分词方式导致的秘密泄露问题,指出BPE分词引发的'垃圾话偏差'现象,并探讨其成因及缓解策略。

Comments Accepted by ACL 26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17385 2026-04-21 cs.CV

SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning

SpatialImaginer: 向空间推理的自适应视觉想象迈进

Yian Li, Yang Jiao, Bin Zhu, Tianwen Qian, Shaoxiang Chen, Jingjing Chen, Yu-Gang Jiang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Computing and Information Systems, Singapore Management University(新加坡管理大学 computing 与信息学院) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) MiniMax Institute of Trustworthy Embodied Al, Fudan University(复旦大学可信具身人工智能研究院)

AI总结 本文提出SpatialImaginer框架,通过结合文本推理与视觉想象,解决多模态大语言模型在空间推理中的鲁棒性问题,实验显示其在复杂空间任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14934 2026-04-21 cs.CL

XQ-MEval: A Dataset with Cross-lingual Parallel Quality for Benchmarking Translation Metrics

XQ-MEval:一个用于评估翻译度量标准的跨语言平行质量数据集

Jingxuan Liu, Zhi Qu, Jin Tei, Hidetaka Kamigaito, Lemao Liu, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术大学) Fudan University(复旦大学)

AI总结 本文提出XQ-MEval数据集,通过注入错误并过滤生成伪翻译,评估翻译度量标准的跨语言评分偏见问题,提供了首个实证证据。

Comments 19 pages, 8 figures, ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14389 2026-04-21 cs.LG cs.AI

From $\log π$ to $π$: Taming Divergence in Soft Clipping via Bilateral Decoupled Decay of Probability Gradient Weight

从log π到π:通过双侧解耦衰减概率梯度权重来驯服发散

Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Chaowen Hu, Cong Qin, Zekai Shao, Binbin Zheng, Lu Pan, Ke Zeng

机构 * Meituan(美团) Fudan University(复旦大学) Tsinghua University(清华大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出DGPO方法,通过解耦衰减机制解决RLVR中概率梯度发散问题,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15724 2026-04-21 cs.CV cs.AI

VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning

VideoThinker:构建具有LLM引导工具推理的智能视频大语言模型

Chenglin Li, Qianglong Chen, Feng Han, Yikun Wang, Xingxi Yin, Yan Gong, Ruilin Li, Yin Zhang, Jiaqi Wang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Wuhan University(武汉大学) Shanghai AI Lab(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

AI总结 VideoThinker通过合成工具交互轨迹构建大规模视频与工具推理数据集,提升长视频理解能力,优于传统语言模型和视频模型基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05920 2026-04-21 cs.CV

High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning

通过多轮基于定位的强化学习实现高分辨率视觉推理

Xinyu Huang, Yuhao Dong, Weiwei Tian, Bo Li, Rui Feng, Ziwei Liu

机构 * Fudan University(复旦大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

AI总结 本文提出MGPO框架,通过多轮对话机制使LMMs在无需额外标注的情况下提升视觉定位能力,实验表明其在MME-Realworld和V*Bench任务中表现优异。

Comments Accepted by ACL(Findings) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏