arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

共收录 1936
2603.25738 2026-03-27 cs.CV

PSDesigner: Automated Graphic Design with a Human-Like Creative Workflow

PSDesigner: 基于人类创意流程的自动化图形设计

Xincheng Shuai, Song Tang, Yutong Huang, Henghui Ding, Dacheng Tao

机构 * Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院大数据研究所) Generative AI Lab, College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院生成式人工智能实验室)

AI总结 PSDesigner通过模拟人类设计师的创意流程,实现了自动化图形设计,通过设计数据集CreativePSD提升工具使用能力,在多种设计任务中优于现有方法,使非专业人士能轻松创建高质量设计。

Comments CVPR 2026, Project Page: https://henghuiding.com/PSDesigner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25732 2026-03-27 cs.CV

BizGenEval: A Systematic Benchmark for Commercial Visual Content Generation

BizGenEval:一个系统化的商业视觉内容生成基准测试

Yan Li, Zezi Zeng, Ziwei Zhou, Xin Gao, Muzhao Tian, Yifan Yang, Mingxi Cheng, Qi Dai, Yuqing Yang, Lili Qiu, Zhendong Wang, Zhengyuan Yang, Xue Yang, Lijuan Wang, Ji Li, Chong Luo

机构 * Microsoft Corporation(微软公司) Shanghai Jiao Tong University(上海交通大学) Xi'an Jiaotong University(西安交通大学) Fudan University(复旦大学)

AI总结 本文提出BizGenEval基准测试,系统评估商业视觉内容生成模型在文档类型和多约束下的能力,包含20个任务和8000个检查问题,揭示现有模型与专业需求间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25730 2026-03-27 cs.CV cs.AI

PackForcing: Short Video Training Suffices for Long Video Sampling and Long Context Inference

PackForcing:短视频训练足以支持长视频采样和长上下文推理

Xiaofeng Mao, Shaohao Rui, Kaining Ying, Bo Zheng, Chuanhao Li, Mingmin Chi, Kaipeng Zhang

机构 * Alaya Studio, Shanda AI Research Tokyo(Alaya工作室,盛大AI研究东京) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出PackForcing框架,通过三部分KV缓存策略有效管理生成历史,实现高效内存使用和长视频生成,展示短视频监督足以支持高质量长视频合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25728 2026-03-27 cs.CV cs.AI

PixelSmile: Toward Fine-Grained Facial Expression Editing

PixelSmile:迈向细粒度面部表情编辑

Jiabin Hua, Hengyuan Xu, Aojie Li, Wei Cheng, Gang Yu, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) StepFun(阶跃星辰)

AI总结 本文提出PixelSmile框架,通过全对称联合训练解耦表情语义,结合强度监督与对比学习实现更清晰可辨的表情生成,提升线性表达控制精度与稳定性,验证了其在连续可控细粒度表情编辑中的有效性。

Comments 21 Pages; Project Page: https://ammmob.github.io/PixelSmile/ Code: https://github.com/Ammmob/PixelSmile

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25672 2026-03-27 cs.RO cs.CV

Can Users Specify Driving Speed? Bench2Drive-Speed: Benchmark and Baselines for Desired-Speed Conditioned Autonomous Driving

用户可以指定驾驶速度吗?Bench2Drive-Speed:用于期望速度条件下的自动驾驶的基准和基线

Yuqian Shao, Xiaosong Jia, Langechuan Liu, Junchi Yan

机构 * Institute of Trustworthy Embodied AI (TEAI), Fudan University(复旦大学可信具身人工智能研究所) NVIDIA(英伟达)

AI总结 本文提出Bench2Drive-Speed基准,通过引入用户期望速度和超车指令,设计了Speed-Adherence Score和Overtake Score等指标,验证了在不增加真实世界数据收集的情况下,通过重新标注常规驾驶数据可实现速度监督。

Comments Project page: https://thinklab-sjtu.github.io/Bench2Drive-Speed/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25133 2026-03-27 cs.AI

RubricEval: A Rubric-Level Meta-Evaluation Benchmark for LLM Judges in Instruction Following

RubricEval: 一种用于LLM评判者的 rubric级元评估基准

Tianjun Pan, Xuan Lin, Wenyan Yang, Qianyu He, Shisong Chen, Licai Qi, Wanqing Xu, Hongwei Feng, Bo Xu, Yanghua Xiao

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) Donghua University(东华大学) Ant Group(蚂蚁集团)

AI总结 RubricEval旨在解决rubric级评估的可靠性问题,通过多样化的指令和响应以及高质量实例,评估评判者在指令遵循中的表现,发现即使GPT-4o在Hard子集也仅达到55.97%的准确率。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12200 2026-03-27 cs.CV

CompBench: Benchmarking Complex Instruction-guided Image Editing

CompBench:复杂指令引导图像编辑的基准测试

Bohan Jia, Wenxuan Huang, Yuntian Tang, Junbo Qiao, Jincheng Liao, Shaosheng Cao, Fei Zhao, Zhaopeng Feng, Zhouhong Gu, Zhenfei Yin, Lei Bai, Wanli Ouyang, Lin Chen, Fei Zhao, Yao Hu, Zihan Wang, Yuan Xie, Shaohui Lin

机构 * East China Normal University(华东师范大学) Xiaohongshu Inc.(小红书) KLATASDS, MOE, China(中国教育部统计与数据科学重点实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Fudan University(复旦大学) University of Oxford(牛津大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

AI总结 CompBench旨在解决现有图像编辑基准测试对任务复杂度简化的问题,通过引入复杂指令引导的图像编辑基准,评估模型在精细操控能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25072 2026-03-27 cs.CV

GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding

GIFT:全局不可替代性帧目标用于高效视频理解

Junpeng Ma, Sashuai Zhou, Guanghao Li, Xin Gao, Yue Cao, Hengyu Zeng, Yuxiang Yan, Zhibin Wang, Jun Song, Bo Zheng, Shanghang Zhang, Jian Pu

机构 * Institute of Science and Technology for Brain-inspired Intelligence, Fudan University(复旦大学类脑智能科学与技术研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Zhejiang University(浙江大学) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Future Living Lab of Alibaba(阿里巴巴未来生活实验室)

AI总结 GIFT通过评估帧的内在不可替代性选择关键帧,解决视频理解中处理密集帧的高计算成本问题,提升视频分析效率。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24941 2026-03-27 cs.CV cs.CL

Beyond Attention Magnitude: Leveraging Inter-layer Rank Consistency for Efficient Vision-Language-Action Models

超越注意力幅度:利用层间排名一致性提升高效视觉-语言-动作模型

Peiju Liu, Jinming Liu, Xipeng Qiu, Xuanjing Huang

机构 * Fudan University(复旦大学)

AI总结 本文提出TIES框架,通过层间排名一致性动态平衡注意力幅度,提升视觉-语言-动作模型的效率,实现在CogACT+SIMPLER基准上成功率提升6%并减少78%的token使用。

Comments 10 pages, 7 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11441 2026-03-27 cs.CL

Is Compression Really Linear with Code Intelligence?

压缩与代码智能之间的真实关系是否线性?

Shijie Xuyang, Xianzhen Luo, Zheng Chu, Houyi Li, Siming Huang, Qiufeng Wang, Wanxiang Che, Qingfu Zhu, Shuigeng Zhou

机构 * Fudan University(复旦大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文通过评估多种开源代码LLM在多语言多任务基准上的表现,发现代码智能与压缩效率之间存在对数关系,挑战了此前线性假设。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15780 2026-03-27 cs.AI cs.CL

TrustGeoGen: Formal-Verified Data Engine for Trustworthy Multi-modal Geometric Problem Solving

TrustGeoGen: 用于可信多模态几何问题求解的正式验证数据引擎

Daocheng Fu, Jianlong Chen, Renqiu Xia, Zijun Chen, Qi Liu, Yuan Feng, Hongbin Zhou, Renrui Zhang, Shiyang Feng, Peng Gao, Hongyuan Zha, Junchi Yan, Botian Shi, Yu Qiao, Bo Zhang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 本文提出TrustGeoGen,通过正式验证生成多模态几何数据,提升模型深度几何推理能力,在GeoQA等基准测试中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24500 2026-03-26 cs.LG physics.flu-dyn

Project and Generate: Divergence-Free Neural Operators for Incompressible Flows

投影与生成:用于不可压缩流体的无散神经算子

Xigui Li, Hongwei Zhang, Ruoxi Jiang, Deshu Chen, Chensen Lin, Limei Han, Yuan Qi, Xin Guo, Yuan Cheng

机构 * Incubation Institute, Fudan University, Shanghai, China(复旦大学上海孵化院) Shanghai Academy of Artificial Intelligence for Science, Shanghai, China(上海人工智能科学研究院)

AI总结 本文提出一种统一框架,通过硬约束强制不可压缩连续性方程,提升确定性和生成模型的物理一致性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24203 2026-03-26 cs.CR cs.AI

Invisible Threats from Model Context Protocol: Generating Stealthy Injection Payload via Tree-based Adaptive Search

基于模型上下文协议的隐形威胁:通过树状自适应搜索生成隐蔽注入负载

Yulin Shen, Xudong Pan, Geng Hong, Min Yang

机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院) Shanghai Innovation Institute(上海创新研究院) IEEE Publication Technology Group(IEEE出版技术组)

AI总结 本文提出TIP攻击方法,通过树状结构搜索生成隐蔽负载,有效攻击MCP增强代理,实验显示其在未防御环境下攻击成功率超95%,且优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24051 2026-03-26 cs.CL

FinToolSyn: A forward synthesis Framework for Financial Tool-Use Dialogue Data with Dynamic Tool Retrieval

FinToolSyn: 一种用于金融工具使用对话数据的前向合成框架,具有动态工具检索

Caishuang Huang, Yang Qiao, Rongyu Zhang, Junjie Ye, Pu Lu, Wenxi Wu, Meng Zhou, Xiku Du, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) FiT, Tencent(腾讯FiT) Zhejiang University(浙江大学)

AI总结 本文提出FinToolSyn框架,通过动态工具检索生成高质量金融对话数据,构建43,066个工具库并合成148k对话实例,提升金融场景下的工具调用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23951 2026-03-26 cs.CL

From AI Assistant to AI Scientist: Autonomous Discovery of LLM-RL Algorithms with LLM Agents

从AI助手到AI科学家:利用LLM代理自主发现LLM-RL算法

Sirui Xia, Yikai Zhang, Aili Chen, Siye Wu, Siyu Yuan, Yanghua Xiao

机构 * Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(上海数据科学关键实验室,计算机科学学院,复旦大学) School of Data Science, Fudan University(数据科学学院,复旦大学)

AI总结 本文提出POISE框架,通过自动化发现语言模型的策略优化算法,改进了政策优化算法,提高了性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23509 2026-03-26 cs.CL cs.AI cs.CR

Internal Safety Collapse in Frontier Large Language Models

前沿大语言模型中的内部安全崩溃

Yutao Wu, Xiao Liu, Yifeng Gao, Xiang Zheng, Hanxun Huang, Yige Li, Cong Wang, Bo Li, Xingjun Ma, Yu-Gang Jiang

机构 * Deakin University(德克萨斯大学) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) City University of Hong Kong(香港城市大学) The University of Melbourne(墨尔本大学) Singapore Management University(新加坡管理大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 研究揭示了前沿大语言模型中一种关键故障模式——内部安全崩溃,通过构建ISC-Bench测试集,发现模型在执行某些任务时会持续生成有害内容,且比传统劫持攻击更危险。

Comments 15 pages of the main text, qualitative examples of jailbreaks may be harmful in nature

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22460 2026-03-26 cs.AI

GeoSketch: A Neural-Symbolic Approach to Geometric Multimodal Reasoning with Auxiliary Line Construction and Affine Transformation

GeoSketch: 一种基于神经符号的方法,用于几何多模态推理中的辅助线构造与仿射变换

Shichao Weng, Zhiqiang Wang, Yuhua Zhou, Rui Lu, Ting Liu, Zhiyang Teng, Xiaozhang Liu, Hanmeng Liu

机构 * Fudan University(复旦大学) IFLYTEK CO.LTD(若lytek有限公司) Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Defense Technology(国防科技大学) Hainan University(海南大学)

AI总结 GeoSketch通过整合感知、符号推理和绘图动作模块,实现动态几何推理,提升多模态推理的准确性和解决问题的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22978 2026-03-25 cs.AI

JFTA-Bench: Evaluate LLM's Ability of Tracking and Analyzing Malfunctions Using Fault Trees

JFTA-Bench:评估LLM在跟踪和分析故障中的能力

Yuhui Wang, Zhixiong Yang, Ming Zhang, Shihan Dou, Zhiheng Xi, Enyu Zhou, Senjie Jin, Yujiong Shen, Dingwei Zhu, Yi Dong, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学)

AI总结 本文提出JFTA-Bench基准,用于评估LLM在复杂环境中的故障跟踪与分析能力,包含3130条记录,每条记录平均40.75轮对话,通过模拟用户错误场景评估模型任务跟踪与错误恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20644 2026-03-25 cs.CV

ScaleEdit-12M: Scaling Open-Source Image Editing Data Generation via Multi-Agent Framework

ScaleEdit-12M:通过多智能体框架实现开源图像编辑数据生成的规模化

Guanzhou Chen, Erfei Cui, Changyao Tian, Danni Yang, Ganlin Yang, Yu Qiao, Hongsheng Li, Gen Luo, Hongjie Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) CUHK MMLab(香港中文大学多模态实验室) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Xiamen University(厦门大学)

AI总结 本文提出ScaleEditor框架,通过多智能体方法构建大规模高质量图像编辑数据集,生成ScaleEdit-12M,涵盖23类任务,提升多种编辑模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07023 2026-03-25 q-fin.TR cs.AI

Behavioral Consistency Validation for LLM Agents: An Analysis of Trading-Style Switching through Stock-Market Simulation

对LLM代理的行为一致性验证:通过股票市场模拟分析交易风格切换

Zeping Li, Guancheng Wan, Keyang Chen, Yu Chen, Yiwen Zhao, Philip Torr, Guangnan Ye, Zhenfei Yin, Hongfeng Chai

机构 * Fudan University(复旦大学) Wuhan University(武汉大学) BNP Paribas(BNP巴黎银行) Oxford University(牛津大学) Haven

AI总结 本文通过股票市场模拟分析交易风格切换,评估LLM代理策略切换与金融理论的一致性,提出四个行为金融驱动因素作为性格特质,并通过Mann-Whitney U检验比较策略切换行为与理论的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02050 2026-03-25 cs.AI cs.SE

Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents

重新思考熵在优化大语言模型代理工具使用行为中的作用

Zeping Li, Hongru Wang, Yiwen Zhao, Guanhua Chen, Yixia Li, Keyang Chen, Yixin Cao, Guangnan Ye, Hongfeng Chai, Zhenfei Yin

机构 * Fudan University(复旦大学) University of Edinburgh(爱丁堡大学) Southern University of Science and Technology(南方科技大学) Oxford University(牛津大学) Haven

AI总结 本文通过熵基实验发现熵减与高质量工具调用正相关,提出两种奖励策略优化工具使用行为,实验表明熵减可提升代理适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02982 2026-03-25 cs.CV cs.RO

U4D: Uncertainty-Aware 4D World Modeling from LiDAR Sequences

U4D:从LiDAR序列中构建不确定性感知的4D世界模型

Xiang Xu, Alan Liang, Youquan Liu, Linfeng Li, Lingdong Kong, Ziwei Liu, Qingshan Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) Nanjing University of Posts and Telecommunications(南京邮电大学) SKL-TI

AI总结 本文提出U4D框架,通过估计空间不确定性图和分阶段生成方法,提升LiDAR序列的几何精度和时间一致性,推动自动驾驶感知与模拟的可靠性。

Comments CVPR 2026; 20 pages, 7 figures, 11 tables; Code at https://github.com/worldbench/U4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00026 2026-03-25 cs.LG cs.AI cs.CL cs.CY

RedTopic: Toward Topic-Diverse Red Teaming of Large Language Models

RedTopic:迈向大语言模型的课题多样化红队测试

Jiale Ding, Xiang Zheng, Yutao Wu, Cong Wang, Wei-Bin Lee, Ling Pan, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) City University of Hong Kong(香港城市大学) Deakin University(德克萨斯大学) Hon Hai Research Institute(鸿海研究室) Hong Kong University of Science and Technology(香港理工大学)

AI总结 本文提出RedTopic框架,通过上下文生成管道、聚合奖励设计和多目标RL训练循环,生成多样化对抗提示,提升红队测试的适应性和课题多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22228 2026-03-24 cs.CV cs.AI

SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation

SpatialReward: 可验证的空间奖励建模以实现文本到图像生成中的细粒度空间一致性

Sashuai Zhou, Qiang Zhou, Junpeng Ma, Yue Cao, Ruofan Hu, Ziang Zhang, Xiaoda Yang, Zhibin Wang, Jun Song, Cheng Yu, Bo Zheng, Zhou Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Fudan University(复旦大学)

AI总结 本文提出SpatialReward,一种专门评估生成图像中空间布局的可验证奖励模型,通过多阶段流程提升空间一致性与生成质量,实验表明其能更贴近人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21862 2026-03-24 cs.LG

Holistic Scaling Laws for Optimal Mixture-of-Experts Architecture Optimization

整体缩放定律用于最优专家混合架构优化

Weilin Wan, Jingtao Han, Weizhong Zhang, Cheng Jin

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Hi Lab, Xiaohongshu Inc.(小红书公司Hi实验室) Project Numina(项目Numina) School of Data Science, Fudan University(复旦大学数据科学学院)

AI总结 本文提出一种框架,通过联合约束三元组和代数约束,优化专家混合架构,实现鲁棒的缩放定律,为大规模计算预算提供完整最优架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21719 2026-03-24 cs.CL

Probing How Scalable Table Data Enhances General Long-Context Reasoning

探究表格数据如何提升长上下文推理的可扩展性

Huaibing Xie, Guoliang Zhao, Yang Liu, Shihan Dou, Siming Huang, Yanling Xiao, Shaolei Wang, Yiting Liu, Cheng Zhang, Shaofan Liu, Pluto Zhou

机构 * Large Language Model Department, Tencent(腾讯大语言模型部门) Xi'an Jiaotong University, Xi'an, China(西安交通大学) Fudan University, Shanghai, China(复旦大学)

AI总结 本文研究表格数据对长上下文推理的增强作用,通过分析表格依赖结构揭示周期性非消失依赖,并提出TableLong框架提升推理能力,实验显示在多个基准上提升8.24%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17779 2026-03-24 cs.CV

CrowdGaussian: Reconstructing High-Fidelity 3D Gaussians for Human Crowd from a Single Image

CrowdGaussian:从单张图像重建高保真的人类人群3D高斯

Yizheng Song, Yiyu Zhuang, Qipeng Xu, Haixiang Wang, Jiahe Zhu, Jing Tian, Siyu Zhu, Hao Zhu

机构 * Nanjing University, China(南京大学) Fudan University, China(复旦大学) State Key Laboratory of Novel Software Technology, China(新型软件技术国家重点实验室)

AI总结 本文提出CrowdGaussian框架,通过单张图像直接重建多人3D高斯点云,解决遮挡、低清晰度和多样外观等挑战,实验表明其能生成逼真且几何一致的多人场景重建。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21105 2026-03-24 cs.LG

ResPrune: Text-Conditioned Subspace Reconstruction for Visual Token Pruning in Large Vision-Language Models

ResPrune:基于文本的子空间重建用于大视觉-语言模型中的视觉令牌修剪

Xu Li, Yi Zheng, Yuxuan Liang, Zhe Liu, Xiaolei Chen, Haotian Chen, Rui Zhu, Xiangyang Xue

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)

AI总结 ResPrune通过子空间重建方法实现视觉令牌修剪,结合文本相关性选择信息量大的令牌,提升大视觉-语言模型推理效率,减少计算和内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20662 2026-03-24 cs.AI cs.CV

Attention in Space: Functional Roles of VLM Heads for Spatial Reasoning

空间中的注意:VLM头部在空间推理中的功能角色

Xueqi Ma, Shuo Yang, Yanbei Jiang, Shu Liu, Zhenzhen Liu, Jiayang Ao, Xingjun Ma, Sarah Monazam Erfani, James Bailey

机构 * The University of Melbourne(墨尔本大学) Australian National University(澳大利亚国立大学) Fudan University(复旦大学) Monash University(莫纳什大学)

AI总结 本文研究VLM中注意力头部在空间推理中的作用,通过机制可解释性视角分析其功能,提出CogVSR数据集并开发探针框架,揭示注意力头部在空间推理中的稀疏性和关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15856 2026-03-24 cs.CL cs.AI cs.IR

Rethinking Soft Compression in Retrieval-Augmented Generation: A Query-Conditioned Selector Perspective

重新思考检索增强生成中的软压缩:从查询条件选择器视角

Yunhao Liu, Zian Jia, Xinyu Gao, Kanjun Xu, Yun Xiong

机构 * Shanghai Key Laboratory of Data Science, College of Computer Science and Artificial Intelligence(上海数据科学 key 实验室,计算机科学与人工智能学院) Fudan University(复旦大学) Shanghai(上海) China(中国)

AI总结 本文提出SeleCom框架,通过查询条件选择器改进RAG中的软压缩,提升信息密度并减少计算开销,实验显示其性能优于现有方法且效率更高。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏