arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

2026-03-03 至 2026-03-03 共收录 19
2603.02024 2026-03-03 cs.CL cs.AI cs.CV

MMR-Life: Piecing Together Real-life Scenes for Multimodal Multi-image Reasoning

MMR-Life: 组合真实场景以进行多模态多图像推理

Jiachun Li, Shaoping Huang, Zhuoran Jin, Chenlong Zhang, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉学科学院)

AI总结 MMR-Life是一个评估多模态多图像推理能力的综合基准,通过现实场景中的多图像信息整合和多种推理类型测试,揭示了现有模型在复杂推理任务中的挑战和性能差异。

Comments Accepted by ICLR 2026, 78 pages, 60 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01947 2026-03-03 cs.CV cs.AI

physfusion: A Transformer-based Dual-Stream Radar and Vision Fusion Framework for Open Water Surface Object Detection

physfusion: 一种基于Transformer的双流雷达与视觉融合框架用于开放水域表面目标检测

Yuting Wan, Liguo Sun, Jiuwu Hao, Zao Zhang, Pin LV

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 PhysFusion通过物理引导雷达编码器和Transformer融合模块,实现开放水域表面目标的高效检测,取得高精度检测结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01698 2026-03-03 cs.CV cs.AI

Towards Principled Dataset Distillation: A Spectral Distribution Perspective

迈向原则化的数据集蒸馏:从谱分布视角

Ruixi Wu, Shaobo Wang, Jiahuan Chen, Zhiyuan Liu, Yicun Yang, Zhaorun Chen, Zekai Li, Kaixin Li, Xinming Wang, Hongzhu Yi, Kai Wang, Linfeng Zhang

机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) UChicago(芝加哥大学) NUS(新加坡国立大学) CASIA(中国科学院自动化研究所) UCAS(中国科学院自动化研究所)

AI总结 本文提出CSDM方法,通过谱分布匹配解决长尾数据集中的分布对齐问题,实现性能提升并增强稳定性。

Comments 30 pages, 5 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01464 2026-03-03 cs.AI cs.CL

ProtRLSearch: A Multi-Round Multimodal Protein Search Agent with Large Language Models Trained via Reinforcement Learning

ProtRLSearch: 一种基于大语言模型的多轮多模态蛋白质搜索代理,通过强化学习进行训练

Congying Liu, Taihao Li, Ming Huang, Xingyuan Wei, Peipei Liu, Yiqing Shen, Yanxu Mao, Tiehan Cui

机构 * University of Chinese Academy of Sciences(中国科学院大学) Hangzhou Institute for Advanced Study(杭州高等研究院) Shenzhen Institutes of Advanced Technology(深圳先进技术研究所) Institute of Information Engineering(信息工程研究所) Johns Hopkins University(约翰霍普金斯大学) Henan University(河南大学)

AI总结 ProtRLSearch通过强化学习训练,利用多模态输入提升蛋白质搜索的准确性和效率,解决传统方法在多模态整合和搜索过程约束上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01106 2026-03-03 cs.AI

DIVA-GRPO: Enhancing Multimodal Reasoning through Difficulty-Adaptive Variant Advantage

DIVA-GRPO:通过难度自适应变体优势增强多模态推理

Haowen Gao, Zhenyu Zhang, Liang Pang, Fangda Guo, Hongjian Dou, Guannan Lv, Shaoguo Liu, Tingting Gao, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Kuaishou Technology, Beijing, China(快手科技,北京,中国)

AI总结 DIVA-GRPO通过难度自适应变体优势方法提升多模态推理能力,解决GRPO在困难问题上的奖励稀疏性和优势消失问题,提升训练稳定性与推理性能。

Comments Accepted to ICLR 2026. Code and models are available at https://github.com/Siaaaaaa1/DIVA-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01058 2026-03-03 cs.AR cs.AI cs.DC

TriMoE: Augmenting GPU with AMX-Enabled CPU and DIMM-NDP for High-Throughput MoE Inference via Offloading

TriMoE:通过卸载增强GPU与AMX启用的CPU和DIMM-NDP实现高吞吐量MoE推理

Yudong Pan, Yintao He, Tianhua Han, Lian Liu, Shixin Zhao, Zhirong Chen, Mengdi Wang, Cangyuan Li, Yinhe Han, Ying Wang

机构 * SKLP, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(SKLP,计算技术研究所,中国科学院,北京) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京)

AI总结 TriMoE通过结合AMX启用的CPU和DIMM-NDP,优化MoE推理的计算单元分配,提升高吞吐量性能。

Comments Accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12660 2026-03-03 cs.CL

Learning Ordinal Probabilistic Reward from Preferences

从偏好中学习序概率奖励

Longze Chen, Lu Wang, Renke Shan, Ze Gong, Run Luo, Jiaming Li, Jing Luo, Qiyao Wang, Min Yang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Ritzz-AI Shenzhen University of Advanced Technology(深圳先进技术大学)

AI总结 本文提出序概率奖励模型,通过区域淹没微调提升奖励模型的准确性和数据效率,有效捕捉绝对文本质量。

Comments 28 pages, 5 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01844 2026-03-03 cs.CV cs.AI

CloDS: Visual-Only Unsupervised Cloth Dynamics Learning in Unknown Conditions

CloDS: 未知条件下的视觉-only 无监督布料动力学学习

Yuliang Zhan, Jian Li, Wenbing Huang, Wenbing Huang, Yang Liu, Hao Sun

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) School of Engineering Science, University of Chinese Academy of Sciences(中国科学院大学工程科学学院)

AI总结 CloDS通过无监督学习从多视角视觉数据中学习布料动力学,解决未知条件下的动态模拟问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13305 2026-03-03 cs.CV

Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving

Prune2Drive: 一种用于自动驾驶中加速视觉-语言模型的即插即用框架

Minhao Xiong, Zichen Wen, Zhuangcheng Gu, Xuyang Liu, Rui Zhang, Hengrui Kang, Jiabing Yang, Junyuan Zhang, Weijia Li, Conghui He, Yafei Wang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Carnegie Mellon University(卡内基梅隆大学) Sichuan University(四川大学) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学)

AI总结 Prune2Drive通过视觉令牌修剪框架在自动驾驶中加速视觉-语言模型,实现显著速度提升和内存节省,性能影响小。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16395 2026-03-03 cs.CL

OJBench: A Competition Level Code Benchmark For Large Language Models

OJBench: 一个面向大语言模型的竞赛级代码基准

Zhexu Wang, Yiping Liu, Yejie Wang, Wenyang He, Bofei Gao, Muxi Diao, Yanxu Chen, Kelin Fu, Flood Sung, Zhilin Yang, Tianyu Liu, Weiran Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) Moonshot AI

AI总结 OJBench是一个用于评估大语言模型竞赛级代码推理能力的基准,通过232个编程竞赛问题揭示了现有模型在复杂推理任务中的局限性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07530 2026-03-03 cs.RO cs.CV

BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation

BitVLA:用于机器人操作的1位视觉-语言-动作模型

Hongyu Wang, Chuyan Xiong, Ruiping Wang, Xilin Chen

机构 * Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences University of Chinese Academy of Sciences(人工智能安全重点实验室,计算技术研究所,中国科学院,中国科学院大学)

AI总结 BitVLA是一种用于机器人操作的1位视觉-语言-动作模型,通过模型设计和优化提升部署效率,实现内存和延迟的显著降低。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19496 2026-03-03 cs.CR cs.AI

Multi-PA: A Multi-perspective Benchmark on Privacy Assessment for Large Vision-Language Models

多视角:面向大视觉-语言模型隐私评估的基准测试

Jie Zhang, Xiangkui Cao, Zhouyu Han, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 Multi-PA是一个多视角的隐私评估基准,用于评估大视觉-语言模型在隐私意识和泄露方面的保护能力,揭示了当前模型在隐私保护方面的风险和漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00486 2026-03-03 cs.CV

Random Wins All: Rethinking Grouping Strategies for Vision Tokens

随机胜出:重新思考视觉token的分组策略

Qihang Fan, Yuang Ai, Huaibo Huang, Ran He

机构 * MAIS & NLPR, Institute of Automation, Chinese Academy of Sciences, Beijing, China(自动化研究所,中国科学院,北京) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京)

AI总结 本文提出随机分组策略,通过简单方法提升视觉token处理效率,实验显示其在多种任务中表现优异。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20511 2026-03-03 cs.CV

Leveraging Causal Reasoning Method for Explaining Medical Image Segmentation Models

利用因果推理方法解释医学图像分割模型

Limai Jiang, Ruitao Xie, Bokai Yang, Huazhen Huang, Juan He, Yufu Huo, Zikai Wang, Yang Wei, Yunpeng Cai

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Shenzhen Polytechnic University(深圳职业技术大学) University of Macau(澳门大学) Southern University of Science and Technology(南方科技大学)

AI总结 本文提出利用因果推理框架解释医学图像分割模型,通过量化输入区域和网络组件对分割区域的影响,提升模型可解释性与优化潜力。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11909 2026-03-03 cs.SD cs.LG

Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning

Echo:通过音频交错推理实现高级音频理解

Daiqing Wu, Xuan Zhang, Dongbao Yang, Jiashu Yao, Longfei Chen, Qingsong Liu, Sicheng Zhao, Can Ma, Yangyang Kang, Yu Zhou

机构 * IIE, Chinese Academy of Sciences(中国科学院信息工程研究所) Zhejiang University(浙江大学) ByteDance China(字节跳动中国) VCIP & TMCC & DISSec, College of Computer Science, Nankai University(VCIP与TMCC与DISSec,南开大学计算机学院) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 Echo通过音频交错推理方法,提升音频理解能力,在基准测试中表现出色。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10575 2026-03-03 cs.CV

UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation

UniFlow:一种统一的像素流标记器用于视觉理解和生成

Zhengrong Yue, Haiyu Zhang, Xiangyu Zeng, Boyu Chen, Chenting Wang, Shaobin Zhuang, Lu Dong, Yi Wang, Limin Wang, Yali Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学) Shenzhen Key Lab of Computer Vision and Pattern Recognition, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳计算机视觉与模式识别重点实验室,深圳先进技术研究院,中国科学院) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 UniFlow是一种统一的像素流标记器,通过灵活适配视觉编码器和轻量级解码器,在视觉理解和生成任务中实现了性能的双赢。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21950 2026-03-03 cs.CV

Customizing Visual Emotion Evaluation for MLLMs: An Open-vocabulary, Multifaceted, and Scalable Approach

为MLLMs定制视觉情绪评估:一种开放词汇、多维且可扩展的方法

Daiqing Wu, Dongbao Yang, Sicheng Zhao, Can Ma, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) VCIP & TMCC & DISSec, College of Computer Science, Nankai University(南开大学计算机学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出一种开放词汇、多维且可扩展的方法,用于定制MLLMs的视觉情绪评估,通过情绪陈述判断任务和自动化流程,评估现有模型在情绪识别和上下文判断中的表现,并揭示其局限性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10067 2026-03-03 cs.CV

FiLo++: Zero-/Few-Shot Anomaly Detection by Fused Fine-Grained Descriptions and Deformable Localization

FiLo++: 通过融合细粒度描述和变形定位实现零/少样本异常检测

Zhaopeng Gu, Bingke Zhu, Guibo Zhu, Yingying Chen, Ming Tang, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(基础模型研究中心,自动化研究所,中国科学院) School of Artifcial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Wuhan AI Research(武汉AI研究所) Peng Cheng Laboratory(鹏城实验室) Guangdong Provincial Key Laboratory of Intellectual Property & Big Data, Guangdong Polytechnic Normal University(广东省知识产权与大数据重点实验室,广东工业大学)

AI总结 FiLo++通过融合细粒度描述和变形定位技术,提升零/少样本异常检测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13671 2026-03-03 cs.CV cs.LG

FiLo: Zero-Shot Anomaly Detection by Fine-Grained Description and High-Quality Localization

FiLo:通过细粒度描述和高质量定位实现零样本异常检测

Zhaopeng Gu, Bingke Zhu, Guibo Zhu, Yingying Chen, Hao Li, Ming Tang, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所基础模型研究中心) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Objecteye Inc., Beijing, China(Objecteye公司) Central South University, Hunan, China(中南大学)

AI总结 FiLo通过细粒度描述和高质量定位实现零样本异常检测,提升检测和定位性能。

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏