arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

共收录 1952
2601.19640 2026-04-09 cs.CV

Focus on What Really Matters in Low-Altitude Governance: A Management-Centric Multi-Modal Benchmark with Implicitly Coordinated Vision-Language Reasoning Framework

聚焦低空治理中真正重要的问题:一种以管理为中心的多模态基准与隐式协调的视觉-语言推理框架

Hao Chang, Zhihui Wang, Lingxiang Wu, Wei An, Boyang Li, Zaiping Lin, Weidong Sheng, Jinqiao Wang

机构 * National University of Defense Technology(国防科技大学) Zidong Taichu (Beijing) Technology Co., Ltd.(紫东太初(北京)科技有限公司) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Wuhan AI Research(武汉人工智能研究院)

AI总结 本文提出GovLA-10K多模态基准和GovLA-Reasoner框架,通过功能显著目标和隐式协调的视觉-语言推理提升低空治理中的管理需求理解与执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05963 2026-04-08 cs.SE cs.LG

QiMeng-PRepair: Precise Code Repair via Edit-Aware Reward Optimization

QiMeng-PRepair: 通过编辑感知奖励优化实现精确代码修复

Changxin Ke, Rui Zhang, Jiaming Guo, Yuanbo Wen, Li Ding, Shuo Wang, Xuyuan Zhu, Xiong Peng, Di Huang, Zidong Du, Xing Hu, Qi Guo, Yunji Chen

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所处理器芯片国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Institute of Microelectronics, CAS(中国科学院微电子研究所)

AI总结 本文提出PRepair框架,通过Self-Breaking和Self-Repairing组件减少过度编辑,提升代码修复精度,实验显示在fix_1@1指标下精度提升31.4%。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05931 2026-04-08 cs.CV cs.AI

Saliency-Guided Representation with Consistency Policy Learning for Visual Unsupervised Reinforcement Learning

基于一致性策略学习的显著性引导表示用于视觉无监督强化学习

Jingbo Sun, Qichao Zhang, Songjun Tu, Xing Fang, Yupeng Zheng, Haoran Li, Ke Chen, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统管理与控制国家重点实验室) Pengcheng Laboratory(鹏城实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本文提出SRCP框架,通过显著性引导动态任务和一致性策略提升视觉无监督强化学习的零样本泛化能力,改进了传统SR方法在高维视觉环境中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03298 2026-04-08 cs.AR cs.DC cs.LG

ENEC: A Lossless AI Model Compression Method Enabling Fast Inference on Ascend NPUs

ENEC:一种无损AI模型压缩方法,使Ascend NPUs上的快速推理成为可能

Jinwu Yang, Jiaan Wu, Zedong Liu, Xinyang Ma, Hairui Zhao, Yida Gu, Yuanhong Huang, Xingchen Liu, Wenjing Huang, Zheng Wei, Jing Xing, Yili Ma, Qingyi Zhang, Baoyi An, Zhongzhe Hu, Shaoteng Liu, Xia Zhu, Jiaxun Lu, Guangming Tan, Dingwen Tao

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 本文提出ENEC,一种专为AI模型权重优化的无损压缩方法,通过块级固定长度编码和NPU特定优化,提升Ascend NPUs的压缩比和吞吐量,实现比现有GPU压缩器更高的性能。

Comments Accepted by ISCA 2026, 17 pages, 13 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05629 2026-04-08 cs.CV

A Unified Foundation Model for All-in-One Multi-Modal Remote Sensing Image Restoration and Fusion with Language Prompting

一种统一的多模态遥感图像修复与融合的全功能基础模型 with语言提示

Yongchuan Cui, Peng Liu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)

AI总结 本文提出LLaRS模型,通过最优传输和混合专家层实现多模态遥感图像修复与融合,结合大规模数据集提升模型性能与迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05514 2026-04-08 cs.AI

OmniDiagram: Advancing Unified Diagram Code Generation via Visual Interrogation Reward

OmniDiagram:通过视觉 interrogation 奖励推进统一图代码生成

Haoyue Yang, Xuanle Zhao, Xuexin Liu, Feibang Jiang, Yao Zhu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学)

AI总结 本文提出OmniDiagram统一框架,结合多种图代码语言和任务定义,引入视觉反馈策略Viva,通过生成方法奖励视觉结构,无需人工标注数据,实验表明其在图代码生成基准上达到新状态。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05462 2026-04-08 stat.ML cs.LG math.ST stat.TH

Hierarchical Contrastive Learning for Multimodal Data

多模态数据的层次对比学习

Huichao Li, Junhan Yu, Doudou Zhou

机构 * University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出层次对比学习框架,通过统一模型学习全局共享、部分共享和模态特定的表示,解决多模态数据中部分共享因素的建模问题,提升预测性能。

Comments 34 pages,11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05393 2026-04-08 cs.CV cs.MM

Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval

超越语义检索:面向组合图像检索的指代锚定

Yuxin Yang, Yinan Zhou, Yuxin Chen, Ziqi Zhang, Zongyang Ma, Chunfeng Yuan, Bing Li, Jun Gao, Weiming Hu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Tencent Inc.(腾讯公司) PeopleAI Inc.(人民人工智能公司) HelloGroup Inc.(哈啰集团) ShanghaiTech University(上海科技大学)

AI总结 本文提出OACIR任务,通过引入对象锚定机制提升组合图像检索的实例一致性,构建了包含16万多个四元组的OACIRR基准,采用AdaFocal框架实现动态关注平衡,实验表明其在保持实例一致性方面表现优异。

Comments Accepted to CVPR 2026. Project page, dataset, and code are available at: https://hahajun1101.github.io/OACIR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04800 2026-04-07 cs.LG cs.CR

Forgetting to Witness: Efficient Federated Unlearning and Its Visible Evaluation

遗忘的见证:高效的联邦去学习及其可见评估

Houzhe Wang, Xiaojie Zhu, Chi Chen

机构 * School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

AI总结 本文提出首个完整联邦去学习流程,通过高效方法和可视化框架评估模型遗忘能力,无需存储历史数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04642 2026-04-07 cs.RO

WaterSplat-SLAM: Photorealistic Monocular SLAM in Underwater Environment

WaterSplat-SLAM:水下环境中的光实单目SLAM

Kangxu Wang, Shaofeng Zou, Chenxing Jiang, Yixiang Dai, Siang Chen, Shaojie Shen, Guijin Wang

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Key Laboratory of Marine Robotics, Shenyang(沈阳海洋机器人重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(香港科技大学电子及计算机工程学系)

AI总结 本文提出WaterSplat-SLAM,通过语义介质过滤和语义引导渲染实现水下高保真密集映射,提升水下单目SLAM的鲁棒性与可视化效果。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05656 2026-04-07 cs.AI

HAG: Hierarchical Demographic Tree-based Agent Generation for Topic-Adaptive Simulation

HAG:基于主题自适应的分层人口树状代理生成

Rongxin Chen, Tianyu Wu, Bingbing Xu, Jiatang Luo, Xiucheng Xu, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学前沿交叉科学学院)

AI总结 本文提出HAG框架,通过分层决策过程生成符合主题需求的代理群体,提升宏观分布与微观一致性。实验表明HAG在减少群体对齐误差和增强社会一致性方面表现优异。

Comments Accepted by ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20685 2026-04-07 cs.RO

C-NAV: Towards Self-Evolving Continual Object Navigation in Open World

C-NAV:迈向开放世界中的自进化持续物体导航

Ming-Ming Yu, Fei Zhu, Wenzhuo Liu, Yirong Yang, Qunbo Wang, Wenjun Wu, Jing Liu

机构 * Beihang University(北京航空航天大学) Centre for Artificial Intelligence and Robotics, HKISI-CAS(香港智能科学与工业研究院人工智能与机器人中心) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) Beijing Jiaotong University(北京交通大学)

AI总结 本文提出C-Nav框架,通过双路径抗遗忘机制和自适应采样策略,解决持续物体导航中的灾难性遗忘问题,实验表明其在多个模型架构上均优于现有方法,且内存需求显著降低。

Comments Accepted at NeurIPS 2025

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14202 2026-04-07 cs.LG

MSDformer: Multi-scale Discrete Transformer For Time Series Generation

MSDformer:多尺度离散Transformer用于时间序列生成

Shibo Feng, Zhicheng Chen, Xi Xiao, Zhong Zhang, Qing Li, Xingyu Gao, Peilin Zhao

机构 * Nanyang Technological University(南洋理工大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Tencent(腾讯) Peng Cheng Laboratory(鹏城实验室) Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 MSDformer通过多尺度离散Transformer方法,解决传统DTM在捕捉复杂时间序列多尺度特征和理论指导方面的不足,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18594 2026-04-07 cs.LG cs.AI

RaPA: Enhancing Transferable Targeted Attacks via Random Parameter Pruning

RaPA: 通过随机参数剪枝增强可迁移的目标攻击

Tongrui Su, Qingbin Li, Shengyu Zhu, Wei Chen, Xueqi Cheng

机构 * State Key Lab of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 RaPA通过引入参数级随机化提升攻击的可迁移性,实验表明其在CNN到Transformer模型迁移中ASR显著提升,且无需训练,具有跨架构高效性。

Comments Accepted by CVPR26 CODE:https://github.com/molarsu/RaPA

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14194 2026-04-07 cs.CV cs.AI

VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model

VLBiasBench: 一个用于评估大视觉-语言模型偏见的综合性基准

Sibo Wang, Xiangkui Cao, Jie Zhang, Zheng Yuan, Shiguang Shan, Xilin Chen, Wen Gao

机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology (ICT)(中国科学院人工智能安全重点实验室,计算技术研究所) University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Peking University(北京大学)

AI总结 本文提出VLBiasBench,通过覆盖九种社会偏见类别和两个交叉偏见类别的大规模数据集,评估大视觉-语言模型的偏见问题,基于15种开源和两种闭源模型进行广泛评估,揭示模型中的偏见特征。

Comments Accepted By TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03309 2026-04-07 cs.CV cs.AI

TreeGaussian: Tree-Guided Cascaded Contrastive Learning for Hierarchical Consistent 3D Gaussian Scene Segmentation and Understanding

TreeGaussian:基于树引导的级联对比学习用于层次一致的3D高斯场景分割与理解

Jingbin You, Zehao Li, Hao Jiang, Xinzhu Ma, Shuqin Gao, Honglong Zhao, Congcong Zheng, Tianlu Mao, Feng Dai, Yucheng Zhang, Zhaoqi Wang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Beihang University(北京航空航天大学)

AI总结 本文提出TreeGaussian,通过树引导的级联对比学习框架,解决3DGS在表示层次结构和捕捉整体-部分关系上的不足,提升分割一致性与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13095 2026-04-07 cs.RO

Empowering Multi-Robot Cooperation via Sequential World Models

通过序列世界模型增强多机器人协作

Zijie Zhao, Honglei Guo, Shengqian Chen, Kaixuan Xu, Bo Jiang, Yuanheng Zhu, Dongbin Zhao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统管理与控制国家重点实验室)

AI总结 本文提出SeqWM框架,通过引入序列范式提升多机器人MBRL的协作能力,实验表明其在性能和样本效率上优于现有方法,并展示了预测适应、时间对齐和角色分配等先进协作行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08751 2026-04-07 cs.CV cs.LG

Disentangled World Models: Learning to Transfer Semantic Knowledge from Distracting Videos for Reinforcement Learning

解耦世界模型:从干扰视频中学习转移语义知识以用于强化学习

Qi Wang, Zhipeng Zhang, Baao Xie, Xin Jin, Yunbo Wang, Shiyu Wang, Liaomo Zheng, Xiaokang Yang, Wenjun Zeng

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室) Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo, China(东方理工高等研究院宁波数字孪生研究院) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Ningbo, China(宁波市空间智能与数字衍生重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) Shenyang CASNC Technology Co., Ltd(沈阳中科数控技术股份有限公司)

AI总结 本文提出了解耦世界模型,通过离线到在线的潜在蒸馏和灵活解耦约束,从干扰视频中学习语义知识,提升强化学习的样本效率。

Comments Accepted by ICCV 2025. Project page: https://qiwang067.github.io/diswm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03016 2026-04-06 cs.AI

Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence?

Agentic-MME:代理能力为多模态智能带来了什么?

Qianshan Wei, Yishan Yang, Siyi Wang, Jinglin Chen, Binyu Wang, Jiaming Wang, Shuang Chen, Zechen Li, Yang Shi, Yuqi Tang, Weining Wang, Yi Yu, Chaoyou Fu, Qi Li, Yi-Fan Zhang

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学院大学) SEU(东南大学) NJU(南京大学) PKU(北京大学) BUAA(北京航空航天大学) NTU(南洋理工大学) UCLA(加州大学洛杉矶分校)

AI总结 Agentic-MME通过418个真实任务评估多模态代理能力,采用过程验证方法,量化效率并验证工具调用准确性,实验显示模型在复杂任务中表现显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02860 2026-04-06 cs.CV cs.AI

A Paradigm Shift: Fully End-to-End Training for Temporal Sentence Grounding in Videos

范式转变:面向视频中的时序句子定位的端到端训练

Allen He, Qi Liu, Kun Liu, Xinchen Liu, Wu Liu

机构 * BASIS International School Park Lane Harbour(贝赛思国际学校(公园港)) UCAS(中国科学院大学) JD Explore Academy(京东探索研究院) USTC(中国科学技术大学)

AI总结 本文提出一种端到端训练范式,联合优化视频主干网络和定位头,通过引入Sentence Conditioned Adapter提升视觉表征,实验表明优于现有方法。

Comments Accepted as CVPR 2026 Workshop PVUW

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02288 2026-04-03 cs.LG cs.AI

Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing

通过样本路由统一组相对和自蒸馏策略优化

Gengsheng Li, Tianyu Yang, Junfeng Fang, Mingyang Song, Mao Zheng, Haiyun Guo, Dan Zhang, Jinqiao Wang, Tat-Seng Chua

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) National University of Singapore(新加坡国立大学) Tencent(腾讯) Wuhan AI Research(武汉人工智能研究院)

AI总结 本文提出SRPO框架,通过样本路由整合GRPO和SDPO的优势,解决自蒸馏在长期训练中的稳定性问题,实现快速早期改进与长周期稳定性的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01941 2026-04-03 cs.CV cs.AI

Captioning Daily Activity Images in Early Childhood Education: Benchmark and Algorithm

在早期教育中的日常活动图像描述:基准和算法

Sixing Li, Zhibin Gu, Ziqi Zhang, Weiguo Pan, Bing Li, Ying Wang, Hongzhe Liu

机构 * School of Robotics, Beijing Union University(北京联合大学机器人学院) College of Computer and Cyber Security, Hebei Normal University(河北师范大学计算机与网络安全学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) National Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) PeopleAI, Inc.(人民人工智能公司) People Youhe Education Technology Co., Ltd.(人民优和教育科技有限公司)

AI总结 本文提出ECAC基准和RSRS算法,通过专家标注和细粒度标签提升早期教育图像描述的专业性,实验显示KinderMM-Cap-3B在TTS上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01860 2026-04-03 cs.RO

Posterior Optimization with Clipped Objective for Bridging Efficiency and Stability in Generative Policy Learning

后验优化与截断目标:在生成策略学习中平衡效率与稳定性

Yuhui Chen, Haoran Li, Zhennan Jiang, Yuxing Qin, Yuxuan Wan, Weiheng Liu, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CFCS, School of Computer Science, Peking University(北京大学计算机学院前沿计算研究中心) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 本文提出POCO框架,通过后验推断方法改进策略,结合离线到在线范式,提升生成模型在机器人操控中的稳定性和效率,实验证明其在多个任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01747 2026-04-03 cs.CV

Unifying UAV Cross-View Geo-Localization via 3D Geometric Perception

通过3D几何感知统一无人机跨视角地理定位

Haoyuan Li, Wen Yang, Fang Xu, Hong Tan, Haijian Zhang, Shengyang Li, Gui-Song Xia

机构 * School of Electronic Information, Wuhan University(武汉大学电子信息学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Technology and Engineering Center for Space Utilization and the Key Laboratory of Space Utilization, Chinese Academy of Sciences(中国科学院空间应用工程与技术中心暨空间利用重点实验室) School of Aeronautics and Astronautics, University of Chinese Academy of Sciences(中国科学院大学航空宇航学院)

AI总结 本文提出一种几何感知的无人机地理定位框架,通过构建局部3D场景并生成虚拟俯视图,实现粗粒度场所识别与细粒度姿态估计的统一,提升GNSS拒止环境下无人机的定位精度。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04823 2026-04-03 cs.AI cs.CL

DR-LoRA: Dynamic Rank LoRA for Fine-Tuning Mixture-of-Experts Models

DR-LoRA:动态秩LoRA用于混合专家模型的微调

Guanzhi Deng, Bo Li, Ronghao Chen, Xiujin Liu, Zhuo Han, Huacan Wang, Lijie Wen, Linqi Song

机构 * City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Peking University(北京大学) University of Michigan(密歇根大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 DR-LoRA通过动态分配不同秩的LoRA模块,提升混合专家模型微调效果,实验表明其优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11579 2026-04-03 cs.CV cs.LG

MS-Mix: Sentiment-Guided Adaptive Augmentation for Multimodal Sentiment Analysis

MS-Mix:基于情感的自适应增强用于多模态情感分析

Hongyu Zhu, Lin Chen, Xin Jin, Mingsheng Shang

机构 * Chongqing Institute of Green Intelligent Technology, Chinese Academy of Sciences(中国科学院重庆绿色智能技术研究院) Chongqing School, University of Chinese Academy of Sciences(中国科学院大学重庆学院) School of Engineering, Westlake University(西湖大学工学院)

AI总结 本文提出MS-Mix,一种基于情感的自适应增强框架,通过情感感知的样本选择策略、情感强度引导模块和情感对齐损失提升多模态情感分析的鲁棒性和实用性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06339 2026-04-03 cs.RO

Vi-TacMan: Articulated Object Manipulation via Vision and Touch

Vi-TacMan:通过视觉和触觉进行关节物体操作

Leiyao Cui, Zihang Zhao, Sirui Xie, Wenhuan Zhang, Zhi Han, Yixin Zhu

机构 * Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Psychological and Cognitive Sciences, Peking University(北京大学心理与认知科学学院) State Key Lab of General AI, Peking University(北京大学通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京大学行为与心理健康北京市重点实验室) LeapZenith AI Research(跃臻人工智能研究院) Embodied Intelligence Lab, PKU-Wuhan Institute for Artificial Intelligence(北京大学武汉人工智能研究院具身智能实验室)

AI总结 本文提出Vi-TacMan,结合视觉和触觉反馈实现关节物体的精确操控,通过表面法线作为几何先验并利用von Mises-Fisher分布建模方向,显著优于基线方法,且无需显式运动学模型。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00983 2026-04-02 cs.CV

ACT Now: Preempting LVLM Hallucinations via Adaptive Context Integration

现在行动:通过自适应上下文整合预防治愈LVLM幻觉

Bei Yan, Yuecong Min, Jie Zhang, Shiguang Shan, Xilin Chen

机构 * University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

AI总结 本文提出ACT方法,通过自适应整合上下文信息缓解LVLM幻觉问题,采用视觉上下文探索和语义上下文聚合技术,有效减少幻觉并提升生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00677 2026-04-02 cs.CV

CL-VISTA: Benchmarking Continual Learning in Video Large Language Models

CL-VISTA:视频大语言模型持续学习基准测试

Haiyang Guo, Yichen Shi, Fei Zhu, Wenzhuo Liu, Hongbo Zhao, Fanhu Zeng, Shijie Ma, Da-Han Wang, Xu-Yao Zhang

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学前沿交叉科学学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FKLPRIU, School of Computer and Information Engineering, Xiamen University of Technology(厦门理工学院计算机与信息工程学院福建省模式识别与图像理解重点实验室)

AI总结 CL-VISTA通过8个多样化任务诱导分布偏移,评估持续学习方法在性能、效率和内存方面的权衡,揭示无单一最优解的特性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00547 2026-04-02 cs.AI cs.LG

Does Unification Come at a Cost? Uni-SafeBench: A Safety Benchmark for Unified Multimodal Large Models

统一是否带来代价?Uni-SafeBench:一种用于统一多模态大模型的安全基准

Zixiang Peng, Yongxiu Xu, Qinyi Zhang, Jiexun Shen, Yifan Zhang, Hongbo Xu, Yubin Wang, Gaopeng Gou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本文提出Uni-SafeBench,用于评估统一多模态大模型的安全性,发现统一过程虽提升能力但显著降低基础LLM的安全性,开源资源以促进更安全的AGI发展。

详情

展开后加载摘要…

URL PDF HTML 收藏