arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

共收录 1952
2604.00530 2026-04-02 cs.CV

AceTone: Bridging Words and Colors for Conditional Image Grading

AceTone:连接词语与颜色的条件图像评分

Tianren Ma, Mingxiang Liao, Xijin Zhang, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) ByteDance(字节跳动)

AI总结 AceTone提出了一种基于多模态条件的颜色评分方法,通过生成颜色转换任务实现统一框架,利用VQ-VAE tokenizer压缩LUT向量并结合大规模数据集训练,提升图像评分的感知和美学一致性。

Comments Accepted by CVPR 2026. Project Page: github.com/martian422/AceTone

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28183 2026-04-02 cs.AI

PReD: An LLM-based Foundation Multimodal Model for Electromagnetic Perception, Recognition, and Decision

PReD:基于大语言模型的电磁感知、识别与决策基础多模态模型

Zehua Han, Jing Xiao, Yiqi Duan, Mengyu Xiang, Yuheng Ji, Xiaolong Zheng, Chenghanyu Zhang, Zhendong She, Junyu Shen, Dingwei Tan, Shichu Sun, Zhou Cong, Mingxuan Liu, Fengxiang Wang, Jinping Sun, Yangang Sun

机构 * Tsinghua University(清华大学) National University of Defense Technology(国防科技大学) Beihang University(北京航空航天大学) Tianjin University(天津大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) The Hong Kong University of Science and Technology(香港科技大学) Civil Aviation University of China(中国民航大学) Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出PReD,首个电磁领域基础模型,涵盖感知、识别与决策闭环,构建高质量多任务电磁数据集和评估基准,通过多阶段训练策略提升电磁领域能力,实验显示在PReD-Bench上达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24587 2026-04-02 cs.LG cs.RO

DreamerAD: Efficient Reinforcement Learning via Latent World Model for Autonomous Driving

DreamerAD:通过潜在世界模型实现高效的强化学习用于自动驾驶

Pengxuan Yang, Yupeng Zheng, Deheng Qian, Zebin Xing, Qichao Zhang, Linbo Wang, Yichen Zhang, Shaoyu Guo, Zhongpu Xia, Qiang Chen, Junyu Han, Lingyun Xu, Yifeng Pan, Dongbin Zhao

机构 * Institute of Automation, CAS(中国科学院自动化研究所) Chongqing Chang’an Technology Co., Ltd(重庆长安科技有限公司) School of Advanced Interdisciplinary Sciences, UCAS(中国科学院大学先进交叉科学学院) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院)

AI总结 DreamerAD通过压缩扩散采样将步骤从100步减少到1步,实现80倍加速并保持视觉可解释性,解决了自动驾驶中真实世界数据训练成本高和安全风险大的问题。

Comments authors update

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19660 2026-04-02 cs.CV cs.SD

Semantic Audio-Visual Navigation in Continuous Environments

语义音频视觉导航在连续环境中

Yichen Zeng, Hebaixu Wang, Meng Liu, Yu Zhou, Chen Gao, Kehan Chen, Gongping Huang

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Shandong Jianzhu University(山东建筑大学) Nankai University(南开大学) Tsinghua University(清华大学) CASIA(中国科学院自动化研究所) UCAS(中国科学院大学)

AI总结 本文提出MAGNet模型,通过多模态Transformer实现语义目标推理,提升在连续空间中导航的鲁棒性与成功率。

Comments This paper has been accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10394 2026-04-02 cs.RO cs.LG

RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI

RoboNeuron:面向具身AI的代理驱动编排中层基础设施

Weifan Guan, Qinghao Hu, Huasen Xi, Chenxiao Zhang, Aosheng Li, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) AiRiA MAICRO

AI总结 本文提出RoboNeuron中层框架,解决视觉-语言-动作模型与机器人中间件间的接口不匹配问题,通过统一执行抽象实现模块化编排与后端切换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19846 2026-04-02 cs.AI

HiMA-Ecom: Enabling Joint Training of Hierarchical Multi-Agent E-commerce Assistants

HiMA-Ecom:面向电商场景的分层多智能体助手联合训练

Junxing Hu, Ai Han, Haolan Zhan, Pu Wei, Zhiqian Zhang, Yuhang Guo, Jiawei Lu, Zhen Chen, Haoran Li, Zicheng Zhang

机构 * JD Retail, JD.com, Inc.(京东零售,京东集团) Faculty of Engineering and Information Technology, The University of Melbourne(墨尔本大学工程与信息技术学院) School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院)

AI总结 本文提出HiMA-Ecom电商多智能体基准,通过VR-GRPO算法实现多智能体联合训练,基于3B/7B开源模型在电商场景中取得优于DeepSeek-V3的性能。

Comments 39 pages, 10 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29557 2026-04-01 cs.AI cs.CL

FlowPIE: Test-Time Scientific Idea Evolution with Flow-Guided Literature Exploration

FlowPIE: 测试时的科学思想演变与流引导文献探索

Qiyao Wang, Hongbo Wang, Longze Chen, Zhihao Yang, Guhong Chen, Hamid Alinejad-Rokny, Hui Li, Yuan Lin, Min Yang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Dalian University of Technology(大连理工大学) UNSW Sydney(新南威尔士大学悉尼分校) Shenzhen University of Advanced Technology(深圳理工大学) Xiamen University(厦门大学)

AI总结 本文提出FlowPIE框架,通过流引导的蒙特卡洛树搜索扩展文献轨迹,结合LLM生成奖励模型指导适应性检索,生成高质量且多样化的初始种群,进而通过选择、交叉和变异实现测试时的科学思想演变。

Comments 30 pages, 11 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01639 2026-04-01 cs.CV

ReCALL: Recalibrating Capability Degradation for MLLM-based Composed Image Retrieval

ReCALL: 为基于MLLM的组合图像检索 recalibrate 能力退化

Tianyu Yang, Chenwei He, Xiangzhao Hao, Tianyue Wang, Jiarui Guo, Haiyun Guo, Leigang Qu, Jinqiao Wang, Tat-Seng Chua

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Southeast University(东南大学) Beijing University of Posts and Telecommunications(北京邮电大学) National University of Singapore(新加坡国立大学) Wuhan AI Research(武汉人工智能研究院) Guangdong Provincial Key Laboratory of Intellectual Property and Big Data, Guangdong Polytechnic Normal University(广东技术师范大学广东省知识产权大数据重点实验室)

AI总结 ReCALL通过诊断生成器盲点、生成修正指令和三元组、并持续训练来缓解基于生成式MLLM的检索能力退化问题,实验证明其在CIRR和FashionIQ上达到SOTA性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29262 2026-04-01 cs.AI

Grokking From Abstraction to Intelligence

从抽象到智能的领悟

Junjie Zhang, Zhen Shen, Gang Xiong, Xisong Dong

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 研究通过模运算中的领悟现象,揭示模型泛化机制源于内部结构的自发简化,结合因果、谱和算法复杂性及奇异学习理论,提出冗余流形的物理坍缩是泛化关键。

Comments 22page and 5 figures,In this paper, we analyze the grokking phenomenon from the perspective of Singular Learning Theory (SLT). This work is currently under review for ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29115 2026-04-01 astro-ph.GA cs.CV

Schrödinger's Seed: Purr-fect Initialization for an Impurr-fect Universe

薛定谔的种子:为一个不完美的宇宙寻找完美的初始化

Mi chen, Renhao Ye

机构 * Kapteyn Astronomical Institute, University of Groningen(格罗宁根大学卡普坦天文研究所) School of Astronomy and Space Science, University of Chinese Academy of Sciences(中国科学院大学天文与空间科学学院) Shanghai Astronomical Observatory, Chinese Academy of Sciences(中国科学院上海天文台)

AI总结 本文提出利用猫的特性生成随机种子,通过蒙特卡洛方法测试21只家猫的物理属性,结果表明猫驱动的种子在准确性上优于传统随机整数。

Comments 3 pages, 1 figure, 21 cats

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22578 2026-03-31 cs.RO

EgoDemoGen: Egocentric Demonstration Generation for Viewpoint Generalization in Robotic Manipulation

EgoDemoGen:用于机器人操作中视角泛化的眼动演示生成

Yuan Xu, Jiabing Yang, Xiaofeng Wang, Yixiang Chen, Zheng Zhu, Bowen Fang, Guan Huang, Xinze Chen, Yun Ye, Qiang Zhang, Peiyan Li, Xiangnan Wu, Kai Wang, Bing Zhan, Shuo Lu, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

机构 * UCAS(中国科学院大学) CASIA(中国科学院自动化研究所) GigaAI Tsinghua University(清华大学) X-Humanoid FiveAges

AI总结 本文提出EgoDemoGen框架,通过EgoTrajTransfer和EgoViewTransfer生成新型眼动视角下的观察-动作演示,提升机器人操作在视角变化下的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28503 2026-03-31 cs.CV

Bridging the Geometry Mismatch: Frequency-Aware Anisotropic Serialization for Thin-Structure SSMs

弥合几何不匹配:面向薄结构SSMs的频率感知各向异性序列化

Jin Bai, Huiyao Zhang, Qi Wen, Ningyang Li, Shengyang Li, Atta ur Rahman, Xiaolin Tian

机构 * University of Chinese Academy of Sciences(中国科学院大学) Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间应用工程与技术中心) University of Peshawar(白沙瓦大学) Macau University of Science and Technology(澳门科技大学)

AI总结 针对薄线结构分割中拓扑允许断裂的关键问题,本文提出频率感知各向异性序列化框架,通过分解特征为稳定拓扑载体和方向高频带,提升空间对齐精度,并结合主动探测策略,在四个挑战性基准上超越现有方法,达到91.3% mIoU和97.1% clDice。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28105 2026-03-31 cs.CV

RAWIC: Bit-Depth Adaptive Lossless Raw Image Compression

RAWIC:位深度自适应无损RAW图像压缩

Chunhang Zheng, Tongda Xu, Mingli Xie, Yan Wang, Dou Li

机构 * School of Electronics, Peking University(北京大学电子学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 RAWIC提出一种位深度自适应的无损RAW图像压缩框架,通过转换Bayer数据并自适应位深度估计,实现对不同相机和位深度的高效压缩,实验表明其在JPEG-XL基础上平均提升7.7%的压缩率。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27949 2026-03-31 cs.CL

EnsemJudge: Enhancing Reliability in Chinese LLM-Generated Text Detection through Diverse Model Ensembles

EnsemJudge: 通过多样化模型集成提升中文LLM生成文本检测的可靠性

Zhuoshang Wang, Yubing Ren, Guoyu Zhao, Xiaowei Zhu, Hao Li, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

AI总结 本文提出EnsemJudge框架,通过定制策略和集成投票机制,有效检测中文LLM生成文本,优于基线方法并在NLPCC2025任务中取得第一,验证了其可靠性。

Comments Accepted by NLPCC 2025 Shared Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27915 2026-03-31 cs.CV

FlashSign: Pose-Free Guidance for Efficient Sign Language Video Generation

FlashSign:无需姿态的高效手语视频生成

Liuzhou Zhang, Zeyu Zhang, Biao Wu, Luyao Tang, Zirui Song, Hongyang He, Renda Han, Guangzhen Yao, Huacan Wang, Ronghao Chen, Xiuying Chen, Guan Huang, Zheng Zhu

机构 * HUST(华中科技大学) GigaAI UTS(悉尼科技大学) HKU(香港大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Warwick(华威大学) TJU(天津大学) NNU(南京师范大学) UCAS(中国科学院大学) UTHealth Houston(德克萨斯大学休斯顿健康科学中心)

AI总结 本文提出无需姿态表示的高效手语视频生成框架,通过扩散模型直接映射自然语言文本到手语视频,引入可训练滑动瓷砖注意力机制提升推理效率,实现3.07倍的生成速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01305 2026-03-31 cs.CV cs.AI

AG-VAS: Anchor-Guided Zero-Shot Visual Anomaly Segmentation with Large Multimodal Models

AG-VAS:基于大多模态模型的锚引导零样本视觉异常分割

Zhen Qu, Xian Tao, Xiaoyi Bao, Dingrong Wang, ShiChen Qu, Zhengtao Zhang, Xingang Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Casivision(中科视语) Weiqiao-UCAS Science and Technology Park(魏桥国科科技园)

AI总结 AG-VAS通过引入三个可学习的语义锚点,建立统一的锚引导分割范式,提升零样本视觉异常分割的精度与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27630 2026-03-31 cs.AR cs.LG

RTLSeek: Boosting the LLM-Based RTL Generation with Multi-Stage Diversity-Oriented Reinforcement Learning

RTLSeek: 通过多阶段多样性导向强化学习提升基于LLM的RTL生成

Xinyu Zhang, Zhiteng Chao, Yonghao Wang, Bin Sun, Tianyun Ma, Tianmeng Yang, Jianan Mu, Jing Justin Ye, Huawei Li

机构 * State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所处理器国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) CASTEST Co., Ltd.(中科芯测科技有限公司)

AI总结 RTLSeek通过多阶段多样性导向强化学习提升基于LLM的RTL生成,结合专家知识与EDA反馈,改进RTL的正确性和多样性,实验表明其在RTLLM基准上优于现有方法。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27460 2026-03-31 cs.CV cs.AI

Project Imaging-X: A Survey of 1000+ Open-Access Medical Imaging Datasets for Foundation Model Development

Project Imaging-X:1000多个开放访问医学影像数据集的调查

Zhongying Deng, Cheng Tang, Ziyan Huang, Jiashi Lin, Ying Chen, Junzhi Ning, Chenglong Ma, Jiyao Liu, Wei Li, Yinghao Zhu, Shujian Gao, Yanyan Huang, Sibo Ju, Yanzhou Su, Pengcheng Chen, Wenhao Tang, Tianbin Li, Haoyu Wang, Yuanfeng Ji, Hui Sun, Shaobo Min, Liang Peng, Feilong Tang, Haochen Xue, Rulin Zhou, Chaoyang Zhang, Wenjie Li, Shaohao Rui, Weijie Ma, Xingyue Zhao, Yibin Wang, Kun Yuan, Zhaohui Lu, Shujun Wang, Jinjie Wei, Lihao Liu, Dingkang Yang, Lin Wang, Yulong Li, Haolin Yang, Yiqing Shen, Lequan Yu, Xiaowei Hu, Yun Gu, Yicheng Wu, Benyou Wang, Minghui Zhang, Angelica I. Aviles-Rivero, Qi Gao, Hongming Shan, Xiaoyu Ren, Fang Yan, Hongyu Zhou, Haodong Duan, Maosong Cao, Shanshan Wang, Bin Fu, Xiaomeng Li, Zhi Hou, Chunfeng Song, Lei Bai, Yuan Cheng, Yuandong Pu, Xiang Li, Wenhai Wang, Hao Chen, Jiaxin Zhuang, Songyang Zhang, Huiguang He, Mengzhang Li, Bohan Zhuang, Zhian Bai, Rongshan Yu, Liansheng Wang, Yukun Zhou, Xiaosong Wang, Xin Guo, Guanbin Li, Xiangru Lin, Dakai Jin, Mianxin Liu, Wenlong Zhang, Qi Qin, Conghui He, Yuqiang Li, Ye Luo, Nanqing Dong, Jie Xu, Wenqi Shao, Bo Zhang, Qiujuan Yan, Yihao Liu, Jun Ma, Zhi Lu, Yuewen Cao, Zongwei Zhou, Jianming Liang, Shixiang Tang, Qi Duan, Dongzhan Zhou, Chen Jiang, Yuyin Zhou, Yanwu Xu, Jiancheng Yang, Shaoting Zhang, Xiaohong Liu, Siqi Luo, Yi Xin, Chaoyu Liu, Haochen Wen, Xin Chen, Alejandro Lozano, Min Woo Sun, Yuhui Zhang, Yue Yao, Xiaoxiao Sun, Serena Yeung-Levy, Xia Li, Jing Ke, Chunhui Zhang, Zongyuan Ge, Ming Hu, Jin Ye, Zhifeng Li, Yirong Chen, Yu Qiao, Junjun He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shanghai Institute of Optics and Fine Mechanics(上海光学精密机械研究所) Fudan University(复旦大学) University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) Fuzhou University(福州大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学) Incept Labs Monash University(莫纳什大学) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院) Alibaba DAMO Academy(阿里巴巴达摩院) The Hong Kong Polytechnic University(香港理工大学) South China University of Technology(华南理工大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Yau Mathematical Sciences Center, Tsinghua University(清华大学丘成桐数学科学中心) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与产业研究院) Shanghai Academy of Artificial Intelligence for Science(上海科学智能研究院) Nankai University(南开大学) The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学) School of Informatics, Xiamen University(厦门大学信息学院) University College London(伦敦大学学院) Sun Yat-sen University(中山大学) Alibaba Group, DAMO Academy, New York, NY, USA(阿里巴巴集团达摩院(纽约)) Tongji University(同济大学) University of Toronto(多伦多大学) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系) Johns Hopkins University(约翰霍普金斯大学) Arizona State University(亚利桑那州立大学) Academy for Clinical Innovation and Translation of Shanghai(上海临床创新转化研究院) University of California, Santa Cruz(加州大学圣克鲁兹分校) ELLIS Institute Finland(芬兰ELLIS研究所) Aalto University(阿尔托大学) Shandong University(山东大学) Xi’an Jiaotong University(西安交通大学)

AI总结 本文调查了1000多个开放访问医学影像数据集,揭示了其规模小、任务碎片化和分布不均的问题,并提出元数据驱动融合方法和交互发现门户,为医学影像数据集的整合和基础模型发展提供路线图。

Comments 157 pages, 19 figures, 26 tables. Project repo: \url{https://github.com/uni-medical/Project-Imaging-X}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27185 2026-03-31 cs.CV

MotionRFT: Unified Reinforcement Fine-Tuning for Text-to-Motion Generation

MotionRFT: 用于文本到动作生成的统一强化微调

Xiaofeng Tan, Wanjiang Weng, Hongsong Wang, Fang Zhao, Xin Geng, Liang Wang

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学)) State Key Laboratory for Novel Software Technology, School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院计算机软件新技术国家重点实验室) New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所多模态人工智能系统国家重点实验室模式识别新实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本文提出MotionRFT框架,通过多维奖励模型和高效微调方法,解决文本到动作生成中语义一致性、现实感和人类偏好对齐的问题,实验表明其在FID和R-Precision上均有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21655 2026-03-31 cs.CV cs.AI

CCCaption: Dual-Reward Reinforcement Learning for Complete and Correct Image Captioning

CCCaption: 为完整和正确图像描述的双奖励强化学习

Zhijiang Tang, Linhua Wang, Jiaxin Qi, Weihao Jiang, Peng Hou, Anxiang Zeng, Jianqiang Huang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) LLM Team, Shopee Pte. Ltd.(Shopee私人有限公司大语言模型团队)

AI总结 本文提出CCCaption框架,通过双奖励强化学习优化图像描述的完整性和正确性,利用多样化LVLMs和动态查询采样策略提升训练效率,并通过验证子描述查询的真实性来惩罚幻觉,从而生成更符合客观标准的描述。

Comments Accept by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04361 2026-03-31 cs.CV cs.AI cs.LG

SparVAR: Exploring Sparsity in Visual AutoRegressive Modeling for Training-Free Acceleration

SparVAR:探索视觉自回归建模中的稀疏性以实现无训练加速

Zekun Li, Ning Wang, Tongxin Bai, Changwang Mei, Peisong Wang, Shuang Qiu, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Nanjing University of Science and Technology(南京理工大学) City University of Hong Kong(香港城市大学)

AI总结 SparVAR通过利用自回归注意力的稀疏性,提出了一种无需训练的加速框架,有效降低计算复杂度,提升生成速度并保持图像质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20451 2026-03-31 cs.CL

MuVaC: A Variational Causal Framework for Multimodal Sarcasm Understanding in Dialogues

MuVaC:一种用于对话中多模态讽刺理解的变分因果框架

Diandian Guo, Fangfang Yuan, Cong Cao, Xixun Lin, Chuan Zhou, Hao Peng, Yanan Cao, Yanbing Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Beihang University(北京航空航天大学)

AI总结 本文提出MuVaC框架,通过变分因果推理实现多模态讽刺检测与解释的联合优化,提升对话中讽刺理解的鲁棒性。

Comments 12 pages, 7 figures. Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11417 2026-03-31 cs.CV

Robust Ego-Exo Correspondence with Long-Term Memory

具有长期记忆的鲁棒自体-外体对应

Yijun Hu, Bing Fan, Xin Gu, Haiqing Ren, Dongfang Liu, Heng Fan, Libo Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) University of North Texas(北德克萨斯大学) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) Rochester Institute of Technology(罗切斯特理工学院)

AI总结 本文提出基于SAM 2的新型EEC框架,通过双记忆架构和自适应特征路由模块提升长期记忆能力,实现更鲁棒的自体-外体对应。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15673 2026-03-31 cs.RO

Omni-LIVO: Robust RGB-Colored Multi-Camera Visual-Inertial-LiDAR Odometry via Photometric Migration and ESIKF Fusion

Omni-LIVO:通过光度迁移和ESIKF融合实现鲁棒的多摄像头视觉-惯性-激光雷达里程计

Yinong Cao, Chenyang Zhang, Xin He, Yuwei Chen, Chengyu Pu, Bingtao Wang, Kaile Wu, Shouzheng Zhu, Fei Han, Shijie Liu, Chunlai Li, Jianyu Wang

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) Advanced Laser Technology Lab of Anhui Province(安徽省先进激光技术实验室) Key Laboratory of Space Active Opto-Electronics Technology, Shanghai Institute of Technical Physics, Chinese Academy of Sciences(中国科学院上海技术物理研究所空间主动光电技术重点实验室)

AI总结 Omni-LIVO通过多视角观测充分利用LiDAR几何信息,引入跨视角直接对齐策略和改进的ESIKF,提升多摄像头视觉-惯性-LiDAR里程计的精度和鲁棒性。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L). Early Access version available. This version supersedes all previous versions and is the official accepted manuscript for citation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26786 2026-03-31 cs.LG cs.AI

A Step Toward Federated Pretraining of Multimodal Large Language Models

迈向多模态大语言模型联邦预训练的一小步

Baochen Xiong, Yifan Xu, Xiaoshan Yang, Yaguang Song, Yaowei Wang, Changsheng Xu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Pengcheng Laboratory(鹏城实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院)

AI总结 本文提出Fed-MA任务,通过冻结视觉编码器和LLM,协同训练跨模态投影器,解决参数干扰和梯度震荡问题,提出Fed-CMP框架在联邦预训练中取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26597 2026-03-30 cs.CV

From Static to Dynamic: Exploring Self-supervised Image-to-Video Representation Transfer Learning

从静态到动态:探索自监督图像到视频表示迁移学习

Yang Liu, Qianqian Xu, Peisong Wen, Siran Dai, Xilin Zhao, Qingming Huang

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

AI总结 本文提出Co-Settle框架,通过轻量投影层调整表示空间,平衡视频内时间一致性和跨视频语义分离性,实验显示在多个视频任务上提升效果。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06178 2026-03-30 cs.CV

Making Training-Free Diffusion Segmentors Scale with the Generative Power

利用生成能力使免训练扩散分割器扩展

Benyuan Meng, Qianqian Xu, Zitai Wang, Xiaochun Cao, Longtao Huang, Qingming Huang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) School of Cyber Science and Tech., Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络空间安全学院) Alibaba Group(阿里巴巴集团) School of Computer Science and Tech., University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Key Laboratory of Big Data Mining and Knowledge Management, CAS(中国科学院大数据挖掘与知识管理重点实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 本文研究了如何通过提升扩散模型的生成能力来改进免训练的图像分割方法,提出自动聚合和像素级重缩放技术以解决注意力图与全局表示不一致及文本标记间得分不平衡的问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25804 2026-03-30 cs.CL

RealChart2Code: Advancing Chart-to-Code Generation with Real Data and Multi-Task Evaluation

RealChart2Code:通过真实数据和多任务评估推进图表到代码生成

Jiajun Zhang, Yuying Li, Zhixun Li, Xingyu Guo, Jingzhuo Wu, Leqi Zheng, Yiran Yang, Jianke Zhang, Qingbin Li, Shannan Yan, Zhetong Li, Changguo Jia, Junfei Wu, Zilei Wang, Qiang Liu, Liang Wang

机构 * USTC(中国科学技术大学) THU(清华大学) CUHK(香港中文大学) UCAS(中国科学院大学) CASIA(中国科学院自动化研究所) BNU(北京师范大学) BUPT(北京邮电大学) BIT(北京理工大学) PKU(北京大学)

AI总结 本文提出RealChart2Code基准,通过真实数据和多任务评估,评估VLMs在复杂图表生成中的性能,揭示其在多面板图表上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25768 2026-03-30 cs.SE cs.AI cs.AR cs.MA

UCAgent: An End-to-End Agent for Block-Level Functional Verification

UCAgent:一种端到端的块级功能验证代理

Junyue Wang, Zhicheng Yao, Yan Pi, Xiaolong Li, Fangyuan Song, Jinru Wang, Yunlong Xie, Sa Wang, Yungang Bao

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所处理器国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Beijing Institute of Open Source Chip(北京开源芯片研究院)

AI总结 UCAgent通过构建纯Python验证环境和31阶段细粒度验证流程,解决传统方法在复杂半导体设计验证中的不足,实现98.5%的代码覆盖率和100%的功能覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24295 2026-03-27 cs.CV

RS-SSM: Refining Forgotten Specifics in State Space Model for Video Semantic Segmentation

RS-SSM:通过状态空间模型细化遗忘的特定信息以实现视频语义分割

Kai Zhu, Zhenyu Cui, Zehua Zang, Jiahuan Zhou

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所) Tsinghua University(清华大学) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出RS-SSM模型,通过互补细化遗忘的时空细节,提升视频语义分割的像素级处理能力,在四个基准上取得最佳性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏