arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

共收录 1952
2605.01373 2026-05-05 cs.CL cs.AI

Focus on the Core: Empowering Diffusion Large Language Models by Self-Contrast

聚焦核心:通过自对比增强扩散大语言模型

Jinyuan Feng, Xin Yu, Yiqun Chen, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Zhiqiang Pu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司)

AI总结 本文通过研究高信息密度token,提出FoCore解码策略,利用自对比提升生成质量与效率,实验表明在数学、代码和逻辑推理任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01231 2026-05-05 cs.LG

CombinationTS: A Modular Framework for Understanding Time-Series Forecasting Models

CombinationTS:一个用于理解时间序列预测模型的模块化框架

Xiaorui Wang, Fanda Fan, Chenxi Wang, Yuxuan Yang, Rui Tang, Kuoyu Gao, Simiao Pang, Yuanfeng Shang, Zhipeng Liu, Wanling Gao, Lei Wang, Jianfeng Zhan

机构 * Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院计算技术研究所) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Northeastern University, Shenyang, China(东北大学) Beijing Normal University - Hong Kong Baptist University United International College, Zhuhai, China(北京师范大学-香港 Baptist大学联合国际学院)

AI总结 本文提出CombinationTS框架,通过分解模型为输入变换、嵌入、编码器、解码器和输出变换模块,量化各部分性能和稳定性,揭示模型改进的核心驱动因素,发现嵌入设计良好时,无参数的Identity编码器可超越复杂结构。

Comments Accepted by ICML 2026 main track. Code available at https://github.com/BenchCouncil/CombinationTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00883 2026-05-05 cs.CV cs.AI

Towards High Fidelity Face Swapping: A Comprehensive Survey and New Benchmark

迈向高保真人脸交换:全面综述与新基准

Qi Li, Weining Wang, Shuangjun Du, Bo Peng, Jing Dong, Kun Wang, Zhenan Sun, Ming-Hsuan Yang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Nanyang Technological University(南洋理工大学) Yonsei University(延世大学)

AI总结 本文综述了人脸交换方法,提出新基准CASIA FaceSwapping,通过系统分析设计原理和局限性,提供统一视角和评估框架以推动更稳健的人脸交换技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00815 2026-05-05 cs.AI

Resource-Efficient Reinforcement for Reasoning Large Language Models via Dynamic One-Shot Policy Refinement

通过动态单次策略细化实现大规模语言模型推理的资源高效强化学习

Yunjian Zhang, Sudong Wang, Yang Li, Peiran Xu, Conghao Zhou, Xiaoyue Ma, Jianing Li, Yao Zhu

机构 * UCAS(中国科学院大学) HKUST(GZ)(香港科技大学(广州)) Tsinghua University(清华大学) Sun Yat-Sen University(中山大学) Xidian University(西安电子科技大学) George Mason University(乔治·梅森大学) Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 本文提出动态单次策略细化方法,通过减少训练样本数量和计算开销,提升大规模语言模型推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10368 2026-05-04 cs.CL cs.AI

Exploring the System 1 Thinking Capability of Large Reasoning Models

探索大型推理模型的系统1思维能力

Wenyuan Zhang, Shuaiyi Nie, Xinghua Zhang, Zefeng Zhang, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

AI总结 本文研究大型推理模型的系统1思维能力,提出S1-Bench基准测试,发现现有模型在简单问题上存在准确率低和效率差的问题,揭示了模型对问题难度的隐含编码。

Comments Accepted by IJCAI 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00620 2026-05-04 cs.CL

SC-Taxo: Hierarchical Taxonomy Generation under Semantic Consistency Constraints using Large Language Models

SC-Taxo:基于语义一致性约束的层次化分类生成方法

Shiqiang Cai, Nianhong Niu, Shizhu He, Kang Liu, Jun Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Science and Technology Beijing(北京科技大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本文提出SC-Taxo框架,利用大语言模型和层次化优化机制,解决现有分类生成方法在结构一致性和语义对齐上的不足,提升分类体系的层次性和准确性。

Comments 12 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00323 2026-05-04 cs.CV cs.LG

Online Self-Calibration Against Hallucination in Vision-Language Models

在线对抗幻觉的视觉-语言模型自我校准

Minghui Chen, Chenxu Yang, Hengjie Zhu, Dayan Wu, Zheng Lin, Qingyi Si

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

AI总结 本文提出OSCAR框架,通过蒙特卡洛树搜索和双粒度奖励机制在线校准视觉-语言模型,减少幻觉并提升多模态能力。

Comments IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28158 2026-05-04 cs.AI

Intern-Atlas: A Methodological Evolution Graph as Research Infrastructure for AI Scientists

Intern-Atlas:一种方法论进化图作为人工智能科学家的研究基础设施

Yujun Wu, Dongxu Zhang, Xinchen Li, Jinhang Xu, Yiling Duan, Yumou Liu, Jiabao Pan, Qiyuan Zhu, Xuanhe Zhou, Jingxuan Wei, Siyuan Li, Jintao Chen, Conghui He, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学) Xi'an Jiaotong University(西安交通大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学) Hunan University(湖南大学) Shanghai Jiao Tong University(上海交通大学) Shanghai University(上海大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 Intern-Atlas通过构建方法论进化图,自动识别方法实体,推断方法间的关系,并捕捉驱动创新过渡的瓶颈,为AI研究提供因果网络支持。

Comments 25 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02443 2026-05-04 cs.LG

Certain Head, Uncertain Tail: Expert-Sample for Test-Time Scaling in Fine-Grained MoE

某些头部,不确定尾部:专家-样本用于测试时缩放在细粒度MoE

Yuanteng Chen, Peisong Wang, Nanxin Zeng, Yuantian Shao, Shuang Qiu, Gang Li, Jing Liu, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) Nanjing University of Science(南京理工大学) City University of Hong Kong(香港城市大学)

AI总结 本文研究细粒度MoE在测试时缩放中的性能优化,提出Expert-Sample方法通过保留高置信度选择并引入可控随机性提升生成多样性。

Comments 25 pages, 13 figures

Journal ref International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11991 2026-05-04 cs.CV cs.AI cs.CL

VGR: Visual Grounded Reasoning

VGR:视觉基础推理

Jiacong Wang, Zijian Kang, Haochen Wang, Haiyong Jiang, Jiawen Li, Bohong Wu, Ya Wang, Jiao Ran, Xiao Liang, Chao Feng, Jun Xiao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ByteDance Inc.(字节跳动公司)

AI总结 本文提出VGR,一种增强视觉感知的多模态大语言模型,通过图像区域检测与回放提升多模态推理能力,在多个基准测试中表现优异。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09971 2026-05-04 cs.CV

APCoTTA: Continual Test-Time Adaptation for Semantic Segmentation of Airborne LiDAR Point Clouds

APCoTTA: 用于空中激光雷达点云语义分割的连续测试时间适应

Yuan Gao, Shaobo Xia, Sheng Nie, Cheng Wang, Xiaohuan Xi, Bisheng Yang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) International Research Center of Big Data for Sustainable Development Goals(可持续发展目标大数据国际研究中心) University of Chinese Academy of Sciences(中国科学院大学) The Department of Geomatics Engineering, Changsha University of Science and Technology(长沙理工大学测绘工程系) The State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)

AI总结 本文提出APCoTTA框架,针对空中激光雷达点云语义分割中的持续领域偏移问题,通过梯度驱动层选择、熵一致性损失和随机参数插值机制提升适应性能,并构建两个基准数据集。

Comments 18 pages,12 figures

Journal ref ISPRS Journal of Photogrammetry and Remote Sensing Volume 237, July 2026, Pages 339-354

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27998 2026-05-01 cs.LG cs.CL

Latent-GRPO: Group Relative Policy Optimization for Latent Reasoning

Latent-GRPO:用于潜在推理的组相对策略优化

Jingcheng Deng, Zihao Wei, Liang Pang, Junhong Wu, Shicheng Xu, Zenghao Duan, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本文提出Latent-GRPO,通过解决潜在推理中的三个瓶颈问题,提升推理稳定性与效率,在低难度和高难度任务中均取得显著性能提升。

Comments This is an actively developing work, and we will continue to update the arXiv version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25326 2026-05-01 cs.AR cs.AI

AHASD: Asynchronous Heterogeneous Architecture for LLM Adaptive Drafting Speculative Decoding on Mobile Devices

AHASD:异步异构架构用于移动设备上的LLM自适应草案推测解码

Ma Zirui, Fan Zhihua, Li Wenxing, Wu Haibin, Zhang Fulin, Ye Xiaochun, Li Wenming

机构 * State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所处理器国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 AHASD提出一种异步异构架构,通过任务级DLM-TLM解耦和熵历史感知草案控制,提升移动设备上LLM自适应草案推测解码的吞吐量和能效。

Comments 7 pages, 9 figures, accepted by DAC 2026, repo: https://github.com/MAdrid1011/AHASD

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02980 2026-05-01 eess.AS cs.CL eess.SP

WST-X Series: Wavelet Scattering Transform for Interpretable Speech Deepfake Detection

WST-X系列:用于可解释性语音深度伪造检测的小波散射变换

Xi Xuan, Davide Carbone, Wenxin Zhang, Ruchi Pandey, Tomi H. Kinnunen

机构 * Computational Speech Group(计算语音组) University of Eastern Finland(东芬兰大学) Laboratoire de Physique de l’Ecole Normale Supérieure, Université PSL, CNRS, Sorbonne Université, Université de Paris(巴黎高等师范大学物理实验室,巴黎大学,CNRS,索邦大学,巴黎大学) University of Chinese Academy of Sciences(中国科学院大学) University of Toronto(多伦多大学)

AI总结 本文提出WST-X系列,结合小波散射变换提升语音深度伪造检测的可解释性与性能,通过多尺度特征提取在多个数据集上取得显著优势。

Comments IEEE Signal Processing Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14602 2026-05-01 cs.RO cs.AI cs.HC

K2MUSE: A human lower-limb multimodal walking dataset spanning task and acquisition variability for rehabilitation robotics

K2MUSE:一种涵盖任务和采集变异性的下肢多模态行走数据集,用于康复机器人

Jiwei Li, Bi Zhang, Xiaowei Tan, Wanxin Chen, Zhaoyuan Liu, Juanjuan Zhang, Weiguang Huo, Jian Huang, Lianqing Liu, Xingang Zhao

机构 * State Key Laboratory of Robotics and Intelligent Systems, Shenyang Institute of Automation, Chinese Academy of Sciences(机器人与智能系统国家重点实验室,沈阳自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) College of Artificial Intelligence, Tianjin Key Laboratory of Intelligent Robotics, Nankai University(人工智能学院,天津智能机器人重点实验室,南开大学) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(人工智能与自动化学院,华中科技大学)

AI总结 K2MUSE数据集通过多模态数据揭示下肢康复机器人与生物力学信息的关系,为康复机器人开发提供大规模步态样本和数据驱动方法支持。

Comments 34 pages, 30 figures,7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27582 2026-05-01 cs.CV

Assessing Pancreatic Ductal Adenocarcinoma Vascular Invasion: the PDACVI Benchmark

评估胰腺导管腺癌血管侵袭:PDACVI基准

M. Riera-Marín, O. K. Sikha, J. Rodríguez-Comas, M. S. May, T. Kirscher, X. Coubez, P. Meyer, S. Faisan, Z. Pan, X. Zhou, X. Liang, C. Hémon, V. Boussot, J. -L. Dillenseger, J. -C. Nunes, K. -C. Kahl, C. Lüth, J. Traub, P. -H. Conze, M. M. Duh, A. Aubanell, R. de Figueiredo Cardoso, S. Egger-Hackenschmidt, J. García-López, M. A. González-Ballester, A. Galdran

机构 * Sycai Technologies SL, Scientific Technical Department, Barcelona, Spain Universit\" a tsklinikum Erlangen, Department of Radiology of the Uniklinikum Erlangen (UKER), Erlangen, Germany University Hospital Erlangen, Imaging Science Institute, Erlangen, Germany ICUBE Laboratory, CNRS UMR-7357, University of Strasbourg, Strasbourg, France Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China University of Chinese Academy of Sciences, Beijing, China German Cancer Research Center (DKFZ), Medical Image Computing (E230), Heidelberg, Germany Hospital de Matar\' o , Matar\' o , Spain Hospital de Sant Pau i la Santa Creu, Diagnostic Imaging Department, Barcelona, Spain Institut de Recerca Sant Pau - CERCA, Advanced Medical Imaging, Artificial Intelligence Imaging-Guided Therapy Research Group, Barcelona, Spain TECNALIA, Basque Research

AI总结 本文提出PDACVI基准,通过密集标注数据集评估胰腺癌血管侵袭,揭示传统体积重叠指标的局限性,强调概率模型在术前决策中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27488 2026-05-01 cs.CL

Skills-Coach: A Self-Evolving Skill Optimizer via Training-Free GRPO

Skills-Coach:一种通过无训练GRPO实现的自我进化技能优化器

Yu Tian, Jiawei Chen, Lifan Zheng, Mingxiang Tao, Xinyi Zeng, Zhaoxia Yin, Hang Su, Xian Sun

机构 * University of Chinese Academy of Sciences(中国科学院大学) East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) Southeast University(东南大学) Hainan University(海南大学) Tsinghua University(清华大学)

AI总结 Skills-Coach通过无训练GRPO框架提升LLM代理技能自我进化能力,包含四个核心模块,通过Skill-X基准测试展示其在多种技能类别中的显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27467 2026-05-01 cs.SE cs.CL

ScaleBox: Enabling High-Fidelity and Scalable Code Verification for Large Language Models

ScaleBox:实现大规模语言模型高保真和可扩展的代码验证

Jiasheng Zheng, Xin Zheng, Boxi Cao, Pengbo Wang, Zhengzhao Ma, Qiming Zhu, Jiazhen Jiang, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory(中国科学院信息处理实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 ScaleBox通过自动化特殊判题生成与管理、细粒度并行执行和配置驱动的评估套件,提升大规模代码训练的验证准确性和效率,显著优于基线方法。

Comments Accepted to ACL 2026 Demo. Our project is available at https://github.com/icip-cas/ScaleBox

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27419 2026-05-01 cs.AI cs.CL

InteractWeb-Bench: Can Multimodal Agent Escape Blind Execution in Interactive Website Generation?

InteractWeb-Bench: 多模态代理能否在交互式网站生成中避免盲目执行?

Qiyao Wang, Haoran Hu, Longze Chen, Hongbo Wang, Hamid Alinejad-Rokny, Yuan Lin, Min Yang

机构 * Shenzhen Institute of Advanced Technology Chinese Academy of Sciences(深圳先进技术研究院中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Dalian University of Technology(大连理工大学) UNSW Sydney(悉尼大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

AI总结 本文提出InteractWeb-Bench,首个针对非专家低代码用户的多模态交互基准,通过模拟用户行为中的模糊性、冗余性和矛盾性,揭示前沿多模态大语言模型在意图识别和适应性交互上的局限。

Comments 21 pages, 13 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27361 2026-05-01 cs.CV cs.GR

CasLayout: Cascaded 3D Layout Diffusion for Indoor Scene Synthesis with Implicit Relation Modeling

CasLayout:基于级联3D布局扩散的室内场景合成与隐式关系建模

Yingrui Wu, Youkang Kong, Mingyang Zhao, Weize Quan, Dong-Ming Yan, Yang Liu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences and School of Artificial Intelligence, University of Chinese Academy of Sciences(MAIS,自动化研究所,中国科学院,人工智能学院,中国科学院大学) Tsinghua University(清华大学) SKLMS, Academy of Mathematics and Systems Science, Chinese Academy of Sciences(系统科学研究所,中国科学院) Microsoft Research Asia(微软亚洲研究院)

AI总结 CasLayout通过级联扩散框架将场景生成分解为四个阶段,结合物理与语义约束,提升生成效率与可控性,实现高质量室内场景合成。

Comments SIGGARPH 2026 (Journal Track), Code: https://github.com/YingruiWoo/CasLayout

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27357 2026-05-01 cs.LG cs.CV

AG-TAL: Anatomically-Guided Topology-Aware Loss for Multiclass Segmentation of the Circle of Willis Using Large-Scale Multi-Center Datasets

AG-TAL:基于解剖学的拓扑感知损失用于使用大规模多中心数据集的Willis环多类分割

Jialu Liu, Yue Cui, Shan Yu

机构 * Laboratory of Brain Atlas and Brain-inspired Intelligence, Institute of Automation, Chinese Academy of Sciences(脑图谱与脑启发智能实验室,自动化研究所,中国科学院) State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology, Chinese Academy of Sciences(脑认知与脑启发智能技术国家重点实验室,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院)

AI总结 本文提出AG-TAL损失函数,通过整合半径感知Dice损失、断裂感知clDice损失和邻接感知共现损失,提升Willis环多类分割的准确率与泛化能力。

Comments 11 pages, 5 figures, submitted to IEEE JBHI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27083 2026-05-01 cs.LG

Co-Evolving Policy Distillation

共进化策略蒸馏

Naibin Gu, Chenxu Yang, Qingyi Si, Chuanyu Qin, Dingyu Yao, Peng Fu, Zheng Lin, Weiping Wang, Nan Duan, Jiaqi Wang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, UCAS(中国科学院大学网络空间安全学院)

AI总结 本文提出CoPD,通过并行训练专家并引入OPD,在专家RLVR训练过程中实现双向知识传递,提升多模态推理能力,优于现有方法。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02845 2026-05-01 cs.CL cs.AI

TiMem: Temporal-Hierarchical Memory Consolidation for Long-Horizon Conversational Agents

TiMem:用于长时域对话代理的时序-层次记忆巩固

Kai Li, Xuanqing Yu, Ziyi Ni, Yi Zeng, Yao Xu, Zheqing Zhang, Xin Li, Jitao Sang, Xiaogang Duan, Xuelei Wang, Chengbao Liu, Jie Tan

机构 * Institute of Automation, CAS(中国科学院自动化研究所) School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院) AI Lab, AIGility Cloud Innovation(AIGility云创新AI实验室) North China Electric Power University(华北电力大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Gaoling School of Artificial Intelligence, RUC(中国人民大学高陵人工智能学院) School of Biomedical Engineering, USTC(中国科学技术大学生物医学工程学院) Suzhou Institute for Advance Research, USTC(中国科学技术大学苏州市先进研究院) School of Computer Science and Technology, BJTU(北京理工大学计算机科学与技术学院) Hunan Central South Intelligent Equipment Co., Ltd.(湖南中南智能装备有限公司)

AI总结 TiMem通过时序记忆树实现对话记忆的系统性巩固,提升长时域个性化效果,实现75.30%和76.88%的基准测试准确率。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26934 2026-04-30 cs.CV

World2VLM: Distilling World Model Imagination into VLMs for Dynamic Spatial Reasoning

World2VLM: 将世界模型的想象能力蒸馏到VLM中以实现动态空间推理

Wanyue Zhang, Wenxiang Wu, Wang Xu, Jiaxin Luo, Helu Zhi, Yibin Huang, Shuo Ren, Zitao Liu, Jiajun Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Wuhan AI Research(武汉人工智能研究院)

AI总结 本文提出World2VLM框架,通过蒸馏生成式世界模型的空间想象能力到VLM中,提升动态空间推理性能,优于基线模型和测试时世界模型耦合方法。

Comments The code is available at https://github.com/WanyueZhang-ai/World2VLM. The dataset is available at https://huggingface.co/datasets/WanyueZhang/World2VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26321 2026-04-30 cs.CV

Motion-Driven Multi-Object Tracking of Model Organisms in Space Science Experiments

空间科学实验中模型生物的运动驱动多目标跟踪

Jianing You, Han Wang, Kang Liu, Jiale Ding, Fengjie Chu, Zihan Guo, Shengyang Li

机构 * Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心) School of Space Exploration, University of Chinese Academy of Sciences(中国科学院大学空间探索学院)

AI总结 本文提出ART-Track框架,通过多模型运动估计、运动状态驱动关联和不确定性自适应融合,有效解决空间实验中生物多目标跟踪的挑战,提升轨迹稳定性与身份保持性。

Comments 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25131 2026-04-30 cs.LG cs.AI

Towards Unified Multi-task EEG Analysis with Low-Rank Adaptation

迈向统一的多任务EEG分析与低秩适应

Sicheng Dai, Kai Chen, Hongwang Xiao, Shan Yu, Qiwei Ye

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artifcial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Brain Cognition(脑认知国家重点实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院) State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

AI总结 本文提出MTEEG框架,通过低秩适应模块解决多任务EEG分析中的任务冲突问题,展示了多任务方法在提升性能和降低计算成本方面的优势。

Journal ref EMBC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16902 2026-04-30 cs.AI

Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models

超越文本主导:理解多模态大语言模型的模态偏好

Xinru Yan, Boxi Cao, Yaojie Lu, Hongyu Lin, Weixiang Zhou, Le Sun, Xianpei Han

机构 * University of Chinese Academy of Sciences(中国科学院大学) Chinese Information Processing Laboratory(中文信息处理实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

AI总结 本文研究多模态大语言模型的模态偏好现象,通过新基准和模态选择率指标量化发现,大多数模型表现出显著的视觉偏好,并通过层间探测揭示偏好在中后期层逐步出现,进而用于诊断跨模态幻觉,提升模型可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11731 2026-04-30 cs.CL

Thinking with Drafting: Optical Decompression via Logical Reconstruction

用草图思考:通过逻辑重建实现光学解压

Jingxuan Wei, Honghao He, Caijun Jia, Siyuan Li, Zheng Sun, Yuhang Xu, Yuanyuan Lin, Linzhuang Sun, Yuchen Wu, Bihui Yu, Xiangxiang Zhang, Cheng Tan

机构 * Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) University of Chinese Academy of Sciences 3 ByteDance 4 Westlake University(中国科学院大学 3 字节跳动 4 西湖大学) Key Laboratory of Computing Power Network(计算功率网络重点实验室) Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(信息安全,教育部,山东计算机科学中心(济南国家超级计算中心),齐鲁工业大学(山东省科学院))

AI总结 本文提出通过逻辑重建实现光学解压,引入TwD方法,利用领域特定语言作为中间表示,以生成可执行代码的视觉证明,建立视觉生成与逻辑验证的闭环系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25914 2026-04-29 cs.CL

DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios

DV-World:在现实场景中评估数据可视化代理的基准测试

Jinxiang Meng, Shaoping Huang, Fangyu Lei, Jingyu Guo, Haoxiang Liu, Jiahao Su, Sihan Wang, Yao Wang, Enrui Wang, Ye Yang, Hongze Chai, Jinming Lv, Anbang Yu, Huangjing Zhang, Yitong Zhang, Yiming Huang, Zeyao Ma, Shizhu He, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Renmin University of China(中国人民大学)

AI总结 DV-World通过260个任务评估数据可视化代理在现实专业生命周期中的能力,涵盖表格操作、视觉进化和意图对齐,采用混合评估框架揭示现有模型在复杂数据可视化挑战中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25642 2026-04-29 cs.CV cs.AI

Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models

预填充阶段干预用于缓解大视觉-语言模型中的幻觉

Chengsheng Zhang, Chenghao Sun, Xinyan Jiang, Wei Li, Xinmei Tian

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Advanced Research Institute, Chinese Academy of Sciences(上海先进研究院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出PTI方法,在预填充阶段干预KV缓存以减少幻觉,通过模态感知方向修正错误表示,提升模型可靠性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏