arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

共收录 1952
2604.17915 2026-04-21 cs.CV

OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models

OneDrive: 统一的多范式驾驶与视觉-语言-动作模型

Yiwei Zhang, Xuesong Chen, Jin Gao, Hanshi Wang, Fudong Ge, Weiming Hu, Shaoshuai Shi, Zhipeng Zhang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA School of Artificial Intelligence, University of Chinese Academy of Sciences AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University Voyager Research, Didi Chuxing School of Information Science(多模态人工智能系统国家重点实验室,中国科学院自动化所人工智能学院,中国科学院大学,AutoLab,上海交通大学人工智能学院,Voyager Research,滴滴出行,信息科学与技术学院)

AI总结 本文提出基于预训练视觉语言模型的统一自动驾驶框架,通过单一Transformer解码器整合异构解码行为,实现多任务联合优化,实验表明在nuScenes和NAVSIM上取得最优性能,且推理效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26721 2026-04-21 cs.AI cs.MM

MaLoRA: Gated Modality LoRA for Key-Space Alignment in Multimodal LLM Fine-Tuning

MaLoRA:基于关键空间对齐的门控模态LoRA

Xinhan Zheng, Huyu Wu, Xueting Wang, Duo Su, Haiyun Jiang

机构 * University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-鲁维尔研究所) Rajiv Gandhi University(拉贾·甘地大学) Palmer Research Laboratories(帕勒实验室)

AI总结 本文提出MaLoRA,通过门控机制对齐多模态LLM微调中的关键空间,揭示文本偏见源于注意力键空间内在不匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24235 2026-04-21 cs.LG cs.AI

PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward Modeling

PaTaRM:通过偏好感知任务自适应奖励模型弥合成对和点状信号

Ai Jian, Jingqing Ruan, Xing Ma, Xiaoyun Zhang, Dailin Li, Weipeng Zhang, Ke Zeng, Xunliang Cai

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Meituan(美团) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 PaTaRM通过偏好感知奖励机制实现成对和点状信号的弥合,无需显式评分标签,提升奖励模型的鲁棒性和任务适应性,实验显示在多个基准测试中表现优异。

Comments ACL Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13464 2026-04-21 cs.CL cs.AI

Estimating Commonsense Plausibility through Semantic Shifts

通过语义转变估计常识可信度

Wanqing Cui, Wei Huang, Keping Bi, Jiafeng Guo, Xueqi Cheng

机构 * CAS Key Lab of Network Data Science and Technology, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院网络数据科学与技术重点实验室,计算技术研究所,中国科学院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

AI总结 本文提出ComPaSS框架,通过测量在添加常识信息时的语义变化来量化常识可信度,验证了判别方法在细粒度常识评估中的优势,并展示了视觉语言模型在结合ComPaSS后的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17451 2026-04-21 cs.CV

SegTTA: Training-Free Test-Time Augmentation for Zero-Shot Medical Imaging Segmentation

SegTTA:无需训练的测试时增强用于零样本医学图像分割

Yihong Yao, Chunlei Li, Canxuan Gang, Wenzhi Hu, Zeyu Zhang, Hao Zhang, Xiaoyan Li

机构 * AI Geeks Qingdao Municipal Hospital(青岛市人民医院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 SegTTA通过结合四种增强技术与多模型加权投票,提升医学图像分割性能,实验显示在三个数据集上均有效,且在肝血管多类数据集上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17428 2026-04-21 cs.CV cs.AI

Long-CODE: Isolating Pure Long-Context as an Orthogonal Dimension in Video Evaluation

Long-CODE:将纯长上下文作为视频评估中的一个正交维度

Zhijiang Tang, Jiaxin Qi, Bing Zhao, Jianqiang Huang

机构 * Hangzhou Institute for Advanced Study, UCAS(浙江大学杭州高等研究院) Computer Network Information Center, CAS(中国科学院计算机网络信息中心) Department of AI Infrastructure, Bilibili Inc.(B站人工智能基础设施部)

AI总结 本文提出Long-CODE,通过分离长上下文属性,设计专门的长视频评估框架,解决传统短视频评估指标在长视频中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17384 2026-04-21 cs.LG

Towards a Data-Parameter Correspondence for LLMs: A Preliminary Discussion

迈向大语言模型的数据-参数对应关系:初步讨论

Ou Wu

机构 * HIAS, University of Chinese Academy of Sciences(中国科学院大学杭州研究院)

AI总结 本文探讨大语言模型优化中数据与参数的统一对应关系,揭示数据处理与模型调整在统计流形上的几何结构,提出数据剪枝、低秩适应和安全隐私保护的三种核心对应关系。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17337 2026-04-21 cs.AI

AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning

AutoSearch: 通过强化学习实现高效的代理RAG自适应搜索深度

Jingbo Sun, Wenyue Chong, Songjun Tu, Qichao Zhang, Yaocheng Zhang, Jiajun Chai, Xiaohan Wang, Wei Lin, Guojun Yin, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所SKL-MAIS实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉学科学院) Meituan(美团)

AI总结 本文提出AutoSearch框架,通过强化学习动态调整搜索深度,在保证搜索质量的同时提升效率,实现在复杂问题上的准确率与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17284 2026-04-21 cs.AI

HalluClear: Diagnosing, Evaluating and Mitigating Hallucinations in GUI Agents

HalluClear:诊断、评估和缓解GUI代理中的幻觉

Chao Jin, Wenkui Yang, Hao Sun, Yuqi Liao, Qianyi Jiang, Kai Zhou, Jie Cao, Ran He, Huaibo Huang

机构 * MAIS&NLPR, Institute of Automation, Chinese Academy of Sciences(自动化研究所人工智能与自然语言处理实验室,中国科学院) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Meituan(美团)

AI总结 HalluClear通过引入专门的幻觉分类、校准的评估流程和闭环推理方案,有效减少GUI代理中的幻觉,提升自动化可靠性。

Comments 47 pages, 44 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02073 2026-04-21 cs.CV

PLUME: Latent Reasoning Based Universal Multimodal Embedding

PLUME:基于潜在推理的通用多模态嵌入

Chenwei He, Xiangzhao Hao, Tianyu Yang, Yuxiang Ma, Yuheng Jia, Lingxiang Wu, Chaoyang Zhao, Haiyun Guo, Jinqiao Wang

机构 * Southeast University(东南大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 PLUME通过引入潜在推理框架改进通用多模态嵌入,用连续潜在状态的自回归滚动替代显式推理链,减少推理开销并提升效率,优于传统显式推理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19880 2026-04-21 cs.LG cs.AI

What If Consensus Lies? Selective-Complementary Reinforcement Learning at Test Time

如果共识是谎言呢?测试时的选择性互补强化学习

Dong Yan, Jian Liang, Yanbo Wang, Shuo Lu, Ran He, Tieniu Tan

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学)

AI总结 本文提出SCRL框架,通过选择性正伪标签和熵门控负伪标签减少标签噪声影响,提升测试时强化学习的鲁棒性和泛化能力。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22839 2026-04-21 cs.AI

DeepPresenter: Environment-Grounded Reflection for Agentic Presentation Generation

DeepPresenter: 基于环境的反思以实现代理演示生成

Hao Zheng, Guozhao Mo, Xinru Yan, Qianhao Yuan, Wenkai Zhang, Xuanang Chen, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory(中国信息处理实验室) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 DeepPresenter通过自主规划和渲染中间幻灯片艺术来支持长周期优化,利用环境感知状态进行反馈驱动的改进,实现超越固定流程的演示生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04745 2026-04-21 cs.AI cs.IR

KnowMe-Bench: Benchmarking Person Understanding for Lifelong Digital Companions

KnowMe-Bench:为终身数字伴侣的人理解进行基准测试

Tingyu Wu, Zhisheng Chen, Ziyan Weng, Shuhe Wang, Chenglong Li, Shuo Zhang, Sen Hu, Silin Wu, Qizhen Lan, Huacan Wang, Ronghao Chen

机构 * UCAS(中国科学院大学) QuantaAlpha PKU(北京大学) CITYU-DG(城市大学-数据科学) HAINNU(海南师范大学) UTHealth(德克萨斯大学健康科学中心) NUS(新加坡国立大学) IAPM (Guangdong)(粤港澳大湾区人工智能研究院)

AI总结 KnowMe-Bench通过长篇自传式叙述构建,评估模型在事实记忆、主观状态归因和原则推理方面的能力,揭示检索增强系统在时间相关解释和高层推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08480 2026-04-21 cs.CV cs.IR

Compressing then Matching: An Efficient Pre-training Paradigm for Multimodal Embedding

压缩后再匹配:一种高效的多模态嵌入预训练范式

Da Li, Yuxiao Luo, Keping Bi, Jiafeng Guo, Wei Yuan, Biao Yang, Yan Wang, Fan Yang, Tingting Gao, Guorui Zhou

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Kuaishou Technology(快手科技)

AI总结 本文提出CoMa,一种高效的多模态嵌入预训练方法,通过压缩预训练阶段提升对比学习效率,实现多模态嵌入模型的高效优化。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02506 2026-04-21 cs.IR cs.AI

R3A: Reinforced Reasoning for Relevance Assessment for RAG in User-Generated Content Platforms

R3A:强化推理用于用户生成内容平台中的RAG相关性评估

Xiaowei Yuan, Lei Jin, Haoxin Zhang, Ziyang Huang, Yan Gao, Yi Wu, Yao Hu, Jun Zhao, Kang Liu

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(复杂系统认知与决策智能重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Xiaohongshu Inc.(小红书公司)

AI总结 R3A通过意图推理和证据定位解决UGC平台中相关性评估的挑战,提升模型在稀疏反馈和非对称相关性中的表现。

Comments Accepted by ACL Industry 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02204 2026-04-21 cs.RO

TacMan-Turbo: Proactive Tactile Control for Robust and Efficient Articulated Object Manipulation

TacMan-Turbo:主动触觉控制用于稳健高效的机械臂物体操控

Zihang Zhao, Zhenghao Qi, Yuyang Li, Leiyao Cui, Zhi Han, Lecheng Ruan, Yixin Zhu

机构 * Peking University(北京大学) State Key Lab of General AI at Peking University(北京大学通用人工智能国家重点实验室) PKU-BingJi Joint Laboratory for Artificial Intelligence(北京大学-百度智云人工智能联合实验室) Wuhan Major Scientific and Technological Special Program(武汉重大科技专项) Hubei Embodied Intelligence Foundation Model Research and Development Program(湖北省具身智能基础模型研发计划) National Comprehensive Experimental Base for Governance of Intelligent Society(智能社会治理国家综合实验基地) LeapZenith AI Research(LeapZenith人工智能研究) Tsinghua University(清华大学) Embodied Intelligence Lab(具身智能实验室) PKU-Wuhan Institute for Artificial Intelligence(北京大学-武汉人工智能研究院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出TacMan-Turbo框架,通过主动触觉控制解决机械臂物体操控中有效性与效率的平衡问题,在200种模拟和真实物体上实现100%成功率,显著提升时间效率、动作效率和轨迹平滑度。

Comments Accepted for publication in the IEEE Transactions on Automation Science and Engineering (T-ASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04509 2026-04-21 cs.CL

ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection

ErrorRadar:通过错误检测基准测试多模态大语言模型的复杂数学推理能力

Yibo Yan, Shen Wang, Jiahao Huo, Hang Li, Boyan Li, Jiamin Su, Xiong Gao, Yi-Fan Zhang, Tianlong Xu, Zhendong Chu, Aoxiao Zhong, Kun Wang, Hui Xiong, Philip S. Yu, Xuming Hu, Qingsong Wen

机构 * Squirrel AI HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) MSU(密歇根州立大学) UCAS(中国科学技术大学) University of Illinois at Chicago(伊利诺伊大学香槟分校)

AI总结 ErrorRadar通过错误检测任务评估多模态大语言模型在复杂数学推理中的能力,包含2500个高质量K-12数学问题,实验显示GPT-4o仍比人类评价差10%。

Comments Accepted by The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026, Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16893 2026-04-21 cs.CV cs.LG

EasyVideoR1: Easier RL for Video Understanding

EasyVideoR1: 更容易的视频理解强化学习

Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng Fu, Nan Duan, Jiaqi Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院)

AI总结 本文提出EasyVideoR1框架,通过高效预处理、统一奖励系统和混合训练策略,提升视频理解任务的训练效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16884 2026-04-21 cs.CV

Bias-constrained multimodal intelligence for equitable and reliable clinical AI

具有偏见约束的多模态智能用于公平且可靠的临床AI

Cheng Li, Weijian Huang, Jiarun Liu, Hao Yang, Qi Yang, Song Wu, Ye Li, Hairong Zheng, Shanshan Wang

机构 * Paul C. Lauterbur Research Center for Biomedical Imaging(Paul C. Lauterbur生物医学成像研究中心) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学) Department of Radiology, Beijing Chaoyang Hospital, Capital Medical University(首都医科大学北京朝阳医院放射科) Department of Urology, South China Hospital, Medical School, Shenzhen University(深圳大学南方医院泌尿科) Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 本文提出BiasCareVL框架,通过在模型设计中直接引入偏见控制,解决医疗影像与文本整合中公平性和可靠性问题,展示了其在多任务和基准测试中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16570 2026-04-21 cs.LG cs.AI

In Search of Lost DNA Sequence Pretraining

寻找丢失的DNA序列预训练

Zhijiang Tang, Jiaxin Qi, Yan Cui, Jinli Ou, Yuhua Zheng, Jianqiang Huang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

AI总结 本文揭示了DNA预训练中三个关键问题:下游数据集不恰当、邻域遮蔽策略缺陷及词汇讨论不足,并提出评估标准、任务设计指导和词汇分析,通过实验验证问题重要性,最终提出标准化测试平台以推动基因组基础模型发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16475 2026-04-21 cs.NE cs.AI

Spike-driven Large Language Model

基于脉冲的大型语言模型

Han Xu, Xuerui Qiu, Baiyu Chen, Xinhao Luo, Xingrun Xing, Jiahong Zhang, Bo Lei, Tiejun Huang, Bo Xu, Guoqi Li

机构 * Institute of Automation, Chinese Academy of Sciences, Beijing 100190, China School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing 100049, China Brain-Inspired Models Group, Beijing Academy of Artificial Intelligence, Beijing 100862, China School of Future Technology, University of Chinese Academy of Sciences, Beijing 101408, China Zhongguancun Academy, Beijing 100094, China Pengcheng Laboratory, Guangdong 518055, China School of Advanced Inter-disciplinary Sciences, University of Chinese Academy of Sciences, Beijing 101408, China School of Computer Science, Peking University, Beijing 100871, China Key Laboratory of Brain Cognition Spiking Intelligence Lab, Tianqiao \& Chirssy Chen Institute, Shanghai 201203, China

AI总结 本文提出SDLLM,通过稀疏加法替代密集矩阵乘法,结合gamma-SQP编码和对称量化机制,有效降低脉冲 firing 率并提升性能,实验表明在脉冲基础上实现更高效且准确的大型语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16313 2026-04-21 cs.IR cs.AI cs.CL

MARA: A Multimodal Adaptive Retrieval-Augmented Framework for Document Question Answering

MARA:一种多模态自适应检索增强框架用于文档问答

Hui Wu, Haoquan Zhai, Yuchen Li, Hengyi Cai, Peirong Zhang, Yidan Zhang, Lei Wang, Chunle Wang, Yingyan Hou, Shuaiqiang Wang, Dawei Yin

机构 * Key Laboratory of Target Cognition and Application Technology (TCAT), AIRI, CAS(目标认知与应用技术重点实验室(TCAT),空气动力研究所,中国科学院) School of Electronic, Electrical and Communication Engineering, UCAS(电子、电气与通信工程学院,中国科学院大学) Aerospace Information Research Institute, Chinese Academy of Sciences(航天信息研究所,中国科学院) Baidu Inc.(百度公司)

AI总结 MARA框架通过引入查询自适应机制提升多模态文档检索与生成的精度和质量,实验表明其在多模态问答基准上优于现有最先进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23885 2026-04-21 cs.CV

Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training

通过现实场景合成和文档感知训练实现真实世界文档解析

Gengluo Li, Pengyuan Lyu, Chengquan Zhang, Huawen Shen, Liang Wu, Xingyu Wan, Gangyan Zeng, Han Hu, Can Ma, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Tencent(腾讯) Nankai University(南开大学) University of Chinese Academy of Sciences(中国科学院大学) Nanjing University of Science and Technology(南京理工大学)

AI总结 本文提出数据训练协同框架,通过现实场景合成和文档感知训练提升文档解析的准确性和鲁棒性,构建了Wild-OmniDocBench基准,并在1B参数MLLM中实现了跨扫描/数字和真实世界场景的优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02618 2026-04-21 cs.CV

Mind the Way You Select Negative Texts: Pursuing the Distance Consistency in OOD Detection with VLMs

注意你选择负样本的方式:在使用VLMs进行OOD检测时追求距离一致性

Zhikang Xu, Qianqian Xu, Zitai Wang, Cong Hua, Sicong Li, Zhiyong Yang, Qingming Huang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与信息安全学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 本文提出InterNeg框架,通过统一的跨模态距离增强提升OOD检测性能,实验显示在ImageNet和Near-OOD基准上取得显著改进。

Comments Accepted by the main track of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11528 2026-04-21 cs.CR cs.AI cs.CL

Stop Tracking Me! Proactive Defense Against Attribute Inference Attack in LLMs

别跟踪我!对抗大语言模型中属性推断攻击的主动防御

Dong Yan, Jian Liang, Ran He, Tieniu Tan

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本文提出TRACE-RPS框架,通过细粒度匿名化和推断阻止优化,有效降低大语言模型中属性推断准确性,实现隐私保护与模型效用的平衡。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12950 2026-04-21 cs.AI

NumCoKE: Ordinal-Aware Numerical Reasoning over Knowledge Graphs with Mixture-of-Experts and Contrastive Learning

NumCoKE: 基于混合专家和对比学习的图知识中有序意识数值推理

Ming Yin, Zongsheng Cao, Qiqing Xia, Chenyang Tu, Neng Gao

机构 * State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Department of Information Science, Tsinghua University(清华大学信息学院)

AI总结 本文提出NumCoKE框架,通过混合专家和对比学习解决知识图谱中数值推理的语义整合不足和有序区分困难问题,实验表明其在不同属性分布下表现优越。

Comments Update

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09953 2026-04-20 cs.CL

ATTNPO: Attention-Guided Process Supervision for Efficient Reasoning

ATTNPO:基于注意力的高效推理过程监督

Shuaiyi Nie, Siyu Ding, Wenyuan Zhang, Linhao Yu, Tianmeng Yang, Yao Chen, Weichong Yin, Yu Sun, Hua Wu, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Baidu Inc.(百度公司) Tianjin University(天津大学)

AI总结 本文提出ATTNPO,通过利用模型内在注意力信号进行步骤级信用分配,有效减少推理长度并提升性能,适用于9个基准测试。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15923 2026-04-20 cs.SD cs.CV

Hierarchical Codec Diffusion for Video-to-Speech Generation

层次编码扩散用于视频到语音生成

Jiaxin Ye, Gaoxiang Cong, Chenhui Wang, Xin-Cheng Wen, Zhaoyang Li, Boyuan Cao, Hongming Shan

机构 * Fudan University(复旦大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 本文提出HiCoDiT,利用残差向量量化编码的层次结构,通过低层和高层块生成不同层级的语音令牌,以实现强音频视觉对齐,实验表明其在保真度和表达性上优于基线。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15821 2026-04-20 cs.DC cs.LG

Breaking the Training Barrier of Billion-Parameter Universal Machine Learning Interatomic Potentials

突破十亿参数通用机器学习互原子势的训练障碍

Yuanchang Zhou, Hongyu Wang, Yiming Du, Yan Wang, Mingzhen Li, Siyu Hu, Xiangyu Zhang, Weijian Liu, Chen Wang, Zhuoqiang Guo, Long Wang, Jingde Bu, Yutong Lu, Guangming Tan, Weile Jia

机构 * State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所 processors 国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Independent Researcher(独立研究者) Sun Yat-Sen University(中山大学)

AI总结 本文提出MatRIS-MoE和Janus框架,解决十亿参数uMLIP训练中的高维分布式训练与计算效率问题,将训练时间从周缩短至小时,为AI4S基础模型树立新标杆。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15814 2026-04-20 cs.CV cs.RO

Continual Hand-Eye Calibration for Open-world Robotic Manipulation

连续手眼校准用于开放世界机器人操作

Fazeng Li, Gan Sun, Chenxi Liu, Yao He, Wei Cong, Yang Cong

机构 * School of Automation Science and Engineering, South China University of Technology(华南理工大学自动化科学与工程学院) State Key Laboratory of Robotics, the Institutes for Robotics and Intelligent Manufacturing, Chinese Academy of Sciences(中国科学院机器人研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出连续手眼校准框架,通过空间重放策略和结构保持蒸馏,解决开放世界中持续学习中的灾难性遗忘问题,实验验证其在多个数据集上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏