arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

共收录 1952
2604.15701 2026-04-20 cs.CL

Improving Reasoning Capabilities in Small Models through Mixture-of-Layers Distillation with Stepwise Attention on Key Information

通过关键信息的分步注意力混合层蒸馏提升小模型的推理能力

Yao Chen, Jiawei Sheng, Wenyuan Zhang, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

AI总结 本文提出一种基于分步注意力的混合层蒸馏方法,通过引导学生模型逐步聚焦关键信息,提升小模型的推理能力,并在多个数学和常识推理数据集上取得一致性能提升。

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15370 2026-04-20 cs.CR cs.LG

TopFeaRe: Locating Critical State of Adversarial Resilience for Graphs Regarding Topology-Feature Entanglement

TopFeaRe: 在拓扑-特征纠缠视角下定位图的对抗鲁棒性临界状态

Xinxin Fan, Wenxiong Chen, Quanliang Jing, Chi Lin, Shaoye Luo, Wenbo Song, Yunfeng Lu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Dalian University of Technology(大连理工大学) Beihang University(北京航空航天大学)

AI总结 本文提出TopFeaRe方法,通过定位图的对抗鲁棒性临界状态,结合复杂动态系统理论,创新性地建模对抗攻击、设计拓扑-特征纠缠函数,并验证了在多个真实数据集上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02210 2026-04-20 cs.CV

HiFi-Inpaint: Towards High-Fidelity Reference-Based Inpainting for Generating Detail-Preserving Human-Product Images

HiFi-Inpaint:迈向高保真参考基于修复生成细节保留的人-产品图像

Yichen Liu, Donghao Zhou, Jie Wang, Xin Gao, Guisheng Liu, Jiatong Li, Quanwei Zhang, Qiang Lyu, Lanqing Guo, Shilei Wen, Weiqiang Wang, Pheng-Ann Heng

机构 * University of Chinese Academy of Sciences(中国科学院大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学)

AI总结 本文提出HiFi-Inpaint框架,通过Shared Enhancement Attention和Detail-Aware Loss解决人-产品图像生成中的细节保留问题,并构建了HP-Image-40K数据集,实验表明其在生成高保真图像方面表现优异。

Comments Accepted by CVPR 2026 (Project page: https://correr-zhou.github.io/HiFi-Inpaint/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05638 2026-04-20 cs.CV

SurgMotion: A Video-Native Foundation Model for Universal Understanding of Surgical Videos

SurgMotion: 一种用于外科视频通用理解的视频原生基础模型

Jinlin Wu, Felix Holm, Chuxi Chen, An Wang, Yaxin Hu, Xiaofan Ye, Zelin Zang, Miao Xu, Lihua Zhou, Huai Liao, Danny T. M. Chan, Ming Feng, Wai S. Poon, Hongliang Ren, Dong Yi, Nassir Navab, Gaofeng Meng, Jiebo Luo, Hongbin Liu, Zhen Lei

机构 * Center for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences, Hong Kong, China(人工智能与机器人中心,香港科学与创新研究院,中国科学院,香港,中国) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院,北京,中国) Computer Aided Medical Procedures, Technical University of Munich, Munich, Germany(医学辅助程序,慕尼黑技术大学,德国慕尼黑) Electronic Engineering Department, The Chinese University of Hong Kong, Hong Kong, China(电子工程系,香港中文大学,香港,中国) Neuromedical Centre, Hong Kong University Shenzhen Hospital, Shenzhen, China(神经医学中心,香港大学深圳医院,深圳,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Department of Respiratory Medicine, The First Affiliated Hospital of Sun Yat-sen University, Guangzhou, China(呼吸科,中山大学附属第一医院,广州,中国)

AI总结 SurgMotion通过引入视频原生基础模型,将学习范式从像素级重建转向潜在运动预测,通过三种关键技术改进提升外科视频理解能力,实验表明其在手术流程识别、动作三元组识别和技能评估等任务中均取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10959 2026-04-20 cs.LG cs.AI cs.CL stat.ML

Revisiting Entropy Regularization: Adaptive Coefficient Unlocks Its Potential for LLM Reinforcement Learning

重新审视熵正则化:自适应系数解锁其在大语言模型强化学习中的潜力

Xiaoyun Zhang, Xiaojian Yuan, Di Huang, Wang You, Chen Hu, Jingqing Ruan, Ai Jian, Kejiang Chen, Xing Hu

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学) StepFun Inc(StepFun公司)

AI总结 本文重新审视熵正则化在强化学习中的应用,提出自适应熵正则化框架,通过动态平衡探索与利用提升数学推理性能。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13215 2026-04-20 cs.CV

DVP-MVS++: Synergize Depth-Normal-Edge and Harmonized Visibility Prior for Multi-View Stereo

DVP-MVS++: 融合深度-法线-边缘与协调视图先验以实现多视图立体摄影

Zhenlong Yuan, Dapeng Zhang, Zehao Li, Chengxuan Qian, Jianing Chen, Yinda Chen, Kehua Chen, Tianlu Mao, Zhaoxin Li, Hao Jiang, Zhaoqi Wang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) DSLAB, School of Information Science & Engineering, Lanzhou University(兰州大学信息科学与工程学院DSLAB) School of Mathematical Science, Jiangsu University(江苏大学数学学院) MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学脑科学与智能感知教育部重点实验室) Agricultural Information Institute, Chinese Academy of Agricultural Sciences(中国农业科学院农业信息研究所) Key Laboratory of Agricultural Big Data, Ministry of Agriculture and Rural Affairs(农业农村部农业大数据重点实验室)

AI总结 本文提出DVP-MVS++方法,通过融合深度-法线-边缘对齐和协调跨视图先验,提升多视图立体摄影中鲁棒性和视图感知的补丁变形能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22171 2026-04-20 cs.CV

An Empirical Study of Validating Synthetic Data for Text-Based Person Retrieval

基于文本的人检索中合成数据验证的实证研究

Min Cao, Yuxin Lu, Ziyin Zeng, Dong Yi, Jinqiao Wang, Mang Ye

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Frontis Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artifcial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Wuhan AI Research, Wuhan, China(武汉人工智能研究所,武汉,中国) School of Computer Science, Wuhan University(武汉大学计算机学院)

AI总结 本文首次系统研究文本基于人检索中合成数据的有效性,提出统一合成 pipeline 并通过实验揭示其作为替代或补充的真实数据的实用性。

Comments 20 pages,13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07520 2026-04-20 cs.CV cs.IR

From Limited Labels to Open Domains:An Efficient Learning Method for Drone-view Geo-Localization

从有限标签到开放领域:一种用于无人机视角地理定位的高效学习方法

Zhongwei Chen, Zhao-Xu Yang, Hai-Jun Rong, Jiawei Lang, Guoqi Li

机构 * State Key Laboratory for Strength and Vibration of Mechanical Structures(强度与振动机械结构国家重点实验室) Shaanxi Key Laboratory of Environment and Control for Flight Vehicle(飞行器环境与控制陕西省重点实验室) School of Aerospace Engineering(航空工程学院) Xi’an Jiaotong University(西安交通大学) Institute of Automation(自动化研究所) Chinese Academy of Sciences(中国科学院) School of Artificial Intelligence(人工智能学院) University of Chinese Academy of Sciences(中国科学院大学) Peng Cheng Laboratory(鹏城实验室)

AI总结 本文提出CDIKTNet,通过有限监督实现无人机视角地理定位的跨域不变知识迁移,解决传统方法依赖配对数据和跨视图相关性学习难题,提升少样本和跨域初始化性能。

Comments Accepted by IEEE Transactions on Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15090 2026-04-17 cs.CV

Beyond Visual Cues: Semantic-Driven Token Filtering and Expert Routing for Anytime Person ReID

超越视觉线索:基于语义的标记过滤和专家路由用于即时人物重识别

Jiaxuan Li, Xin Wen, Zhihang Li

机构 * Tsinghua University(清华大学) Independent Researcher(独立研究者) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出STFER框架,利用大视觉-语言模型生成身份一致的文本,提升对服装变化和模态转换的鲁棒性,通过语义驱动的标记过滤和专家路由实现多场景鲁棒性,实验表明模型在AT-USTC数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14580 2026-04-17 cs.CV cs.MM cs.SD

TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation

TurboTalk: 一步生成音频驱动的虚拟角色的渐进蒸馏

Xiangyu Liu, Feng Gao, Xiaomei Zhang, Yong Zhang, Xiaoming Wei, Zhen Lei, Xiangyu Zhu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Meituan(美团) The Hong Kong Polytechnic University(香港理工大学) CAIR, HKISI, CAS(中国科学院CAS HKISI CAIR)

AI总结 本文提出TurboTalk框架,通过分布匹配蒸馏和对抗蒸馏逐步压缩多步音频驱动视频扩散模型,实现单步生成高质量虚拟角色,推理速度提升120倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14399 2026-04-17 cs.RO cs.AI cs.SY eess.SY

SpaceMind: A Modular and Self-Evolving Embodied Vision-Language Agent Framework for Autonomous On-orbit Servicing

SpaceMind:一种模块化且自我进化的具身视觉-语言代理框架,用于自主在轨服务

Aodi Wu, Haodong Han, Xubo Luo, Ruisuo Wang, Shan He, Xue Wan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心)

AI总结 本文提出SpaceMind框架,通过模块化和自我进化机制,实现自主在轨服务中的视觉感知、三维空间推理和多阶段任务执行,验证了其在不同环境下的鲁棒性和适应性。

Comments 23 pages, 6 figures, 7 tables. Code available at https://github.com/wuaodi/SpaceMind

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14202 2026-04-17 q-bio.NC cs.AI

Bridging scalp and intracranial EEG in BCI via pretrained neural representations and geometric constraint embedding

通过预训练神经表示和几何约束嵌入桥接头皮和脑内EEG

Yihang Dong, Changhong Jing, Shuqiang Wang

机构 * Shenzhen Institutes of Advanced Technology(深圳先进技术研究院) Chinese Academy of Sciences(中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出统一框架提升EEG-iEEG表示,通过几何结构指导功能,结合预训练模型和扩散过程生成高保真神经信号,提升BCI性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11600 2026-04-17 cs.CV

Geoparsing: Diagram Parsing for Plane and Solid Geometry with a Unified Formal Language

几何解析:一种统一形式语言用于平面和立体几何的图表解析

Peijie Wang, Ming-Liang Zhang, Jun Cao, Chao Deng, Dekang Ran, Hongda Sun, Pi Bu, Xuan Zhang, Yingyao Wang, Jun Song, Bo Zheng, Fei Yin, Cheng-Lin Liu

机构 * MAIS, Institute of Automation of Chinese Academy of Sciences(中国科学院自动化研究所MAIS) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Future Living Lab of Alibaba(阿里巴巴未来生活实验室)

AI总结 本文提出一种统一形式语言,结合平面和立体几何,构建了GDP-29K数据集,通过监督微调与可验证奖励的强化学习提升几何解析性能,提升MLLMs的几何推理能力。

Comments Accepted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23998 2026-04-17 cs.CL

Sparse Growing Transformer: Training-Time Sparse Depth Allocation via Progressive Attention Looping

稀疏增长变换器:通过渐进注意力循环实现训练时稀疏深度分配

Yao Chen, Yilong Chen, Yinqi Yang, Junyuan Shang, Zhenyu Zhang, Zefeng Zhang, Shuaiyi Nie, Shuohuan Wang, Yu Sun, Hua Wu, HaiFeng Wang, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Baidu Inc.(百度公司)

AI总结 本文提出稀疏增长变换器,通过渐进式注意力循环实现训练时的稀疏深度分配,减少计算冗余并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17512 2026-04-17 cs.CL

Language on Demand, Knowledge at Core: Composing LLMs with Encoder-Decoder Translation Models for Extensible Multilinguality

按需语言,知识为核心:通过编码器-解码器翻译模型组成LLM以实现可扩展的多语言性

Mengyu Bu, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences(智能信息处理重点实验室,计算技术研究所,中国科学院) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

AI总结 本文提出XBridge架构,利用预训练翻译模型实现多语言理解和生成,同时保留LLM作为英语核心处理通用知识,通过轻量级跨模型映射层和最优传输对齐目标,提升多语言生成性能。

Comments ACL 2026 Main Conference. Code: https://github.com/ictnlp/XBridge | Models: https://huggingface.co/collections/ICTNLP/xbridge

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04567 2026-04-17 cs.CV

All Changes May Have Invariant Principles: Improving Ever-Shifting Harmful Meme Detection via Design Concept Reproduction

所有变化可能都有不变原则:通过设计概念再现改进永动有害迷因检测

Ziyou Jiang, Mingyang Li, Junjie Wang, Yuekai Huang, Jie Huang, Zhiyuan Chang, Zhaoyang Li, Qing Wang

机构 * State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) Science and Technology on Integrated Information System Laboratory Institute of Software Chinese Academy of Sciences(软件研究所信息集成系统技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出RepMD方法,通过设计概念再现检测不断变化的有害迷因,利用攻击树定义设计概念图,并指导多模态大语言模型提高检测准确率。

Comments 19 pages, 11 figures, 9 tables accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15946 2026-04-17 cs.LG cs.AI cs.CR

Fall into a Pit, Gain in a Wit: Cognitive-Guided Harmful Meme Detection via Misjudgment Risk Pattern Retrieval

跌入陷阱,获得智慧:通过误判风险模式检索的认知引导有害迷因检测

Wenshuo Wang, Ziyou Jiang, Junjie Wang, Mingyang Li, Jie Huang, Yuekai Huang, Zhiyuan Chang, Feiyan Duan, Qing Wang

机构 * State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) Science and Technology on Integrated Information System Laboratory(集成信息系统技术研究所) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出PatMD方法,通过学习并主动缓解潜在误判风险,识别有害迷因的深层误判风险模式,提升多模态大语言模型的检测能力,实验显示在5项有害检测任务中,F1-score和准确率均显著提升。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14142 2026-04-16 cs.LG cs.AI cs.CL

From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space

从P(y|x)到P(y):在预训练空间中研究强化学习

Yuqiao Tan, Minzheng Wang, Bo Liu, Zichen Liu, Tian Liang, Shizhu He, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Tencent AI Lab(腾讯AI实验室)

AI总结 本文提出PreRL和DSRL方法,通过优化预训练空间中的边际分布P(y),提升LLM推理能力,并通过NSR机制增强推理效果,实验表明DSRL在推理任务中表现优异。

Comments Preprint. Our code is available at https://github.com/Trae1ounG/Pretrain_Space_RLVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20913 2026-04-16 cs.CV

LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding

LongVideo-R1: 低成本长视频理解的智能导航

Jihao Qiu, Lingxi Xie, Xinyue Huo, Qi Tian, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) Huawei Consumer Business Group(华为消费者业务集团)

AI总结 本文提出LongVideo-R1,一种基于多模态大语言模型的智能导航系统,通过高效视频上下文导航减少冗余搜索,提升长视频理解的效率与准确性。

Comments 17 pages, 9 figures, 8 tables, accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08605 2026-04-16 cs.CL cs.AI

ExpSeek: Self-Triggered Experience Seeking for Web Agents

ExpSeek:面向Web代理的自触发经验寻求

Wenyuan Zhang, Xinghua Zhang, Haiyang Yu, Shuaiyi Nie, Bingli Wu, Juwei Yue, Tingwen Liu, Yongbin Li

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Tongyi Lab , Alibaba Group(阿里云实验室,阿里巴巴集团)

AI总结 ExpSeek通过自触发机制实现Web代理的经验主动获取,提升交互能力,实验表明其在不同规模模型上均取得显著性能提升。

Comments ACL 2026 Findings, the code is accessible at https://github.com/WYRipple/ExpSeek

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12460 2026-04-16 cs.CL

Beyond Black-Box Interventions: Latent Probing for Faithful Retrieval-Augmented Generation

超越黑盒干预:用于忠实检索增强生成的潜在探测

Linfeng Gao, Qinggang Zhang, Baolong Bi, Bo Zeng, Zheng Yuan, Zerui Chen, Zhimin Wei, Shenghua Liu, Linlong Xu, Longyue Wang, Weihua Luo, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) The Hong Kong Polytechnic University(香港理工大学) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室(厦门大学),中华人民共和国文化和旅游部,中国)

AI总结 本文提出ProbeRAG框架,通过潜在冲突探测和注意力调节提升检索增强生成的忠实度,解决传统方法在评估知识冲突时的不足。

Comments ACL 2026 Findings; Code is available at https://github.com/LinfengGao/ProbeRAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12941 2026-04-15 cs.CV

Direct Discrepancy Replay: Distribution-Discrepancy Condensation and Manifold-Consistent Replay for Continual Face Forgery Detection

直接不一致重放:分布不一致压缩与流形一致重放用于持续人脸伪造检测

Tianshuo Zhang, Haoyuan Zhang, Siran Peng, Weisong Zhao, Xiangyu Zhu, Zhen Lei

机构 * SAI, UCAS(UCAS模式识别实验室) MAIS, CASIA(中国科学院自动化研究所) IIE, CAS(中国科学院自动化研究所) SCS, UCAS(UCAS智能科学学院) SCSE, FIE, M.U.S.T(法国里尔大学)

AI总结 本文提出分布不一致压缩和流形一致重放方法,通过压缩真实与伪造分布差异并生成兼容当前真实人脸统计的重放样本,有效缓解持续人脸伪造检测中的灾难性遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12632 2026-04-15 cs.LG cs.AI

Calibration-Aware Policy Optimization for Reasoning LLMs

面向推理大语言模型的校准感知策略优化

Ziqi Wang, Xingzhou Lou, Meiqi Wu, Zhengqi Wen, Junge Zhang

机构 * National Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institution of Automation, Chinese Academy of Sciences(认知与复杂系统决策智能国家实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心,清华大学)

AI总结 本文提出CAPO方法,通过引入logistic AUC替代损失和噪声掩码机制,提升推理大语言模型的校准与准确性,实验显示其在多个数学推理基准上校准提升达15%,并在下游任务中进一步提升准确性。

Comments Published as a conference paper at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12559 2026-04-15 cs.CL

FABLE: Fine-grained Fact Anchoring for Unstructured Model Editing

FABLE:面向无结构模型编辑的细粒度事实锚定

Peng Wang, Biyu Zhou, Xuehai Tang, Jizhong Han, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与信息安全学院)

AI总结 FABLE通过分层框架实现细粒度事实注入与整体文本生成的解耦,采用事实优先策略提升细粒度问答性能,同时保持整体编辑能力。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05818 2026-04-15 cs.CV cs.CL cs.IR

WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering

WikiSeeker: 重新思考视觉语言模型在基于知识的视觉问答中的作用

Yingjian Zhu, Xinming Wang, Kun Ding, Ying Wang, Bin Fan, Shiming Xiang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室 (MAIS))

AI总结 本文提出WikiSeeker框架,通过引入多模态检索器和重新定义视觉语言模型的角色,提升多模态检索性能和答案质量,实现在EVQA、InfoSeek和M2KR数据集上的最优表现。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00181 2026-04-15 cs.CV cs.AI

CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning

CamReasoner:通过结构化空间推理强化相机运动理解

Hang Wu, Yujun Cai, Zehao Li, Haonan Ge, Bowen Sun, Junsong Yuan, Yiwei Wang

机构 * University of California, Merced(加州大学梅尔德分校) University of Queensland(昆士兰大学) Ant Group(蚂蚁集团) University of Chinese Academy of Sciences(中国科学院大学) University at Buffalo, State University of New York(纽约州立大学布法罗分校)

AI总结 CamReasoner通过结构化推理框架提升相机运动理解,采用O-T-A范式和大规模推理轨迹集,首次利用强化学习实现逻辑对齐,提升分类和VQA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13789 2026-04-15 cs.CR cs.AI

Uncovering and Aligning Anomalous Attention Heads to Defend Against NLP Backdoor Attacks

揭示并对齐异常注意力头以防御NLP后门攻击

Haotian Jin, Yang Li, Haihui Fan, Lin Shen, Xiangfang Li, Bo Li

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

AI总结 本文提出基于注意力相似性的后门检测方法,通过检测异常注意力头相似性来防御后门攻击,结合头部微调修复污染的注意力头,有效降低攻击成功率并保持下游任务性能。

Journal ref "Proceedings of the 40th AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05167 2026-04-15 cs.LG

FMASH: Advancing Traditional Chinese Medicine Formula Recommendation with Efficient Fusion of Multiscale Associations of Symptoms and Herbs

FMASH:通过高效融合症状与药材的多尺度关联来推进传统中医方剂推荐

Xinhan Zheng, Xueting Wang, Ruotai Li, Huyu Wu, Haopeng Jin, Yehan Yang, Guodong Shan

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出FMASH框架,通过融合症状与药材的多尺度关联,提升中医方剂推荐效果,实验表明其在两个数据集上均优于现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12508 2026-04-15 cs.CV

From Attenuation to Attention: Variational Information Flow Manipulation for Fine-Grained Visual Perception

从衰减到注意:用于细粒度视觉感知的变分信息流操控

Jilong Zhu, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(智能信息处理重点实验室,计算技术研究所,中国科学院(ICT/CAS)) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院(ICT/CAS)) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

AI总结 本文提出变分信息流框架,通过建模问题-答案对相关的视觉显著性作为潜在分布,解决多模态大语言模型在细粒度感知任务中的信息衰减问题,提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12502 2026-04-15 cs.CV cs.AI

SEATrack: Simple, Efficient, and Adaptive Multimodal Tracker

SEATrack: 简单、高效且自适应的多模态跟踪器

Junbin Su, Ziteng Xue, Shihui Zhang, Kun Chen, Weiming Hu, Zhipeng Zhang

机构 * School of Artificial Intelligence (School of Software), Yanshan University(燕山大学人工智能学院(软件学院)) School of Software, Beihang University(北航软件学院) Hebei Key Laboratory of Computer Virtual Technology and System Integration(河北省计算机虚拟技术与系统集成重点实验室) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), CASIA(多模态人工智能系统国家重点实验室(MAIS),CASIA) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院自动化实验室)

AI总结 SEATrack通过跨模态对齐和层次混合专家机制,在RGB-T、RGB-D和RGB-E跟踪任务中实现性能与效率的平衡。

Comments Accepted as a CVPR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏