arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

共收录 1959
2603.17437 2026-03-19 cs.RO

FloorPlan-VLN: A New Paradigm for Floor Plan Guided Vision-Language Navigation

FloorPlan-VLN: 一种新的基于平面图引导的视觉-语言导航范式

Kehan Chen, Yan Huang, Dong An, Jiawei He, Yifei Su, Jing Liu, Nianfeng Liu, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences and School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院自动化研究所新型模式识别实验室,中国科学院人工智能学院) AMap, Alibaba Group(阿里巴巴集团高德地图) BAAI(北京人工智能研究院) Xiaomi Robotics Lab(小米机器人实验室) FiveAges

AI总结 本文提出FloorPlan-VLN范式,利用结构化的语义平面图作为全局空间先验,通过FP-Nav方法实现仅需简洁指令的导航,实验表明其在导航成功率上优于现有方法,验证了平面图引导导航的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17307 2026-03-19 cs.CV cs.AI

Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding

Symphony:一种受认知启发的多智能体系统用于长视频理解

Haiyang Yan, Hongyun Zhou, Peng Xu, Xiaoxue Feng, Mengyi Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Kuaishou Technology(快手科技) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院)

AI总结 本文提出Symphony多智能体系统,通过模拟人类认知模式,提升长视频理解任务的推理能力,实验显示在多个基准测试中表现优异。

Comments Accepted by cvpr2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16966 2026-03-19 cs.CV cs.AI cs.MM cs.SD eess.AS

CineSRD: Leveraging Visual, Acoustic, and Linguistic Cues for Open-World Visual Media Speaker Diarization

CineSRD:利用视觉、听觉和语言线索进行开放世界视觉媒体说话人聚类

Liangbin Huang, Xiaohua Liao, Chaoqun Cui, Shijing Wang, Zhaolong Huang, Yanlong Du, Wenji Mao

机构 * Hujing Digital Media and Entertainment Group(华景数字媒体与娱乐集团) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部门) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)

AI总结 CineSRD通过整合视觉、听觉和语言线索,解决开放世界视觉媒体中说话人识别的挑战,提出统一多模态框架并构建专用基准数据集,验证其在复杂场景下的鲁棒性和泛化能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16944 2026-03-19 cs.CV cs.AI

Omni IIE Bench: Benchmarking the Practical Capabilities of Image Editing Models

Omni IIE Bench:图像编辑模型实际能力的基准测试

Yujia Yang, Yuanxiang Wang, Zhenyu Guan, Tiankun Yang, Chenxi Bao, Haopeng Jin, Jinwen Luo, Xinyu Zuo, Lisheng Duan, Haijin Liang, Jin Ma, Xinming Wang, Ruiwen Tao, Hongzhu Yi

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent(腾讯)

AI总结 本文提出Omni IIE Bench,通过双轨诊断设计评估图像编辑模型在不同语义尺度任务中的一致性,揭示模型在低到高语义任务间性能显著下降的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16448 2026-03-19 cs.AI

TRUST-SQL: Tool-Integrated Multi-Turn Reinforcement Learning for Text-to-SQL over Unknown Schemas

TRUST-SQL:基于工具的多轮强化学习用于未知模式下的文本到SQL

Ai Jian, Xiaoyun Zhang, Wanrou Du, Jingqing Ruan, Jiangbo Pei, Weipeng Zhang, Ke Zeng, Xunliang Cai

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所处理器国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Meituan(美团)

AI总结 本文提出TRUST-SQL,通过工具集成的多轮强化学习解决文本到SQL在未知模式下的问题,通过结构化四阶段协议和Dual-Track GRPO策略提升性能,实验表明在多个基准上取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06396 2026-03-19 cs.AI cs.CR

Efficient LLM Safety Evaluation through Multi-Agent Debate

通过多智能体辩论实现高效的LLM安全评估

Dachuan Lin, Guobin Shen, Zihao Yang, Tianrong Liu, Dongcheng Zhao, Yi Zeng

机构 * Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Super Alignment(北京安全人工智能与超对齐重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) CSE, The Chinese University of Hong Kong(香港中文大学电子工程系) University of Chinese Academy of Sciences(中国科学院大学) Department of Mathematics, The Chinese University of Hong Kong(香港中文大学数学系) Long-term AI(长期人工智能)

AI总结 本文提出多智能体辩论框架,利用HAJailBench基准测试,提升LLM安全评估的可靠性与经济性,验证了少量辩论轮次即可获得显著效果。

Comments 15 pages, 5 figures, 10 tables. Updated abstract to fix an incconsistency issue with the main paper: HAJailBench size (12,000 -> 11,100)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22496 2026-03-19 cs.CV

Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation

MLLMs关注什么以及依赖什么:解释自回归标记生成

Ruoyu Chen, Xiaoqing Guo, Kangwei Liu, Siyuan Liang, Shiming Liu, Qunli Zhang, Laiyuan Wang, Hua Zhang, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) College of Computing and Data Science, NTU(NTU 计算与数据科学学院) Huawei(华为) School of Flexible Electronics, SYSU(SYSU 灵活电子学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(Sun Yat-sen 大学深圳校区计算机科学与技术学院)

AI总结 本文提出EAGLE框架,通过轻量级黑盒方法解释MLLMs的自回归标记生成,量化语言先验和感知证据的影响,提升模型可解释性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03887 2026-03-19 cs.CV

OccTENS: 3D Occupancy World Model via Temporal Next-Scale Prediction

OccTENS: 通过时间下一尺度预测实现的3D占用世界模型

Bu Jin, Songen Gu, Xiaotao Hu, Yupeng Zheng, Xiaoyang Guo, Qian Zhang, Xiaoxiao Long, Wei Yin

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Chinese Academy of Sciences(中国科学院大学) Horizon Robotics(地平线机器人) Nanjing University(南京大学)

AI总结 本文提出OccTENS,一种能高效生成高质量长期占用场景的生成模型,通过时间下一尺度预测任务解决效率、时间退化和可控性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05591 2026-03-19 cs.AI

MLlm-DR: Towards Explainable Depression Recognition with MultiModal Large Language Models

MLlm-DR: 向多模态大语言模型的可解释性抑郁识别迈进

Wei Zhang, Juan Chen, En Zhu, Wenhong Cheng, YunPeng Li, Yanbo J. Wang

机构 * National University of Defense Technology(国防科技大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Mental Health Center, Shanghai Jiao Tong University School of Medicine(上海精神卫生中心,上海交通大学医学院) Nanjing Industria Tenebris Information Technology Co., Ltd.(南京Industria Tenebris信息技术有限公司) National University of Uzbekistan named after Mirzo Ulugbek(乌兹别克斯坦Mirzo Ulugbek命名的国立大学)

AI总结 本文提出MLlm-DR模型,通过多模态大语言模型实现可解释的抑郁识别,结合小型LLM和轻量级查询模块,提升诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16620 2026-03-18 cs.CV

TCATSeg: A Tooth Center-Wise Attention Network for 3D Dental Model Semantic Segmentation

TCATSeg:一种针对3D牙科模型语义分割的牙齿中心导向注意力网络

Qiang He, Wentian Qu, Jiajia Dai, Changsong Lei, Shaofeng Wang, Feifei Zuo, Yajie Wang, Yaqian Liang, Xiaoming Deng, Cuixia Ma, Yong-Jin Liu, Hongan Wang

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Beijing Stomatological Hospital, Capital Medical University(首都医科大学北京 stomatological Hospital) LargeV Instrument Corporation, Ltd.(LargeV仪器有限公司)

AI总结 本文提出TCATSeg网络,结合局部几何特征与全局语义上下文,通过引入物理意义的稀疏超点提升分割精度,并通过400个牙科模型数据集验证方法有效性。

Comments 6 pages, 4 figures, ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16463 2026-03-18 cs.AI cs.HC

Follow the Clues, Frame the Truth: Hybrid-evidential Deductive Reasoning in Open-Vocabulary Multimodal Emotion Recognition

循证推断,还原真相:面向开放词汇多模态情感识别的混合证据推理

Yu Liu, Lei Zhang, Haoxun Li, Hanlei Shi, Yuxuan Ding, Leyuan Qu, Taihao Li

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou, China(杭州高等研究 institute,中国科学院大学,杭州,中国)

AI总结 本文提出HyDRA架构,通过混合证据推理解决多模态情感识别中的歧义问题,通过强化学习优化推理过程,提升在复杂场景下的识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16133 2026-03-18 cs.CV

DualPrim: Compact 3D Reconstruction with Positive and Negative Primitives

DualPrim: 基于正负原语的紧凑3D重建

Xiaoxu Meng, Zhongmin Chen, Bo Yang, Weikai Chen, Weixiao Liu, Lin Gao

机构 * Independent Researcher(独立研究者) Waymo LLC(Waymo公司) Lucid Motors Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Advanced Interdisciplinary Science, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院)

AI总结 DualPrim通过正负超球体实现紧凑且结构化的3D重建,提升拓扑感知建模能力,实现端到端学习和无缝导出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16088 2026-03-18 cs.IR cs.AI

RecBundle: A Next-Generation Geometric Paradigm for Explainable Recommender Systems

RecBundle:可解释推荐系统的新一代几何范式

Hui Wang, Tianzhu Hu, Mingming Li, Xi Zhou, Chun Gan, Jiao Dai, Jizhong Han, Songlin Hu, Tao Guo

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyberspace Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

AI总结 RecBundle通过引入纤维丛理论,将用户交互网络作为基础流形,动态偏好作为纤维,实现推荐系统中用户协作与内容演化的几何建模,提出信息茧房和进化偏见的量化机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10376 2026-03-18 cs.CV cs.RO

MSGNav: Unleashing the Power of Multi-modal 3D Scene Graph for Zero-Shot Embodied Navigation

MSGNav: 释放多模态3D场景图在零样本具身导航中的潜力

Xun Huang, Shijia Zhao, Yunxiang Wang, Xin Lu, Wanfa Zhang, Rongsheng Qu, Weixin Li, Yunhong Wang, Chenglu Wen

机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing(福建智能感知与计算重点实验室) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(多媒体可信感知与高效计算重点实验室) Beihang University(北航) Nanyang Technological University(南洋理工大学) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院)

AI总结 MSGNav通过多模态3D场景图实现零样本具身导航,引入关键子图选择模块、自适应词汇更新模块和闭环推理模块,解决开放词汇和视觉证据保留问题,实验表明其在GOAT-Bench和HM3D-ObjNav基准上表现优异。

Comments 18 pages, Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16253 2026-03-18 cs.CV

Open-Vocabulary Octree-Graph for 3D Scene Understanding

开放词汇八叉树图用于3D场景理解

Zhigang Wang, Yifei Su, Chenhui Li, Dong Wang, Yan Huang, Bin Zhao, Xuelong Li

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) CASIA TeleAI

AI总结 本文提出Octree-Graph,通过CGSM和IFA算法获取3D实例及语义特征,构建适应性八叉树结构以高效表示场景,实验表明其在多种任务中具有广泛适用性和有效性。

Comments Accepted by ICCV25. 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15696 2026-03-18 cs.LG cs.AI

Tackling Over-smoothing on Hypergraphs: A Ricci Flow-guided Neural Diffusion Approach

应对超图上的过平滑问题:一种基于里奇流的神经扩散方法

Mengyao Zhou, Zhiheng Zhou, Xiao Han, Xingqin Qi, Guanghui Wang, Guiying Yan

机构 * Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) University of Chinese Academy of Sciences(中国科学院大学) School of Mathematics and Statistics, Shandong University(山东大学数学与统计学院) School of Artificial Intelligence, Beihang University(北航人工智能学院) School of Mathematics, Shandong University(山东大学数学学院)

AI总结 本文提出基于里奇流的超图神经扩散方法,通过调节节点特征演化缓解过平滑问题,实验表明其在多个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15518 2026-03-17 cs.CL

Beyond the Covariance Trap: Unlocking Generalization in Same-Subject Knowledge Editing for Large Language Models

超越协方差陷阱:在大型语言模型中解锁同一主体知识编辑的泛化能力

Xiyu Liu, Qingyi Si, Zhengxiao Liu, Chenxu Yang, Naibin Gu, Zheng Lin

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

AI总结 本文针对大型语言模型在同一主体知识编辑中泛化能力不足的问题,提出RoSE方法,通过几何对齐和知识整合提升指令遵循能力。

Comments 23 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15402 2026-03-17 cs.CL cs.AI

A Closer Look into LLMs for Table Understanding

深入探究用于表格理解的大型语言模型

Jia Wang, Chuanyu Qin, Mingyu Zheng, Qingyi Si, Peize Li, Zheng Lin

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

AI总结 本文通过研究16种LLM,探讨其理解表格数据和执行下游任务的机制,发现注意力动态、有效层数、专家激活及输入设计影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13295 2026-03-17 cs.LG cs.AI

ICPRL: Acquiring Physical Intuition from Interactive Control

ICPRL: 从交互控制中获取物理直觉

Xinrun Xu, Pi Bu, Ye Wang, Börje F. Karlsson, Ziming Wang, Tengtao Song, Qi Zhu, Jun Song, Shuo Zhang, Zhiming Ding, Bo Zheng

机构 * Institute of Software, Chinese Academy of Science(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) RUC(中国人民大学) PUC-Rio(里约热内卢联邦大学)

AI总结 ICPRL通过多轮组相对策略优化,使VLM在动态物理环境中获取物理直觉并适应策略,其世界模型预测潜在动作结果,提升物理谜题解决能力。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10722 2026-03-17 cs.CV cs.AI

UAV traffic scene understanding: A regulation embedded multi-modal network and a unified benchmark

无人机交通场景理解:一种嵌入监管的多模态网络和一个统一的基准

Yu Zhang, Zhicheng Zhao, Ze Luo, Chenglong Li, Jin Tang

机构 * Computer Network Information Center, Chinese Academy of Sciences, Beijing 100190, China(中国科学院计算机网络信息中心,北京100190,中国) University of Chinese Academy of Sciences, Beijing 100190, China(中国科学院大学,北京100190,中国) Anhui Provincial Key Laboratory of Multi-modal Cognitive Computation, Anhui University, Hefei 230601, China(安徽省多模态认知计算重点实验室,安徽大学,合肥230601,中国) Information Materials and Intelligent Sensing Laboratory of Anhui Province, Anhui University, Hefei 230601, China(安徽省信息材料与智能感知实验室,安徽大学,合肥230601,中国)

AI总结 本文提出MTCNet多模态交通认知网络,通过原型引导知识嵌入模块和质量感知光谱补偿模块,提升无人机交通场景理解的鲁棒性,并构建首个大规模光学-热红外基准Traffic-VQA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17618 2026-03-17 cs.CL cs.PF

SimLens for Early Exit in Large Language Models: Eliciting Accurate Latent Predictions with One More Token

SimLens用于大型语言模型中的早期退出:通过一个额外的标记获取准确的潜在预测

Ming Ma, Bowen Zheng, Zhongqiao Lin, Tianming Yang

机构 * Institute of Neuroscience, State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology, Center for Excellence in Brain Science and Intelligence Technology, Chinese Academy of Sciences(中国科学院脑科学与智能技术卓越创新中心神经科学研究所,脑认知与脑启发智能技术国家重点实验室,脑科学与智能技术卓越创新中心) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院)

AI总结 本文提出SimLens,一种无需训练的解码器,通过保留起始标记和候选答案标记进行轻量级延续,提升潜在预测准确性。结合线性SimLens和SimExit机制,在多个数据集上实现更高的准确性和更快的推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12938 2026-03-16 cs.CV cs.AI

Thinking in Streaming Video

流式视频思考

Zikang Liu, Longteng Guo, Handong Li, Ru Zhen, Xingjian He, Ruyi Ji, Xiaoming Ren, Yanhao Zhang, Haonan Lu, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) OPPO AI Center, OPPO Inc.(OPPO人工智能中心,OPPO公司)

AI总结 本文提出ThinkStream框架,通过Watch-Think-Speak范式实现流式视频推理,采用RCSM压缩内存和流式强化学习提升效率,实验表明其在多个流式视频基准上性能优越且低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12793 2026-03-16 cs.CV cs.AI

Cheers: Decoupling Patch Details from Semantic Representations Enables Unified Multimodal Comprehension and Generation

Cheers:解耦补丁细节与语义表示以实现统一的多模态理解和生成

Yichen Zhang, Da Peng, Zonghao Guo, Zijian Zhang, Xuesong Yang, Tong Sun, Shichu Sun, Yidan Zhang, Yanghao Li, Haiyan Zhao, Wang Xu, Qi Shi, Yangang Sun, Chi Chen, Shuo Wang, Yukun Yan, Xu Han, Qiang Ma, Wei Ke, Liang Wang, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 Cheers通过解耦补丁细节与语义表示,实现统一的多模态理解和生成,提升图像生成的保真度,并在多个基准测试中表现优异,同时实现4倍的token压缩效率。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12582 2026-03-16 cs.CL cs.CR

RTD-Guard: A Black-Box Textual Adversarial Detection Framework via Replacement Token Detection

RTD-Guard: 一种通过替换词检测的黑盒文本对抗检测框架

He Zhu, Yanshu Li, Wen Liu, Haitian Yang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

AI总结 本文提出RTD-Guard框架,利用替换词检测器识别对抗样本,无需对抗数据或模型调优,仅需两次黑盒查询,有效检测多种先进攻击方法生成的对抗文本。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12290 2026-03-16 cs.IR cs.AI

Detecting Miscitation on the Scholarly Web through LLM-Augmented Text-Rich Graph Learning

通过LLM增强的文本丰富图学习检测学术网络中的误引

Huidong Wu, Haojia Xiang, Jingtong Gao, Xiangyu Zhao, Dengsheng Wu, Jianping Li

机构 * Chinese Academy of Sciences & City University of Hong Kong(中国科学院与香港城市大学) City University of Hong Kong(香港城市大学) Shenzhen University & Beijing Dongbi Data Technology(深圳大学与北京东碧数据技术) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出LAGMiD框架,利用LLM进行深度语义推理,结合图神经网络实现高效误引检测,通过证据链推理和知识蒸馏降低计算成本,实验显示效果优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12271 2026-03-16 cs.CL cs.AI cs.LG

Diagnosing Retrieval Bias Under Multiple In-Context Knowledge Updates in Large Language Models

在大型语言模型中多上下文知识更新下的检索偏见诊断

Boyu Qiao, Sean Guo, Xian Yang, Kun Li, Wei Zhou, Songlin Hu, Yunya Song

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与安全学院) Hong Kong University of Science and Technology(香港科学与技术大学) The University of Manchester(曼彻斯特大学)

AI总结 研究探讨了多次上下文知识更新对大型语言模型检索偏的影响,发现更新次数增加时偏见加剧,且最新状态准确性显著下降,通过分析发现模型在处理最新更新时存在识别困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12932 2026-03-16 cs.CV cs.AI

SEDEG:Sequential Enhancement of Decoder and Encoder's Generality for Class Incremental Learning with Small Memory

SEDEG:解码器和编码器通用性的逐步增强用于具有小内存的类别增量学习

Hongyang Chen, Shaoling Pu, Lingyu Zheng, Zhongwu Sun

机构 * Zhejiang Lab(浙江实验室) Hangzhou Institute for Advanced Study(杭州高等研究院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 SEDEG通过两阶段训练框架提升视觉Transformer中解码器和编码器的通用性,以应对动态数据输入,减少灾难性遗忘,实验表明其在小内存场景下表现优异。

Comments Accepted by ICONIP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22433 2026-03-13 cs.CV

SkeletonAgent: An Agentic Interaction Framework for Skeleton-based Action Recognition

SkeletonAgent: 一种基于骨架的动作识别代理交互框架

Hongda Liu, Yunfan Liu, Changlu Wang, Yunlong Wang, Zhenan Sun

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences(神经信息处理研究室,自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 SkeletonAgent通过Questioner和Selector两个代理连接识别模型与LLM,提升基于骨架的动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10852 2026-03-12 cs.CV

UltrasoundAgents: Hierarchical Multi-Agent Evidence-Chain Reasoning for Breast Ultrasound Diagnosis

超声波智能体:用于乳腺超声诊断的层次多智能体证据链推理

Yali Zhu, Kang Zhou, Dingbang Wu, Gaofeng Meng

机构 * Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所,北京,中国) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学(大学层面)交叉学科学院,北京,中国) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences, Hong Kong(人工智能与机器人中心,香港创新科学研究院,中国科学院,香港)

AI总结 UltrasoundAgents通过层次多智能体框架实现乳腺超声诊断中的证据链推理,提升诊断准确性和证据可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09541 2026-03-11 cs.CV cs.MM

Memory-Guided View Refinement for Dynamic Human-in-the-loop EQA

动态人机交互EQA中的记忆引导视角细化

Xin Lu, Rui Li, Xun Huang, Weixin Li, Chuanqing Zhuang, Jiayuan Li, Zhengda Lu, Jun Xiao, Yunhong Wang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院) Beihang University(北京航空航天大学) Ministry of Education of China, Xiamen University(中华人民共和国教育部、厦门大学) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院)

AI总结 DynHiL-EQA数据集提出动态人机交互EQA的挑战,DIVRR框架通过相关性引导的视角细化和选择性记忆选择,提升遮挡鲁棒性和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏