arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

2026-03-19 至 2026-03-19 共收录 13
2603.17809 2026-03-19 cs.CV cs.AI

Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients

细粒度后训练量化用于大型视觉语言模型的量化感知集成梯度

Ziwei Xiang, Fanhu Zeng, Hongjian Fang, Rui-Qi Wang, Renxing Chen, Yanan Zhu, Yi Chen, Peipei Yang, Xu-Yao Zhang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,中国科学院自动化所) School of Artificial Intelligence, UCAS(人工智能学院,中国科学院大学) Beijing National Research Center for Information Science and Technology(北京信息科学研究中心) Institute of Artificial Intelligence, USTB(信息科学技术大学人工智能学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Zhongguancun Academy(中关村学院)

AI总结 本文提出细粒度后训练量化方法,通过量化感知集成梯度评估token敏感性,提升大型视觉语言模型的精度与效率。

Comments Accepted by CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15359 2026-03-19 cs.RO

NavThinker: Action-Conditioned World Models for Coupled Prediction and Planning in Social Navigation

NavThinker: 用于社交导航中耦合预测与规划的行动条件世界模型

Tianshuai Hu, Zeying Gong, Lingdong Kong, XiaoDong Mei, Yiyi Ding, Qi Zeng, Ao Liang, Rong Li, Yangyi Zhong, Junwei Liang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 NavThinker通过结合行动条件世界模型与on-policy强化学习,解决社交导航中机器人动作与人类运动相互影响的耦合预测-规划问题,实现未来感知的导航状态对齐与路径规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17474 2026-03-19 cs.CV cs.AI

Revisiting Cross-Attention Mechanisms: Leveraging Beneficial Noise for Domain-Adaptive Learning

重新审视交叉注意力机制:利用有益噪声进行领域自适应学习

Zelin Zang, Yehui Yang, Fei Wang, Liangyu Li, Baigui Sun

机构 * School of Engineering, Westlake University(西lake大学工程学院) Centre for Artificial Intelligence and Robotics (CAIR), Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences (HKISI-CAS)(香港科学院人工智能与机器人中心) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) Alibaba Group(阿里巴巴集团)

AI总结 本文提出DACSM框架,通过引入有益噪声增强交叉注意力,结合领域翻译和尺度感知对齐,提升跨领域表示学习的鲁棒性,实验显示在VisDA-2017等数据集上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17468 2026-03-19 cs.LG

Efficient Soft Actor-Critic with LLM-Based Action-Level Guidance for Continuous Control

高效软演员-评论家与基于大语言模型的动作级指导在连续控制中的应用

Hao Ma, Zhiqiang Pu, Xiaolin Ai, Huimu Wang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院,北京,中国) Institute of Automation, Chinese Academy of Sciences, Beijing 100190, China(中国科学院自动化研究所,北京100190,中国)

AI总结 本文提出GuidedSAC算法,利用大语言模型提供动作级指导,提升连续控制中的探索效率,并通过理论分析和实验验证其收敛性和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17437 2026-03-19 cs.RO

FloorPlan-VLN: A New Paradigm for Floor Plan Guided Vision-Language Navigation

FloorPlan-VLN: 一种新的基于平面图引导的视觉-语言导航范式

Kehan Chen, Yan Huang, Dong An, Jiawei He, Yifei Su, Jing Liu, Nianfeng Liu, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences and School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院自动化研究所新型模式识别实验室,中国科学院人工智能学院) AMap, Alibaba Group(阿里巴巴集团高德地图) BAAI(北京人工智能研究院) Xiaomi Robotics Lab(小米机器人实验室) FiveAges

AI总结 本文提出FloorPlan-VLN范式,利用结构化的语义平面图作为全局空间先验,通过FP-Nav方法实现仅需简洁指令的导航,实验表明其在导航成功率上优于现有方法,验证了平面图引导导航的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17307 2026-03-19 cs.CV cs.AI

Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding

Symphony:一种受认知启发的多智能体系统用于长视频理解

Haiyang Yan, Hongyun Zhou, Peng Xu, Xiaoxue Feng, Mengyi Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Kuaishou Technology(快手科技) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院)

AI总结 本文提出Symphony多智能体系统,通过模拟人类认知模式,提升长视频理解任务的推理能力,实验显示在多个基准测试中表现优异。

Comments Accepted by cvpr2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16966 2026-03-19 cs.CV cs.AI cs.MM cs.SD eess.AS

CineSRD: Leveraging Visual, Acoustic, and Linguistic Cues for Open-World Visual Media Speaker Diarization

CineSRD:利用视觉、听觉和语言线索进行开放世界视觉媒体说话人聚类

Liangbin Huang, Xiaohua Liao, Chaoqun Cui, Shijing Wang, Zhaolong Huang, Yanlong Du, Wenji Mao

机构 * Hujing Digital Media and Entertainment Group(华景数字媒体与娱乐集团) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部门) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)

AI总结 CineSRD通过整合视觉、听觉和语言线索,解决开放世界视觉媒体中说话人识别的挑战,提出统一多模态框架并构建专用基准数据集,验证其在复杂场景下的鲁棒性和泛化能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16944 2026-03-19 cs.CV cs.AI

Omni IIE Bench: Benchmarking the Practical Capabilities of Image Editing Models

Omni IIE Bench:图像编辑模型实际能力的基准测试

Yujia Yang, Yuanxiang Wang, Zhenyu Guan, Tiankun Yang, Chenxi Bao, Haopeng Jin, Jinwen Luo, Xinyu Zuo, Lisheng Duan, Haijin Liang, Jin Ma, Xinming Wang, Ruiwen Tao, Hongzhu Yi

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent(腾讯)

AI总结 本文提出Omni IIE Bench,通过双轨诊断设计评估图像编辑模型在不同语义尺度任务中的一致性,揭示模型在低到高语义任务间性能显著下降的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16448 2026-03-19 cs.AI

TRUST-SQL: Tool-Integrated Multi-Turn Reinforcement Learning for Text-to-SQL over Unknown Schemas

TRUST-SQL:基于工具的多轮强化学习用于未知模式下的文本到SQL

Ai Jian, Xiaoyun Zhang, Wanrou Du, Jingqing Ruan, Jiangbo Pei, Weipeng Zhang, Ke Zeng, Xunliang Cai

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所处理器国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Meituan(美团)

AI总结 本文提出TRUST-SQL,通过工具集成的多轮强化学习解决文本到SQL在未知模式下的问题,通过结构化四阶段协议和Dual-Track GRPO策略提升性能,实验表明在多个基准上取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06396 2026-03-19 cs.AI cs.CR

Efficient LLM Safety Evaluation through Multi-Agent Debate

通过多智能体辩论实现高效的LLM安全评估

Dachuan Lin, Guobin Shen, Zihao Yang, Tianrong Liu, Dongcheng Zhao, Yi Zeng

机构 * Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Super Alignment(北京安全人工智能与超对齐重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) CSE, The Chinese University of Hong Kong(香港中文大学电子工程系) University of Chinese Academy of Sciences(中国科学院大学) Department of Mathematics, The Chinese University of Hong Kong(香港中文大学数学系) Long-term AI(长期人工智能)

AI总结 本文提出多智能体辩论框架,利用HAJailBench基准测试,提升LLM安全评估的可靠性与经济性,验证了少量辩论轮次即可获得显著效果。

Comments 15 pages, 5 figures, 10 tables. Updated abstract to fix an incconsistency issue with the main paper: HAJailBench size (12,000 -> 11,100)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22496 2026-03-19 cs.CV

Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation

MLLMs关注什么以及依赖什么:解释自回归标记生成

Ruoyu Chen, Xiaoqing Guo, Kangwei Liu, Siyuan Liang, Shiming Liu, Qunli Zhang, Laiyuan Wang, Hua Zhang, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) College of Computing and Data Science, NTU(NTU 计算与数据科学学院) Huawei(华为) School of Flexible Electronics, SYSU(SYSU 灵活电子学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(Sun Yat-sen 大学深圳校区计算机科学与技术学院)

AI总结 本文提出EAGLE框架,通过轻量级黑盒方法解释MLLMs的自回归标记生成,量化语言先验和感知证据的影响,提升模型可解释性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03887 2026-03-19 cs.CV

OccTENS: 3D Occupancy World Model via Temporal Next-Scale Prediction

OccTENS: 通过时间下一尺度预测实现的3D占用世界模型

Bu Jin, Songen Gu, Xiaotao Hu, Yupeng Zheng, Xiaoyang Guo, Qian Zhang, Xiaoxiao Long, Wei Yin

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Chinese Academy of Sciences(中国科学院大学) Horizon Robotics(地平线机器人) Nanjing University(南京大学)

AI总结 本文提出OccTENS,一种能高效生成高质量长期占用场景的生成模型,通过时间下一尺度预测任务解决效率、时间退化和可控性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05591 2026-03-19 cs.AI

MLlm-DR: Towards Explainable Depression Recognition with MultiModal Large Language Models

MLlm-DR: 向多模态大语言模型的可解释性抑郁识别迈进

Wei Zhang, Juan Chen, En Zhu, Wenhong Cheng, YunPeng Li, Yanbo J. Wang

机构 * National University of Defense Technology(国防科技大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Mental Health Center, Shanghai Jiao Tong University School of Medicine(上海精神卫生中心,上海交通大学医学院) Nanjing Industria Tenebris Information Technology Co., Ltd.(南京Industria Tenebris信息技术有限公司) National University of Uzbekistan named after Mirzo Ulugbek(乌兹别克斯坦Mirzo Ulugbek命名的国立大学)

AI总结 本文提出MLlm-DR模型,通过多模态大语言模型实现可解释的抑郁识别,结合小型LLM和轻量级查询模块,提升诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏