arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

2026-03-11 至 2026-03-11 共收录 6
2603.09541 2026-03-11 cs.CV cs.MM

Memory-Guided View Refinement for Dynamic Human-in-the-loop EQA

动态人机交互EQA中的记忆引导视角细化

Xin Lu, Rui Li, Xun Huang, Weixin Li, Chuanqing Zhuang, Jiayuan Li, Zhengda Lu, Jun Xiao, Yunhong Wang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院) Beihang University(北京航空航天大学) Ministry of Education of China, Xiamen University(中华人民共和国教育部、厦门大学) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院)

AI总结 DynHiL-EQA数据集提出动态人机交互EQA的挑战,DIVRR框架通过相关性引导的视角细化和选择性记忆选择,提升遮挡鲁棒性和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09392 2026-03-11 cs.CV cs.AI

ICDAR 2025 Competition on End-to-End Document Image Machine Translation Towards Complex Layouts

ICDAR 2025竞赛:面向复杂布局的端到端文档图像机器翻译

Yaping Zhang, Yupu Liang, Zhiyang Zhang, Zhiyuan Chen, Lu Xiang, Yang Zhao, Yu Zhou, Chengqing Zong

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Fanyu AI Laboratory, Zhongke Fanyu Technology Company Ltd.(中科泛宇人工智能实验室,中科泛宇科技有限公司)

AI总结 ICDAR 2025竞赛聚焦于复杂布局文档图像的端到端机器翻译,通过OCR-free和OCR-based两个赛道推动多模态文档理解领域的发展。

Comments accepted by ICDAR 2025

Journal ref ICDAR 2025. Lecture Notes in Computer Science, vol 16027

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09320 2026-03-11 cs.CV cs.AI

SpaceSense-Bench: A Large-Scale Multi-Modal Benchmark for Spacecraft Perception and Pose Estimation

SpaceSense-Bench: 一个大规模多模态基准用于航天器感知与姿态估计

Aodi Wu, Jianhong Zuo, Zeyuan Zhao, Xubo Luo, Ruisuo Wang, Xue Wan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

AI总结 SpaceSense-Bench通过大规模多模态数据集提升航天器感知与姿态估计的鲁棒性与准确性。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08574 2026-03-11 cs.SD

Scalable Neural Vocoder from Range-Null Space Decomposition

从范围-空域分解实现可扩展的神经语音合成器

Andong Li, Tong Lei, Zhihang Sun, Rilin Chen, Xiaodong Li, Dong Yu, Chengshi Zheng

机构 * Key Laboratory of Noise and Vibration Research, Institute of Acoustics, Chinese Academy of Sciences(噪声与振动研究重点实验室,中国科学院声学研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Communications and Information Engineering, Chongqing University of Posts and Telecommunications(通信与信息工程学院,重庆邮电大学) Tencent AI Lab(腾讯AI实验室)

AI总结 本文提出了一种基于范围-空域分解的可扩展神经语音合成器,通过双路径框架和数据增强策略实现高效频谱建模和轻量级网络结构。

Comments 30 pages, 30 figures, 21 tables, Extension journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11609 2026-03-11 cs.RO

UniBYD: A Unified Framework for Learning Robotic Manipulation Across Embodiments Beyond Imitation of Human Demonstrations

UniBYD: 一种跨具身体的机器人操作学习统一框架

Tingyu Yuan, Biaoliang Guan, Wen Ye, Ziyan Tian, Yi Yang, Weijie Zhou, Zhaowen Li, Yan Huang, Peng Wang, Chaoyang Zhao, Jinqiao Wang

机构 * CASIA(中国科学院自动化研究所) UCAS(乌尔姆大学) XJTU(西安交通大学) CSU(中国科学技术大学) BJTU(北京理工大学) Yinwang Intelligent Technology Co. Ltd.(云网智能技术有限公司)

AI总结 UniBYD通过动态强化学习和统一形态表示,实现跨具身机器人操作学习,提升任务成功率44.08%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20223 2026-03-11 cs.CV

V-Attack: Targeting Disentangled Value Features for Controllable Adversarial Attacks on LVLMs

V-Attack:针对解耦价值特征的可控对抗攻击LVLMs

Sen Nie, Jie Zhang, Jianxin Yan, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学)

AI总结 V-Attack通过精准操控LVLMs中的价值特征,提升对抗攻击的成功率,揭示视觉语言理解的关键漏洞。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏