arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

2026-03-26 至 2026-03-26 共收录 10
2603.24581 2026-03-26 cs.CV cs.RO

Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving

潜在世界动作建模:端到端自动驾驶的潜在世界建模

Linbo Wang, Yupeng Zheng, Qiang Chen, Shiwei Li, Yichen Zhang, Zebin Xing, Qichao Zhang, Xiang Li, Deheng Qian, Pengxuan Yang, Yihang Dong, Ce Hao, Xiaoqing Ye, Junyu han, Yifeng Pan, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Chongqing Chang’an Technology Co., Ltd(重庆长安科技有限公司) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) College of AI, Tsinghua University(清华大学人工智能学院) Zhongguancun Academy(中关村学院)

AI总结 本文提出Latent-WAM框架,通过空间感知和动态感知的潜在世界表示实现高效端到端自动驾驶,实验显示在NAVSIM v2和HUGSIM上取得新的SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24571 2026-03-26 cs.CV

Towards Training-Free Scene Text Editing

无训练场景文本编辑

Yubo Li, Xugong Qin, Peng Zhang, Hailun Lin, Gangyan Zeng, Kexin Zhang

机构 * School of Cyber Science and Engineering(网络安全科学与工程学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

AI总结 本文提出TextFlow框架,通过结合Attention Boost和Flow Manifold Steering方法,实现无需额外训练的高保真文本编辑,实验表明其在视觉质量和文本准确性上优于传统方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24558 2026-03-26 cs.CV cs.AI

LensWalk: Agentic Video Understanding by Planning How You See in Videos

LensWalk: 通过规划如何在视频中观看实现代理视频理解

Keliang Li, Yansong Li, Hongze Shen, Mengdi Liu, Hong Chang, Shiguang Shan

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Peng Cheng Laboratory(鹏城实验室) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 LensWalk通过建立紧密的推理-计划-观察循环,使大语言模型能够主动控制视觉观察,提升视频理解的准确性和鲁棒性。

Comments To be published in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24198 2026-03-26 cs.CV

RefReward-SR: LR-Conditioned Reward Modeling for Preference-Aligned Super-Resolution

RefReward-SR: 基于低分辨率参考的偏好对齐超分辨率奖励建模

Yushuai Song, Weize Quan, Weining Wang, Jiahui Sun, Jing Liu, Meng Li, Pengbin Yu, Zhentao Chen, Wei Shen, Lunxi Yuan, Dong-ming Yan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) OPPO AI Center, OPPO Inc.(OPPO人工智能中心)

AI总结 本文提出RefReward-SR,通过低分辨率参考意识奖励模型实现偏好对齐的超分辨率,利用多模态大语言模型评估语义一致性,构建首个大规模低分辨率条件偏好数据集,实验表明其在人类判断对齐方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07659 2026-03-26 cs.CV

Scaling Test-Time Robustness of Vision-Language Models via Self-Critical Inference Framework

通过自批评推理框架提升视觉-语言模型的测试时鲁棒性

Kaihua Tang, Jiaxin Qi, Jinli Ou, Yuhua Zheng, Jianqiang Huang

机构 * Tongji University(同济大学) Computer Network Information Center, CAS(计算机网络信息中心,中国科学院) HIAS, University of Chinese Academy of Sciences(高等研究所,中国科学院大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出自批评推理框架,通过多轮反事实推理提升视觉-语言模型的鲁棒性,引入动态鲁棒性基准评估框架以应对语言偏差和敏感性问题,实验表明该方法在鲁棒性上优于基线方法。

Comments Accepted to CVPR 2026. Code: https://github.com/KaihuaTang/Self-Critical-Inference-Framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04607 2026-03-26 cs.OS cs.AI cs.LG

From Imperative to Declarative: Towards LLM-friendly OS Interfaces for Boosted Computer-Use Agents

从命令式到声明式:面向提升计算机使用代理的LLM友好操作系统接口

Yuan Wang, Mingyu Li, Haibo Chen

机构 * Key Laboratory of System Software (Chinese Academy of Sciences)(中国科学院系统软件重点实验室) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) Shanghai Jiao Tong University(上海交通大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出Declarative Model Interface (DMI),通过将传统GUI转化为三种声明式原语,提升LLM驱动的计算机使用代理的任务成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24030 2026-03-26 cs.CV cs.MM

Decompose and Transfer: CoT-Prompting Enhanced Alignment for Open-Vocabulary Temporal Action Detection

分解与迁移:基于CoT提示的对齐增强开放词汇时序动作检测

Sa Zhu, Wanqian Zhang, Lin Wang, Xiaohua Chen, Chenxu Cui, Jinchao Zhang, Bo Li

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) Hangzhou Dianzi University(杭州电子科技大学) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本文提出PDA框架,通过CoT提示语义分解和适应性相位对齐,提升开放词汇时序动作检测的跨类别迁移能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23896 2026-03-26 cs.CV

MMTIT-Bench: A Multilingual and Multi-Scenario Benchmark with Cognition-Perception-Reasoning Guided Text-Image Machine Translation

MMTIT-Bench: 一个具有认知-感知-推理引导的多语言多场景文本-图像机器翻译基准

Gengluo Li, Chengquan Zhang, Yupu Liang, Huawen Shen, Yaping Zhang, Pengyuan Lyu, Weinong Wang, Xingyu Wan, Gangyan Zeng, Han Hu, Can Ma, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Tencent(腾讯) Nankai University(南开大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University of Science and Technology(南京理工大学)

AI总结 MMTIT-Bench通过1400张覆盖14种非英语和非中文语言的图像,评估端到端文本-图像机器翻译的鲁棒性,并提出CPR-Trans数据范式提升翻译推理能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23840 2026-03-26 cs.AI cs.CL

VehicleMemBench: An Executable Benchmark for Multi-User Long-Term Memory in In-Vehicle Agents

VehicleMemBench:多用户长期记忆的可执行基准

Yuhao Chen, Yi Xu, Xinyun Ding, Xiang Fang, Shuochen Liu, Luxi Lin, Qingyu Zhang, Ya Li, Quan Liu, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院) Xiamen University(厦门大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出VehicleMemBench,用于评估车载代理的多用户长期记忆能力,通过可执行仿真环境比较行动后环境状态与目标状态,揭示强大模型在动态偏好变化场景中的不足,强调需更 robust 的记忆管理机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14951 2026-03-26 cs.CV

Morph: A Motion-free Physics Optimization Framework for Human Motion Generation

Morph:一种无需运动的物理优化框架用于人类运动生成

Zhuo Li, Mingshuang Luo, Ruibing Hou, Xin Zhao, Hao Liu, Hong Chang, Zimo Liu, Chen Li

机构 * WeChat, Tencent Inc(微信,腾讯公司) Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, China(中国科学院智能信息处理重点实验室(CAS),计算技术研究所,CAS,中国) Peng Cheng Laboratory, China(鹏城实验室,中国) University of Chinese Academy of Sciences, China(中国科学院大学,中国) MoE Key Laboratory of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能MoE重点实验室,人工智能研究院,上海交通大学)

AI总结 本文提出Morph框架,通过运动生成器和运动物理细化模块提升运动的物理合理性,无需昂贵真实运动数据,实验显示其在文本到运动和音乐到舞蹈生成任务中达到最先进的运动质量。

Comments Accepted by ICCV 2025, 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏