arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

共收录 1959
2603.09392 2026-03-11 cs.CV cs.AI

ICDAR 2025 Competition on End-to-End Document Image Machine Translation Towards Complex Layouts

ICDAR 2025竞赛:面向复杂布局的端到端文档图像机器翻译

Yaping Zhang, Yupu Liang, Zhiyang Zhang, Zhiyuan Chen, Lu Xiang, Yang Zhao, Yu Zhou, Chengqing Zong

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Fanyu AI Laboratory, Zhongke Fanyu Technology Company Ltd.(中科泛宇人工智能实验室,中科泛宇科技有限公司)

AI总结 ICDAR 2025竞赛聚焦于复杂布局文档图像的端到端机器翻译,通过OCR-free和OCR-based两个赛道推动多模态文档理解领域的发展。

Comments accepted by ICDAR 2025

Journal ref ICDAR 2025. Lecture Notes in Computer Science, vol 16027

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09320 2026-03-11 cs.CV cs.AI

SpaceSense-Bench: A Large-Scale Multi-Modal Benchmark for Spacecraft Perception and Pose Estimation

SpaceSense-Bench: 一个大规模多模态基准用于航天器感知与姿态估计

Aodi Wu, Jianhong Zuo, Zeyuan Zhao, Xubo Luo, Ruisuo Wang, Xue Wan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

AI总结 SpaceSense-Bench通过大规模多模态数据集提升航天器感知与姿态估计的鲁棒性与准确性。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08574 2026-03-11 cs.SD

Scalable Neural Vocoder from Range-Null Space Decomposition

从范围-空域分解实现可扩展的神经语音合成器

Andong Li, Tong Lei, Zhihang Sun, Rilin Chen, Xiaodong Li, Dong Yu, Chengshi Zheng

机构 * Key Laboratory of Noise and Vibration Research, Institute of Acoustics, Chinese Academy of Sciences(噪声与振动研究重点实验室,中国科学院声学研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Communications and Information Engineering, Chongqing University of Posts and Telecommunications(通信与信息工程学院,重庆邮电大学) Tencent AI Lab(腾讯AI实验室)

AI总结 本文提出了一种基于范围-空域分解的可扩展神经语音合成器,通过双路径框架和数据增强策略实现高效频谱建模和轻量级网络结构。

Comments 30 pages, 30 figures, 21 tables, Extension journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11609 2026-03-11 cs.RO

UniBYD: A Unified Framework for Learning Robotic Manipulation Across Embodiments Beyond Imitation of Human Demonstrations

UniBYD: 一种跨具身体的机器人操作学习统一框架

Tingyu Yuan, Biaoliang Guan, Wen Ye, Ziyan Tian, Yi Yang, Weijie Zhou, Zhaowen Li, Yan Huang, Peng Wang, Chaoyang Zhao, Jinqiao Wang

机构 * CASIA(中国科学院自动化研究所) UCAS(乌尔姆大学) XJTU(西安交通大学) CSU(中国科学技术大学) BJTU(北京理工大学) Yinwang Intelligent Technology Co. Ltd.(云网智能技术有限公司)

AI总结 UniBYD通过动态强化学习和统一形态表示,实现跨具身机器人操作学习,提升任务成功率44.08%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20223 2026-03-11 cs.CV

V-Attack: Targeting Disentangled Value Features for Controllable Adversarial Attacks on LVLMs

V-Attack:针对解耦价值特征的可控对抗攻击LVLMs

Sen Nie, Jie Zhang, Jianxin Yan, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学)

AI总结 V-Attack通过精准操控LVLMs中的价值特征,提升对抗攻击的成功率,揭示视觉语言理解的关键漏洞。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08227 2026-03-10 cs.CV

SRNeRV: A Scale-wise Recursive Framework for Neural Video Representation

SRNeRV:一种用于神经视频表示的分层递归框架

Jia Wang, Jun Zhu, Xinfeng Zhang

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences(计算机科学与技术学院,中国科学院大学)

AI总结 SRNeRV通过分层递归框架实现神经视频表示的参数高效共享,提升率失真性能。

Comments Accepted by IEEE ISCAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22555 2026-03-10 cs.LG cs.AI

Autoregressive Visual Decoding from EEG Signals

从EEG信号进行自回归视觉解码

Sicheng Dai, Hongwang Xiao, Shan Yu, Qiwei Ye

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artifcial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑启智技术国家重点实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院) National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

AI总结 AVDE通过自回归生成框架和对比学习提升EEG信号的视觉解码效率,实现高效且可解释的脑机接口应用。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07691 2026-03-10 cs.RO cs.CV

RoboPCA: Pose-centered Affordance Learning from Human Demonstrations for Robot Manipulation

RoboPCA:基于姿态的从人类示范中学习空间可及性的方法用于机器人操作

Zhanqi Xiao, Ruiping Wang, Xilin Chen

机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室、计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 RoboPCA通过联合预测接触区域和姿态,提升机器人操作中从人类示范中学习空间可及性的性能。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10416 2026-03-10 cs.CV cs.AI

Beyond Endpoints: Path-Centric Reasoning for Vectorized Off-Road Network Extraction

超越端点:面向向量化的非公路网络提取的路径中心推理

Wenfei Guan, Jilin Mei, Tong Shen, Xumin Wu, Shuo Wang, Chen Min, Yu Hu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

AI总结 本文提出MaGRoad,一种基于路径中心的非公路道路网络提取方法,通过构建大规模数据集和改进模型结构,在野外环境中实现了更鲁棒的道路提取。

Comments This revision improves clarity and consistency throughout the paper. We refine terminology to more precisely describe the vertex extraction optimization, add motivational context to the edge feature encoding section, and clarify the overall inference pipeline. We also add an Acknowledgments section

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17234 2026-03-10 cs.MM cs.AI cs.CV

Taming Modality Entanglement in Continual Audio-Visual Segmentation

驯服持续音频-视觉分割中的模态纠缠

Yuyang Hong, Qi Yang, Tao Zhang, Zili Wang, Zhaojin Fu, Kun Ding, Bin Fan, Shiming Xiang

机构 * School of Artificial Intelligence, UCAS(人工智能学院,UCAS) MAIS, Institute of Automation(自动化研究所MAIS) School of Intelligent Science and Technology, University of Science and Technolog Beijing(智能科学与技术学院,北京理工大学)

AI总结 本文提出CAVS任务和CMR框架,通过解决多模态语义漂移和共现混淆问题,提升持续音频-视觉分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10238 2026-03-10 cs.CV

MTVCraft: Tokenizing 4D Motion for Arbitrary Character Animation

MTVCraft: 4D运动分词用于任意角色动画

Yanbo Ding, Xirui Hu, Zhizhi Guo, Yan Zhang, Xinrui Wang, Zhixiang He, Chi Zhang, Yali Wang, Xuelong Li

机构 * Shenzhen Key Laboratory of Computer Vision and Pattern Recognition, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳计算机视觉与模式识别重点实验室,深圳先进技术研究院,中国科学院,深圳,中国) Institute of Artificial Intelligence (TeleAI), China Telecom, Beijing, China(人工智能研究所(TeleAI),中国电信,北京,中国) School of Computer Science and Technology, Xi’an Jiaotong University, Xi’an, China(计算机科学与技术学院,西安交通大学,西安,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

AI总结 MTVCraft通过直接建模4D运动序列,实现任意角色动画,提升运动控制灵活性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06925 2026-03-10 cs.CV

Small Target Detection Based on Mask-Enhanced Attention Fusion of Visible and Infrared Remote Sensing Images

基于可见与红外遥感图像的掩码增强注意力融合的小目标检测

Qianqian Zhang, Xiaolong Jia, Ahmed M. Abdelmoniem, Li Zhou, Junshe An

机构 * National Space Science Center, Chinese Academy of Sciences(中国科学院国家空间科学中心) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦大学玛丽女王学院电子工程与计算机科学学院) School of Astronomy and Space Science, University of Chinese Academy of Sciences(中国科学院大学天文学与空间科学学院)

AI总结 本文提出ESM-YOLO+,通过掩码增强注意力融合和结构表示增强方法,实现可见与红外图像中小目标的高效检测,提升检测精度并降低模型复杂度。

Comments The manuscript has been submitted to the journal and is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06920 2026-03-10 cs.CV

DLRMamba: Distilling Low-Rank Mamba for Edge Multispectral Fusion Object Detection

DLRMamba: 低秩Mamba用于边缘多光谱融合目标检测

Qianqian Zhang, Leon Tabaro, Ahmed M. Abdelmoniem, Junshe An

机构 * National Space Science Center, Chinese Academy of Sciences(中国科学院国家空间科学中心) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术系) School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦大学Queen Mary电子工程与计算机科学学院) School of Astronomy and Space Science, University of Chinese Academy of Sciences(中国科学院大学天文与空间科学系)

AI总结 DLRMamba通过低秩SS2D和结构感知知识蒸馏,提升边缘多光谱融合目标检测的效率与精度。

Comments Has been submitted to the IEEE TGRS journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06670 2026-03-10 cs.CV cs.AI

calibfusion: Transformer-Based Differentiable Calibration for Radar-Camera Fusion Detection in Water-Surface Environments

calibfusion: 基于Transformer的可微校准方法用于水表面环境的雷达-摄像头融合检测

Yuting Wan, Liguo Sun, Jiuwu Hao, Pin LV

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 CalibFusion通过端到端学习隐式外校准,提升水表面环境下雷达-摄像头融合检测的鲁棒性和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23681 2026-03-10 cs.CV

QuantSparse: Comprehensively Compressing Video Diffusion Transformer with Model Quantization and Attention Sparsification

QuantSparse: 通过模型量化和注意力稀疏化全面压缩视频扩散变换器

Weilun Feng, Chuanguang Yang, Haotong Qin, Mingqiang Wu, Yuqi Li, Xiangqi Li, Zhulin An, Libo Huang, Yulun Zhang, Michele Magno, Yongjun Xu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) ETH Zürich(苏黎世联邦理工学院) City College of New York, City University of New York, USA(纽约城市学院,纽约城市大学,美国) Shanghai Jiao Tong University(上海交通大学)

AI总结 QuantSparse通过结合模型量化和注意力稀疏化,实现视频扩散变换器的高效压缩,提升性能并减少存储与推理时间。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21302 2026-03-10 cs.CV

Quantized Visual Geometry Grounded Transformer

量化视觉几何基础变换器

Weilun Feng, Haotong Qin, Mingqiang Wu, Chuanguang Yang, Yuqi Li, Xiangqi Li, Zhulin An, Libo Huang, Yulun Zhang, Michele Magno, Yongjun Xu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) ETH Zürich(苏黎世联邦理工学院) City College of New York, City University of New York, USA(纽约城市学院,纽约城市大学,美国) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出QuantVGGT,首个针对大规模VGGT的量化框架,通过双平滑细粒度量化和噪声过滤多样化采样技术,在保持高精度的同时实现显著的内存减少和加速。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04016 2026-03-10 cs.CV

S$^2$Q-VDiT: Accurate Quantized Video Diffusion Transformer with Salient Data and Sparse Token Distillation

S$^2$Q-VDiT: 精确量化视频扩散变换器与显著数据和稀疏令牌蒸馏

Weilun Feng, Haotong Qin, Chuanguang Yang, Xiangqi Li, Han Yang, Yuqi Li, Zhulin An, Libo Huang, Michele Magno, Yongjun Xu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) ETH Zürich(苏黎世联邦理工学院)

AI总结 S$^2$Q-VDiT通过显著数据选择和稀疏令牌蒸馏提升视频扩散变换器的量化性能,实现无损压缩和加速推理。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00329 2026-03-10 cs.LG cs.AI math.OC stat.ML

OTAD: An Optimal Transport-Induced Robust Model for Agnostic Adversarial Attack

OTAD: 一种基于最优传输的鲁棒模型用于无偏对抗攻击

Kuo Gai, Sicong Wang, Shihua Zhang

机构 * Shanghai Institute for Mathematics and Interdisciplinary Sciences(上海数学与交叉科学研究院) Academy of Mathematics and Systems Science(数学系统科学学院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 OTAD通过结合最优传输理论与对抗防御方法,提出一种新的模型以提高深度学习系统的鲁棒性和安全性。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23138 2026-03-09 cs.CV

VisualPrompter: Semantic-Aware Prompt Optimization with Visual Feedback for Text-to-Image Synthesis

VisualPrompter: 基于视觉反馈的语义感知提示优化用于文本到图像合成

Shiyu Wu, Mingzhen Sun, Weining Wang, Yequan Wang, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学)

AI总结 VisualPrompter通过语义感知的提示优化机制,提升文本到图像合成的对齐性能和内容质量。

Comments ICLR2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06199 2026-03-09 cs.CL cs.AI

FlashPrefill: Instantaneous Pattern Discovery and Thresholding for Ultra-Fast Long-Context Prefilling

FlashPrefill: ultra-fast long-context prefilling的即时模式发现与阈值处理

Qihang Fan, Huaibo Huang, Zhiying Wu, Juqiu Wang, Bingning Wang, Ran He

机构 * MAIS&NLPR, CASIA(MAIS与NLPR,中国科学院自动化研究所) UCAS(中国科学技术大学) WeChat, Tencent(微信、腾讯)

AI总结 FlashPrefill通过即时模式发现和动态阈值机制,实现超快长上下文prefilling,显著提升效率并保持在不同序列规模下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06073 2026-03-09 cs.RO cs.AI

Lifelong Embodied Navigation Learning

持续性具身导航学习

Xudong Wang, Jiahua Dong, Baichen Liu, Qi Lyu, Lianqing Liu, Zhi Han

机构 * State Key Laboratory of Robotics and Intelligent Systems(机器人与智能系统国家重点实验室) Shenyang Institute of Automation(沈阳自动化研究所) Chinese Academy of Sciences(中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 Uni-Walker通过分解导航知识为共享和特定组件,解决持续性具身导航学习中的灾难性遗忘问题,提升导航代理的持续学习能力。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06043 2026-03-09 cs.CV

Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models

通过理解学习生成:基于理解的内在奖励用于统一多模态模型

Jiadong Pan, Liang Li, Yuxin Peng, Yu-Ming Tang, Shuohuan Wang, Yu Sun, Hua Wu, Qingming Huang, Haifeng Wang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Sun Yat-sen University(中山大学) Baidu Inc.(百度公司)

AI总结 本文提出GvU机制,通过内在奖励提升统一多模态模型的生成能力,同时增强其视觉理解能力,缩小理解与生成之间的能力差距。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05921 2026-03-09 cs.CV cs.AI

BlackMirror: Black-Box Backdoor Detection for Text-to-Image Models via Instruction-Response Deviation

BlackMirror: 通过指令-响应偏差检测文本到图像模型的黑盒后门

Feiran Li, Qianqian Xu, Shilong Bao, Zhiyong Yang, Xilin Zhao, Xiaochun Cao, Qingming Huang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) BDKM, University of Chinese Academy of Sciences(中国科学院大学BDKM) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) School of Cyber Science and Tech., Shenzhen Campus, Sun Yat-sen University(中山大学深圳校区网络安全科学与技术学院)

AI总结 BlackMirror通过指令-响应偏差检测文本到图像模型的黑盒后门,利用视觉模式与指令的对齐及偏差稳定性评估实现高效检测。

Comments This paper is accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02002 2026-03-09 cs.LG cs.AI

MatRIS: Toward Reliable and Efficient Pretrained Machine Learning Interatomic Potentials

MatRIS:迈向可靠且高效的预训练机器学习原子势能函数

Yuanchang Zhou, Siyu Hu, Xiangyu Zhang, Hongyu Wang, Guangming Tan, Weile Jia

机构 * State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(处理器国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) School of Advanced Interdisciplinary Sciences, UCAS(交叉科学学院,UCAS)

AI总结 MatRIS通过引入基于注意力的三体相互作用建模,提出了一种高效且准确的不变机器学习原子势能函数模型,实现了在多种基准测试中与等变模型相当的性能,同时显著降低了计算成本。

Comments 28 pages, 9 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13127 2026-03-09 cs.CV cs.CR

SPARK: Jailbreaking T2V Models by Synergistically Prompting Auditory and Recontextualized Knowledge

SPARK:通过协同提示音频与重新上下文化知识实现T2V模型的劫持

Zonghao Ying, Moyang Chen, Nizhang Li, Zhiqiang Wang, Wenxin Zhang, Quanchen Zou, Zonglei Jing, Aishan Liu, Xianglong Liu

机构 * State Key Laboratory of Complex \& Critical Software Environment, Beihang University College of Science, Mathematics Technology, Wenzhou-Kean University 360 AI Security Lab Faculty of Innovation Engineering, Macau University of Science Hong Kong University of Science University of Chinese Academy of Sciences

AI总结 SPARK通过模块化提示设计,利用音频与视觉关联模式,实现对T2V模型的高效劫持,提升攻击成功率23%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19674 2026-03-09 cs.LG cs.CV

C^2Prompt: Class-aware Client Knowledge Interaction for Federated Continual Learning

C²Prompt:面向联邦持续学习的类感知客户端知识交互

Kunlun Xu, Yibo Feng, Jiangmeng Li, Yongsheng Qi, Jiahuan Zhou

机构 * Wangxuan Institute of Computer Technology Peking University(北京大学王轩计算机技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Inner Mongolia University of Technology(内蒙古科技大学)

AI总结 C²Prompt通过增强类层面知识一致性,解决联邦持续学习中的时间与空间遗忘问题,实现最先进的性能。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11245 2026-03-09 cs.CV

NarrLV: Towards a Comprehensive Narrative-Centric Evaluation for Long Video Generation

NarrLV: 向长视频生成的综合性叙事导向评估迈进

X. Feng, H. Yu, M. Wu, S. Hu, J. Chen, C. Zhu, J. Wu, X. Chu, K. Huang

机构 * UCAS CASIA(中国科学院自动化研究所) AMAP, Alibaba Group(阿里云实验室) NTU(国立科技大学) PKU(北京大学)

AI总结 NarrLV是首个针对长视频生成模型的综合性叙事评估基准,通过引入时间叙事原子和基于MLLM的评估指标,全面评估模型在叙事表达上的能力。

Comments Project Page: https://amap-ml.github.io/NarrLV-Website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05204 2026-03-06 cs.LG cs.AI

Stable-LoRA: Stabilizing Feature Learning of Low-Rank Adaptation

Stable-LoRA: 低秩适应特征学习的稳定化

Yize Wu, Ke Gao, Ling Li, Yanjun Wu

机构 * Intelligent Software Research Center, Institute of Software, CAS, Beijing, China(软件研究所智能软件研究中心,中国科学院,北京) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京)

AI总结 Stable-LoRA通过动态收缩A矩阵提升LoRA特征学习的稳定性,有效解决非零初始化导致的次优问题,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05185 2026-03-06 cs.RO

Critic in the Loop: A Tri-System VLA Framework for Robust Long-Horizon Manipulation

循环批评者:一种三系统VLA框架用于鲁棒的长周期操控

Pengfei Yi, Yingjie Ma, Wenjiang Xu, Yanan Hao, Shuai Gan, Wanting Li, Shanlin Zhong

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) the School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 循环批评者提出了一种三系统VLA框架,通过动态调度VLM和VLA实现鲁棒的长周期操控,提升系统在分布外场景的自主性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04980 2026-03-06 cs.CV

A Simple Baseline for Unifying Understanding, Generation, and Editing via Vanilla Next-token Prediction

一种通过 vanilla next-token 预测统一理解、生成和编辑的简单基线

Jie Zhu, Hanghang Ma, Jia Wang, Yayong Guan, Yanbing Zeng, Lishuai Gao, Junqiang Wu, Jie Hu, Leye Wang

机构 * Key Lab of High Confidence Software Technologies (Peking University), Ministry of Education, China(高可信软件技术重点实验室(北京大学),教育部,中国) School of Computer Science, Peking University, Beijing, China(北京大学计算机学院,北京,中国) School of Computer Science and Technology, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学计算机科学与技术学院,北京,中国)

AI总结 本文提出 Wallaroo,一种通过 vanilla next-token 预测统一多模态理解、生成和编辑的简单基线模型,展示了其在多任务中的竞争力。

Comments Technical report. This work serves as a straightforward autoregressive baseline for unifying understanding, generation, and editing

详情

展开后加载摘要…

URL PDF HTML 收藏