arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Li Auto(理想汽车)

2026-03-10 至 2026-03-10 共收录 3
2603.02767 2026-03-10 cs.CV cs.AI

ITO: Images and Texts as One via Synergizing Multiple Alignment and Training-Time Fusion

通过协同多模态对齐和训练时融合实现图像与文本一体化:ITO

Hanpeng Liu, Yaqian Li, Zidan Wang, Shuoxi Zhang, Zonglin Zhao, Zihao Bo, Rinyoichi Takezoe, Kaiwen Long, Kun He

机构 * School of Computer Science(计算机科学学院) Huazhong University of Science and Technology(华中科技大学) Li Auto Inc.(力汽车公司) Institute of AI for Industries, Chinese Academy of Sciences(产业人工智能研究院,中国科学院)

AI总结 ITO通过协同多模态对齐与训练时融合机制,提升图像与文本表示的一致性,有效解决模态间结构化交互问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02748 2026-03-10 cs.CV cs.AI

iGVLM: Dynamic Instruction-Guided Vision Encoding for Question-Aware Multimodal Understanding

iGVLM:动态指令引导的视觉编码用于问题感知的多模态理解

Hanpeng Liu, Yaqian Li, Zidan Wang, Shuoxi Zhang, Zihao Bo, Rinyoichi Takezoe, Kaiwen Long, Kun He

机构 * School of Computer Science(计算机科学学院) Technology, Huazhong University of Science(科技,华中科技大学) Li Auto Inc.(Li汽车公司) Institute of AI for Industries, Chinese Academy of Sciences(产业人工智能研究所,中国科学院)

AI总结 iGVLM通过动态指令引导的视觉编码框架,提升多模态理解中对指令的敏感度,实现从通用感知到任务感知推理的平滑过渡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05611 2026-03-10 cs.CV

FLARE: Learning Future-Aware Latent Representations from Vision-Language Models for Autonomous Driving

FLARE: 从视觉-语言模型中学习未来感知的潜在表示以实现自动驾驶

Chengen Xie, Chonghao Sima, Tianyu Li, Bin Sun, Junjie Wu, Zhihui Hao, Hongyang Li

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) OpenDriveLab at The University of Hong Kong(香港大学OpenDrive实验室) Li Auto Inc.(Li汽车公司)

AI总结 FLARE通过自监督的未来特征预测目标,从大规模未标记数据中学习鲁棒驾驶表示,无需语言监督,提升自动驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏