arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Li Auto(理想汽车)

共收录 122
2601.10318 2026-01-16 cs.CL

Boundary-Aware NL2SQL: Integrating Reliability through Hybrid Reward and Data Synthesis

边界感知的NL2SQL:通过混合奖励和数据合成集成可靠性

Songsong Tian, Kongsheng Zhuo, Zhendong Wang, Rong Shen, Shengtao Zhang, Yong Wu

机构 * Li Auto Inc.(Li汽车公司) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 BAR-SQL通过混合奖励和数据合成方法,提升NL2SQL在生成准确性和边界感知回避能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25756 2026-01-15 cs.RO cs.LG

SAC Flow: Sample-Efficient Reinforcement Learning of Flow-Based Policies via Velocity-Reparameterized Sequential Modeling

SAC Flow: 通过速度重参数化序列建模高效训练基于流的策略

Yixian Zhang, Shu'ang Yu, Tonghe Zhang, Mo Guang, Haojia Hui, Kaiwen Long, Yu Wang, Chao Yu, Wenbo Ding

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) Li Auto(利汽车) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 SAC Flow通过速度重参数化序列建模,高效训练基于流的策略,实现连续控制和机器人操作的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05640 2026-01-13 cs.CV

SGDrive: Scene-to-Goal Hierarchical World Cognition for Autonomous Driving

SGDrive: 场景到目标层次化世界认知用于自动驾驶

Jingyu Li, Junjie Wu, Dongnan Hu, Xiangkai Huang, Bin Sun, Zhihui Hao, Xianpeng Lang, Xiatian Zhu, Li Zhang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Li Auto Inc.(利汽车公司) Tongji University(同济大学) University of Surrey(Surrey大学)

AI总结 SGDrive通过构建驾驶特定的知识层次结构,改进了视觉语言模型在自动驾驶中的轨迹规划能力,实现了在导航模拟基准上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09993 2026-01-12 cs.AI

SPAN: Benchmarking and Improving Cross-Calendar Temporal Reasoning of Large Language Models

SPAN:大型语言模型跨日历时间推理的基准测试与改进

Zhongjian Miao, Hao Fu, Chen Wei

机构 * Li Auto(利亚特)

AI总结 SPAN通过开发时间代理提升大型语言模型跨日历时间推理能力,实验显示其准确率高达95.31%

Comments Accepted at the AAAI 2026 conference. This version includes the supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01768 2026-01-08 cs.CL

Can LLMs Track Their Output Length? A Dynamic Feedback Mechanism for Precise Length Regulation

LLMs能否追踪其输出长度?一种动态反馈机制用于精确长度控制

Meiman Xiao, Ante Wang, Qingguo Hu, Zhongjian Miao, Huangjun Shen, Longyue Wang, Weihua Luo, Jinsong Su

机构 * School of Informatics, Xiamen University, China(信息学院,厦门大学) Alibaba International Digital Commerce Group(阿里巴巴国际数字 commerce 集团) Li Auto Inc(李汽车公司)

AI总结 本文提出一种动态反馈机制,用于提升LLM在生成文本时对长度的精确控制,通过无训练方法和进一步微调实现更准确的长度调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03531 2026-01-08 cs.CL

PALM-Bench: A Comprehensive Benchmark for Personalized Audio-Language Models

PALM-Bench: 一个全面的个性化音频-语言模型基准测试

Yuwen Wang, Xinyuan Qian, Tian-Hao Zhang, Jiaran Gao, Yuchen Pan, Xin Wang, Zhou Pan, Chen Wei, Yiming Wang

机构 * University of Science and Technology Beijing(北京科技大学) Li Auto(利汽车) Fondazione Bruno Kessler(布鲁诺·克塞尔基金会)

AI总结 PALM-Bench旨在通过构建首个个性化音频-语言模型基准测试,促进个性化模型在多说话者场景中的方法发展和评估。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23412 2026-01-08 cs.AI

MindWatcher: Toward Smarter Multimodal Tool-Integrated Reasoning

MindWatcher:迈向更智能的多模态工具集成推理

Jiawei Chen, Xintian Shen, Lihao Zheng, Zhenwei Shao, Handong Cui, Chaoqun Du, Li Gong, Feng Gu, Xuefeng Hao, Wei He, Jiabang He, Yi Hu, Bin Huang, Shanshan Li, Qizhen Li, Jing Luo, Zide Liu, Xiaobo Liu, Ning Mao, Lifu Mu, Xuhao Pan, Zhiheng Qu, Chang Ren, Xudong Rao, Haoyi Sun, Qian Wang, Shuai Wang, Zhichao Wang, Wei Wang, Lian Wen, Jiqing Zhan, Hongfu Yang, Sheng Yang, Jiajun Yang, Pengfei Yu, Hongyuan Zhang, Bin Zhang, Chunpeng Zhou, Zheng Zhou, Shucheng Zhou, Shuo Xie, Yun Zhu, Hao Ma, Tao Wei, Pan Zhou, Wei Chen

机构 * Li Auto Inc(力汽车公司)

AI总结 MindWatcher是一种能够自主调用工具并进行多模态推理的智能体,通过高效训练和高质量数据集提升了多步骤决策任务的性能。

Comments Technique Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03252 2026-01-07 cs.CV

InfiniDepth: Arbitrary-Resolution and Fine-Grained Depth Estimation with Neural Implicit Fields

InfiniDepth:基于神经隐式场的任意分辨率和细粒度深度估计

Hao Yu, Haotong Lin, Jiawei Wang, Jiaxin Li, Yida Wang, Xueyang Zhang, Yue Wang, Xiaowei Zhou, Ruizhen Hu, Sida Peng

机构 * Zhejiang University(浙江大学) Li Auto(利汽车) Shenzhen University(深圳大学)

AI总结 InfiniDepth通过神经隐式场实现任意分辨率和细粒度深度估计,提升深度估计性能和新视角合成质量。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19453 2025-12-23 cs.RO

MaP-AVR: A Meta-Action Planner for Agents Leveraging Vision Language Models and Retrieval-Augmented Generation

MaP-AVR: 一种利用视觉语言模型和检索增强生成的元动作规划器

Zhenglong Guo, Yiming Zhao, Feng Jiang, Heng Jin, Zongbao Feng, Jianbin Zhou, Siyuan Xu

机构 * Li Auto

AI总结 MaP-AVR通过元动作规划和检索增强生成技术,提升机器人在复杂环境中的任务规划能力。

Comments 8 pages, 10 figures, This work was completed in December 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16360 2025-12-19 cs.CV

EverybodyDance: Bipartite Graph-Based Identity Correspondence for Multi-Character Animation

EverybodyDance: 基于二分图的身份对应关系的多角色动画

Haotian Ling, Zequn Chen, Qiuying Chen, Donglin Di, Yongjia Ma, Hao Li, Chen Wei, Zhulin Tao, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) Li Auto Communication University of China(通信大学) MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, USTC(教育部脑科学与智能感知认知重点实验室,中国科学技术大学)

AI总结 EverybodyDance通过构建身份匹配图和多尺度匹配策略,有效提升了多角色动画中身份对应关系的正确性和视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14225 2025-12-17 cs.CV

OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving

OmniGen:面向自动驾驶的统一多模态传感器生成

Tao Tang, Enhui Ma, xia zhou, Letian Wang, Tianyi Yan, Xueyang Zhang, Kun Zhan, Peng Jia, XianPeng Lang, Jia-Wang Bian, Kaicheng Yu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Westlake University(西湖大学) Li Auto Inc.(Li汽车公司) The University of Toronto(多伦多大学) University of Macau(澳门大学)

AI总结 OmniGen通过统一框架生成对齐的多模态传感器数据,结合共享BEV空间和UAE方法,实现高效且灵活的传感器生成。

Comments ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08591 2025-12-12 cs.CV

Joint2Human: High-quality 3D Human Generation via Compact Spherical Embedding of 3D Joints

Joint2Human: 通过紧凑的球面嵌入3D关节实现高质量3D人体生成

Muxin Zhang, Qiao Feng, Zhuo Su, Chao Wen, Zhou Xue, Kun Li

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) PICO IDL, ByteDance China(字节跳动中国PICO IDL) Li Auto(利亚德)

AI总结 Joint2Human通过紧凑球面嵌入3D关节,结合2D扩散模型和多视角重绘策略,实现高质量3D人体生成,兼顾全局结构与局部细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05152 2025-12-08 cs.CV

EFDiT: Efficient Fine-grained Image Generation Using Diffusion Transformer Models

EFDiT:利用扩散变换器模型实现高效的细粒度图像生成

Kun Wang, Donglin Di, Tonghua Su, Lei Fan

机构 * Harbin Institute of Technology(哈尔滨工业大学) Chongqing Research Institute of HIT(重庆HIT研究所) Li Auto(利汽车) University of New South Wales(新南威尔士大学)

AI总结 EFDiT通过引入分层嵌入器和ProAttention机制,提升细粒度图像生成的语义信息融合和细节表现,优于现有微调方法。

Comments 6pages, 5figures, published to 2025 IEEE International Conference on Multimedia and Expo (ICME), Nantes, France, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03574 2025-12-04 cs.CV

Global-Local Aware Scene Text Editing

全局-局部感知场景文本编辑

Fuxiang Yang, Tonghua Su, Donglin Di, Yin Chen, Xiangqian Wu, Zhongjie Wang, Lei Fan

机构 * Harbin Institute of Technology(哈尔滨工业大学) Li Auto Suzhou Research Institute(苏州研究院) University of New South Wales(新南威尔士大学)

AI总结 本文提出GLASTE模型,通过结合全局和局部信息,解决场景文本编辑中的不一致性和长度敏感性问题,提升编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02895 2025-12-04 cs.CV

MindGPT-4ov: An Enhanced MLLM via a Multi-Stage Post-Training Paradigm

MindGPT-4ov: 一种通过多阶段训练范式增强的多模态大语言模型

Wei Chen, Chaoqun Du, Feng Gu, Wei He, Qizhen Li, Zide Liu, Xuhao Pan, Chang Ren, Xudong Rao, Chenfeng Wang, Tao Wei, Chengjun Yu, Pengfei Yu, Yufei Zheng, Chunpeng Zhou, Pan Zhou, Xuhan Zhu

机构 * MindGPT-4o Team(MindGPT-4o 团队) Li Auto Inc.(利汽车公司)

AI总结 MindGPT-4ov通过多阶段训练范式提升多模态大语言模型的性能与泛化能力,实现低成本高效率的训练与部署。

Comments 33 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20073 2025-12-02 cs.CL cs.AI cs.MA

Collab-Overcooked: Benchmarking and Evaluating Large Language Models as Collaborative Agents

Collab-Overcooked: 大语言模型作为协作代理的基准测试与评估

Haochen Sun, Shuwen Zhang, Lujie Niu, Lei Ren, Hao Xu, Hao Fu, Fangkun Zhao, Caixia Yuan, Xiaojie Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Li Auto Inc

AI总结 本文提出Collab-Overcooked基准测试,评估大语言模型在协作代理中的表现,揭示其在目标解释和协作能力上的优劣。

Comments Accepted to EMNLP 2025 Main Conference. Camera-Ready Version. 30 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14530 2025-11-19 cs.CV cs.LG cs.MM

DeCo-VAE: Learning Compact Latents for Video Reconstruction via Decoupled Representation

Xiangchen Yin, Jiahui Yuan, Zhangchi Hu, Wenzhang Sun, Jie Chen, Xiaozhen Qiao, Hao Li, Xiaoyan Sun

机构 * University of Science and Technology of China(中国科学技术大学) Li Auto Inc.(力汽车公司)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13297 2025-11-18 cs.CV

CorrectAD: A Self-Correcting Agentic System to Improve End-to-end Planning in Autonomous Driving

Enhui Ma, Lijun Zhou, Tao Tang, Jiahuan Zhang, Junpeng Jiang, Zhan Zhang, Dong Han, Kun Zhan, Xueyang Zhang, XianPeng Lang, Haiyang Sun, Xia Zhou, Di Lin, Kaicheng Yu

机构 * Li Auto Inc. Autolab, Westlake University(Autolab,西lake大学)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00603 2025-07-02 cs.CV

World4Drive: End-to-End Autonomous Driving via Intention-aware Physical Latent World Model

Yupeng Zheng, Pengxuan Yang, Zebin Xing, Qichao Zhang, Yuhang Zheng, Yinfeng Gao, Pengfei Li, Teng Zhang, Zhongpu Xia, Peng Jia, Dongbin Zhao

机构 * CASIA(中国科学院自动化研究所) Li Auto(力汽车) PCL(鹏城实验室) NUS(新加坡国立大学) Tsinghua(清华大学)

Comments ICCV 2025, first version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23854 2025-07-01 cs.CV cs.GR

HiNeuS: High-fidelity Neural Surface Mitigating Low-texture and Reflective Ambiguity

Yida Wang, Xueyang Zhang, Kun Zhan, Peng Jia, Xianpeng Lang

机构 * Li Auto Inc.(利自动公司)

Comments Published in International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22756 2025-07-01 cs.CV cs.RO

RoboPearls: Editable Video Simulation for Robot Manipulation

Tao Tang, Likui Zhang, Youpeng Wen, Kaidong Zhang, Jia-Wang Bian, xia zhou, Tianyi Yan, Kun Zhan, Peng Jia, Hefeng Wu, Liang Lin, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Sun Yat-sen University(中山大学) Bytedance Seed(字节跳动种子) Li Auto Inc.(李自动公司)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04875 2025-07-01 cs.CV

3DRealCar: An In-the-wild RGB-D Car Dataset with 360-degree Views

Xiaobiao Du, Yida Wang, Haiyang Sun, Zhuojie Wu, Hongwei Sheng, Shuyun Wang, Jiaying Ying, Ming Lu, Tianqing Zhu, Kun Zhan, Xin Yu

机构 * The University of Queensland(昆士兰大学) University of Technology Sydney(悉尼技术大学) Li Auto Inc.(力汽车公司) City University of Macau(澳门城市大学) Peking University(北京大学)

Comments Project Page: https://xiaobiaodu.github.io/3drealcar

Journal ref ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10096 2025-06-16 cs.CV

A Self-supervised Motion Representation for Portrait Video Generation

Qiyuan Zhang, Chenyu Wu, Wenzhang Sun, Huaize Liu, Donglin Di, Wei Chen, Changqing Zou

机构 * Zhejiang University(浙江大学) Li Auto(利汽车) Zhejiang Lab(浙江实验室) Hangzhou Institute for Advanced Study,University of Chinese Academy of Sciences(杭州高等研究 institute, 中国科学院大学)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10977 2025-06-13 cs.CV

QuadricFormer: Scene as Superquadrics for 3D Semantic Occupancy Prediction

Sicheng Zuo, Wenzhao Zheng, Xiaoyong Han, Longchao Yang, Yong Pan, Jiwen Lu

机构 * Tsinghua University(清华大学) Li Auto Inc.(利亚 Auto 公司)

Comments Project page: https://zuosc19.github.io/QuadricFormer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04280 2025-06-06 cs.CV cs.AI

Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark

Ziming Cheng, Binrui Xu, Lisheng Gong, Zuhe Song, Tianshuo Zhou, Shiqi Zhong, Siyu Ren, Mingxiang Chen, Xiangchao Meng, Yuxin Zhang, Yanlin Li, Lei Ren, Wei Chen, Zhiyuan Huang, Mingjie Zhan, Xiaojie Wang, Fangxiang Feng

机构 * BUPT China(北京邮电大学) YSU China(云南大学) NUS Singapore(新加坡国立大学) Li Auto Inc. China(利汽车公司) SenseTime Research China(商汤研究)

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03109 2025-06-04 cs.LG

On Weak-to-Strong Generalization and f-Divergence

Wei Yao, Gengze Xu, Huayi Tang, Wenkai Yang, Donglin Di, Ziqiao Wang, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Li Auto Inc.(力汽车公司) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23036 2025-05-30 cs.SD eess.AS

AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition

Yuhang Dai, He Wang, Xingchen Li, Zihan Zhang, Shuiyuan Wang, Lei Xie, Xin Xu, Hongxiao Guo, Shaoji Zhang, Hui Bu, Wei Chen

机构 * Beijing AISHELL Technology Co., Ltd.(北京AISHELL科技有限公司) Beijing, China(中国北京) Li Auto Inc.(利汽车公司)

Comments 5 pages, 1 figures, 3 tables, accepted by InterSpeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22421 2025-05-30 cs.CV cs.RO

GeoDrive: 3D Geometry-Informed Driving World Model with Precise Action Control

Anthony Chen, Wenzhao Zheng, Yida Wang, Xueyang Zhang, Kun Zhan, Peng Jia, Kurt Keutzer, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Li Auto Inc.(利亚德公司) UC Berkeley(加州大学伯克利分校)

Comments code will be released at https://github.com/antonioo-c/GeoDrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11922 2025-05-20 cs.CL

Enhancing Complex Instruction Following for Large Language Models with Mixture-of-Contexts Fine-tuning

Yuheng Lu, ZiMeng Bai, Caixia Yuan, Huixing Jiang, Xiaojie Wang

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学) LI Auto Inc.(LI汽车公司)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19614 2025-04-29 cs.CV

DiVE: Efficient Multi-View Driving Scenes Generation Based on Video Diffusion Transformer

Junpeng Jiang, Gangyi Hong, Miao Zhang, Hengtong Hu, Kun Zhan, Rui Shao, Liqiang Nie

机构 * Harbin Institute of Technology(哈尔滨工业大学) Li Auto Inc.(Li汽车公司) Tsinghua University(清华大学)

详情

展开后加载摘要…

URL PDF HTML 收藏