arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Li Auto(理想汽车)

共收录 122
2510.22973 2026-05-26 cs.CV

Scaling Up Occupancy-centric Driving Scene Generation: Dataset and Method

扩展以占据为中心的驾驶场景生成:数据集与方法

Bohan Li, Xin Jin, Hu Zhu, Hongsi Liu, Ruikai Li, Jiazhe Guo, Kaiwen Cai, Chao Ma, Yueming Jin, Hao Zhao, Xiaokang Yang, Wenjun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东部技术研究院) School of Electronic Information and Electrical Engineering(电子信息与电气工程学院) Li Auto(力汽车) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生实验室) Ningbo Institute of Digital Twin(宁波数字孪生研究院)

AI总结 针对占据数据稀缺问题,构建最大语义占据数据集Nuplan-Occ,并提出统一框架联合生成高质量语义占据、多视角视频和LiDAR点云,采用时空解耦架构及高斯泼溅稀疏点图渲染和传感器感知嵌入策略,实现高保真生成。

Comments IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04537 2026-05-22 cs.LG cs.CL

Linear Dynamics in the RLVR Training of Large Language Models

在大语言模型RLVR训练中的线性动力学

Tianle Wang, Jiayu Liu, Zhongyuan Wu, Shenghao Jin, Wei Chen, Hao Xu, Ning Miao

机构 * Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Hong Kong Institute of AI for Science, City University of Hong Kong(香港城市大学人工智能科学研究院) Li Auto Inc. Beihang University(北航大学)

AI总结 本文研究了强化学习可验证奖励(RLVR)在大语言模型训练中的内部动态,发现RLVR在多种模型和训练配置下均进入线性区域,通过实验和理论分析证明这种线性特性源于训练信号的高方差和噪声,且具有预测性和实用性。

Comments Major revision: substantially reorganized the manuscript and added a theoretical explanation section. The replacement is intended for the same arXiv paper; the core topic and contribution remain the same

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21372 2026-05-21 cs.CV cs.AI cs.LG cs.RO

Closed Loop Dynamic Driving Data Mixture for Real-Synthetic Co-Training

闭环动态驾驶数据混合用于真实-合成协同训练

Hongzhi Ruan, Pei Liu, Weiliang Ma, Zhengning Li, Xueyang Zhang, Jun Ma, Dan Xu, Kun Zhan

机构 * Li Auto(力汽车) HKUST(香港科技大学) HKUST (GZ)(香港科技大学(广州))

AI总结 本文提出了一种闭环动态数据混合方法,通过动态优化过程调整训练数据混合比例,以提升模型性能,解决了在有限预算下优化数据混合的关键问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20961 2026-05-21 cs.CV

Preserve, Reveal, Expand: Faithful 4D Video Editing with Region-Aware Conditioning

保留、揭示、扩展:基于区域感知的4D视频编辑

Zhangchi Hu, Wenzhang Sun, Xiangchen Yin, Jiahui Yuan, Chunfeng Wang, Hao Li, Kun Zhan, Xiaoyan Sun

机构 * University of Science and Technology of China(中国科学技术大学) Li Auto Inc.(利汽车公司)

AI总结 本文提出PREX框架,通过区域感知分解目标时空体积,解决4D视频编辑中区域保持、揭示和扩展的问题,提升了视频编辑的准确性和稳定性。

Comments 23 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18548 2026-05-19 cs.CL cs.AI

STT-Arena: A More Realistic Environment for Tool-Using with Spatio-Temporal Dynamics

STT-Arena:一种更现实的工具使用环境,包含时空动态

Tingfeng Hui, Hao Xu, Pengyu Zhu, Hongsheng Xin, Kun Zhan, Sen Su, Chunxiao Liu, Ning Miao

机构 * Hong Kong Institute of AI for Science, City University of Hong Kong(香港人工智能科学研究院,香港城市大学) Department of Data Science, City University of Hong Kong(数据科学系,香港城市大学) Beijing University of Posts and Telecommunications(北京邮电大学) Li Auto Inc.(李汽有限公司) Independent Researcher(独立研究者)

AI总结 本文提出STT-Arena基准测试,旨在评估大型语言模型在面对时空动态变化时的适应性规划能力,发现现有模型在处理此类动态问题时存在显著不足,并提出改进方法STT-Agent-4B以提升性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12625 2026-05-15 cs.RO cs.CV

Driving Intents Amplify Planning-Oriented Reinforcement Learning

意图驱动强化学习放大规划导向的强化学习

Hengtong Lu, Victor Shea-Jay Huang, Chengmin Yang, Pengfei Jing, Jifeng Dai, Yan Xie, Benjin Zhu

机构 * Li Auto(力 auto) Tsinghua University(清华大学) CUHK MMLab(香港大学MMLab)

AI总结 本文提出DIAL框架,通过两阶段方法解决连续动作策略在偏好对齐中的模式崩溃问题,通过意图引导的采样扩展分布并提升性能。

Comments Project page: https://mind-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12624 2026-05-15 cs.RO cs.CV

MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving

MindVLA-U1:统一流架构使VLA超越VA用于自动驾驶

Yuzhou Huang, Benjin Zhu, Hengtong Lu, Victor Shea-Jay Huang, Haiming Zhang, Wei Chen, Jifeng Dai, Yan Xie, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) Li Auto Tsinghua University(清华大学)

AI总结 MindVLA-U1通过统一流架构实现自动驾驶中VLA超越VA,采用统一视觉语言模型骨干和流匹配连续动作轨迹,在保持各模态自然输出形式的同时,实现高效规划和低延迟。

Comments Work in progress. Project page: https://mind-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12622 2026-05-15 cs.RO cs.CV

Action Emergence from Streaming Intent

从流式意图中涌现动作

Pengfei Jing, Victor Shea-Jay Huang, Hengtong Lu, Jifeng Dai, Yan Xie, Benjin Zhu

机构 * Li Auto Tsinghua University(清华大学) CUHK

AI总结 本文提出流式意图方法,通过连续思维链生成语义合适且安全的动作,实现自动驾驶中长尾交通场景的自主决策。

Comments Project page: https://mind-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12163 2026-05-14 cs.CV

Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model

自洽潜在推理:面向视觉语言模型的长潜在序列推理

Chenfeng Wang, Wei He, Xuhan Zhu, Chunpeng Zhou, Qizhen Li, Song Yan, Yufei Zheng, Chengjun Yu, Fan Lu, Wei Zhai, Yang Cao, Pengfei Yu, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Li Auto Inc.(利亚自动化公司)

AI总结 本文提出SCOLAR模型,通过轻量级detransformer生成辅助视觉token,结合三阶段SFT和ALPO强化学习,显著提升视觉语言模型的长序列推理能力,达到开源模型在现实任务中的最佳性能。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07756 2026-05-12 cs.CV

Determinism of Randomness: Prompt-Residual Seed Shaping for Diffusion Generation

随机性的确定性:提示残差种子塑形用于扩散生成

Song Yan, Wei Zhai, Chenfeng Wang, Xinliang Bi, Jian Yang, Yancheng Cai, Yusen Zhang, Yunwei Lan, Tao Zhang, GuanYe Xiong, Min Li, Zheng-Jun Zha

机构 * USTC(中国科学技术大学) Li Auto Inc.(利亚自动化公司) Xi’an High-tech Research Institute(西安高新技术研究院) Wechat Vision(微信视觉) Cambridge University(剑桥大学) HUST(华中科技大学)

AI总结 本文研究了扩散生成中种子敏感性,提出无需训练的提示残差种子塑形方法,通过单个高噪声冷启动提示残差提升生成对齐和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09924 2026-05-12 cs.CL

Evolving Knowledge Distillation for Lightweight Neural Machine Translation

进化知识蒸馏用于轻量级神经机器翻译

Xuewen Zhang, Haixiao Zhang, Xinlong Huang

机构 * Department of Content Generation(内容生成系) Li Auto Beijing, China(中国北京)

AI总结 本文提出进化知识蒸馏方法,通过逐步增加教师模型容量,解决教师-学生模型容量差距问题,实验显示在多个数据集上提升了翻译性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09879 2026-05-12 cs.AI

M2A: Synergizing Mathematical and Agentic Reasoning in Large Language Models

M2A:在大型语言模型中协同数学与代理推理

Junjian Wang, Xin Zhou, Qiran Xu, Kun Zhan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Li Auto Inc.(Li Auto公司)

AI总结 本文提出M2A框架,通过模型融合协同数学与代理推理,提升多任务学习下的推理稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16349 2026-05-12 cs.IR cs.AI cs.CL

Benchmarking Real-Time Question Answering via Executable Code Workflows

通过可执行代码工作流基准测试实时问答

Wenjie Zhou, Yuan Gao, Xin Zhou, Hao Fu, Zhongjian Miao, Wei Chen, Bo Chen, Xiaobing Zhao

机构 * Li Auto Inc(利亚 Auto 公司) Minzu University of China(民族大学)

AI总结 本文提出RT-QA框架,通过可执行代码工作流实现动态评估,发现现有模型在实时适应性上存在显著不足,主要问题包括懒惰检索和时间混淆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07359 2026-05-11 cs.CV

UniISP: A Unified ISP Framework for Both Human and Machine Vision

UniISP: 一种兼顾人类和机器视觉的统一ISP框架

Hanxi Li, Yao Cheng, Bo Zhang, Li Zeng

机构 * Li Auto Inc.(利自动公司)

AI总结 本文提出UniISP框架,结合混合注意力模块和监督学习,生成视觉 pleasing 的图像,同时通过特征适配模块提升下游任务性能,实验显示其在多种场景和数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23996 2026-04-28 cs.CV

SMoES: Soft Modality-Guided Expert Specialization in MoE-VLMs

SMoES:在MoE-VLMs中的软模态引导专家专业化

Zi-Hao Bo, Yaqian Li, Anzhou Hou, Rinyoichi Takezoe, Ertao Zhao, Tianxiang Pan, Jiale Yan, Mo Guang, Kaiwen Long

机构 * Li Auto Inc.(李自动公司)

AI总结 本文提出SMoES,通过动态软模态评分、专家分组机制和互信息正则化,提升MoE-VLMs的模态感知专家专业化,实验显示在多模态和语言任务上平均提升0.9%和4.2%,通信开销降低56.1%,吞吐量提升12.3%。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23950 2026-04-28 cs.CV

LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models

LearnPruner: 重新思考基于注意力的视觉语言模型中令牌修剪

Rinyoichi Takezoe, Yaqian Li, Zihao Bo, Anzhou Hou, Mo Guang, Kaiwen Long

机构 * Li Auto Inc.(利自动公司)

AI总结 本文提出LearnPruner,通过两阶段令牌修剪框架在视觉语言模型中实现高效修剪,保留95%性能的同时减少5.5%视觉令牌使用,提升3.2倍推理速度。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04751 2026-04-28 cs.AI

Evaluating the Search Agent in a Parallel World

在平行世界中评估搜索代理

Jiawei Chen, Xintian Shen, Lihao Zheng, Lifu Mu, Haoyi Sun, Ning Mao, Hao Ma, Tao Wei, Pan Zhou, Kun Zhan

机构 * Li Auto

AI总结 本文提出Mind-ParaWorld框架,通过生成未来场景和不可侵犯的原子事实,解决传统搜索代理评估中的基准构建、动态过时和证据判断难题。

Comments https://github.com/TIMMY-CHAN/Mind-ParaWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22240 2026-04-27 cs.CV

OccDirector: Language-Guided Behavior and Interaction Generation in 4D Occupancy Space

OccDirector:基于语言的4D占用空间中行为与交互生成

Zhuding Liang, Tianyi Yan, Dubing Chen, Jiasen Zheng, Huan Zheng, Cheng-zhong Xu, Yida Wang, Kun Zhan, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau, Macau, China(SKL-IOTSC、CIS、澳门大学、澳门、中国) Li Auto Inc, Beijing, China(Li Auto Inc、北京、中国)

AI总结 本文提出OccDirector框架,通过自然语言生成4D占用空间动态,解决复杂多代理交互生成问题,引入多级语言指令数据集和评估基准,实现语言驱动的行为编排。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19257 2026-04-22 cs.CV

Unposed-to-3D: Learning Simulation-Ready Vehicles from Real-World Images

未置姿到3D:从真实世界图像学习仿真准备的车辆

Hongyuan Liu, Bochao Zou, Qiankun Liu, Haochen Yu, Qi Mei, Jianfei Jiang, Chen Liu, Cheng Bi, Zhao Wang, Xueyang Zhang, Yifei Zhan, Jiansheng Chen, Huimin Ma

机构 * University of Science and Technology Beijing(北京科技大学) Li Auto Inc(利汽车公司)

AI总结 本文提出Unposed-to-3D框架,通过图像-only监督从真实驾驶图像重建3D车辆,解决现有方法在真实世界分布上的领域差距问题,实现姿态一致且符合仿真的3D模型生成。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17862 2026-04-21 cs.LG cs.AR

M100: An Orchestrated Dataflow Architecture Powering General AI Computing

M100:一种赋能通用人工智能计算的协同数据流架构

Yan Xie, Changkui Mao, Changsong Wu, Chao Lu, Chao Suo, Cheng Qian, Chun Yang, Danyang Zhu, Hengchang Xiong, Hongzhan Lu, Hongzhen Liu, Jiafu Liu, Jie Chen, Jie Dai, Junfeng Tang, Kai Liu, Kun Li, Lipeng Ge, Meng Sun, Min Luo, Peng Chen, Peng Wang, Shaodong Yang, Shibin Tang, Shibo Chen, Weikang Zhang, Xiao Ling, Xiaobo Du, Xin Wu, Yang Liu, Yi Jiang, Yihua Jin, Yin Huang, Yuli Zhang, Zhen Yuan, Zhiyuan Man, Zhongxiao Yao

机构 * Li Auto

AI总结 M100通过协同数据流架构提升自动驾驶、大语言模型等领域的AI计算效率与成本效益,采用编译器-架构协同设计优化数据传输,减少缓存依赖,提升系统性能。

Comments Accepted to appear at ISCA 2026 Industry Track. 12 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07937 2026-04-21 cs.CL

HCRE: LLM-based Hierarchical Classification for Cross-Document Relation Extraction with a Prediction-then-Verification Strategy

HCRE: 基于大语言模型的跨文档关系抽取的分层分类方法

Guoqi Ma, Liang Zhang, Hongyao Tu, Hao Fu, Hui Li, Yujie Lin, Longyue Wang, Weihua Luo, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Li Auto Inc.(Li Auto公司) Alibaba International Digital Commerce Group(阿里巴巴国际数字贸易集团)

AI总结 本文提出HCRE方法,通过分层关系树减少LLM需考虑的关系选项,结合预测-验证策略提升可靠性,实验表明其优于现有基线。

Comments ACL 2026 Findings; camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00789 2026-04-21 cs.CV

CogDriver: Integrating Cognitive Inertia for Temporally Coherent Planning in Autonomous Driving

CogDriver:通过整合认知惯性实现自动驾驶中的时间一致规划

Pei Liu, Qingtian Ning, Xinyan Lu, Haipeng Liu, Weiliang Ma, Dangen She, Peng Jia, Xianpeng Lang, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Li Auto Inc.(利汽车公司)

AI总结 本文提出CogDriver框架,通过引入认知惯性提升自动驾驶中的时间一致性规划能力,通过大规模视觉-语言-动作数据集和稀疏时间记忆架构,显著提升了闭环驾驶得分和模仿准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14518 2026-04-20 cs.AI

Mind DeepResearch Technical Report

Mind DeepResearch 技术报告

MindDR Team, Li Auto Inc

机构 * MindDR Team(MindDR团队) Li Auto Inc(Li Auto公司)

AI总结 MindDR通过高效多智能体深度研究框架,在仅30B参数模型下实现领先性能,采用精心设计的数据合成和多阶段训练流程,其核心创新为三智能体架构及四阶段智能体专用训练流程,展现竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14629 2026-04-17 cs.CV

Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models

Switch-KD:视觉切换知识蒸馏用于视觉-语言模型

Haoyi Sun, Xiaoxiao Wang, Ning Mao, Qian Wang, Lifu Mu, Wen Zheng, Tao Wei, Wei Chen

机构 * Li Auto Inc(利-auto公司)

AI总结 Switch-KD通过统一视觉-语言知识转移,解决多模态对齐问题,使小模型高效蒸馏大模型的多模态知识。

Comments 11 pages, 3 figures

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22039 2026-04-15 cs.CV

SparseWorld-TC: Trajectory-Conditioned Sparse Occupancy World Model

SparseWorld-TC: 基于轨迹的稀疏占用世界模型

Jiayuan Du, Yiming Zhao, Zhenglong Guo, Yong Pan, Wenbo Hou, Zhihui Hao, Kun Zhan, Qijun Chen

机构 * Tongji University(同济大学) Li Auto Inc(力汽车公司)

AI总结 本文提出了一种基于轨迹的未来3D场景占用预测新架构,通过端到端方式直接从原始图像特征预测多帧占用,避免了离散token化和BEV表示的限制,实现了nuScenes基准上的1-3秒占用预测最优性能。

Comments Accepted by CVPR2026 as an oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02387 2026-04-14 cs.AI

VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments

VS-Bench:评估多智能体环境中视觉语言模型的战略能力

Zelai Xu, Zhexuan Xu, Xiangmin Yi, Huining Yuan, Mo Guang, Kaiwen Long, Xinlei Chen, Yi Wu, Chao Yu, Yu Wang

机构 * EE, Tsinghua University(清华大学电子工程系) SIGS, Tsinghua University(清华大学深圳国际研究生院) Li Auto Inc.(理想汽车) IIIS, Tsinghua University(清华大学交叉信息研究院)

AI总结 VS-Bench是首个评估多智能体环境中视觉语言模型战略能力的多模态基准,涵盖合作、竞争和混合动机交互,通过感知、推理和决策三个维度评估15种领先模型,揭示当前模型在推理和决策上的显著差距。

Comments Published at CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09023 2026-04-13 cs.CV

CAD 100K: A Comprehensive Multi-Task Dataset for Car Related Visual Anomaly Detection

CAD 100K:一个全面的多任务数据集用于汽车相关视觉异常检测

Jiahua Pang, Ying Li, Dongpu Cao, Jingcai Luo, Yanuo Zheng, Bao Yunfan, Yujie Lei, Rui Yuan, Yuxi Tian, Guojin Yuan, Hongchang Chen, Zhi Zheng, Yongchun Liu

机构 * Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学) China Agricultural University(中国农业大学) Beijing Jiaotong University(北京交通大学) The Hong Kong Polytechnic University(香港理工大学) Li Auto(理想汽车)

AI总结 本文提出CAD 100K数据集,用于汽车相关多任务视觉异常检测,包含100万张图像,涵盖7个车辆领域和3个任务,通过合成数据增强实现少样本异常检测,验证了多任务学习在任务交互和知识迁移中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14075 2026-04-13 cs.CV cs.CL

Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models

通过蒸馏和强化学习生长多头Twig以加速大视觉-语言模型

Zhenwei Shao, Mingyang Wang, Weijun Zhang, Zhou Yu, Wenwen Pan, Yan Yang, Tao Wei, Hongyuan Zhang, Jun Yu

机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission, School of Computer Science, Hangzhou Dianzi University(浙江省空间信息感知与传输重点实验室,计算机学院,杭州电子科技大学) Li Auto Inc.(理想汽车) School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院)

AI总结 本文提出TwigVLM,通过在基础VLM早期层上生长轻量模块Twig,结合 Twig 引导的 token 剪枝和自推测解码策略,实现更高的准确性和速度。实验表明, TwigVLM 在剪枝88.9%的视觉token后仍保持96%的原始性能,并在生成长响应时达到154%的速度提升。

Comments An extended version of our ICCV paper at ICCV2025/html/Shao_Growing_a_Twig_to_Accelerate_Large_Vision-Language_Models_ICCV_2025_paper.html" target="_blank" rel="noopener">https://openaccess.thecvf.com/content/ICCV2025/html/Shao_Growing_a_Twig_to_Accelerate_Large_Vision-Language_Models_ICCV_2025_paper.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08301 2026-04-10 cs.CV

GroundingAnomaly: Spatially-Grounded Diffusion for Few-Shot Anomaly Synthesis

GroundingAnomaly: 基于空间的扩散用于少样本异常合成

Yishen Liu, Hongcang Chen, Pengcheng Zhao, Yunfan Bao, Yuxi Tian, Jieming Zhang, Hao Chen, Zheng Zhi, Yongchun Liu, Ying Li, Dongpu Cao

机构 * Beijing Institute of Technology(北京理工大学) Beijing Jiaotong University(北京交通大学) Li Auto(理想汽车) Tsinghua University(清华大学)

AI总结 本文提出GroundingAnomaly框架,通过空间条件模块和门控自注意力模块实现精准异常合成,提升少样本异常检测性能。

Comments 32 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15958 2026-04-07 cs.CV

FreeGraftor: Training-Free Cross-Image Feature Grafting for Subject-Driven Text-to-Image Generation

FreeGraftor:无需训练的跨图像特征移植用于主体驱动的文本到图像生成

Zebin Yao, Lei Ren, Huixing Jiang, Wei Chen, Xiaojie Wang, Ruifan Li, Fangxiang Feng

机构 * College of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Li Auto Inc.(理想汽车)

AI总结 本文提出FreeGraftor,通过跨图像特征移植解决主体驱动图像生成中保真度与效率的平衡问题,采用语义匹配和位置约束注意力融合,结合新的噪声初始化策略,实现高保真主体身份迁移和文本对齐的场景合成。

Comments Code: https://github.com/Nihukat/FreeGraftor

详情

展开后加载摘要…

URL PDF HTML 收藏