arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Huazhong University of Science and Technology(华中科技大学)

共收录 50
2604.05809 2026-08-14 cs.CR cs.LG 版本更新

Adjustable Text-Guided Backdoor Attacks with Natural-Word Triggers on Multimodal Pretrained Models

隐蔽且可调节的文本引导后门攻击多模态预训练模型

Yiyang Zhang, Chaojian Yu, Ziming Hong, Yuanjie Shao, Qinmu Peng, Tongliang Liu, Xinge You

机构 * National Anti-Counterfeit Engineering Research Center, Huazhong University of Science and Technology(华中科技大学国家防伪工程技术研究中心) School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) Sydney AI Centre, The University of Sydney(悉尼大学悉尼人工智能中心)

AI总结 本文提出一种基于文本的后门攻击方法,利用常见文本词汇作为触发器,提升攻击隐蔽性和实用性,并通过视觉对抗扰动调节模型对文本触发器的学习,实现可控的攻击效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10810 2026-08-13 cs.CL cs.AI 版本更新

Surfacing the Unsaid: CUE-Bench for Affective Stance in Chinese Discourse

揭示未明之言:面向中文话语情感立场的CUE-Bench基准

Zhenyan Zheng, Yunyao Zhang, Junxi Sheng, Junqing Yu, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 针对现有情感基准缺乏情感相关要素结构化说明的问题,本文构建了以情感立场为核心的CUE Bench基准,实验证实融入情感立场可提升细粒度情感识别与语用意图检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08494 2026-08-12 cs.CV 版本更新

Linguistically-Aligned and Visually-Grounded Preference Optimization for Clinically-Augmented Medical Report Generation

面向临床增强型医疗报告生成的语言对齐与视觉 grounded 的偏好优化

Qiang Hu, Yuxuan Luo, Yingjie Guo, Hao Wang, Qimei Wang, Qiang Li, Zhiwei Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 针对现有医疗报告生成方法的临床事实错误与视觉-语言对齐不足问题,提出DPO-Clin框架,通过ECD模块、M²DPO及反事实偏好数据构建提升模型可靠性,在多医学数据集上取得优异性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07904 2026-08-12 cs.CV 版本更新

DeCo: Zero-Shot Industrial Anomaly Generation through Decoupling and Recoupling

DeCo:通过解耦与重耦实现零样本工业异常生成

Shilei Zeng, Xurui Li, Yaohan Tang, Yu Zhou

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院)

AI总结 本文提出DeCo方法,通过解耦与重耦实现零样本工业异常生成,解决现有方法的局限,在MVTec AD和VisA数据集上训练下游检测模型分别获5.1%、8.2%的像素级AP提升,达到新最优性能。

Comments Accepted at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07864 2026-08-12 cs.CV 版本更新

UniScale: Arbitrary-Scale Industrial Anomaly Generation

UniScale:任意尺度的工业异常生成

Shilei Zeng, Linxin Guan, Xurui Li, Yaohan Tang, Yu Zhou

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院)

AI总结 针对工业异常检测中真实异常样本不足及小尺度异常易丢失的问题,提出UniScale框架,通过EMT策略和生成后融合去噪方法,在VisA、MVTec AD 2等数据集上显著优于现有方法。

Comments Accepted at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04597 2026-08-11 cs.LG stat.ML 版本更新

Minimum Block Width for Universal Approximation by Residual Neural Networks with Inner Width One

具有内部宽度为一的残差神经网络通用逼近的最小块宽度

Qi Zhou, Xuan Zhou, Xiao-Song Yang

机构 * School of Mathematics and Statistics, Huazhong University of Science and Technology(华中科技大学数学与统计学院) Hubei Key Laboratory of Engineering Modeling and Scientific Computing, Huazhong University of Science and Technology(湖北省工程建模与科学计算重点实验室)

AI总结 研究残差神经网络通用逼近性质,针对特定激活函数建立块宽度上下界,证明内部宽度为1时在紧致域上实现\(L^p\)逼近的最小块宽度,还给出特定块宽度网络能实现一致逼近及宽度小于某值不能逼近所有目标函数的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27519 2026-08-11 cs.CV 版本更新

SPROUT: A Scalable Diffusion Foundation Model for Agricultural Vision

SPROUT:一种用于农业视觉的可扩展扩散基础模型

Shuai Xiang, James Burridge, Shouyang Liu, Hao Lu, Tokihiro Fukatsu, Yinqiang Zheng, Wei Guo

机构 * Graduate School of Agricultural and Life Sciences, The University of Tokyo(东京大学大学院农学生命科学研究科) National Key Laboratory of Multispectral Information Intelligent Processing Technology, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学多谱信息智能处理技术全国重点实验室、人工智能与自动化学院) Institute of Agricultural Machinery, NARO(日本国立研究开发法人农业·食品产业技术综合研究机构农业机械研究所) Institute of Life and Environmental Sciences, University of Tsukuba(筑波大学生命环境科学研究所)

AI总结 SPROUT是一种基于扩散去噪的多作物多任务农业基础模型,通过大规模未标注数据预训练,在多种下游任务中表现优异,且预训练成本较低。

Comments Code: https://github.com/UTokyo-FieldPhenomics-Lab/SPROUT Dataset: https://huggingface.co/datasets/XIANG-Shuai/MCD-2.6m

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01267 2026-08-11 cs.LG 版本更新

Diving into Kronecker Adapters: Component Design Matters

深入Kronecker适配器:组件设计至关重要

Jiayu Bai, Danchen Yu, Zhenyu Liao, TianQi Hou, Feng Zhou, Robert C. Qiu, Zenan Ling

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息学院) Huawei(华为) Center for Applied Statistics and School of Statistics, Renmin University of China(中国人民大学应用统计中心和统计学院)

AI总结 本文通过分析Kronecker适配器的组件维度和数量,提出组件设计的Kronecker适配器(CDKA),并给出参数预算感知的配置指南和训练稳定策略,实验证明其有效性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20266 2026-08-04 cs.SD 版本更新

A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook

大型音频语言模型综述:通用性、可信度与展望

Kaiwen Luo, Zhenhong Zhou, Leyan Wang, Liang Lin, Tianyu Shao, Yuanhe Zhang, Yang Xiao, Yuxuan Li, Miao Yu, Kailin Lyu, Jiaming Zhang, Li Sun, Songze Li, Yueming Wu, Ting Dang, Xiaojun Jia, Dongrui Liu, Kai Li, Rohan Kumar Das, Siyuan Liang, Xinfeng Li, Qiankun Li, Jing Chen, Xingjun Ma, Kun Wang, Junhao Dong, Deqing Zou, Yu Cheng, Xia Hu, Zhigang Zeng, Sen Su, Yang Liu, Yu-Gang Jiang, Philip S. Yu, Yew-Soon Ong

机构 * Nanyang Technological University(南洋理工大学) Independent Researcher(独立研究者) The University of Melbourne(墨尔本大学) North China Electric Power University(华北电力大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) Fortemedia Singapore(富媒体新加坡) Tencent(腾讯) Fudan University(复旦大学) Wuhan University(武汉大学) Chinese University of Hong Kong(香港中文大学) Chongqing University of Posts and Telecommunications(重庆邮电大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

AI总结 本文综述了大型音频语言模型的通用性、可信度及未来发展方向,探讨了其架构创新、对齐算法及安全风险,并提出了防御深入、因果音频世界建模等策略以提升音频智能的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10719 2026-08-04 cs.RO cs.CV 版本更新

From Representational Complementarity to Dual Systems: Synergizing VLM and Vision-Only Backbones for End-to-End Driving

从表征互补性到双系统:协同VLM和纯视觉骨干网络用于端到端驾驶

Sining Ang, Yuguang Yang, Chenxu Dang, Canyu Chen, Cheng Chi, Haiyan Liu, Xuanyao Mao, Jason Bao, Xuliang, Bingchuan Sun, Yan Wang

机构 * Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) School of Electronic Information Engineering, Beihang University(北京航空航天大学电子信息工程学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) National Superior College for Engineers, Beihang University(北京航空航天大学国家级工程师学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Lenovo Group Limited(联想集团有限公司) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院)

AI总结 本文通过协同VLM和纯视觉骨干网络,提出HybridDriveVLA和DualDriveVLA,提升端到端驾驶的PDMS性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13319 2026-08-03 cs.LG 版本更新

LightningRL: Breaking the Accuracy-Parallelism Trade-off of Block-wise dLLMs via Reinforcement Learning

LightningRL: 通过强化学习打破块状dLLMs的精度-并行性权衡

Yanzhe Hu, Yijie Jin, Pengfei Liu, Kai Yu, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出LightningRL框架,通过强化学习优化预训练dLLMs的速度-质量帕累托前沿,提升并行生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12753 2026-07-31 cs.CV 版本更新

RFMSR: Residual Flow Matching for Image Super-Resolution

RFMSR:用于图像超分辨率的残差流匹配

Shuwei Huang, Tianyao Luo, Jicheng Liu, Pan Zhou

机构 * Huazhong University of Science and Technology(华中科技大学) Wuhan University(武汉大学)

AI总结 研究针对图像超分辨率,提出残差流匹配框架RFMSR,将源分布集中于LQ潜变量以减少传输距离并保留结构先验,采用两阶段训练策略,实验证明该方法相比SOTA实现了相当甚至更优的感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27628 2026-07-29 cs.AI 版本更新

DSevolve: Enabling Real-Time Adaptive Scheduling on Dynamic Flexible Job Shop with LLM-Evolved Heuristic Portfolios

DSevolve:基于LLM进化启发式组合的动态车间实时自适应调度框架

XinLei Zhou, Jin Huang, Jie Yang, Xinyu Li, Liang Gao

机构 * School of Mechanical Science and Engineering, Huazhong University of Science and Technology(华中科技大学机械科学与工程学院)

AI总结 本文提出DSevolve框架,通过离线进化高质量调度规则组合并在突发扰动时快速部署,优于现有AHD框架和经典调度规则,解决动态车间调度的适应性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26795 2026-07-28 cs.AI 版本更新

What Does Chain-of-Thought Contribute at Probe Time? Evidence for Local Co-Occurrence Activation

链式思维在探测时为何有效?局部共现而非全局推导

Xiang Wang, Wei Wei

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 研究链式思维提示在探测时提升语言模型准确率的原因,发现增益主要来自词汇激活和短距离标记共现,而非句子级逻辑推导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08992 2026-07-28 cs.AI 版本更新

Rethinking Prospect Theory for LLMs: Revealing the Instability of Decision-Making under Epistemic Uncertainty

重新思考用于大语言模型的前景理论:在认知不确定性下决策的不稳定性

Rui Wang, Qihan Lin, Jiayu Liu, Qing Zong, Tianshi Zheng, Dadi Guo, Haochen Shi, Peixuan Han, Weiqi Wang, Yangqiu Song

机构 * Hong Kong University of Science and Technology(香港科技大学) Huazhong University of Science and Technology(华中科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文重新审视前景理论在大语言模型中的应用,发现其在认知不确定性下的决策稳定性存在问题,指出前景理论可能无法可靠地处理此类不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13335 2026-07-28 cs.CV 版本更新

Deblur-Avatar: Animatable Avatars from Motion-Blurred Monocular Videos

Deblur-Avatar:从运动模糊单目视频生成可动画化头像

Xianrui Luo, Juewen Peng, Zhongang Cai, Lei Yang, Fan Yang, Zhiguo Cao, Guosheng Lin

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) S-Lab for Advanced Intelligence, Nanyang Technological University(南洋理工大学先进智能实验室) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) SenseTime Research(商汤科技研究院)

AI总结 该研究针对运动模糊单目视频输入,提出将基于人类运动的运动模糊模型集成到3D高斯平铺的框架,通过优化轨迹和高斯分布重建高质量可动画化头像,实验证明其在渲染质量等方面显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14617 2026-07-27 cs.LG 版本更新

HD3C: Efficient Medical Data Classification for Edge Devices

HDC-X:面向嵌入式设备的高效医疗数据分类

Jianglan Wei, Zhenyu Zhang, Pengcheng Wang, Mingjie Zeng, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出HDC-X框架,通过高维超向量编码和聚类原型聚合,实现低功耗医疗数据分类,在心脏病声音分类中比贝叶斯ResNet节能350倍,且具备抗噪声和数据限制的鲁棒性。

Journal ref CAAI International Conference on Artificial Intelligence (CICAI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07556 2026-07-24 cs.HC cs.AI 版本更新

Backpropagation-Free Test-Time Adaptation for Lightweight EEG-Based Brain-Computer Interfaces

无需反向传播的测试时间适应用于轻量级基于EEG的脑机接口

Siyang Li, Jiayi Ouyang, Zhenyao Cui, Ziwei Wang, Tianwang Jia, Feng Wan, Dongrui Wu

机构 * Ministry of Education Key Laboratory of Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(教育部长图像处理与智能控制重点实验室,人工智能与自动化学院,华中科技大学) Shenzhen Huazhong University of Science and Technology Research Institute(深圳华中科技大学研究机构) Department of Electrical and Computer Engineering, Faculty of Science and Technology, University of Macau(科技学院电子与计算机工程系,澳门大学) Centre for Cognitive and Brain Sciences, Institute of Collaborative Innovation, University of Macau(认知与脑科学中心,创新研究院,澳门大学)

AI总结 本文提出无需反向传播的变换(BFT)方法,用于解决EEG解码中的测试时间适应问题,通过样本级变换和学习到排名模块提升鲁棒性和效率,实现轻量级BCI的部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02187 2026-07-23 cs.CR cs.AI 版本更新

Rewriting the Response Path: Silent Tampering and Provider-Signed Defense in BYOK LLM Agents

重写响应路径:BYOK LLM 代理中的静默篡改与提供者签名防御

Mingyu Luo, Zihan Zhang, Zesen Liu, Yuchong Xie, Zhixiang Zhang, Dung Hiu Hilton Yeung, Wai Ip Lai, Ping Chen, Ming Wen, Dongdong She

机构 * Fudan University(复旦大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 研究BYOK LLM代理响应路径完整性问题,发现中继可篡改响应。提出sign-c服务器端方案,能认证执行承载字段和查询,本地垫片验证,加密保护机密性,防御有效拒绝篡改响应,误拒率为零,延迟开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17332 2026-07-23 cs.RO 版本更新

Multi-Resolution Voxelized Map-Based Stereo Visual-Inertial Odometry

基于多分辨率体素化地图的立体视觉惯性里程计

Shuyi Pan, Hangtian Wang, Zhaoxing Zhang, Chengliang Zhang, Zikang Yuan, Xin Yang

机构 * Huazhong University of Science and Technology(华中科技大学) AI Chip Center for Emerging Smart Systems (AC-CESS)(新兴智能系统人工智能芯片中心)

AI总结 研究视觉惯性里程计中姿态估计问题,提出多分辨率先验地图构建方法及基于地图的VIO系统,通过体素化地图、锥形索引策略和DDA算法,减少数据传输量与计算负载,实验证明该系统能在少数据传输下实现准确姿态估计。

Comments 9 pages, 4 figures, 6 tables. Accepted to appear in the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11338 2026-07-23 cs.AI 版本更新

AutoVSR: Automatic Visual-to-Symbolic Reasoning for Symbolic Expression Generation from Circuit Schematic

AutoVSR:用于从电路原理图生成符号表达式的自动视觉到符号推理

Zhe Xiao, Longfei Li, Xu He, Haoying Wu, Zixing Zhang, Mingyu Liu

机构 * Hunan University, Changsha, China(湖南大学) Wuhan University of Technology, Wuhan, China(武汉理工大学) Huazhong University of Science and Technology, Wuhan, China(华中科技大学)

AI总结 研究旨在解决从电路原理图生成符号表达式的难题,提出AutoVSR框架,利用视觉语言模型,通过重建电路图为可执行中间表示并借助符号求解器推理,引入两项创新提升准确率,在任务中表现优于其他方法,还降低了推理成本和提高了计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07248 2026-07-22 cs.CV 版本更新

IBoxCLA: Towards Robust Box-supervised Segmentation of Polyp via Improved Box-dice and Contrastive Latent-anchors

IBoxCLA:通过改进的盒式骰子和对比潜在锚点实现息肉的鲁棒盒监督分割

Qiang Hu, Ying Chen, Hongkuan Shi, Qiang Li, Zhiwei Wang

机构 * Wuhan National Laboratory for Optoelectronics, Huazhong University of Science and Technology(光学电子国家重点实验室,华中科技大学)

AI总结 研究针对盒监督息肉分割中模型形状坍塌问题,提出改进的盒式骰子(IBox)和对比潜在锚点(CLA)两种学习方式,结合训练出IBoxCLA模型,该模型在多数据集实验中表现出色,相比其他盒监督技术有显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10623 2026-07-21 cs.GR cs.CV 版本更新

LATO.2: Factorized 3D Mesh Generation with Vertex and Topology Flow

LATO.2:基于顶点和拓扑流的因式分解3D网格生成

Hang Long, Tianhao Zhao, Junkai Lin, Youjia Zhang, Huipeng Guo, Rendong Liang, Jiale Xu, Jozef Hladký, Matthias Nießner, Yuanming Hu, Wei Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Meshy AI Technical University of Munich(慕尼黑技术大学)

AI总结 研究针对现有拓扑感知网格生成方法的不足,提出LATO.2框架,将网格生成分解为顶点流和连通性流,由专用变分自编码器支持,具有逐部分生成和拓扑自适应编辑优势,实验证明其超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27088 2026-07-21 cs.CV 版本更新

SubdivAR: Autoregressive Next-Scale Prediction for Neural Mesh Subdivision

SubdivAR: 用于神经网格细分的自回归下一尺度预测

Huipeng Guo, Zikai Song, Hang Long, Jielei Zhang, Wenbing Li, Junkai Lin, Tianhao Zhao, Jinshen Zhang, Tianle Guo, Wei Yang

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 提出SubdivAR框架,将网格细分建模为自回归下一尺度预测,利用混合拓扑感知Transformer结合全局语义与局部拓扑特征,在FII-40K数据集上显著降低Hausdorff距离和Chamfer距离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19235 2026-07-20 cs.CV cs.RO 版本更新

Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding

生成模型了解空间:解锁隐式3D先验用于场景理解

Xianjin Wu, Dingkang Liang, Tianrui Feng, Kui Xia, Yumeng Zhang, Xiaofan Li, Xiao Tan, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Baidu Inc.(百度公司)

AI总结 本文提出通过大规模视频生成模型的隐式空间先验提升场景理解,引入VEGA-3D框架,利用预训练视频扩散模型作为潜在世界模拟器,通过时空特征提取与语义融合增强大语言模型的几何信息,实验验证其在3D场景理解、空间推理和具身操控中的优越性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12262 2026-07-20 cs.CV 版本更新

Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously

视频流思考:VideoLLMs可以同时观看和思考

Yiran Guan, Liang Yin, Dingkang Liang, Jianzhong Ju, Zhenbo Luo, Jian Luan, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) MiLM Plus Xiaomi Inc.(小米公司)

AI总结 VST提出了一种视频流理解的新范式,通过在流式过程中激活推理,提高实时响应和理解能力,同时在多个基准测试中表现出更高的效率和泛化能力。

Comments Accepted by ECCV 2026, project page https://1ranguan.github.io/VST/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13636 2026-07-20 cs.CV cs.RO 版本更新

MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning

MindDrive: 一种通过在线强化学习实现自动驾驶的视觉-语言-动作模型

Haoyu Fu, Diankun Zhang, Zongchuang Zhao, Jianfeng Cui, Hongwei Xie, Bing Wang, Guang Chen, Hangjun Ye, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米电动车)

AI总结 MindDrive通过在线强化学习实现自动驾驶中的视觉-语言-动作模型,结合决策专家和动作专家,提升复杂场景下的驾驶决策与探索效率。

Comments Accepted by ECCV 2026; Project Page: https://xiaomi-mlab.github.io/MindDrive/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30347 2026-07-15 cs.CV cs.AI 版本更新

FFAvatar: Feed-Forward 4D Head Avatar Reconstruction from Sparse Portrait Images

FFAvatar: 从稀疏肖像图像进行前馈4D头部化身重建

Jianjiang Yao, Ke Xian, Renxiang Dai, Robert Caiming Qiu

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology, Wuhan 430074, China(华中科技大学电子信息与通信学院,武汉430074,中国)

AI总结 提出基于Transformer的3D高斯框架FFAvatar,通过交替注意力机制和稀疏到密集学习范式,从一张或多张参考图像高效构建高质量、可动画的4D头部化身,支持增量重建和动态个性化。

Comments Accepted to ECCV 2026. Project page: https://jj-yao.github.io/ffavatar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12783 2026-07-15 cs.IR cs.AI 版本更新

SQuTR: A Robustness Benchmark for Spoken Query to Text Retrieval under Acoustic Noise

SQuTR:一种在语音噪声下 spoken query 到文本检索的鲁棒性基准

Yuejie Li, Ke Yang, Yueying Hua, Berlin Chen, Jianhao Nie, Yueping He, Caixin Kang

机构 * Huazhong University of Science and Technology(华中科技大学) The University of Hong Kong(香港大学) Soochow University(苏州大学) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Tsinghua University(清华大学) The University of Tokyo(东京大学)

AI总结 SQuTR通过大规模数据集和统一评估协议,评估语音检索系统在复杂噪声环境下的鲁棒性,揭示了极端噪声下检索性能显著下降的问题。

Comments Accepted by SIGIR 2026

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), July 20--24, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10332 2026-07-14 cs.AI 版本更新

EmbodiSkill: Skill-Aware Reflection for Self-Evolving Embodied Agents

EmbodiSkill:基于技能的反思以实现自我进化的具身智能体

Ruofei Ju, Xinrui Wang, Xin Ding, Yifan Yang, Hao Wu, Shiqi Jiang, Qianxi Zhang, Hao Wen, Xiangyu Li, Weijun Wang, Kun Li, Yunxin Liu, Haipeng Dai, Wei Wang, Ting Cao

机构 * Nanjing University(南京大学) Huazhong University of Science and Technology(华中科技大学) University of Science and Technology of China(中国科学技术大学) Microsoft Research(微软研究院) Institute for AI Industry Research (AIR) Tsinghua University(清华大学人工智能产业研究院)

AI总结 本文提出EmbodiSkill,一种无需训练的具身技能自我进化框架,通过技能感知反思和针对性修订提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏