Text-Driven Emotionally Continuous Talking Face Generation
基于文本的情绪连续对话面部生成
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; SERES
AI总结 本文提出了一种基于文本的情绪连续对话面部生成方法,通过定制模型实现动态情感变化,生成逼真且富有情感的视频。
高校专区
基于文本的情绪连续对话面部生成
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; SERES
AI总结 本文提出了一种基于文本的情绪连续对话面部生成方法,通过定制模型实现动态情感变化,生成逼真且富有情感的视频。
HART: 基于数据的幻觉归因与证据导向追踪用于大语言模型
机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学)
AI总结 HART通过结构化建模方法提升大语言模型幻觉归因与证据追踪的准确性与可解释性。
CoEditor++:基于指令的视觉编辑 via 认知推理
机构 * Hong Kong Polytechnic University(香港理工大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Microsoft(微软公司)
AI总结 CoEditor++通过认知推理实现基于指令的视觉编辑,无需训练即可在通用和负责任的编辑任务中取得最佳性能。
从分词偏差到骨干能力:对用于时间序列预测的LLM进行受控研究
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Wuhan University(武汉大学)
AI总结 本文通过设计三个具有相同架构但不同预训练策略的模型,研究了LLM在时间序列预测中的性能,发现其表现有限,无法超越专门训练的模型。
双向课程生成:一种用于数据高效数学推理的多智能体框架
机构 * Zhejiang University(浙江大学) ; University of Macau(澳门大学) ; Peking University(北京大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Wuhan University(武汉大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
AI总结 本文提出双向课程生成框架,通过多智能体系统动态生成数据以提升数学推理效率,优化学习轨迹并减少训练样本需求。
K-Gen:一种多模态语言条件方法用于可解释的关键点引导轨迹生成
机构 * Harbin Institute of Technology Chongqing Research Inst. of HIT(哈尔滨工业大学重庆研究院) ; Changan Automobile Co., Ltd Chongqing, China(长安汽车有限公司重庆)
AI总结 K-Gen通过多模态语言模型结合关键点引导方法,提升自动驾驶轨迹生成的可解释性和准确性。
通过群体层面的自然语言反馈进行探索的强化学习
机构 * Harbin Institute of Technology(哈尔滨工业大学)
AI总结 GOLF通过整合群体层面的自然语言反馈,提升强化学习的探索效率和样本效率,实现2.2倍的改进。
逐步细化调节以加速扩散语言模型解码
机构 * Department of Artificial Intelligence, Xi'an Jiaotong University(人工智能系,西安交通大学) ; College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) ; School of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术学院,哈尔滨工业大学)
AI总结 逐步细化调节通过动态控制细化规则提升扩散语言模型解码效率并保持生成质量。
Comments 19 pages, 10 figures, Code available upon publication
阐明基于任意噪声的扩散模型的设计空间
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Case Western Reserve University(凯斯西储大学)
AI总结 EDA通过扩展噪声模式灵活性并保持模块化,提升图像恢复任务的泛化能力。
Comments 16 pages, 4 figures, accepted by CVPR 2026
SaFeR:通过可行性约束的令牌重采样实现自动驾驶测试的安全关键场景生成
机构 * School of Traffic and Transportation, Harbin Institute of Technology(哈尔滨工业大学交通学院) ; Chongqing Research Institute of HIT(哈尔滨工业大学重庆研究所) ; Chongqing Changan Automobile Company Ltd(重庆长安汽车有限公司)
AI总结 SaFeR通过可行性约束的令牌重采样生成安全关键场景,提升自动驾驶测试的对抗性和现实性
LiDAR驱动的时空多视角立体摄影用于自动驾驶
机构 * Unmanned Vehicle Dept., CaiNiao Inc., Alibaba Group(无人车辆部门, Cainiao Inc.,阿里巴巴集团) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 LiDAR驱动的时空多视角立体摄影框架DriveMVS通过几何提示和深度融合提升自动驾驶的度量精度和跨领域泛化能力。
D2Dewarp: 基于双维度几何表示学习的文档图像去畸变
机构 * Harbin Institute of Technology Shenzhen(哈尔滨工业大学深圳学院) ; PengCheng Laboratory(鹏城实验室)
AI总结 D2Dewarp通过双维度几何表示学习提升文档图像去畸变效果,提出细粒度变形感知模型和自动标注方法,构建新数据集并验证方法有效性。
Comments Accepted by CVPR 2026
链式世界:潜在运动中的世界模型思维
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Li Auto ; Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院) ; University of New South Wales(新南威尔士大学) ; Chongqing Research Institute of HIT(哈尔滨工业大学重庆研究院) ; Peking University(北京大学)
AI总结 CoWVLA通过统一世界模型的时间推理与解耦的潜在运动表示,提升视觉-运动学习效率。
Comments Accepted by CVPR2026. Project page: https://fx-hit.github.io/cowvla-io/
SEHFS: 结构熵引导的多视图多标签特征选择中的高阶相关性学习
机构 * College of Software, Jilin University(吉林大学软件学院) ; College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) ; Key Laboratory of Symbolic Computation and Knowledge Engineering of the Ministry of Education(教育部符号计算与知识工程重点实验室) ; School of Computing and Artificial Intelligence, Southwestern University of Finance and Economics(西南财经大学计算机与人工智能学院) ; Engineering Research Center of Intelligent Finance, Ministry of Education(教育部智能金融工程研究中心) ; Shenzhen Key Laboratory of Visual Object Detection and Recognition, Harbin Institute of Technology(哈尔滨工业大学深圳视觉对象检测与识别重点实验室) ; School of Artificial Intelligence and Computer Science, Nantong University(南通大学人工智能与计算机科学学院) ; Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院)
AI总结 SEHFS通过结构熵引导的高阶相关性学习,提升多视图多标签特征选择的性能。
MiM-DiT:基于扩散变换器的MoE在MoE中实现全功能图像修复
机构 * Nanjing University of Science and Technology(南京理工大学) ; Nankai University(南开大学) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 MiM-DiT通过双层MoE架构与预训练扩散模型,实现对多种图像退化类型的统一修复,提升复杂真实场景下的修复效果。
Comments Project website: https://github.com/kkkls/MIM-DiT
OmniFashion: 通过多任务视觉-语言学习实现通用时尚智能
机构 * National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence, School of Computer Science, Wuhan University(国家多媒体软件工程技术研究中心、人工智能研究院、计算机科学学院、武汉大学) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 OmniFashion通过多任务视觉-语言学习,构建百万级时尚数据集,实现统一的时尚对话范式,提升多任务推理和交互能力,推动通用时尚智能发展。
Comments 12 pages, 8 figures
可扩展的多语言多模态机器翻译与语音-文本融合
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Pengcheng Laboratory(鹏城实验室)
AI总结 本文提出一种语音引导的机器翻译框架,通过融合语音和文本提升多语言翻译性能,并在多个基准上取得新突破。
Comments Accepted in ICLR 2026
BAED: 一种新的少样本图学习范式,具有循环解释
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Fuzhou University(福州大学)
AI总结 BAED提出了一种新的少样本图学习范式,通过循环解释机制提升模型的鲁棒性和可解释性,实验显示其在预测准确性、训练效率和解释质量上均优于现有方法。
Comments Accepted to Neural Networks 2026
基于解释的对抗训练以获得稳健和可解释的模型
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Fuzhou University(福州大学) ; NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(神经网络与模式识别实验室、机器学习与智能系统研究所、自动化研究所,中国科学院)
AI总结 EGAT结合对抗训练和解释引导学习,提升模型的预测性能、鲁棒性和解释质量,通过生成对抗示例并施加解释约束,在保持效率的同时增强模型的稳健性和可解释性。
Comments Accepted by IEEE Transactions On Circuits and Systems For Video Technology (TCSVT 2026)
TacMamba: 一种连接快速反射与慢速VLA推理的触觉历史压缩适配器
机构 * Zhejiang University(浙江大学) ; GigaAI ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 TacMamba通过触觉历史压缩器和双阶段训练策略,实现高频率触觉数据与低频视觉推理的高效融合,提升实时任务性能。
VidDoS:针对基于视频的大语言模型的通用拒绝服务攻击
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; The Chinese University of Hong Kong, Hong Kong SAR(香港中文大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院) ; Shenzhen Loop Area Institute, China(深圳环园院) ; McGill University(麦吉尔大学) ; The Hong Kong University of Science and Technology, Guangzhou(香港科学与技术大学)
AI总结 VidDoS是一种针对视频大语言模型的通用拒绝服务攻击方法,通过通用优化生成实例无关的触发器,导致模型推理延迟和token扩展显著增加,引发安全问题。
Uni-X: 通过双端分离架构缓解多模态冲突以实现统一多模态模型
机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) ; Baidu Inc.(百度公司)
AI总结 Uni-X通过双端分离和中间共享的架构缓解多模态冲突,提升统一多模态模型的训练效率和性能。
Comments ICLR 2026
ULC:一种用于人形机器人运动-操作的统一且细粒度控制器
机构 * State Key Laboratory of Robotics and Systems, Harbin Institute of Technology(机器人与系统国家重点实验室,哈尔滨工业大学) ; School of Engineering, Westlake University(工程学院,西湖大学)
AI总结 ULC通过统一策略实现人形机器人运动-操作的高精度与鲁棒性,结合多种关键技术提升整体协调性能。
UNICBench: 多模态多层级计数基准与评估工具包
机构 * Northwestern Polytechnical University(北华大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所) ; Sun Yat-sen University(中山大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
AI总结 UNICBench是一个统一的多模态计数基准,通过准确的地面真实值和分层报告,评估45种最先进的MLLMs在图像、文本和音频计数任务上的性能,揭示了模型在推理和难分支上的不足。
Comments This paper has been accepted by CVPR 2026
DiffTrans: 可微几何-材料分解用于重建透明物体
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Peng Cheng Laboratory(鹏城实验室) ; Nanjing University(南京大学)
AI总结 DiffTrans通过可微渲染框架实现透明物体的高效几何-材料分解,适用于复杂场景中的高精度重建。
沉默法官:通过潜在几何聚类的自我验证强化学习
机构 * Meituan(美团) ; Peking University(北京大学) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文提出Latent-GRPO框架,通过潜在空间几何聚类生成内在奖励,提升大语言模型推理性能并加速训练过程。
Concerto:联合2D-3D自监督学习产生空间表示
机构 * The University of Hong Kong(香港大学) ; The Chinese University of Hong Kong(香港中文大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
AI总结 Concerto通过联合2D-3D自监督学习,产生更连贯的信息空间表示,优于现有SOTA模型并在多个基准上取得新成就。
Comments NeurIPS 2025, produced by Pointcept, project page: https://pointcept.github.io/Concerto
Journal ref Neural Information Processing Systems 2025
TTOM:测试时优化与记忆化用于组合视频生成
机构 * National University of Singapore(国立新加坡大学) ; University of Science and Technology of China(中国科学技术大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
AI总结 TTOM通过测试时优化与记忆化机制,提升组合视频生成的跨模态对齐能力,实现高效且可扩展的实时生成。
Comments ICLR 2026 Camera-ready. Project page: https://ttom-t2v.github.io/
文化在框架中:C$^3$B作为基于漫画的多模态文化意识基准
机构 * Harbin Institute of Technology(哈尔滨工业大学)
AI总结 C$^3$B是一个基于漫画的多模态文化意识基准,旨在评估和提升多语言、多任务和多文化环境下MLLMs的文化理解能力。
通过渐进式概念构建推进复杂视频对象分割
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; CPII under InnoHK(InnoHK下的CPII)
AI总结 SeC通过渐进式概念构建方法,在复杂视频对象分割任务中实现了显著性能提升,特别是在语义复杂场景下的表现优于现有方法。
Comments project page: https://rookiexiong7.github.io/projects/SeC/ ; code: https://github.com/OpenIXCLab/SeC ; dataset: https://huggingface.co/datasets/OpenIXCLab/SeCVOS