LLM can Read Spectrogram: Encoder-free Speech-Language Modeling
LLM 能读频谱图:无编码器的语音语言建模
机构 * Microsoft, USA(微软公司,美国)
专题命中 扩散模型 :diffusion(abstract)
AI总结 提出 Mel-LLM,一种无需专用语音编码器、直接将梅尔频谱图补丁通过线性投影输入 LLM 的架构,在 ASR 和 TTS 任务上验证了其可行性,ASR 性能与有编码器方案相当,TTS 初步可行。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
LLM 能读频谱图:无编码器的语音语言建模
机构 * Microsoft, USA(微软公司,美国)
专题命中 扩散模型 :diffusion(abstract)
AI总结 提出 Mel-LLM,一种无需专用语音编码器、直接将梅尔频谱图补丁通过线性投影输入 LLM 的架构,在 ASR 和 TTS 任务上验证了其可行性,ASR 性能与有编码器方案相当,TTS 初步可行。
SkillDAG:面向大规模LLM技能选择的自演化类型化技能图
机构 * Fudan University(复旦大学) ; National University of Singapore(国立新加坡大学) ; CFAR A*STAR
专题命中 扩散模型 :diffusion(abstract)
AI总结 提出SkillDAG,通过类型化有向图建模技能间关系,并作为推理时可调用的结构化检索接口,支持在线演化,在ALFWorld和SkillsBench上显著超越基线。
Comments 19 pages, 5 figures
介质无序中光的三维安德森局域化
专题命中 扩散模型 :diffusion(abstract)
AI总结 通过大规模时域模拟,从动力学、光谱和实空间特征证明高折射率介质无序系统中存在三维安德森局域化矢量电磁模式。
盘旋黑洞喷流与银河化石
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文提出银河中心γ射线过剩现象与费米和eROSITA气泡是SgrA*过去活动的化石印记,通过盘旋抛物线Blandford-Znajek喷流解释其形成机制和贡献。
Comments 44 pages, 8 Figures
晶体中空位动力学的元动力学方法
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文提出基于元动力学的空位自由能面构建方法,利用平行偏置元动力学与分族策略,无需定义唯一空位坐标或引入强控制拓扑的参数,通过多山策略提升效率,验证了其在金属和离子晶体中自扩散和杂质扩散的有效性。
谐波势中$d$维跑-颠簸粒子的精确稳态
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文推导了各向同性谐波陷阱中$d$维跑-颠簸粒子的精确非平衡稳态,通过旋转对称性降维,利用Kesten型递归得到一维广义陷阱粒子的封闭解,并重构了径向分布和联合分布,揭示了持久性控制的形状转变。
Comments 38 pages, 11 figures
Journal ref Phys. Rev. E 114, 014144 (2026)
基于局部随机神经网络的扰动校正方法用于拟线性界面问题
专题命中 扩散模型 :diffusion(abstract)
AI总结 针对拟线性椭圆界面问题,提出一种局部随机神经网络扰动校正方法(LRaNN-PC),通过主阶段和扰动校正阶段缓解非凸目标泛函导致的停滞,数值实验显示相对L2误差降低4-7个数量级。
利用合成与增强生物信号实现多模态和多通道心音分类的规模化
机构 * School of Electrical Engineering, Computing, and Mathematical Sciences (EECMS), Faculty of Science and Engineering, Curtin University, Bentley, WA 6102, Australia(电气工程、计算与数学科学学院(EECMS),科学与工程学院, Curtin 大学,Bentley,WA 6102,澳大利亚)
专题命中 扩散模型 :diffusion(abstract)
AI总结 针对心音分类中同步和多通道数据集有限的问题,提出结合传统信号处理与去噪扩散模型生成增强数据,微调Wav2Vec 2.0分类器,在多个数据集上取得最优性能。
Comments 35 pages, 37 figures, 19 tables
潜在策略屏障:通过保持分布内学习鲁棒的视觉运动策略
机构 * Stanford University(斯坦福大学)
专题命中 扩散模型 :diffusion(abstract)
AI总结 提出潜在策略屏障(LPB)框架,通过将专家演示的潜在嵌入作为隐式屏障,分离精确模仿与分布外恢复,利用基础扩散策略和动力学模型提升视觉运动策略的鲁棒性和数据效率。
非平衡动力学与随机过程的第一通过性质:从布朗运动到活性粒子
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文研究非平衡随机过程的动力学及第一通过性质,重点探讨活性粒子系统,推导出精确的平均第一通过时间表达式,并探讨随机重置与切换扩散模型的特性。
Comments PhD thesis defended on June 16, 2025 at Sorbonne Université, Paris. 252 pages
Journal ref HAL tel-05238622 , version 1 (2025)
基于量子随机数的改进型ChaCha算法
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文提出基于量子随机数的改进型ChaCha算法,通过异或初始常量和周期性注入量子随机数增强扩散,提升对差分攻击的抗性并生成具有统计随机性的密钥流,满足经典和量子攻击的鲁棒性要求。
Comments 20 pages,4 figures
Journal ref International Journal of Applied Mathematics and Computer Science, vol. 36, no. 2, 2026, pp. 267-280
可逆扩散的半参数Bernstein-von Mises定理
专题命中 扩散模型 :diffusion(abstract)
AI总结 针对周期可逆多维扩散模型,建立了基于连续观测的贝叶斯非参数先验的半参数Bernstein-von Mises定理,并应用于高斯和Besov-Laplace先验,验证了其有效性和不确定性量化。
Comments 43 pages, 5 figures, 2 tables
基于Reeb图的周期数据环形最大流
专题命中 扩散模型 :diffusion(abstract)
AI总结 针对周期性边界条件数据,利用Reeb图将空间几何简化为有向一维隧道网络,并引入容量约束定义环形最大流,通过线性优化求解,无需指定进出口。
DriveWeaver: 基于点云条件的视频修复用于自动驾驶仿真中的可控车辆插入
机构 * School of Data Science, Fudan University(复旦大学数据科学学院) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 可控生成 :inpainting(title,abstract);分类 cs.CV
AI总结 提出DriveWeaver框架,通过点云条件视频修复实现自动驾驶仿真中可控车辆插入,解决光照不一致和3D资产依赖问题,支持大规模场景增强。
Comments Accepted at ECCV 2026, Project Page: https://github.com/LogosRoboticsGroup/DriveWeaver
Control-DINO:用于可控图像到视频扩散的特征空间条件
机构 * Huawei Technologies, Switzerland(华为技术(瑞士)) ; Huawei Technologies, Austria(华为技术(奥地利)) ; Graz University of Technology, Austria(格拉茨技术大学)
专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出Control-DINO,通过解耦外观与其他特征,实现对视频扩散模型的可控生成,提升生成渲染的可控性。
Comments ECCV 2026 - Project Page https://dedoardo.github.io/projects/control-dino/
一种多传感器融合方法用于大规模无人机测绘中的快速正射影像生成
机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与技术学院) ; TopXGun Robotics(TopXGun机器人)
专题命中 可控生成 :image generation(title,abstract);分类 cs.CV
AI总结 本文提出一种多传感器融合方法,通过优化姿态前馈特征匹配提升速度与精度,有效解决传统正射影像生成在时间性能、系统鲁棒性和地理参考精度方面的不足,适用于低纹理场景如农田的快速正射影像生成。
Journal ref IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2025
SEPS:面向细粒度跨模态对齐的语义增强补丁精简框架
专题命中 可控生成 :text-to-image(abstract);分类 cs.CV、cs.MM
AI总结 提出SEPS框架,通过两阶段机制整合稠密与稀疏文本语义,识别显著视觉补丁,并利用相关性感知选择与均值计算突出关键补丁-词对应,提升跨模态相似度评估,在Flickr30K和MS-COCO上rSum提升23%-86%。
异构约束下无需训练的可控人体运动生成
机构 * Lancaster University(兰卡斯特大学) ; Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出Motion-Inference-as-Control框架,将扩散运动生成建模为随机控制问题,统一处理连续目标型和基于准则的约束,无需约束特定训练或可微性要求。
Comments ECCV 2026
SPAR: 语义-像素自对齐与自适应路由的统一多模态模型
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Xiaohongshu Inc.(小红书公司)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出SPAR框架,通过非对称双流统一分词器协调语义感知与像素重建,利用自对齐生成范式消除外部依赖,并引入动态令牌路由实现灵活多模态交互,在统一架构中达到生成、重建与视觉理解的最优性能。
Comments ECCV2026
PASDiff: 面向真实世界低光人脸增强与恢复的物理感知语义引导
机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; PCA Lab, Nanjing University of Science and Technology(南京理工大学PCA实验室) ; East China Normal University(华东师范大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出PASDiff,一种无需训练的物理感知语义扩散模型,通过逆强度加权和Retinex理论引入光度约束,并利用风格无关结构注入从现成人脸先验中提取结构,在真实低光人脸增强上实现自然光照、色彩恢复和身份一致性的优越平衡。
Comments Accepted by ECCV 2026
通过修补UV空间高斯建模的一次前馈360度可动画化头像
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Zeekr Automobile R&D Co., Ltd(Zeekr汽车研发有限公司)
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 提出一种基于UV空间高斯建模的一次前馈框架,利用预训练3D GAN的先验知识修补缺失区域,实现360度全头可动画化头像的高质量重建与实时动画。
Comments Accepted by ECCV 2026. Project page: https://shaelynz.github.io/fhavatar/
TabletopGen: 桌面场景生成与机器人操作的交互式仿真
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院多模态人工智能系统国家重点实验室) ; D-Robotics ; Horizon Robotics
专题命中 可控生成 :text-to-image(abstract);分类 cs.CV
AI总结 提出TabletopGen,一种无需训练的全自动桌面场景生成与交互仿真引擎,通过实例提取、位姿对齐和物理仿真生成可交互场景,用于机器人操作数据合成。
Comments Project page: https://d-robotics-ai-lab.github.io/TabletopGen.project/
Bridge-WA: 预测世界变化的位置和方式以支持机器人动作
机构 * Sun Yat-sen University(中山大学) ; Pengcheng Laboratory(鹏城实验室) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) ; X-Era AI Lab(X-Era AI实验室)
专题命中 可控生成 :image generation(abstract)
AI总结 提出Bridge-WA轻量框架,通过蒸馏未来变化教师模型为三个紧凑先验,引导动作生成聚焦于场景变化的位置和方式,提升机器人操作的成功率和鲁棒性。
Comments 21 pages, 8 figures, https://hcplab-sysu.github.io/BRIDGE-WA
年龄-空间结构化群体的双线性控制
专题命中 可控生成 :diffusion(abstract)
AI总结 研究具有更新边界条件和内源性监测反馈的非局部年龄-空间结构化种群方程的双线性最优控制,通过特征温和公式建立闭环适定性和弗雷歇可微性,推导降阶和反馈校正伴随方程,并证明一阶最优性条件。
通过随机最大原理视角的伴随匹配
机构 * Microsoft Research New England(微软研究院新英格兰) ; Flatiron Institute(熨斗研究所)
专题命中 可控生成 :diffusion(abstract)
AI总结 本文基于随机最优控制问题,重新推广并严谨推导了伴随匹配方法,将其置于随机最大原理基础上,提出通用Hamiltonian伴随匹配目标,并展示其在连续时间下的实现方法,为随机控制问题提供新的可实施目标。
学习多任务机器人操作的语义原子技能
机构 * ShanghaiTech University(上海科技大学)
专题命中 可控生成 :diffusion(abstract)
AI总结 提出AtomSkill框架,通过语义对比对齐和关键姿态想象,从演示中学习可重用原子技能,实现多任务机器人操作,优于现有方法。
从伪造到基础模型:身份证件攻击与检测的系统性综述
专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV
AI总结 本文系统综述了身份证件伪造攻击(物理呈现、数字注入、生成式合成)及检测方法,揭示了基准与现实间的差距,并发现最强模型在零样本场景下APCER超25%。
Style-CCL:通过课程持续学习实现内容保持的风格迁移
机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 针对扩散变换器在风格迁移中内容与风格特征纠缠的问题,提出多阶段课程持续学习框架Style-CCL,通过从语义到纹理风格、从干净到合成数据的分阶段训练,并采用随机记忆排练防止灾难性遗忘,在风格相似性、内容一致性和美学质量上达到最优。
Comments code and models of QwenStyle are released at https://github.com/witcherofresearch/Qwen-Image-Style-Transfer/ and https://github.com/Tele-AI/TeleStyle/
MIBE:面向个性化图像生成的多主体交互基准与评估器
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; University of Southern California(南加州大学) ; DeerLab LLC(DeerLab有限责任公司) ; Carnegie Mellon University(卡内基梅隆大学) ; Clemson University(克莱姆森大学) ; Google(谷歌) ; San Jose State University(圣何塞州立大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV
AI总结 提出MIBE框架,包含多主体交互基准(MIB)和评估器(MIE),通过解耦数据体制和双头排序诊断目标,解决多主体个性化图像生成中主体遗漏、外观失配和交互错误问题,在黄金集上达到0.922成对准确率。
COMFYCLAW:面向图像生成工作流的自进化技能工具包
机构 * University of Maryland(马里兰大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Nvidia(英伟达) ; Lehigh University(里海大学)
专题命中 图像生成评测 :image generation(title,abstract)
AI总结 提出COMFYCLAW框架,通过类型化图编辑、区域级VLM验证器和渐进式技能库进化,提升ComfyUI工作流构建的代理可靠性和性能,在多个基准上取得最佳平均评分。