arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 582 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 582 篇

2608.07154 2026-08-10 cs.RO cs.AI 新提交 57%

Representation Handoffs for OpenArm-Based Laboratory Mobile Manipulation

基于OpenArm的实验室移动操作的表示交接

Yang Shen, Chonghao Cheng, Ziyi Zhao, Jialuo Zhu, Zhenyi Yi, Qi Zhao, Jian Yang, Yuhui Shi, Chin-Teng Lin

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI

AI总结 本研究提出基于OpenArm的实验室移动操作原型,通过表示交接整合多模块,可暴露部署阻碍并为具身系统整合提供调试接口。

Comments Robotics: Science and Systems (RSS) Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06300 2026-08-07 cs.AI 新提交 57%

Bias Analysis of L2 Speaking Assessment Systems Using Concept Activation Vectors

基于概念激活向量的L2口语评估系统的偏差分析

Arya Labroo, Mengjie Qian, Kate Knill

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI

AI总结 该研究将概念激活向量(CAV)分析扩展到BERT和Whisper两个L2口语评估系统,发现概念可恢复性及对概念的敏感性依赖于模型架构,稀疏自编码器(SAEs)可提升概念线性恢复性但会减弱激活空间敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04902 2026-08-06 cs.CV cs.LG cs.SD 新提交 57%

Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

视觉表示很重要:利用视频到音频生成中的时间差异

Zehua Chen, Junyou Wang, Yuxuan Jiang, Zhenying Fang, Yusheng Dai, Jianfei Chen, Ziwei Liu, Jun Zhu

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 针对现有基于条件扩散的视频到音频(V2A)生成方法需额外网络或强归纳偏置的问题,提出TD-V2A框架,利用时间差异(TD)增强视觉条件,提升了V2A生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04732 2026-08-06 eess.SY cs.AI cs.RO cs.SY 新提交 57%

Toward Integrating Adaptive Experience Replay and Online Uncertainty Estimation in Safe Actor-Critic Optimal Control

在安全Actor-Critic最优控制中融合自适应经验回放与在线不确定性估计

Mahshad Rastegarmoghaddam, Davoud Nikkhouy, Shima Samadzadeh

专题命中 知识编辑与模型理解 :post-training(abstract);分类 cs.AI

AI总结 该研究在安全Actor-Critic最优控制中提出融合自适应经验回放与在线不确定性估计的集成架构,在二维机器人导航任务的测试中,该集成配置在极端压力测试下实现零接触且全部种子到达目标,性能优于仅移除不确定性估计的配置。

Comments Code, deterministic seeds, data, figures, and protocol files are archived at https://doi.org/10.5281/zenodo.21515850 and https://github.com/SDNT8810/safe-actor-critic-aer-ue-reproducibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04510 2026-08-06 cs.RO cs.AI 新提交 57%

GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAs

GUARD:面向扩散型视觉-语言动作(VLA)的不确定性与基于消融的风险检测

Suhas Hegde, Jitendra Yasaswi Bharadwaj Katta

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 本文提出GUARD方法,无需修改预训练扩散型VLA策略即可检测其故障,在多基准测试中提升未见过任务的ROC-AUC,提供可跨多维度迁移的故障信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03817 2026-08-05 cs.CV cs.AI 新提交 57%

UHP Detection: LVLMs have their Unique Hallucination Pattern in the Consistency Space

UHP检测:大型视觉语言模型(LVLMs)在一致性空间中具有独特的幻觉模式

Amir Mohammad Ezzati, Kiyan Rezaee, Bardiya Kariminia, Mohamad Amin Yousefi, Asal Mohammadjafari Mamaqani, Behrad Samimi, Mohammad Hossein Rohban

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 本研究针对LVLMs的幻觉问题,提出UHP检测框架,通过图像与文本扰动模态、陈述与否定逻辑极性构建四组一致性特征,训练分类器,在AMBER和PhD数据集上显著优于现有基线。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29240 2026-08-03 cs.CV cs.AI 新提交 57%

When Model Priors Conflict with Visual Evidence: Mitigating Commonsense-Driven Hallucinations by Selective Prior Calibration

当模型先验与视觉证据冲突时:通过选择性先验校准缓解常识驱动的幻觉

Kesheng Chen, Yamin Hu, Wenjian Luo

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 针对视觉-语言模型的常识驱动幻觉,提出选择性先验校准方法,可提升反事实图像准确率并保留常识图像准确率,增益可推广至多类基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29213 2026-08-03 cs.IR cs.LG 新提交 57%

GALA: Generative Aligned Learning for Adaptive Multimodal Representation in the Taobao Shangou Recommender System

GALA:淘宝商购推荐系统中用于自适应多模态表示的生成对齐学习

Jiping Liu, Zhongmin Zhang, Zisen Sang, Zhijia Fang, Tao Ouyang, Ma Jiang, Shaopeng Liang, Zeyang Hou, Guodong Cao, Jia Jia

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 本文针对外卖推荐系统多模态融合难、语义与行为对齐不足的问题,提出三阶段流程GALA,通过生成式RL对齐阶段弥合预训练-微调差距,在淘宝商购部署后提升了订单量与AUC等指标。

Comments 13 pages, 12 figures, 5 tables. Accepted at the 2026 IEEE International Conference on Data Engineering (ICDE 2026), Industry and Applications Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25507 2026-07-29 cs.CL 新提交 57%

Phase Structure in Rotary Attention: A Spectral Framework for Semantic Continuity and Execution-Boundary Governance

旋转注意力中的相位结构:语义连续性和执行边界治理的谱框架

Abraham Chachamovits

机构 * ENTRUST AI(ENTRUST人工智能公司)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

AI总结 研究Transformer语言模型中旋转注意力的相位结构,通过定义有效域、推导分数和引入函数构建谱框架,可区分表征连续性与执行边界可接受性,为相关研究提供理论和方法程序。

Comments 14 pages; theoretical framework and proposed experimental program

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24730 2026-07-28 cs.CV cs.AI 新提交 57%

KANEx: Translating Kolmogorov-Arnold Networks' Interpretability to Medical Explainability

KANEx:将柯尔莫哥洛夫-阿诺德网络的可解释性转化为医学可解释性

Krithi Shailya, Ananya Lakshmi Ravi, Venkatanathan K. V., Sowmya S. Sundaram, Gokul S. Krishnan, Aditi Anand, Balaraman Ravindran

机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯分校) Vanderbilt University School of Medicine(范德堡大学医学院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 研究针对医学应用中视觉模型黑箱问题,提出KANEx框架,利用柯尔莫哥洛夫-阿诺德网络的符号透明度为VLM推理奠基,设计KAN-Map热图生成方法,经实验验证该方法能提升语义相似度、视觉定位及推理质量,为可信医学人工智能发展助力。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23924 2026-07-28 cs.CV cs.AI 新提交 57%

DuoAD: Leveraging [CLS] Dual Characteristics for Training-Free Few-Shot Anomaly Detection

DuoAD:利用[CLS]双重特征进行无训练少样本异常检测

Jyun-Ze Tang, Po-Han Huang, Ming-Ching Chang, Chih-Fan Hsu, Jeng-Lin Li

机构 * Inventec Corporation(英业达股份有限公司) University at Albany, State University of New York(纽约州立大学奥尔巴尼分校)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI

AI总结 研究针对现有视觉基础模型无训练异常检测依赖局部特征、未充分利用全局信息的问题,提出DuoAD框架,利用ViT [CLS]令牌双重特征,通过自动增强选择和注意力引导特征重加权实现无训练少样本异常检测,取得优异结果并建立新的技术水平。

Comments Code: https://github.com/inventec-ai-center/DuoAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22508 2026-07-27 cs.LG eess.SP 新提交 57%

Interpretable EEG biomarkers with bag-of-waves: Spatial and temporal waveform dictionaries for low-data regimes

基于波形包的可解释脑电生物标志物:低数据量情况下的时空波形字典

Athanasios Papastathopoulos-Katsaros, Steven T. Lee, Lin Yao, Ajay Thomas, Junseok Park, Matthew J. McGinley, Zhandong Liu

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 研究针对脑电分析难题,提出波形包框架,通过学习波形模板字典及扩展表示,在三个数据集上测试,能在低数据量下以少参数实现与先进模型竞争的性能,且具有完全可解释性。

Comments In Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22408 2026-07-27 cs.LG 新提交 57%

LunarFM: A Shared Multimodal Representation of the Moon's Surface

LunarFM:月球表面的共享多模态表示

Marc Girona-Mata, Jakob Gawlikowski, Sumit Goski, Gautier Bardi de Fourtou, Valentin T. Bickel, Ben Moseley, Abigail Calzada-Diaz, Sylvester Kaczmarek, Raúl Ramos-Pollán

机构 * University of Cambridge(剑桥大学) German Aerospace Center (DLR)(德国航空航天中心) SPAIDER SPACE(斯派德太空公司) Mines Paris - PSL University(巴黎矿业学院 - 巴黎文理研究大学) University of Bern(伯尔尼大学) Imperial College London(伦敦帝国理工学院) European Space Resources Innovation Center (ESRIC)(欧洲空间资源创新中心) Universidad de Antioquia(安蒂奥基亚大学)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 因月球探索需求,针对多源观测致月球表面分析碎片化问题,提出LunarFM多模态基础模型,融合多仪器观测学习通用表示,支持多种下游应用,还提供相关数据集、预训练模型等,助力月球表面高效分析。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22148 2026-07-27 cs.CV cs.AI 新提交 57%

dRAE: Representation Autoencoder with Hyper-Spherical Codes

dRAE:具有超球面码的表示自编码器

Tianren Ma, Lin Long, Chuyan Chen, Mu Zhang, Junbo Zhao, Tong Zhang, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学) Peking University(北京大学) Ant Group(蚂蚁集团)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 研究旨在解决高维视觉表示离散化难题,提出超球面量化(HSQ),其离散表示自编码器(dRAE)能解耦语义与特征幅度,防止码本坍缩,实现高保真重建,实验证明性能提升、码本利用率高且训练流程简化。

Comments Preprint. Project Page: https://drae-hsq.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22068 2026-07-27 cs.CV cs.LG 新提交 57%

Rethinking Multi-Branch and Cross-Backbone Fusion for Vehicle Re-Identification in the Foundation-Model Era

在基础模型时代重新思考用于车辆重识别的多分支和跨骨干融合

Yu Wang, Hongyu Yang

机构 * Huahuan (Yunnan) Technology Co., Ltd.(华环(云南)科技有限公司)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 研究在基础模型时代车辆重识别中多分支和跨骨干融合方法,以单个DINOv3预训练ConvNeXt为强基线,经无训练重排提升性能,通过实验评估增加表示多样性的效果,发现改进单骨干加检索重排比增加架构复杂度更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19253 2026-07-22 cs.AI cs.CY cs.IR 新提交 57%

Sequential Learner Modeling Using Multi-Relational Graph Convolutional Networks

使用多关系图卷积网络的序列学习者建模

Rawaa Alatrash, Mohamed Amine Chatti, Hong Yang, Yumeng Wang

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 该研究针对用户建模问题,提出MR-ConceptGCN方法,结合个人知识图谱、多关系图卷积网络和预训练语言模型,构建序列学习者模型,通过在线用户研究验证了该方法在多个用户关注方面的优势。

Comments Paper submitted to IJAIED

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18816 2026-07-22 cs.DB cs.AI 新提交 57%

AgentTrails: Towards Trust and Reuse for Agentic Tasks

AgentTrails:迈向代理任务的信任与重用

Eden Wu, Sonia Castelo, Yurong Liu, Cláudio T. Silva, Juliana Freire

机构 * New York University(纽约大学)

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.AI

AI总结 针对大语言模型驱动代理轨迹掩盖数据依赖限制开发人员理解等问题,提出AgentTrails系统,将原始轨迹转换为结构化溯源图,支持执行比较、模式提取等,能揭示隐藏依赖、对齐不同执行并展现重复工具使用模式。

Comments 4 pages, 4 figures. Short paper accepted at the Workshop on Systems for Data-centric Agents with Human-in-the-loop (DASHSys 2026), co-located with VLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17712 2026-07-21 cs.AI 新提交 57%

Learning to Detect Cross-Modal Negation: An Analysis of Latent Representations and an Attention-Based Solution

学习检测跨模态否定:潜在表示分析与基于注意力的解决方案

Ali AbuSaleh, Leon Hammerla, Alexander Mehler

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 研究跨模态否定检测难题,提出新型跨模态注意力架构,分析发现文本与视觉否定的不对称性,结合自监督视频表示推进时间否定建模,为多模态系统学习语义对齐表示提供新方法。

Comments This manuscript is an accepted version of the article (published at ICNLP2026). Published in IEEE Xplore, DOI:10.1109/ICNLP69856.2026.11527861 document: https://ieeexplore.ieee.org/abstract/document/11527861

Journal ref 2026 8th International Conference on Natural Language Processing (ICNLP), Xi'an, China, 2026, pp. 613-622

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17272 2026-07-21 cs.LG cs.SI 新提交 57%

Node4All: Learning Node Representation Beyond Datasets

Node4All:超越数据集学习节点表示

Dooho Lee, Jaemin Yoo

机构 * KAIST(韩国科学技术院) Seoul National University(首尔国立大学)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 研究针对多数节点表示学习方法依赖特定数据集训练的问题,提出Node4All,基于通道图变换器和自监督学习构建,能跨任意图数据集泛化,在节点分类任务中表现出色,实现可复用性且实践效果好。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16681 2026-07-21 cs.LG 新提交 57%

A Framework for Early Sepsis Prediction via Self-Supervised (JEPA) and Federated Representation Learning

一种通过自监督(JEPA)和联邦表示学习进行早期脓毒症预测的框架

Umair bin Mansoor, Munaf Rashid, Roomi Naqvi

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 研究针对电子健康记录中早期脓毒症预测面临的问题,比较了JEPA等四种建模范式及原始特征基线,最佳模型在发病时接近SupMix基准且减少生物标志物使用,一级管道有显著提升,微调后的VICReg编码器特征持久性最佳。

Comments 11 pages, 6 figures, Submitted to arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15623 2026-07-20 stat.ML cs.LG 新提交 57%

Retraining Seeks Stable Signals

重新训练寻找稳定信号

Moritz Hardt

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 研究大规模预测模型性能表现现象下重新训练问题,提出稳定信号原理,证明存在稳定信号时经正则化的重复风险最小化会收敛到该信号方向,扩展分析范围并应用于语言建模数据反馈回路。

Comments Companion article to an invited contribution to the Proceedings of the International Congress of Mathematicians (ICM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14536 2026-07-17 cs.LG 新提交 57%

Muse: Representation Geometry of Muon Beyond Normalized Momentum

缪子:超越归一化动量的μ子表示几何

Da Chang, Qiankun Shi, Lvgang Zhang, Di He, Yaoshuai Ma, Ganzhao Yuan, Yongxiang Liu

机构 * Pengcheng Laboratory(鹏城实验室) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Southern University of Science and Technology(南方科技大学) Shenzhen University of Advanced Technology(深圳先进技术大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 研究μ子风格优化器中表示选择对优化器几何的影响,引入{\方法}族优化器,通过预训练实验及固定动量诊断发现平衡非原生表示可匹配原生表示性能,减小较短维度会改变优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14280 2026-07-17 cs.RO cs.LG 新提交 57%

DiMaS: Distribution Matching for Steering Vision-Language-Action Models

DiMaS:用于引导视觉-语言-动作模型的分布匹配

Pegah Khayatan, Sara Meziane, Jayneel Parekh, Matthieu Cord

机构 * ISIR, Sorbonne Université(法国国家信息与自动化研究所,索邦大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 研究针对基于流匹配的视觉-语言-动作模型细粒度行为控制不足的问题,提出DiMaS分布匹配引导策略,能有效控制行为,研究其泛化性并分析原因,推动了视觉运动设置下的分布匹配设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14250 2026-07-17 cs.CL 新提交 57%

The Severance Problem: LLMs are Unaware of the Person Beyond the Prompt

分离问题:大语言模型未意识到提示之外的人

Dor Litvak, Liu Leqi

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

AI总结 研究指出个人AI助手存在不良行为,源于语言模型的“分离问题”。提出通过“分离模式”将结构化无知纳入语言模型上下文的解决方案,经实证,五个模型家族采用此模式后能减少不良行为,模型在信息缺失时会询问澄清问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13899 2026-07-16 cs.AI 新提交 57%

AIMO Interpretability Challenge

AIMO可解释性挑战

Michal Štefánik, Philipp Mondorf, Andreas Waldis, Qianying Liu, Chuan Yang, Michal Spiegel, Josef Kuchař, Marek Kadlčík, Adam Vawda-Oomerjee, Chaoran Liu, Simon Frieder, Barbara Plank, Fazl Barez, Pontus Stenetorp

机构 * National Institute of Informatics(日本国立信息学研究所) Munich Center for Machine Learning / MaiNLP LMU(慕尼黑机器学习中心/慕尼黑大学语言与文学计算研究所) University of Tübingen(图宾根大学) Fuzhou University(福州大学) Masaryk University(马萨里克大学) University College London(伦敦大学学院) University of Oxford(牛津大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 提出AIMO可解释性挑战,基于前沿数学语言模型内部机制区分稳健与虚假推理。利用AIMO问题等资源,提供推理问题、模型访问及鲁棒性评估,助参与者开发识别稳健模型的方法,创建新基准和基线系统,连接可解释性与泛化研究。

Comments Accepted Competition at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13047 2026-07-16 cs.LG 新提交 57%

Targeted Recovery of Weight-Space Mechanisms From Neural Networks

从神经网络中定向恢复权重空间机制

Antoine Vigouroux, Lee Sharkey

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 研究提出定向参数分解(tPD)方法,通过引入高秩通用组件,从神经网络中仅识别处理特定感兴趣输入的组件,在玩具模型和Transformer语言模型上验证有效,能以低计算量提取子模型并对记忆序列进行手术式操作。

Comments Accepted at the Mechanistic Interpretability Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11698 2026-07-14 cs.CR cs.AI 新提交 57%

Agent Hacks Agent: Autoresearch for Production-Agent Red-Teaming

智能体攻击智能体:用于生产智能体红队测试的自动研究

Xutao Mao, Xiang Zheng, Cong Wang

机构 * City University of Hong Kong(香港城市大学)

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.AI

AI总结 研究生产型语言模型智能体的自动化红队测试,提出AHA可证伪发现循环,通过该循环构建漏洞概念图。在Claude Code和Codex上测试,发现跨模型和智能体的可重复使用漏洞核心,生成的VCG为安全团队提供可审计工件,提升测试性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09544 2026-07-13 cs.CV cs.LG 新提交 57%

The Count Is There, but Misaligned: Understanding and Correcting Counting Failures in VLMs

计数存在但未对齐:理解和纠正视觉语言模型中的计数失败

Ahmed Oumar El-Shangiti, Abzal Nurgazy, Hilal AlQuabeh, Nikolai Rozanov, Kentaro Inui

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Imperial College London(伦敦帝国学院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 研究视觉语言模型计数失败问题,通过对VLM激活进行探测训练及分析,发现其虽常编码正确计数但输出错误,提出探测器引导的自校正方法,在不更新参数时提高计数准确率,揭示内部知识与模型输出差距并提供改进工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08741 2026-07-10 cs.GR cs.CV cs.LG cs.RO 新提交 57%

ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation

ARDY:用于交互式人体运动生成的具有混合表示的自回归扩散

Kaifeng Zhao, Mathis Petrovich, Haotian Zhang, Tingwu Wang, Siyu Tang, Davis Rempe

机构 * NVIDIA(英伟达) ETH Zürich(苏黎世联邦理工学院)

专题命中 知识编辑与模型理解 :prompting(abstract);分类 cs.LG

AI总结 研究旨在解决交互式应用中人体运动生成问题,提出ARDY框架,采用混合表示和两阶段自回归变压器去噪器,能通过在线文本提示和运动学约束实现高保真运动生成,经评估验证了有效性和实用性。

Comments ACM Transactions on Graphics (SIGGRAPH 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03806 2026-07-07 eess.AS cs.AI eess.SP 新提交 57%

Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings

探测CLAP音频嵌入中的低层声学属性编码

Héctor Martel, Joe Hennessy-Priest, Taemin Cho

机构 * BandLab Technologies(BandLab技术公司)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI

AI总结 该研究通过探测框架分析CLAP音频嵌入,探究混响、响度等三类基础声学属性的编码方式,发现多数属性可恢复,存在线性与非线性两种编码模式,还验证了跨模态一致性。

Comments Accepted to DAFx 2026

详情

展开后加载摘要…

URL PDF HTML 收藏