arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 2338
2606.26379 2026-06-26 cs.CV 新提交

Layer-Specific Prompt Fusion Discovery via Differentiable Search in Vision Foundation Models

基于可微搜索的视觉基础模型层特定提示融合发现

Xi Xiao, Xingjian Li, Yunbei Zhang, Cheng Han, Tianming Liu, Tianyang Wang, Runmin Jiang, Jihun Hamm, Xiao Wang, Min Xu

机构 * UAB(阿拉巴马大学伯明翰分校) CMU(卡内基梅隆大学) Tulane(杜兰大学) UMKC(密苏里大学堪萨斯分校) UGA(佐治亚大学) ORNL(橡树岭国家实验室)

AI总结 研究视觉提示微调中提示与图像令牌的融合方案,提出可微架构搜索方法联合优化可学习提示及其融合方式,在34个数据集上取得一致提升。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20632 2026-06-26 cs.CL cs.AI cs.CY 新提交

Post-Training Recipe, More Than Model Family, Shapes Multi-Agent LLM Conversational Behavior

后训练配方,而非模型家族,塑造多智能体LLM对话行为

Luyang Zhang, Jialu Wang, Fei Xue, Yi-Yun Chu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

AI总结 研究通过大规模语料库和因子实验发现,后训练配方(如推理蒸馏)对多LLM对话行为(如回避性回答)的影响超过模型家族,表明模型家族不能完全代表对话多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01195 2026-06-26 cs.CV cs.AI 版本更新

VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning

VisNec: 衡量和利用视觉必要性进行多模态指令微调

Mingkang Dong, Hongyi Cai, Jie Li, Sifan Zhou, Bin Ren, Kunyu Peng, Yuqian Fu

机构 * SJTU(上海交通大学) Universiti Malaya(马来亚大学) CMU(卡内基梅隆大学) MBZUAI(穆萨台普大学人工智能研究所) KIT(卡尔斯鲁厄理工学院) KAUST(王国立阿联酋科学技术大学)

AI总结 提出VisNec分数衡量视觉输入在多模态指令微调中的边际贡献,结合语义聚类选择高必要性样本,在15%数据上达到全数据性能的100.2%。

Comments Accepted at ECCV 2026. Project Page: https://dmk041218.github.io/VisNec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18900 2026-06-26 cs.CR cs.CV 版本更新

PrivacyBench: Privacy Isn't Free in Hybrid Privacy-Preserving Vision Systems

PrivacyBench: 混合隐私保护视觉系统中的隐私并非免费

Nnaemeka Obiefuna, Samuel Oyeneye, Similoluwa Odunaiya, Iremide Oyelaja, Steven Kolawole

机构 * ML Collective(ML集体) Friedrich-Alexander-Universität Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出PrivacyBench框架,系统评估FL+DP、FL+SMPC等混合隐私技术在医学图像分类中的交互效应,发现FL+DP组合导致严重收敛失败和性能下降,而FL+SMPC保持近基线性能,为隐私-效用-成本权衡提供系统评估平台。

Comments Preprint; preceding version accepted at ES-FOMO III, ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25990 2026-06-25 cs.CL cs.AI cs.SD 新提交

SpeechEQ: Benchmarking Emotional Intelligence Quotient in Socially Aware Voice Conversational Models

SpeechEQ: 社交感知语音对话模型的情商基准测试

Liang-Yuan Wu, Zih-Ching Chen, Tongshuang Wu, Chao-Han Huck Yang, Hua Shen

机构 * New York University(纽约大学) NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) NYU Shanghai(上海纽约大学)

AI总结 提出SpeechEQ框架,基于EQ-i 2.0理论构建2265个对话数据集,通过口语情商(SEQ)评分评估语音语言模型在主动多轮对话中的副语言社交线索推理能力,揭示端到端模型存在模态捷径、安全陷阱和上下文遗忘等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25220 2026-06-25 cs.CV cs.GR 新提交

Cage-based Texture Transfer with Geometric Filtering

基于笼形几何滤波的纹理迁移

Rose Mei Zhou, Lynnette Hui Xian Ng, Adrian Xuan Wei Lim, Conor Griffin, Faraz Baghernezhad

机构 * Roblox CMU(卡内基梅隆大学)

AI总结 提出一种基于笼形几何滤波的方法,通过识别非化妆区抑制伪影,实现高效、无需训练的实时纹理迁移,在移动设备上对约4.8k三角网格达到约70ms运行时间。

Comments Accepted to SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25178 2026-06-25 cs.AI 新提交

Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR

通用推理的可迁移性:多领域RLVR的自动课程

Yongjin Yang, Jiarui Liu, Yinghui He, Lechen Zhang, Bernhard Schölkopf, Zhijing Jin

机构 * Jinesis Lab, University of Toronto & Vector Institute(Jinesis实验室,多伦多大学与向量研究所) Carnegie Mellon University(卡内基梅隆大学) Princeton University(普林斯顿大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ELLIS Institute Tübingen(ELLIS研究所图宾根) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) EuroSafeAI

AI总结 提出迁移感知课程(TAC),利用优势信号和投影梯度估计跨领域可迁移性,在多领域推理套件上实现最佳平均准确率。

Comments 32 pages, including supplementary material; code available at https://github.com/YangYongJin/transfer-aware-curriculum

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25134 2026-06-25 cs.RO 新提交

Causality-Based Parametric Control Barrier Function for Safe Multi-Vehicle Interaction

基于因果关系的参数化控制屏障函数用于安全多车交互

Yiwei Lyu, Caleb Chang, John M. Dolan

机构 * School of Electrical and Computer Engineering, Georgia Institute of Technology(佐治亚理工学院电气与计算机工程学院) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 针对多车交互中因果推断困难导致保守行为的问题,提出基于因果关系的参数化控制屏障函数,实现自适应安全控制,提升任务效率。

Comments accepted ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15834 2026-06-25 cs.AI cs.CR cs.SY eess.SY 新提交

AIChilles: Automatically Uncovering Hidden Weaknesses in AI-Evolved Systems

AIChilles:自动发现AI进化系统中的隐藏弱点

Yajie Zhou, Ao Li, Ashwin Silla, Zaoxing Liu, Vyas Sekar

机构 * Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学)

AI总结 提出AIChilles框架,通过结合确定性工作负载参数提取、基于代理的约束推断、差异预言机和代码频率覆盖,自动发现AI进化程序在正确性、运行时、内存使用或输出质量上相对于基线程序的回归问题,在5个系统应用和30个AI进化程序中发现49个隐藏弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22225 2026-06-25 cs.CL cs.SD eess.AS 版本更新

Adapting Self-Supervised Speech Representations for Cross-lingual Dysarthria Detection in Parkinson's Disease

自适应自监督语音表示用于帕金森病跨语言构音障碍检测

Abner Hernandez, Eunjung Yeo, Kwanghee Choi, Chin-Jou Li, Zhengjun Yue, Rohan Kumar Das, Jan Rusz, Mathew Magimai Doss, Juan Rafael Orozco-Arroyave, Tomás Arias-Vergara, Andreas Maier, Elmar Nöth, David R. Mortensen, David Harwath, Paula Andrea Perez-Toro

机构 * FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡大学) UT Austin(奥斯汀大学) CMU(卡内基梅隆大学) Czech Technical University in Prague(布拉格技术大学) Idiap Research Institute(Idiap研究机构) Universidad de Antioquia(安提奥基亚大学) Shenzhen Loop Area Institute(深圳河套学院) Fortemedia(Fortemedia公司)

AI总结 针对构音障碍数据稀缺导致跨语言检测困难,提出基于质心的表示级语言迁移方法,对齐自监督语音表示,在捷克语、德语和西班牙语帕金森病语音数据集上显著提升跨语言检测敏感性和F1值。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04109 2026-06-25 cs.HC cs.AI 版本更新

Tinker Tales: A Tangible Dialogue System for Child-AI Co-Creative Storytelling

Tinker Tales:一个用于儿童与AI共同创意故事讲述的有形对话系统

Nayoung Choi, Jiseung Hong, Peace Cyebukayire, Ikseon Choi, Jinho D. Choi

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) Department of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学系) School of Nursing, Emory University(埃默里大学护理学院)

AI总结 提出Tinker Tales有形对话系统,通过结合物理故事板、NFC玩具和移动应用,支持儿童与AI在四个叙事阶段进行协作故事创作,并发现提示框架影响儿童叙事贡献的形式和一致性。

Comments Accepted to SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05933 2026-06-25 cs.CL cs.AI 版本更新

Reinforcement Learning Improves Traversal of Parametric Knowledge in LLMs

强化学习改善LLM中参数化知识的遍历

Renfei Zhang, Manasa Kaniselvan, Rylan Schaeffer abd Niloofar Mireshghallah

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院) Stanford University(斯坦福大学)

AI总结 本文发现强化学习提升LLM知识回忆能力,原因在于改进了模型对参数化知识层次结构的遍历技能,而非获取新知识。

Comments `

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24082 2026-06-24 eess.AS cs.SD 新提交

Comparative Reasoning: Making an Audio Language Model Better at Comparing Emotions

比较推理:让音频语言模型更擅长比较情感

Abinay Reddy Naini, Jaeyeon Kim, Chao-Han Huck Yang, Shinji Watanabe, Carlos Busso

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) The University of Texas at Dallas(德克萨斯大学达拉斯分校) NVIDIA(英伟达)

AI总结 提出一种推理引导的序数情感识别框架,通过配对语音输入和推理轨迹训练音频语言模型,实现可解释的比较情感判断,仅需传统方法5%的训练数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24773 2026-06-24 cs.CL 新提交

Posterior Refinement: Fast Language Generation via Any-Order Flow Maps

后验精炼:通过任意阶流映射实现快速语言生成

Manan Agarwal, Sheel Shah, Chanhyuk Lee, Jaehoon Yoo, Jerry Huang, Seunghoon Hong, Aditi Raghunathan, Jinwoo Kim, Nicholas M. Boffi

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出FMLM+框架,结合掩码噪声调度实现单步生成,并利用后验评分进行自适应精炼,在32倍更少NFE下达到离散基线性能,改善速度-质量权衡。

Comments 24 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24734 2026-06-24 cs.CL cs.AI cs.HC 新提交

Task Decomposition for Efficient Annotation

高效标注的任务分解

Nupoor Gandhi, Emma Strubell

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出将结构化标注任务分解为子任务以减少推理负担,基于中心理论建模推理负荷,并给出分配策略以在固定预算下最大化质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24712 2026-06-24 cs.RO cs.AI 新提交

TACTFUL: Tactile-Driven Exploration For Object Localization and Identification in Confined Environments

TACTFUL: 受限环境中的触觉驱动探索用于物体定位与识别

Shivani Kamtikar, Chung Hee Kim, Camilla Tabasso, Tye Brady, Joshua Migdal, Taskin Padir

机构 * Amazon Fulfillment Technologies & Robotics(亚马逊履约技术与机器人) Siebel School of Computing and Data Science, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校西贝尔计算与数据科学学院) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 提出无视觉触觉探索框架TACTFUL,使多指机器人通过动态奖励策略平衡全局探索与局部表面细化,实现物体自主发现与识别,平均重建误差0.015米,成功率77%。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24078 2026-06-24 cs.RO 新提交

MinInter: Minimizing Trajectory Interpolation During Data Augmentation for Imitation Learning

MinInter:在模仿学习的数据增强中最小化轨迹插值

Qingyang Wang, Xingang Liu, Changwei Yao, Zikai Ouyang, Junwei Liu, Haibo Lu, Wei Zhang

机构 * School of Automation and Intelligent Manufacturing, Southern University of Science and Technology(南方科技大学自动化与智能制造学院) Pengcheng Laboratory(鹏城实验室) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出MinInter方法,通过选择需要最少插值的源演示来生成高质量合成轨迹,在MimicGen基准的12个操作任务中显著提升数据生成成功率和策略成功率。

Comments Accepted by IEEE CASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24004 2026-06-24 cs.CL cs.AI 新提交

Towards Spec Learning: Inference-Time Alignment from Preference Pairs

面向规范学习:从偏好对进行推理时对齐

Dhriti Krishnan, Tejas Goyal, Jaromir Savelka

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出规范学习框架,利用少量用户指令和偏好判断生成自然语言规范,在推理时引导LLM行为,无需参数更新,在密集偏好信号领域优于DPO,且规范可解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23991 2026-06-24 cs.AI cs.LG cs.MA cs.RO 新提交

Critique of Agent Model

智能体模型批判

Eric Xing, Mingkai Deng, Jinyu Hou

机构 * Institute of Foundation Models, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学基础模型研究所) School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

AI总结 本文区分了自动化与智能体,提出真正智能体需内化目标、身份、决策、自我调节和学习等结构,并设计了GIC通用智能体架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23938 2026-06-24 cs.AI cs.CL 新提交

Neuro-Symbolic Drive: Rule-Grounded Faithful Reasoning for Driving VLAs

神经符号驱动:基于规则忠实推理的驾驶VLA

Xiangbo Gao, Xiukun Huang, Boyu Lu, Junge Zhang, Mengjie Mao, Jiachen Li, Wei Xiong, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯农工大学) Carnegie Mellon University(卡内基梅隆大学) University of Maryland(马里兰大学) University of California, Riverside(加利福尼亚大学河滨分校) University of Pittsburgh(匹兹堡大学)

AI总结 提出神经符号驱动框架,利用规则规划器的决策轨迹监督驾驶VLA,实现推理与运动生成的因果耦合,显著降低轨迹误差和碰撞率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23920 2026-06-24 cs.LG cs.AI 新提交

Catastrophic Compositional Generation: Why Vanilla Diffusion Models Fail to Extrapolate

灾难性组合生成:为什么普通扩散模型无法外推

Duncan Soiffer, Chandler Squires, Yuan Guan, Jason Hartford, Pradeep Ravikumar

机构 * Machine Learning Department, Carnegie Mellon University(卡内基梅隆大学机器学习系) Valence Labs Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系)

AI总结 本文论证普通条件扩散模型在组合生成任务中常不可行,通过理论泛化论证和实验表明,当目标分布超出源分布范围时,分数估计误差会导致灾难性性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10124 2026-06-24 cs.LG cs.AI 新提交

FedSteer: Taming Extreme Gradient Staleness in Federated Learning with Corrective Projections and Caching

FedSteer: 通过校正投影和缓存驯服联邦学习中的极端梯度陈旧性

Haoran Zhang, Cainã Figueiredo Pereira, Marie Siew, Xutong Liu, Carlee Joe-Wong, Rachid El-Azouzi

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Avignon(阿维尼昂大学) Singapore University of Technology and Design(新加坡科技与设计大学) University of Washington(华盛顿大学)

AI总结 针对联邦学习中客户端参与不均导致的梯度陈旧问题,提出FedSteer方法,利用客户端梯度缓存构建子空间,通过投影和缓存策略校正陈旧梯度,显著提升训练稳定性与精度。

Comments UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05896 2026-06-24 cs.CV 版本更新

Resonant Minds: Closed-Loop Social Avatars with Theory of Mind

共鸣心智:具备心智理论的闭环社交虚拟人

Jianxu Shangguan, Jing Xu, Hang Ye, Xiaoxuan Ma, Yizhou Wang, Jenq-Neng Hwang, Wentao Zhu

机构 * University of Washington(华盛顿大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Eastern Institute of Technology, Ningbo(宁波工程技术学院)

AI总结 提出一个闭环双智能体框架,通过整合感知、社会推理(基于心智理论)和多模态生成,实现具备社交智能的虚拟人,并在信息不对称数据集上取得优于全信息脚本模式的对话质量。

Comments Project page: https://resonantminds.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20892 2026-06-24 cs.AI 版本更新

Representation Interventions Enable Lifelong Knowledge Memory Control in LLMs

表示干预使大语言模型在终身学习中实现知识记忆控制

Xuyuan Liu, Shengyu Chen, Xinshuai Dong, Yanchi Liu, Xujiang Zhao, Haoyu Wang, Yujun Yan, Haifeng Chen, Zhengzhang Chen

机构 * Dartmouth College(达特茅斯学院) NEC Laboratories America(NEC美国实验室) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出RILKE方法,通过在模型表示空间中进行干预,实现大语言模型的终身知识控制,有效更新知识并保持通用性。

Comments In Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics: ACL 2026, Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10807 2026-06-24 cs.RO

Bridging Language and Action: A Survey of Language-Conditioned Robot Manipulation

连接语言与行动:语言引导的机器人操作综述

Xiangtong Yao, Hongkuan Zhou, Oier Mees, Yuan Meng, Ted Xiao, Yonatan Bisk, Jean Oh, Edward Johns, Mohit Shridhar, Dhruv Shah, Jesse Thomason, Kai Huang, Joyce Chai, Zhenshan Bing, Alois Knoll

机构 * Technical University of Munich(慕尼黑技术大学) Corporate Research, Robert Bosch GmbH(罗伯特·博世集团企业研究部) University of California Berkeley(加州大学伯克利分校) Microsoft(微软) Google DeepMind(谷歌DeepMind) Carnegie Mellon University(卡内基梅隆大学) Imperial College London(伦敦帝国理工学院) Princeton University(普林斯顿大学) University of Southern California(南加州大学) Sun Yat-sen University(中山大学) University of Michigan(密歇根大学) Institute for Artificial Intelligence, University of Stuttgart(斯图加特大学人工智能研究所) The State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)

AI总结 本文综述了语言引导的机器人操作领域,探讨了语言如何与机器人系统整合,分析了现有方法的分类及最新进展,指出关键争议和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20450 2026-06-24 cs.CL cs.AI cs.CY cs.LG 版本更新

Policies Permitting LLM Use for Polishing Peer Reviews Are Currently Not Enforceable

允许使用LLM润色同行评审的政策目前无法执行

Rounak Saha, Gurusha Juneja, Dayita Chaudhuri, Naveeja Sajeevan, Nihar B Shah, Danish Pruthi

机构 * Indian Institute of Science(印度科学研究院) University of California, Santa Barbara(加州大学圣芭芭拉分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本研究通过模拟多级人机协作的同行评审数据集,评估五种AI文本检测器,发现它们无法可靠区分LLM润色后的评审与纯人工评审,导致误判风险,表明当前政策不可执行。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22548 2026-06-24 cs.CL cs.AI cs.LG 版本更新

Are LLM Evaluators Really Narcissists? Sanity Checking Self-Preference Evaluations

LLM评估者真的是自恋者吗?对自我偏好评估的健全性检查

Dani Roytburg, Matthew Bozoukov, Matthew Nguyen, Jou Barzdukas, Mackenzie Puig-Hall, Narmeen Oozeer

机构 * Department of Machine Learning, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学机器学习系) Department of Computer Science and Engineering, University of California San Diego, La Jolla, CA, USA(加州大学圣地亚哥分校计算机科学与工程系) Department of Computer Science, University of Virginia, Charlottesville, VA, USA(弗吉尼亚大学计算机科学系) Martian Research, San Francisco, California, USA(火星研究公司) Apart Research, San Francisco, California, USA(Apart研究公司)

AI总结 通过比较评估者自我评价与评价其他模型时的投票分布,发现仅51%的先前结果具有统计显著性,表明自我偏好主要由评估者质量而非自恋驱动。

Comments ICML 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03647 2026-06-24 cs.CL cs.AI cs.LG 版本更新

Breaking the Mirror: Activation-Based Mitigation of Self-Preference in LLM Evaluators

打破镜像:基于激活的LLM评估者自我偏好缓解方法

Dani Roytburg, Matthew Bozoukov, Matthew Nguyen, Jou Barzdukas, Simon Fu, Narmeen Oozeer

机构 * University of Virginia(弗吉尼亚大学) University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学) School of Computer Science(计算机科学学院)

AI总结 针对LLM评估者自我偏好偏见,提出轻量级引导向量方法,在推理时无需重训练即可将不公正自我偏好降低97%,但存在稳定性问题。

Comments Presented at {Mechanistic Interpretability, Evaluations, Reliable-ML} Workshops, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21854 2026-06-23 eess.AS cs.SD 新提交

ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era

ESPnet3:基础模型时代可扩展语音与音频研究的基础设施

Masao Someki, Alexander Polok, Carlos Carvalho, Chyi-Jiunn Lin, Da-Hee Yang, Jiatong Shi, Jinchuan Tian, Nelson Enrique Yalta Soplin, Samuele Cornell, Siddhant Arora, Francisco Teixeira, Wei Wang, William Chen, Alberto Abad, Chenda Li, Shinji Watanabe, Wangyou Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Brno University of Technology(布拉格技术大学) Instituto Superior Técnico(技术高等研究院) Hanyang University(翰阳大学) Hitachi Astemo(日立阿美士多) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出ESPnet3框架,通过模块化系统架构、配置驱动的数据集组合和统一Python工作流,实现大规模语音音频研究的高效训练与扩展,显著降低工程开销。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23688 2026-06-23 cs.CV 新提交

Lift4D: Harmonizing Single-View 3D Estimation for 4D Reconstruction In-the-Wild

Lift4D: 协调单视图3D估计以实现野外4D重建

Yehonathan Litman, Xiaoxuan Ma, Manan Shah, Nicolas Ugrinovic, Kris Kitani, Fernando De la Torre, Shubham Tulsiani

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出Lift4D框架,通过因果潜在条件化单视图3D模型获得时域一致的初始化,再结合遮挡感知优化和扩散先验,实现从单目视频重建动态非刚体4D场景,显著优于现有方法。

Comments Webpage, Demos: https://lift4d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏