arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 2338
2605.21059 2026-05-21 cs.CV cs.LG

Multimodal LLMs under Pairwise Modalities

基于成对模态的多模态大语言模型

Yan Li, Yunlong Deng, Yuewen Sun, Gongxu Luo, Kun Zhang, Guangyi Chen

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出了一种基于成对模态训练多模态大语言模型的方法,通过理论分析和表示学习框架,实现了跨模态对齐和重构,提升了模型的跨模态性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21058 2026-05-21 cs.LG

A Dialogue between Causal and Traditional Representation Learning: Toward Mutual Benefits in a Unified Formulation

因果与传统表征学习之间的对话:在统一框架中实现相互受益

Yan Li, Yuewen Sun, Shaoan Xie, Gongxu Luo, Yunlong Deng, Kun Zhang, Guangyi Chen

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文探讨了因果表征学习与传统表征学习之间的对话,提出统一框架,通过任务组件和约束组件相互促进发展,实验表明因果约束的有效性依赖于所配的任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20960 2026-05-21 cs.CL

JobArabi: An Arabic Corpus and Analysis of Job Announcements from Social Media

JobArabi: 一个阿拉伯语语料库及来自社交媒体的招聘公告分析

Wajdi Zaghouani, Shimaa Amer Ibrahim, Mabrouka Bessghaier, Houda Bouamor

机构 * Northwestern University in Qatar(卡塔尔诺维克大学) Carnegie Mellon University in Qatar(卡塔尔卡内基梅隆大学)

AI总结 本文介绍了JobArabi,一个从2024年1月至2025年10月期间收集的阿拉伯语招聘公告语料库,包含20,528条来自X平台的公开帖子,旨在分析阿拉伯语在线社区中的就业相关话语,揭示社交媒体在劳动力市场沟通和语言变化研究中的潜力。

Comments Accepted at LREC 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20767 2026-05-21 cs.CL cs.LG stat.ME

The Illusion of Intervention: Your LLM-Simulated Experiment is an Observational Study

干预的幻觉:你的LLM模拟实验实际上是一个观察性研究

Victoria Lin, Taedong Yun, Maja Matarić, John Canny, Arthur Gretton, Alexander D'Amour

机构 * Google DeepMind(谷歌DeepMind) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文探讨了大型语言模型在模拟人类行为中的潜在作用,指出在LLM模拟的合成用户中进行干预可能引起潜在用户属性的意外变化,从而导致用户漂移,影响效果估计。本文提出了使用负对照结果来检测分布变化的方法,并通过调整角色描述以减少偏倚来缓解漂移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20609 2026-05-21 cs.LG

Compositional Transduction with Latent Analogies for Offline Goal-Conditioned Reinforcement Learning

基于潜在类比的组合转导用于离线目标条件强化学习

Junseok Kim, Dohyeong Kim, Mineui Hong, Songhwai Oh

机构 * Department of Electrical and Computer Engineering and ASRI, Seoul National University(电气与计算机工程系和首尔国立大学ASRI) Independent researcher(独立研究者) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 本文提出了一种基于潜在类比的组合转导方法,用于解决离线目标条件强化学习中面对新情境时的目标泛化问题,通过引入新的类比表示方法,提升了在不同情境下的目标达到能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14364 2026-05-21 cs.LG

MoRe: Modular Representations for Principled Continual Representation Learning on Sequential Data

MoRe:模块化表示用于序列数据的原理化持续表示学习

Jiaqi Sun, Boyang Sun, Rasmy M. H., Xiangchen Song, Kun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文提出MoRe框架,通过模块化表示方法实现序列数据的原理化持续学习,其核心贡献是通过分解知识为可识别的模块层级,实现模块的重用、对齐和扩展,从而在保持旧模块的同时提升模型的可塑性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09860 2026-05-21 cs.AI

When to Re-Commit: Temporal Abstraction Discovery for Long-Horizon Vision-Language Reasoning

何时重新承诺:为长时间视觉-语言推理发现时间抽象

Chen Li, Zhantao Yang, Fangyi Chen, Han Zhang, Anudeepsekhar Bolimera, Marios Savvides

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出了一种可学习的状态条件化承诺深度方法,用于长时间视觉-语言推理任务,通过动态调整承诺深度,提高了求解率并减少了基本动作数量,优于固定深度基线和现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14392 2026-05-21 cs.LG cs.RO

WestWorld: A Knowledge-Encoded Scalable Trajectory World Model for Diverse Robotic Systems

WestWorld: 一种知识编码的可扩展轨迹世界模型用于多样化机器人系统

Yuchen Wang, Jiangtao Kong, Sizhe Wei, Xiaochang Li, Haohong Lin, Hongjue Zhao, Tianyi Zhou, Lu Gan, Huajie Shao

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文提出WestWorld,一种知识编码的可扩展轨迹世界模型,用于多样化机器人系统,通过引入系统感知的混合专家(Sys-MoE)和结构嵌入来提升可扩展性和零样本泛化能力,实现了在多种机器人环境中的高效轨迹预测和控制。

Comments ICML 2026 spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23538 2026-05-21 cs.AI cs.CL cs.CV cs.SE

JanusCoder: Towards a Foundational Visual-Programmatic Interface for Code Intelligence

JanusCoder: 向代码智能的视觉-程序化界面迈进

Qiushi Sun, Jingyang Gong, Yang Liu, Qiaosheng Chen, Lei Li, Kai Chen, Qipeng Guo, Ben Kao, Fei Yuan

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出JanusCoder,一种面向代码智能的视觉-程序化界面,通过构建大规模多模态代码数据集和统一模型,实现从文本指令、视觉输入或两者结合生成代码,展示了其在文本和视觉编程任务中的优越性能。

Comments ICLR 2026 Camera Ready Version, with code and data available

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09724 2026-05-21 cs.SE cs.AI

InteractScience: Programmatic and Visually-Grounded Evaluation of Interactive Scientific Demonstration Code Generation

InteractScience: 交互式科学演示代码生成的程序化与视觉导向评估

Qiaosheng Chen, Yang Liu, Lei Li, Kai Chen, Qipeng Guo, Gong Cheng, Fei Yuan

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室,南京大学,中国南京) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,中国上海) Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学,美国匹兹堡)

AI总结 本文提出InteractScience基准,用于评估大语言模型在生成交互式科学演示代码时结合科学知识与前端交互能力的综合表现,通过程序化测试和视觉测试相结合的方法,评估30种开源和闭源LLM的表现,揭示了在整合领域知识与交互前端编码方面的持续不足。

Comments 27 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20506 2026-05-21 cs.LG cs.CL

Reinforcing Human Behavior Simulation via Verbal Feedback

通过言语反馈强化人类行为模拟

Weiwei Sun, Xuhui Zhou, Jiarui Liu, Weihua Du, Haojia Sun, Yiqing Xie, Qianou Ma, Sihao Chen, Mengting Wan, Longqi Yang, Pei Zhou, Sherry Wu, Sean Welleck, Graham Neubig, Yiming Yang, Maarten Sap

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软)

AI总结 本文提出DITTO模型,通过将言语反馈作为强化学习中的首要信号来提升LLM模拟人类行为的能力,并引入SOUL基准测试平台,展示了在多个任务中显著提升性能的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20425 2026-05-21 cs.AI

AgentCo-op: Retrieval-Based Synthesis of Interoperable Multi-Agent Workflows

AgentCo-op: 基于检索的互操作多智能体工作流合成

Shuaike Shen, Wenduo Cheng, Shike Wang, Mingqian Ma, Jian Ma

机构 * Ray and Stephanie Lane Computational Biology Department, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院雷和斯蒂芬妮·兰德计算生物学系) Machine Learning Department, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院机器学习系)

AI总结 本文提出AgentCo-op,一种基于检索的多智能体工作流合成框架,通过类型化任务传递合成可执行工作流,并在执行证据表明失败时应用有界自引导局部修复。在两个开放世界基因组学案例研究中,AgentCo-op在不重设计或运行全局拓扑搜索的情况下,将独立开发的科学智能体和外部工具库整合到可审计的工作流中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20396 2026-05-21 cs.LG stat.ML

Score-Based Causal Discovery of Latent Variable Causal Models

基于得分的潜在变量因果模型因果发现

Ignavier Ng, Xinshuai Dong, Haoyue Dai, Biwei Huang, Peter Spirtes, Kun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, San Diego(加州大学圣地亚哥分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文提出了一种基于得分的方法,用于识别包含因果相关潜在变量的因果结构,并提供了可识别性保证,同时通过实验验证了方法的有效性。

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20285 2026-05-21 cs.LG cs.AI

Introspective X Training: Feedback Conditioning Improves Scaling Across all LLM Training Stages

反思式X训练:反馈条件化提升跨所有LLM训练阶段的扩展性

Brandon Cui, Ximing Lu, Jaehun Jung, Syeda Nahida Akter, Hyunwoo Kim, Yuxiao Qu, David Acuna, Shrimai Prabhumoye, Yejin Choi, Prithviraj Ammanabrolu

机构 * NVIDIA University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) UC San Diego(南加州大学)

AI总结 本文提出反思式训练(IXT),通过利用后续阶段的动态来改进早期阶段,从而提高LLM训练的扩展效率,实验表明该方法在计算效率和性能上均有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10784 2026-05-21 cs.AI

TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training

TorchUMM: 一个用于评估、分析和训练后处理的统一多模态模型代码库

Yinyi Luo, Wenwen Wang, Hayes Bai, Hongyu Zhu, Hao Chen, Pan He, Marios Savvides, Sharon Li, Jindong Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) William & Mary(威廉与玛丽学院) Auburn University(阿肯色大学欧文分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出TorchUMM,一个统一的多模态模型代码库,用于评估、分析和训练后处理,涵盖多种多模态模型架构、任务和数据集,通过统一接口和标准化评估协议,促进异构模型的公平比较和深入理解,推动更强大的统一多模态系统的发展。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06649 2026-05-20 cs.CL

Measuring Stereotype and Deviation Biases in Large Language Models

测量大型语言模型中的刻板印象和偏差偏见

Daniel Wang, Eli Brignac, Minjia Mao, Xiao Fang

机构 * Carnegie Mellon University, U.S.A.(卡内基梅隆大学,美国) University of Delaware, U.S.A.(德雷塞尔大学,美国)

AI总结 本文研究了大型语言模型中刻板印象和偏差偏见的测量问题,通过生成个体档案来分析不同群体与政治立场、宗教信仰和性取向等属性之间的关联,揭示了LLM在推断用户属性时的偏见及其潜在危害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19695 2026-05-20 eess.AS cs.SD

Cross-Talk Speech Reduction, by Separation, for Separation

通过分离实现的交叉talk语音消除,用于分离

Zhong-Qiu Wang, Samuele Cornell

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Southern University of Science and Technology(南方科技大学) Language Technologies Institute(语言技术研究所) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出了一种旨在从近场混合信号中分离说话人语音的交叉talk消除任务,并提出了一种名为CTRnet的新型方法,可以直接在真实录制的近场和远场混合信号对上训练以完成CTR。基于CTRnet,进一步提出基于伪标签的远场语音分离(PuLSS),利用CTRnet估计的干净语音作为伪标签来训练分离远场混合信号的模型。该框架的主要优势是CTRnet和PuLSS都可以在目标域的真实数据上进行训练,解决了模型仅在模拟数据上训练时通常观察到的泛化差距。在CHiME-6数据集上,该框架在Oracle和估计说话人分离条件下实现了最先进的ASR性能,超过了所有CHiME-{7,8}挑战提交。据我们所知,这是首个在真实对话“语音在野外”数据上显著优于引导源分离的神经语音分离方法。

Comments in submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19516 2026-05-20 cs.CL cs.AI cs.LG

Base Models Look Human To AI Detectors

基础模型对AI检测器看起来很像人类

Yixuan Even Xu, Ziqian Zhong, Aditi Raghunathan, Fei Fang, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本研究发现基础模型生成的文本在AI检测器中常被误判为人类生成,提出HIP方法通过迭代改写提升检测器规避能力,揭示当前检测器更关注指令调优和局部上下文而非通用机器生成文本特征。

Comments 39 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19341 2026-05-20 cs.CL cs.AI cs.LG stat.ML

HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models

HalluWorld: 一个用于通过参考世界模型控制幻觉的基准

Emmy Liu, Varun Gangal, Michael Yu, Zhuofu Tao, Karan Singh, Sachin Kumar, Steven Y. Feng

机构 * Carnegie Mellon University(卡内基梅隆大学) Patronus AI Independent Researcher(独立研究者) Stanford University(斯坦福大学) The Ohio State University(俄亥俄州立大学) DegenAI Labs(DegenAI实验室)

AI总结 本文提出HalluWorld基准,通过显式参考世界模型研究语言模型的幻觉问题,发现不同任务中幻觉表现不一致,表明幻觉源于多种失败模式而非单一能力。

Comments HalluWorld benchmark (code and data) at github.com/DegenAI-Labs/HalluWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18445 2026-05-20 cs.CV cs.AI cs.CL cs.LG

What's Holding Back Latent Visual Reasoning?

是什么在阻碍潜在视觉推理?

André G. Viveiros, Nuno Gonçalves, André F. T. Martins, Matthias Lindemann

机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学理工学院) Instituto de Telecomunicações(电信研究所) TransPerfect(TransPerfect公司) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本研究探讨了现有模型如何利用潜在令牌,发现潜在令牌在最终预测中起作用有限,主要问题在于训练数据中潜在令牌信息有限且推理时生成的潜在令牌偏离真实表示,需要高质量数据和更精确的潜在令牌预测来推动发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16679 2026-05-20 cs.CL cs.AI

CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?

CHI-Bench: 能否让AI代理自动化端到端、长周期、政策丰富的医疗工作流程?

Haolin Chen, Deon Metelski, Leon Qi, Tao Xia, Joonyul Lee, Steve Brown, Kevin Riley, Frank Wang, T. Y. Alvin Liu, Hank Capps MD, Zeyu Tang, Xiangchen Song, Lingjing Kong, Fan Feng, Tianyi Zeng, Zhiwei Liu, Zixian Ma, Hang Jiang, Fangli Geng, Yuan Yuan, Chenyu You, Qingsong Wen, Hua Wei, Yanjie Fu, Yue Zhao, Carl Yang, Biwei Huang, Kun Zhang, Caiming Xiong, Sanmi Koyejo, Eric P. Xing, Philip S. Yu, Weiran Yao

机构 * Johns Hopkins Medicine(约翰霍普金斯医学中心) Wellstar Health System(Wellstar健康系统) Stanford University(斯坦福大学) CMU(卡内基梅隆大学) UCSD(加州大学圣地亚哥分校) Yale School of Medicine(耶鲁医学院) Salesforce AI Research(Salesforce人工智能研究) University of Washington(华盛顿大学) Northeastern University(东北大学) Brown University(布朗大学) Boston College(波士顿学院) Stony Brook University(史泰森布里克大学) University of Oxford(牛津大学) Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) Emory University(埃默里大学) MBZUAI Recursive Superintelligence(递归超级智能) University of Illinois at Chicago(伊利诺伊大学芝加哥分校)

AI总结 本文提出CHI-Bench基准,旨在评估AI代理在医疗工作流程中端到端、长周期和政策丰富任务中的自动化能力,揭示当前基准测试中政策密度、多角色协作和多方交互等能力的不足。

Comments Website: https://actava.ai/benchmarks Code: https://github.com/actava-ai/chi-bench Dataset: https://huggingface.co/datasets/actava/chi-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05958 2026-05-20 cs.LG cs.AI

MaxShapley: Towards Incentive-compatible Generative Search with Fair Context Attribution

MaxShapley:迈向具有公平上下文归因的激励兼容生成搜索

Sara Patel, Mingxun Zhou, Giulia Fanti

机构 * Carnegie Mellon University(卡内基梅隆大学) HKUST(香港科技大学)

AI总结 本文提出MaxShapley算法,用于在生成搜索流程中公平地归因和补偿内容提供者,该算法基于Shapley值的特例,通过可分解的max-sum效用函数在多项式时间内计算归因,相比Shapley值的指数成本具有更高的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13727 2026-05-20 cs.AI

From Refusal to Recovery: A Control-Theoretic Approach to Generative AI Guardrails

从拒绝到恢复:一种生成AI防护机制的控制论方法

Ravi Pandya, Madison Bland, Duy P. Nguyen, Changliu Liu, Jaime Fernández Fisac, Andrea Bajcsy

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) Equal Advising(平等指导)

AI总结 本文提出了一种基于控制论的生成AI防护机制,通过实时监控和主动纠正高风险输出,提供了一种动态替代传统标志和阻断方法的解决方案。

Journal ref Second International Association on Safe and Ethical AI Conference (IASEAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18959 2026-05-20 astro-ph.IM astro-ph.CO astro-ph.EP astro-ph.GA cs.LG

Hyrax: An Extensible Framework for Rapid ML Experimentation and Unsupervised Discovery in the Era of Rubin, Roman, and Euclid

Hyrax:一个用于快速机器学习实验和无监督发现的可扩展框架,在Rubin、Roman和Euclid时代

Aritra Ghosh, Drew Oldag, Michael Tauraso, Andrew J. Connolly, Peter Ferguson, Derek Jones, Gourav Khullar, Argyro Sasli, Samarth Venkatesh, Gracia Wang, Maxine West, Dylan Berry, Neven Caplar, Colin Orion Chandler, Tanawan Chatchadanoraset, Michael W. Coughlin, Melissa DeLucchi, Alexandra Junell, Diego Miura, Felipe Fontinele Nunes, Wilson Beebe, Doug Branton, Sandro Campos, Liam Cunningham, Mi Dai, Jeremy Kubica, Konstantin Malanchev, Rachel Mandelbaum, Sean McGuire, Imad Pasha, Dan S. Taranu, Tianqing Zhang

机构 * Dept. of Astronomy \& the DiRAC Institute, University of Washington, Box 351580, Seattle, WA 98195, USA School of Physics Astronomy, University of Minnesota, Minneapolis, MN 55455, USA Department of Astronomy Planetary Science, Northern Arizona University, Flagstaff, USA McWilliams Center for Cosmology Astrophysics, Department of Physics, Carnegie Mellon University, Pittsburgh, PA 15213, USA

AI总结 本文提出Hyrax,一个支持天文领域完整机器学习生命周期的开源框架,通过五个实际应用展示了其在大规模天文数据中的无监督发现和监督检测能力,为下一代天文调查提供了系统化的机器学习基础设施。

Comments 28 pages, 20 figures, submitted to AJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18878 2026-05-20 eess.SP cs.CV cs.LG eess.IV

Prognostic Value of Lung Ultrasound Biomarkers for Readmission Risk in Congestive Heart Failure: A Pilot Data-Driven Analysis

心力衰竭再入院风险的肺部超声生物标志物预后价值:一项试点数据驱动分析

Jana Armouti, Laura Hutchins, Jacob Duplantis, Thomas Deiss, Thales Nogueira Gomes, Keyur H. Patel, Seema Walvekar, Shane Guillory, Thomas H. Fox, Amita Krishnan, Ricardo Rodriguez, Bennett DeBoisblanc, Deva Ramanan, John Galeotti, Gautam Gare

机构 * Carnegie Mellon University(卡内基梅隆大学) LSUHSC Internal Medicine(路易斯安那州立大学医学部) Cosmetic Surgery Facility LLC(美容外科诊所有限公司)

AI总结 本研究通过数据驱动方法利用住院期间获得的B型肺部超声(LUS)数据,预测30天内心力衰竭再入院风险,发现依赖性下肺区域、时间差特征以及多视图特征拼接在预测中表现最佳,展示了超声生物标志物在非侵入性心力衰竭风险分层中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18829 2026-05-20 cs.LG cs.CR

Lossless Anti-Distillation Sampling

无损反蒸馏采样

Zibo Diao, Jingchu Gai, Xinyue Ai, Zhang Zhang, Zhenyu He, Di He

机构 * Peking University(北京大学) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出了一种无损反蒸馏采样方法,通过在保持良性用户体验的同时,有效对抗多账号蒸馏攻击,降低蒸馏模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18763 2026-05-20 cs.IR cs.AI

Query-Conditioned Graph Retrieval for Contextualized LLM Reasoning in Personalized Wearable Data

基于查询的图检索用于个性化可穿戴数据中的上下文化LLM推理

Zhenyu Lu, Mahyar Abbasian, Amir M. Rahmani

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Irvine(加州大学 Irvine 分校)

AI总结 本文提出WAG框架,通过图检索实现LLM在可穿戴数据中的上下文化推理,通过构建个性化知识图谱并检索查询条件子图,提高推理效率和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18753 2026-05-19 cs.CL cs.AI cs.LG

DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention

DashAttention: 可微且自适应的稀疏分层注意力

Yuxiang Huang, Nuno M. T. Gonçalves, Federico Alvetreti, Lei Li, Xu Han, Edoardo M. Ponti, André F. T. Martins, Marcos V. Treviso

机构 * Tsinghua University(清华大学) Instituto Superior Técnico, Universidade de Lisboa(里斯本大学理工学院) Instituto de Telecomunicações(电信研究院) Carnegie Mellon University(卡内基梅隆大学) Sapienza University of Rome(罗马萨皮恩扎大学) University of Edinburgh(爱丁堡大学) TransPerfect(TransPerfect公司) ELLIS Unit Lisbon(里斯本ELLIS单位)

AI总结 本研究提出DashAttention,一种可微且自适应的稀疏分层注意力机制,通过自适应稀疏α-entmax变换选择可变数量的块,从而在保持整个层次结构可微的同时,提升长上下文建模能力,实验表明其在高稀疏度下优于现有方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15929 2026-05-19 cs.CL

MUSCAT: MUltilingual, SCientific ConversATion Benchmark

MUSCAT:多语言、科学对话基准

Supriti Sinhamahapatra, Thai-Binh Nguyen, Yiğit Oğuz, Enes Ugan, Jan Niehues, Alexander Waibel

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出MUSCAT基准,用于评估自动语音识别系统在处理多语言混合输入、特定词汇和语言切换等挑战方面的性能,揭示了当前最先进的ASR系统仍面临开放性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09413 2026-05-19 cs.SD cs.AI cs.CL cs.MA eess.AS

Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception

Speech-Hands: 一种基于自我反思的语音代理方法用于语音识别和多感知音频推理

Zhen Wan, Chao-Han Huck Yang, Jinchuan Tian, Hanrong Ye, Ankita Pasad, Szu-wei Fu, Arushi Goel, Ryo Hachiuma, Shizhe Diao, Kunal Dhawan, Sreyan Ghosh, Yusuke Hirota, Zhehuai Chen, Rafael Valle, Chenhui Chu, Shinji Watanabe, Yu-Chiang Frank Wang, Boris Ginsburg

机构 * NVIDIA Kyoto University(京都大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出Speech-Hands框架,通过自我反思决策机制解决语音识别和外部声音理解任务中的信任问题,提升了模型在多任务音频推理中的准确性和鲁棒性。

Comments Accepted to ACL 2026. Oral Presentation. Code: https://github.com/YukinoWan/Speech-Hands OpenClaw Branch: https://github.com/openclaw/openclaw/pull/69073

详情

展开后加载摘要…

URL PDF HTML 收藏