Multimodal LLMs under Pairwise Modalities
基于成对模态的多模态大语言模型
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出了一种基于成对模态训练多模态大语言模型的方法,通过理论分析和表示学习框架,实现了跨模态对齐和重构,提升了模型的跨模态性能。
高校专区
基于成对模态的多模态大语言模型
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出了一种基于成对模态训练多模态大语言模型的方法,通过理论分析和表示学习框架,实现了跨模态对齐和重构,提升了模型的跨模态性能。
因果与传统表征学习之间的对话:在统一框架中实现相互受益
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德·本·扎耶德人工智能大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文探讨了因果表征学习与传统表征学习之间的对话,提出统一框架,通过任务组件和约束组件相互促进发展,实验表明因果约束的有效性依赖于所配的任务。
JobArabi: 一个阿拉伯语语料库及来自社交媒体的招聘公告分析
机构 * Northwestern University in Qatar(卡塔尔诺维克大学) ; Carnegie Mellon University in Qatar(卡塔尔卡内基梅隆大学)
AI总结 本文介绍了JobArabi,一个从2024年1月至2025年10月期间收集的阿拉伯语招聘公告语料库,包含20,528条来自X平台的公开帖子,旨在分析阿拉伯语在线社区中的就业相关话语,揭示社交媒体在劳动力市场沟通和语言变化研究中的潜力。
Comments Accepted at LREC 2026 Main Conference
干预的幻觉:你的LLM模拟实验实际上是一个观察性研究
机构 * Google DeepMind(谷歌DeepMind) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文探讨了大型语言模型在模拟人类行为中的潜在作用,指出在LLM模拟的合成用户中进行干预可能引起潜在用户属性的意外变化,从而导致用户漂移,影响效果估计。本文提出了使用负对照结果来检测分布变化的方法,并通过调整角色描述以减少偏倚来缓解漂移问题。
基于潜在类比的组合转导用于离线目标条件强化学习
机构 * Department of Electrical and Computer Engineering and ASRI, Seoul National University(电气与计算机工程系和首尔国立大学ASRI) ; Independent researcher(独立研究者) ; Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
AI总结 本文提出了一种基于潜在类比的组合转导方法,用于解决离线目标条件强化学习中面对新情境时的目标泛化问题,通过引入新的类比表示方法,提升了在不同情境下的目标达到能力。
Comments ICML 2026
MoRe:模块化表示用于序列数据的原理化持续表示学习
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
AI总结 本文提出MoRe框架,通过模块化表示方法实现序列数据的原理化持续学习,其核心贡献是通过分解知识为可识别的模块层级,实现模块的重用、对齐和扩展,从而在保持旧模块的同时提升模型的可塑性和稳定性。
何时重新承诺:为长时间视觉-语言推理发现时间抽象
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出了一种可学习的状态条件化承诺深度方法,用于长时间视觉-语言推理任务,通过动态调整承诺深度,提高了求解率并减少了基本动作数量,优于固定深度基线和现有模型。
WestWorld: 一种知识编码的可扩展轨迹世界模型用于多样化机器人系统
机构 * Georgia Institute of Technology(佐治亚理工学院) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Carnegie Mellon University(卡内基梅隆大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
AI总结 本文提出WestWorld,一种知识编码的可扩展轨迹世界模型,用于多样化机器人系统,通过引入系统感知的混合专家(Sys-MoE)和结构嵌入来提升可扩展性和零样本泛化能力,实现了在多种机器人环境中的高效轨迹预测和控制。
Comments ICML 2026 spotlight
JanusCoder: 向代码智能的视觉-程序化界面迈进
机构 * The University of Hong Kong(香港大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanjing University(南京大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 本文提出JanusCoder,一种面向代码智能的视觉-程序化界面,通过构建大规模多模态代码数据集和统一模型,实现从文本指令、视觉输入或两者结合生成代码,展示了其在文本和视觉编程任务中的优越性能。
Comments ICLR 2026 Camera Ready Version, with code and data available
InteractScience: 交互式科学演示代码生成的程序化与视觉导向评估
机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室,南京大学,中国南京) ; Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,中国上海) ; Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学,美国匹兹堡)
AI总结 本文提出InteractScience基准,用于评估大语言模型在生成交互式科学演示代码时结合科学知识与前端交互能力的综合表现,通过程序化测试和视觉测试相结合的方法,评估30种开源和闭源LLM的表现,揭示了在整合领域知识与交互前端编码方面的持续不足。
Comments 27 pages, 17 figures
通过言语反馈强化人类行为模拟
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Microsoft(微软)
AI总结 本文提出DITTO模型,通过将言语反馈作为强化学习中的首要信号来提升LLM模拟人类行为的能力,并引入SOUL基准测试平台,展示了在多个任务中显著提升性能的成果。
AgentCo-op: 基于检索的互操作多智能体工作流合成
机构 * Ray and Stephanie Lane Computational Biology Department, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院雷和斯蒂芬妮·兰德计算生物学系) ; Machine Learning Department, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院机器学习系)
AI总结 本文提出AgentCo-op,一种基于检索的多智能体工作流合成框架,通过类型化任务传递合成可执行工作流,并在执行证据表明失败时应用有界自引导局部修复。在两个开放世界基因组学案例研究中,AgentCo-op在不重设计或运行全局拓扑搜索的情况下,将独立开发的科学智能体和外部工具库整合到可审计的工作流中。
基于得分的潜在变量因果模型因果发现
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
AI总结 本文提出了一种基于得分的方法,用于识别包含因果相关潜在变量的因果结构,并提供了可识别性保证,同时通过实验验证了方法的有效性。
Comments ICML 2024
反思式X训练:反馈条件化提升跨所有LLM训练阶段的扩展性
机构 * NVIDIA ; University of Washington(华盛顿大学) ; Carnegie Mellon University(卡内基梅隆大学) ; UC San Diego(南加州大学)
AI总结 本文提出反思式训练(IXT),通过利用后续阶段的动态来改进早期阶段,从而提高LLM训练的扩展效率,实验表明该方法在计算效率和性能上均有显著提升。
TorchUMM: 一个用于评估、分析和训练后处理的统一多模态模型代码库
机构 * Carnegie Mellon University(卡内基梅隆大学) ; William & Mary(威廉与玛丽学院) ; Auburn University(阿肯色大学欧文分校) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
AI总结 本文提出TorchUMM,一个统一的多模态模型代码库,用于评估、分析和训练后处理,涵盖多种多模态模型架构、任务和数据集,通过统一接口和标准化评估协议,促进异构模型的公平比较和深入理解,推动更强大的统一多模态系统的发展。
Comments Technical Report
测量大型语言模型中的刻板印象和偏差偏见
机构 * Carnegie Mellon University, U.S.A.(卡内基梅隆大学,美国) ; University of Delaware, U.S.A.(德雷塞尔大学,美国)
AI总结 本文研究了大型语言模型中刻板印象和偏差偏见的测量问题,通过生成个体档案来分析不同群体与政治立场、宗教信仰和性取向等属性之间的关联,揭示了LLM在推断用户属性时的偏见及其潜在危害。
通过分离实现的交叉talk语音消除,用于分离
机构 * Department of Computer Science and Engineering(计算机科学与工程系) ; Southern University of Science and Technology(南方科技大学) ; Language Technologies Institute(语言技术研究所) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出了一种旨在从近场混合信号中分离说话人语音的交叉talk消除任务,并提出了一种名为CTRnet的新型方法,可以直接在真实录制的近场和远场混合信号对上训练以完成CTR。基于CTRnet,进一步提出基于伪标签的远场语音分离(PuLSS),利用CTRnet估计的干净语音作为伪标签来训练分离远场混合信号的模型。该框架的主要优势是CTRnet和PuLSS都可以在目标域的真实数据上进行训练,解决了模型仅在模拟数据上训练时通常观察到的泛化差距。在CHiME-6数据集上,该框架在Oracle和估计说话人分离条件下实现了最先进的ASR性能,超过了所有CHiME-{7,8}挑战提交。据我们所知,这是首个在真实对话“语音在野外”数据上显著优于引导源分离的神经语音分离方法。
Comments in submission
基础模型对AI检测器看起来很像人类
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 本研究发现基础模型生成的文本在AI检测器中常被误判为人类生成,提出HIP方法通过迭代改写提升检测器规避能力,揭示当前检测器更关注指令调优和局部上下文而非通用机器生成文本特征。
Comments 39 pages, 9 figures
HalluWorld: 一个用于通过参考世界模型控制幻觉的基准
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Patronus AI ; Independent Researcher(独立研究者) ; Stanford University(斯坦福大学) ; The Ohio State University(俄亥俄州立大学) ; DegenAI Labs(DegenAI实验室)
AI总结 本文提出HalluWorld基准,通过显式参考世界模型研究语言模型的幻觉问题,发现不同任务中幻觉表现不一致,表明幻觉源于多种失败模式而非单一能力。
Comments HalluWorld benchmark (code and data) at github.com/DegenAI-Labs/HalluWorld
是什么在阻碍潜在视觉推理?
机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学理工学院) ; Instituto de Telecomunicações(电信研究所) ; TransPerfect(TransPerfect公司) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本研究探讨了现有模型如何利用潜在令牌,发现潜在令牌在最终预测中起作用有限,主要问题在于训练数据中潜在令牌信息有限且推理时生成的潜在令牌偏离真实表示,需要高质量数据和更精确的潜在令牌预测来推动发展。
CHI-Bench: 能否让AI代理自动化端到端、长周期、政策丰富的医疗工作流程?
机构 * Johns Hopkins Medicine(约翰霍普金斯医学中心) ; Wellstar Health System(Wellstar健康系统) ; Stanford University(斯坦福大学) ; CMU(卡内基梅隆大学) ; UCSD(加州大学圣地亚哥分校) ; Yale School of Medicine(耶鲁医学院) ; Salesforce AI Research(Salesforce人工智能研究) ; University of Washington(华盛顿大学) ; Northeastern University(东北大学) ; Brown University(布朗大学) ; Boston College(波士顿学院) ; Stony Brook University(史泰森布里克大学) ; University of Oxford(牛津大学) ; Arizona State University(亚利桑那州立大学) ; University of Southern California(南加州大学) ; Emory University(埃默里大学) ; MBZUAI ; Recursive Superintelligence(递归超级智能) ; University of Illinois at Chicago(伊利诺伊大学芝加哥分校)
AI总结 本文提出CHI-Bench基准,旨在评估AI代理在医疗工作流程中端到端、长周期和政策丰富任务中的自动化能力,揭示当前基准测试中政策密度、多角色协作和多方交互等能力的不足。
Comments Website: https://actava.ai/benchmarks Code: https://github.com/actava-ai/chi-bench Dataset: https://huggingface.co/datasets/actava/chi-bench
MaxShapley:迈向具有公平上下文归因的激励兼容生成搜索
机构 * Carnegie Mellon University(卡内基梅隆大学) ; HKUST(香港科技大学)
AI总结 本文提出MaxShapley算法,用于在生成搜索流程中公平地归因和补偿内容提供者,该算法基于Shapley值的特例,通过可分解的max-sum效用函数在多项式时间内计算归因,相比Shapley值的指数成本具有更高的效率。
从拒绝到恢复:一种生成AI防护机制的控制论方法
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) ; Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) ; Equal Advising(平等指导)
AI总结 本文提出了一种基于控制论的生成AI防护机制,通过实时监控和主动纠正高风险输出,提供了一种动态替代传统标志和阻断方法的解决方案。
Journal ref Second International Association on Safe and Ethical AI Conference (IASEAI 2026)
Hyrax:一个用于快速机器学习实验和无监督发现的可扩展框架,在Rubin、Roman和Euclid时代
机构 * Dept. of Astronomy \& the DiRAC Institute, University of Washington, Box 351580, Seattle, WA 98195, USA ; School of Physics ; Astronomy, University of Minnesota, Minneapolis, MN 55455, USA ; Department of Astronomy ; Planetary Science, Northern Arizona University, Flagstaff, USA ; McWilliams Center for Cosmology ; Astrophysics, Department of Physics, Carnegie Mellon University, Pittsburgh, PA 15213, USA
AI总结 本文提出Hyrax,一个支持天文领域完整机器学习生命周期的开源框架,通过五个实际应用展示了其在大规模天文数据中的无监督发现和监督检测能力,为下一代天文调查提供了系统化的机器学习基础设施。
Comments 28 pages, 20 figures, submitted to AJ
心力衰竭再入院风险的肺部超声生物标志物预后价值:一项试点数据驱动分析
机构 * Carnegie Mellon University(卡内基梅隆大学) ; LSUHSC Internal Medicine(路易斯安那州立大学医学部) ; Cosmetic Surgery Facility LLC(美容外科诊所有限公司)
AI总结 本研究通过数据驱动方法利用住院期间获得的B型肺部超声(LUS)数据,预测30天内心力衰竭再入院风险,发现依赖性下肺区域、时间差特征以及多视图特征拼接在预测中表现最佳,展示了超声生物标志物在非侵入性心力衰竭风险分层中的实用性。
无损反蒸馏采样
机构 * Peking University(北京大学) ; Tsinghua University(清华大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出了一种无损反蒸馏采样方法,通过在保持良性用户体验的同时,有效对抗多账号蒸馏攻击,降低蒸馏模型的泛化能力。
基于查询的图检索用于个性化可穿戴数据中的上下文化LLM推理
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of California, Irvine(加州大学 Irvine 分校)
AI总结 本文提出WAG框架,通过图检索实现LLM在可穿戴数据中的上下文化推理,通过构建个性化知识图谱并检索查询条件子图,提高推理效率和生成质量。
DashAttention: 可微且自适应的稀疏分层注意力
机构 * Tsinghua University(清华大学) ; Instituto Superior Técnico, Universidade de Lisboa(里斯本大学理工学院) ; Instituto de Telecomunicações(电信研究院) ; Carnegie Mellon University(卡内基梅隆大学) ; Sapienza University of Rome(罗马萨皮恩扎大学) ; University of Edinburgh(爱丁堡大学) ; TransPerfect(TransPerfect公司) ; ELLIS Unit Lisbon(里斯本ELLIS单位)
AI总结 本研究提出DashAttention,一种可微且自适应的稀疏分层注意力机制,通过自适应稀疏α-entmax变换选择可变数量的块,从而在保持整个层次结构可微的同时,提升长上下文建模能力,实验表明其在高稀疏度下优于现有方法。
Comments Preprint
MUSCAT:多语言、科学对话基准
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出MUSCAT基准,用于评估自动语音识别系统在处理多语言混合输入、特定词汇和语言切换等挑战方面的性能,揭示了当前最先进的ASR系统仍面临开放性挑战。
Speech-Hands: 一种基于自我反思的语音代理方法用于语音识别和多感知音频推理
机构 * NVIDIA ; Kyoto University(京都大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出Speech-Hands框架,通过自我反思决策机制解决语音识别和外部声音理解任务中的信任问题,提升了模型在多任务音频推理中的准确性和鲁棒性。
Comments Accepted to ACL 2026. Oral Presentation. Code: https://github.com/YukinoWan/Speech-Hands OpenClaw Branch: https://github.com/openclaw/openclaw/pull/69073