arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

2026-06-05 至 2026-06-05 共收录 4
2606.05817 2026-06-05 cs.LG cs.AI

Consistency Training Along the Transformer Stack

沿Transformer堆栈的一致性训练

Sukrati Gautam, Neil Shah, Arav Dhoot, Bryan Maruyama, Caroline Wei, Rohan Kapoor, Robert Sidey, Prakhar Gupta, Zi Cheng Huang, David Demitri Africa

机构 * Purdue University(普渡大学) Independent(独立) Columbia University(哥伦比亚大学) University of California, San Diego(加州大学圣地亚哥分校) University of California, Los Angeles(加州大学洛杉矶分校) Dartmouth College(达特茅斯学院) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

AI总结 本文通过引入MLP状态和注意力分布的一致性目标,将一致性训练扩展到多种安全威胁,并发现跨威胁泛化及共享机制,证明其作为灵活对齐框架的有效性。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05557 2026-06-05 cs.CL

AURA: Intent-Directed Probing for Implicit-Need Surfacing in Situated LLM Agents

AURA: 面向情境化LLM代理中隐式需求挖掘的意图导向探测

Yang Li, Jiaxiang Liu, Jiang Cai, Mingkun Xu

机构 * Guangdong Institute of Intelligence Science and Technology(广东省智能科学与技术研究院)

AI总结 提出AURA方法,通过在场景感知和工具使用之间插入意图推理步骤生成IntentFrame,以结构化估计隐式需求并控制探测预算,在隐式意图基准上提升覆盖率达+0.07,同时减少82%的探测次数并避免隐私违规。

Comments Submitted to EMNLP 2026. Code, simulator, and benchmark: https://github.com/innovation64/AURA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07294 2026-06-05 cs.CV cs.AI

MAviS: A Multimodal Conversational Assistant For Avian Species

MAviS:一种用于鸟类物种的多模态对话助手

Yevheniia Kryklyvets, Mohammed Irfan Kurpath, Sahal Shaji Mullappilly, Jinxing Zhou, Fahad Shabzan Khan, Rao Anwer, Salman Khan, Hisham Cholakkal

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文提出MAviS数据集和MAviS-Chat模型,通过整合图像、音频和文本信息,提升对鸟类物种的细粒度理解与多模态问答能力,并展示了在生态应用中领域适应的多模态大语言模型的重要性。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09061 2026-06-05 cs.SD eess.AS

O_O-VC: Synthetic Data-Driven One-to-One Alignment for Any-to-Any Voice Conversion

O_O-VC: 基于合成数据驱动的任意到任意语音转换一一对一对齐

Huu Tuong Tu, Huan Vu, cuong tien nguyen, Dien Hy Ngo, Nguyen Thi Thu Trang

机构 * VNPT AI, VNPT Group(VNPT AI,VNPT集团) Hanoi University of Science and Technology(河内科学技术大学) Business AI Lab, National Economics University(国家经济大学商业人工智能实验室)

AI总结 本文提出了一种基于合成数据驱动的任意到任意语音转换方法,通过利用高质量预训练多说话人文本到语音模型生成的合成语音数据,学习源语音到目标语音的直接映射,从而在保留语言内容的同时捕捉说话人特定特征,并在零样本场景中提升适应性和性能。

Comments EMNLP 2025

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏