arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 2338
2506.05412 2026-06-02 cs.CV cs.CL

Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues

视觉-语言模型将头部方向误认为注视方向:非语言对话线索

Zory Zhang, Pinyuan Feng, Bingyang Wang, Tianwei Zhao, Suyang Yu, Qingying Gao, Hokin Deng, Ziqiao Ma, Yijiang Li, Dezhi Luo

机构 * Brown University(布朗大学) Columbia University(哥伦比亚大学) Emory University(埃默里大学) Johns Hopkins University(约翰霍普金斯大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) UC San Diego(圣地亚哥大学)

AI总结 本研究通过控制头部方向的实验发现,视觉-语言模型(VLMs)在推断注视目标时主要依赖头部方向而非眼睛外观,导致与人类存在显著性能差距,并指出数据偏差是主要原因。

Comments Accepted by ACL 2026. Project page at https://zoryzhang.github.io/gaze/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02792 2026-06-02 cs.CV

RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation

RichControl: 面向文本到图像生成的、结构和外观丰富的免训练空间控制

Lexi Pang, Liheng Zhang, Hang Ye, Xiaoxuan Ma, Yizhou Wang

机构 * Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出一种免训练框架,通过解耦条件特征的采样调度与去噪过程,并引入重启细化调度和外观丰富提示策略,在复杂条件下实现结构和外观平衡的受控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03745 2026-06-02 cs.LG cs.NA math.NA

Neural Low-Discrepancy Sequences

神经低差异序列

Michael Etienne Van Huffel, Nathan Kirk, Makram Chahine, Daniela Rus, T. Konstantin Rusch

机构 * MIT(麻省理工学院) CMU(卡内基梅隆大学) Harvard University(哈佛大学)

AI总结 提出NeuroLDS,首个基于机器学习的有限低差异序列生成框架,通过监督预训练和无监督微调两步学习,在多个应用中显著优于传统方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20070 2026-06-02 cs.RO

LLM Trainer: Automated Robotic Data Generation via Demonstration Augmentation using LLMs

LLM Trainer:利用大语言模型通过演示增强自动生成机器人数据

Abraham George, Amir Barati Farimani

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出LLM Trainer,一种利用大语言模型的世界知识将少量人类演示自动扩展为大规模机器人数据集的管道,通过离线标注和在线关键姿势重定向生成新轨迹,并采用汤普森采样优化标注。

Comments 9 pages, 5 figures, 4 tables. Accepted in ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.02071 2026-06-02 cs.CV

Representation-Centric Survey of Supervised Skeletal Action Recognition and the New Benchmark

以表示为中心的监督式骨骼动作识别综述与新基准

Yang Liu, Jiyao Yang, Madhawa Perera, Pan Ji, Dongwoo Kim, Min Xu, Tianyang Wang, Saeed Anwar, Tom Gedeon, Lei Wang, Zhenyue Qin

机构 * School of Computing, Australian National University(澳大利亚国立大学计算学院) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) OPPO US Research Center(OPPO美国研究中心) Carnegie Mellon University(卡内基梅隆大学) University of Western Australia(西澳大利亚大学) Curtin University(Curtin大学) School of Engineering and Built Environment, Griffith University(格里菲斯大学工程与环境学院) School of Medicine, Yale University(耶鲁大学医学院)

AI总结 本文以输入表示类型(关节坐标、骨骼向量、运动流及扩展表示)为中心,系统综述了监督式3D骨骼动作识别方法,并提出了包含多视角、复杂多人交互等挑战的大规模数据集ANUBIS,通过实验揭示了动作-特征依赖关系及多表示融合的局限性。

Comments Accepted for publication in Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07339 2026-06-02 stat.AP cs.LG

Benchmarking Waitlist Mortality Prediction in Heart Transplantation Through Time-to-Event Modeling using New Longitudinal UNOS Dataset

基于新的纵向UNOS数据集通过时间-事件模型对心脏移植等待名单死亡率预测进行基准测试

Yingtao Luo, Reza Skandari, Carlos Martinez, Arman Kilic, Rema Padman

机构 * Carnegie Mellon University(卡内基梅隆大学) Imperial College(帝国理工学院) United Network for Organ Sharing(美国器官共享网络) Medical University of South Carolina(南卡罗来纳医学院)

AI总结 本研究利用纵向等待名单历史数据,通过时间-事件模型对心脏移植等待名单死亡率进行预测,最佳模型C-Index达0.94,AUROC达0.89,显著优于以往模型。

Comments Best Student Paper Finalist in Proceedings of AMIA Annual Symposium 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05500 2026-06-02 cs.CL cs.AI

EuroBERT: Scaling Multilingual Encoders for European Languages

EuroBERT:面向欧洲语言的多语言编码器扩展

Nicolas Boizard, Hippolyte Gisserot-Boukhlef, Duarte M. Alves, André Martins, Ayoub Hammal, Caio Corro, Céline Hudelot, Emmanuel Malherbe, Etienne Malaboeuf, Fanny Jourdan, Gabriel Hautreux, João Alves, Kevin El Haddad, Manuel Faysse, Maxime Peyrard, Nuno M. Guerreiro, Patrick Fernandes, Ricardo Rei, Pierre Colombo

机构 * Artefact Research Center(Artfact研究中心) CNRS(法国国家科学研究中心) ISIA Lab(ISIA实验室) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出EuroBERT系列多语言编码器,通过整合生成式模型的最新进展,在检索、回归和分类等任务上超越现有模型,并原生支持长达8192个token的序列。

Comments 28 pages, 8 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14782 2026-06-02 cs.CL

Lessons from the Trenches on Reproducible Evaluation of Language Models

关于语言模型可重复评估的前线经验教训

Stella Biderman, Hailey Schoelkopf, Lintang Sutawika, Leo Gao, Jonathan Tow, Baber Abbasi, Alham Fikri Aji, Pawan Sasanka Ammanamanchi, Sidney Black, Jordan Clive, Anthony DiPofi, Julen Etxaniz, Benjamin Fattori, Jessica Zosa Forde, Charles Foster, Jeffrey Hsu, Mimansa Jaiswal, Wilson Y. Lee, Haonan Li, Charles Lovering, Niklas Muennighoff, Ellie Pavlick, Jason Phang, Aviya Skowron, Samson Tan, Xiangru Tang, Kevin A. Wang, Genta Indra Winata, François Yvon, Andy Zou

机构 * MBZUAI IIIT Hyderabad EleutherAI HiTZ Center - Ixa, UPV/EHU Ivy Natal University of Michigan HubSpot LibrAI Kensho Contextual AI Brown University New York University Amazon Yale University HKUST Sorbonne University CMU

AI总结 本文基于开发Language Model Evaluation Harness框架的三年经验,总结了语言模型评估中面临的方法论挑战、缺乏可重复性和透明度等问题,并提供了改进评估严谨性和信心的建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31593 2026-06-01 cs.CR cs.AI

Stateful Online Monitoring Catches Distributed Agent Attacks

有状态在线监控捕获分布式智能体攻击

Davis Brown, Samarth Bhargav, Arav Santhanam, Kasper Hong, Ivan Zhang, Matan Shtepel, Steffi Chern, Alexander Robey, Eric Wong, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对分布式智能体攻击中跨账户聚合的恶意行为难以被单上下文监控检测的问题,提出一种基于实时聚类的有状态在线监控方法,能够更早、更有效地捕获分布式攻击,同时保持低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31463 2026-06-01 cs.LG cs.AI cs.CL cs.DC

PithTrain: A Compact and Agent-Native MoE Training System

PithTrain: 一个紧凑且面向智能体的MoE训练系统

Ruihang Lai, Hao Kang, Haozhan Tang, Akaash R. Parthasarathy, Zichun Yu, Junru Shao, Todd C. Mowry, Chenyan Xiong, Tianqi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) Xlue NVIDIA(英伟达)

AI总结 提出PithTrain,一个基于智能体原生设计原则的紧凑型MoE训练框架,通过引入ATE-Bench评估智能体任务效率,在保持生产框架吞吐量的同时,将智能体任务轮次和活跃GPU时间分别降低62%和64%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30907 2026-06-01 cs.SE cs.AI cs.CL cs.LG

BlueFin: Benchmarking LLM Agents on Financial Spreadsheets

BlueFin: 在金融电子表格上对LLM智能体进行基准测试

Srivatsa Kundurthy, Clara Na, Colton Moraine, Anoushka Mohta, Case Winter, George Fang, John Ling, Emma Strubell, Zach Kirshner

机构 * Longitude Labs Inc.(Longitude Labs公司) Cornell University(康奈尔大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出BlueFin基准,通过131个真实金融电子表格任务评估LLM智能体的合成、操作和理解能力,并验证了LM评判与人类专家的一致性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30617 2026-06-01 cs.RO math.OC

Exploiting Chordal Sparsity for Globally Optimal Estimation with Factor Graphs

利用弦稀疏性实现因子图的全局最优估计

Avinash Subramanian, Connor Holmes, Timothy D. Barfoot, Frank Dellaert, Frederike Dümbgen

机构 * College of Computing, Georgia Institute of Technology(佐治亚理工学院计算机学院) Robotics Institute, University of Toronto(多伦多大学机器人研究所) Department of Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系)

AI总结 本文提出在GTSAM框架中自动构建凸半定规划松弛,并利用贝叶斯树分解加速求解,实现因子图的全局最优估计。

Journal ref ICRA 2026 WORKSHOP ON FRONTIERS OF OPTIMIZATION FOR ROBOTICS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30482 2026-06-01 cs.LG

Discovering a Zeta Map Algorithm on Dyck Paths via Mechanistic Interpretability

通过机制可解释性发现 Dyck 路径上的 Zeta 映射算法

Xiaoyu Huang, Blake Jackson, Kyu-Hwan Lee

机构 * Department of Mathematics, Temple University, Philadelphia, PA, USA(特拉华大学数学系) Institute for Computer-Aided Reasoning in Mathematics, Carnegie Mellon University, Pittsburgh, PA, USA(计算机辅助数学推理研究所,卡内基梅隆大学) Department of Mathematics, University of Connecticut, Storrs, CT, USA(康乃狄克大学数学系) Korea Institute for Advanced Study, Seoul 02455, Republic of Korea(韩国高等研究院)

AI总结 本文通过训练一个小型编码器-解码器 Transformer 模型来学习 Dyck 路径上的 zeta 映射,并利用机制可解释性工具分析其计算过程,从而发现并证明了一种新的显式组合算法——脚手架映射。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23468 2026-06-01 math.MG cs.AI cs.LO math.NT

Progress in Formalizing Sphere Packing in Dimension 8

八维球堆积形式化进展

Sidharth Hariharan, Christopher Birkbeck, Seewoo Lee, Ho Kiu Gareth Ma, Bhavik Mehta, Auguste Poiroux, Maryna Viazovska

机构 * Carnegie Mellon University(卡内基梅隆大学) University of East Anglia(东安格利亚大学) University of California, Berkeley(加州大学伯克利分校) University of Warwick(沃里克大学) Imperial College London(伦敦帝国理工学院) Math, Inc(Math公司) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)

AI总结 本文介绍了使用Lean定理证明器形式化验证Viazovska在8维球堆积问题上的解,并讨论了与自动形式化模型Gauss的合作及剩余目标。

Comments 8 pages, title updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10432 2026-06-01 cs.RO

AnySlot: Goal-Conditioned Vision-Language-Action Policies for Zero-Shot Slot-Level Placement

AnySlot: 用于零样本槽级放置的目标条件视觉-语言-动作策略

Zhaofeng Hu, Sifan Zhou, Qinbo Zhang, Rongtao Xu, Qi Su, Jorge Mendez-Mendz, Ci-Jyun Liang

机构 * Stony Brook University(石溪大学) Carnegie Mellon University(卡内基梅隆大学) MBZUAI Peking University(北京大学)

AI总结 提出AnySlot框架,通过将语言指令转化为空间视觉目标,解耦高层槽选择与低层执行,实现零样本槽级精确放置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01985 2026-06-01 cs.LG cs.AI cs.RO

World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry

World Action Verifier: 通过前向-反向不对称性自我改进世界模型

Yuejiang Liu, Fan Feng, Lingjing Kong, Weifeng Lu, Jinzhou Tang, Kun Zhang, Kevin Murphy, Chelsea Finn, Yilun Du

机构 * Stanford University(斯坦福大学) UC San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学) Google DeepMind(谷歌DeepMind) Harvard University(哈佛大学)

AI总结 提出World Action Verifier (WAV)框架,利用状态合理性和动作可达性的独立验证以及前向-反向不对称性,通过视频语料库的多样子目标生成器和稀疏逆模型实现循环一致性,从而在欠探索区域自我改进世界模型,在多个任务中样本效率提升2倍且下游策略性能提升22%以上。

Comments Project Website: https://world-action-verifier.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20789 2026-06-01 cs.CL cs.LG cs.SE

SERA: Soft-Verified Efficient Repository Agents

SERA:软验证的高效仓库智能体

Ethan Shen, Daniel Tormoen, Saurabh Shah, Ali Farhadi, Tim Dettmers

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Paul G. Allen School of Computer Science and Engineering(保罗·G·艾伦计算机科学与工程学院) Allen Institute of Artificial Intelligence(艾伦人工智能研究所) Machine Learning Department(机器学习系)

AI总结 提出SERA方法,通过软验证生成(SVG)高效训练编码智能体,使其快速适应私有代码库,在开源模型中取得领先性能且成本极低。

Comments 21 main pages, 6 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01075 2026-06-01 cs.LG cs.AI cs.CV

Flow Equivariant World Models: Memory for Partially Observed Dynamic Environments

流等变世界模型:部分观测动态环境的记忆

Hansen Jin Lillemark, Benhao Huang, Fangneng Zhan, Yilun Du, Thomas Anderson Keller

机构 * Kempner Institute, Harvard University(哈佛大学 Kempner 研究所) ML, Carnegie Mellon University(卡内基梅隆大学 ML 研究所) SEAS, Harvard University(哈佛大学 SEAS 研究所)

AI总结 提出流等变世界建模框架,利用时间参数化对称性在潜在记忆中实现长时程稳定准确的动力学预测,解决部分观测问题。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20853 2026-06-01 eess.AS cs.CL cs.SD

Beyond Hearing: Learning Task-Agnostic ExG Representations from Earphones via Physiology-Informed Tokenization

超越听觉:通过生理学启发的标记化从耳机学习任务无关的ExG表示

Hyungjun Yoon, Seungjoo Lee, Yu Yvonne Wu, Xiaomeng Chen, Taiting Lu, Freddy Yifei Liu, Taeckyung Lee, Hyeongheon Cha, Haochen Zhao, Gaoteng Zhao, Dongyao Chen, Cecilia Mascolo, Sung-Ju Lee, Lili Qiu

机构 * KAIST(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学) University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学) Pennsylvania State University(宾夕法尼亚州立大学) UCLA(加州大学洛杉矶分校) Northwest University(北华大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft Research(微软研究院)

AI总结 提出一种基于耳机的生理学启发的多频带标记化方法(PiMT),通过无干扰的日常ExG数据采集和重建任务学习鲁棒表示,实现跨多种任务(包括五种人类感官)的通用ExG监测。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12500 2026-06-01 cs.LG stat.ME

Learning General Causal Structures with Hidden Dynamic Process for Climate Analysis

学习具有隐藏动态过程的通用因果结构用于气候分析

Minghao Fu, Biwei Huang, Zijian Li, Yujia Zheng, Ignavier Ng, Guangyi Chen, Yingyao Hu, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, UAE(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学) University of California San Diego, La Jolla, CA, USA(加州大学圣地亚哥分校) Johns Hopkins University, Baltimore, MD, USA(约翰·霍普金斯大学)

AI总结 提出统一框架CaDRe,联合发现观测变量间的因果关系和隐藏动态过程,在非参数设置下可识别,并在气候数据上验证了有效性和可解释性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16687 2026-06-01 cs.LG

Native Hierarchical and Compositional Representations with Subspace Embeddings

原生层次与组合表示:基于子空间嵌入

Gabriel Moreira, Zita Marinho, Manuel Marques, João Paulo Costeira, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出用线性子空间替代向量表示概念,通过子空间维度与包含关系自然建模层次与组合性,并引入可微软投影矩阵实现端到端训练,在层次推理和自然语言推理任务上达到最优性能。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30338 2026-05-29 cs.CV

REST3D: Reconstructing Physically Stable 3D Scenes from a Single Image

REST3D: 从单张图像重建物理稳定的3D场景

Xiaoxuan Ma, Jiashun Wang, Nicolas Ugrinovic, Yehonathan Litman, Kris Kitani

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出REST3D框架,通过物理场景理解与物理约束优化,从单张RGB图像重建物理稳定的3D场景,显著减少物理错误并提升仿真稳定性。

Comments Project page: https://shirleymaxx.github.io/REST3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30326 2026-05-29 cs.RO cs.AI

RoboWits: Unexpected Challenges for Robotic Creative Problem Solving

RoboWits:机器人创造性问题解决中的意外挑战

Chunru Lin, Hongxin Zhang, Fenghao Yu, Zhehuan Chen, Thomas L. Griffiths, Yejin Choi, David Held, Chuang Gan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Princeton University(普林斯顿大学) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出RoboWits双臂机器人基准,通过多智能体协作的自动化任务生成流水线评估机器人在几何、材料和装配推理中的认知推理、创造性工具使用及鲁棒性,发现预训练VLA在突变任务中表现脆弱。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20752 2026-05-29 cs.RO

GaussianDream: A Feed-Forward 3D Gaussian World Model for Robotic Manipulation

GaussianDream:用于机器人操作的前馈3D高斯世界模型

Zijian Zhang, Yuqing Jiang, Qian Cheng, Xiaofan Li, Si Liu, Ding Zhao, Ping Luo, Weitao Zhou, Haibao Yu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

AI总结 提出GaussianDream,一种前馈3D高斯世界模型插件,通过可学习查询编码当前帧3D空间结构和短期未来演化,在训练时用静态重建和未来预测头监督,推理时仅保留查询条件化动作生成,在多个机器人操作基准上达到最先进性能。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10474 2026-05-29 cs.LG cs.NE cs.RO

Muscle Synergy Priors Enhance Biomechanical Fidelity in Predictive Musculoskeletal Locomotion Simulation

肌肉协同先验增强预测性肌肉骨骼运动模拟的生物力学保真度

Ilseung Park, Eunsik Choi, Jangwhan Ahn, Jooeun Ahn

机构 * Department of Mechanical Engineering(机械工程系) Carnegie Mellon University(卡内基梅隆大学) Department of Physical Education(体育系) Seoul National University(首尔国立大学) Lampe Joint Department of Biomedical Engineering(生物医学工程联合部门) UNC-Chapel Hill and NC State University(北卡罗来纳大学教堂山分校和北卡罗来纳州立大学)

AI总结 提出一种生理学启发的强化学习框架,通过肌肉协同约束控制,在有限实验数据下提高了预测性人体运动模拟的生物力学保真度和泛化能力。

Comments Added a manuscript footnote stating "Project page with supplementary videos: https://ces40320.github.io/WebHomepage__Walk-RL ."

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15382 2026-05-29 cs.CL cs.CV cs.LG

The Vision Wormhole: Latent-Space Communication in Heterogeneous Multi-Agent Systems

视觉虫洞:异构多智能体系统中的潜在空间通信

Xiaoze Liu, Ruowang Zhang, Weichen Yu, Siheng Xiong, Liu He, Feijie Wu, Hoin Jung, Matt Fredrikson, Xiaoqian Wang, Jing Gao

机构 * Purdue University(普渡大学) Contextual AI(情境人工智能) Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 提出Vision Wormhole框架,通过通用视觉编解码器将推理轨迹映射到共享连续空间,实现异构VLM间的潜在状态传输,无需配对翻译器,降低对齐复杂度并提升效率。

Comments Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08979 2026-05-29 cs.SD cs.CL

Beyond Transcripts: A Renewed Perspective on Audio Chaptering

超越文本:音频章节划分的新视角

Fabian Retkowski, Maike Züfle, Thai Binh Nguyen, Jan Niehues, Alexander Waibel

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文通过提出音频专用架构AudioSeg、分析影响性能的因素以及形式化评估协议,系统研究了音频章节划分任务,发现AudioSeg显著优于基于文本的方法,停顿是最有效的声学特征,而多模态大模型在短音频上表现有潜力。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00065 2026-05-29 cs.LG cs.CL cs.CR

When the Same Coefficients Reach Different Places: Asymmetric Realizability in Transplanting Tokenizers across Large Language Models

当相同系数到达不同位置:跨大型语言模型移植分词器中的非对称可实现性

Xiaoze Liu, Weichen Yu, Matt Fredrikson, Xiaoqian Wang, Jing Gao

机构 * Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文发现跨词汇模型组合中分词器移植的几何结构非对称性,并构造了“破坏令牌”以利用该漏洞,通过实验验证其在多个模型对中的存在性及对微调、谱滤波等防御措施的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29392 2026-05-29 cs.SE cs.CL cs.CY cs.HC

Offloading Score: Measuring AI Reliance Through Counterfactual Workflows

卸载分数:通过反事实工作流衡量AI依赖度

Vishakh Padmakumar, Lujain Ibrahim, Zora Zhiruo Wang, Jennifer Wang, Q. Vera Liao, Diyi Yang

机构 * Stanford University(斯坦福大学) University of Oxford(牛津大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学)

AI总结 本文提出卸载分数(offloading score),一种通过构建反事实工作流量化用户向AI工具卸载认知努力比例的依赖度度量,并通过内在验证和用户实验证明其能检测时间压力下的依赖度变化。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29307 2026-05-29 cs.CL cs.AI cs.IR cs.LG

GrepSeek: Training Search Agents for Direct Corpus Interaction

GrepSeek:训练用于直接语料库交互的搜索代理

Alireza Salemi, Chang Zeng, Atharva Nijasure, Jui-Hui Chung, Razieh Rahimi, Fernando Diaz, Hamed Zamani

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Princeton University(普林斯顿大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出GrepSeek,一种通过两阶段训练(冷启动数据集+GRPO优化)和语义保持的分片并行执行引擎,训练紧凑型搜索代理直接与文本语料库交互(通过shell命令),在开放域问答中取得最优F1和精确匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏