arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Carnegie Mellon University(卡内基梅隆大学)

2026-03-20 至 2026-03-20 共收录 6
2603.19232 2026-03-20 cs.CV

Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens

三次离散扩散:高维表示上的离散视觉生成

Yuqing Wang, Chuofan Ma, Zhijie Lin, Yao Teng, Lijun Yu, Shuai Wang, Jiaming Han, Jiashi Feng, Yi Jiang, Xihui Liu

机构 * University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) Carnegie Mellon University(卡内基梅隆大学) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出CubiD,首个高维表示离散生成模型,通过精细掩码实现高维离散表示的生成,具备固定步数的生成能力,且在ImageNet-256上达到SOTA性能,验证离散token保留原始表示能力。

Comments Accepted by CVPR 2026 main track; Code: https://github.com/YuqingWang1029/CubiD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17769 2026-03-20 cs.SD cs.CL cs.LG eess.AS

Modeling Overlapped Speech with Shuffles

用洗牌操作建模重叠语音

Matthew Wiesner, Samuele Cornell, Alexander Polok, Lucas Ondel Yang, Lukáš Burget, Sanjeev Khudanpur

机构 * Johns Hopkins University(约翰霍普金斯大学) LISN, CNRS(LISN-CNRS) Carnegie Mellon University(卡内基梅隆大学) Brno University of Technology(布拉格技术大学)

AI总结 本文提出用洗牌操作建模重叠语音,通过洗牌积和偏序有限状态自动机实现对重叠语音的对齐和说话人标注。采用总分值作为损失函数进行训练,并通过偏序FSAs减少图规模。通过直接建模(token, speaker)元组实现说话人标注,Viterbi对齐通过洗牌积FSA实现单次对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20636 2026-03-20 cs.LG

Image2Gcode: Image-to-G-code Generation for Additive Manufacturing Using Diffusion-Transformer Model

Image2Gcode: 基于扩散-变换器模型的图像到G-code生成用于增材制造

Ziyue Wang, Yayati Jadhav, Peter Pak, Amir Barati Farimani

机构 * Department of Materials Science and Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(材料科学与工程系,卡内基梅隆大学,匹兹堡,PA,USA) Department of Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(机械工程系,卡内基梅隆大学,匹兹堡,PA,USA)

AI总结 本文提出Image2Gcode框架,通过图像直接生成可打印的G-code,省去CAD建模步骤,提升增材制造的易用性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18418 2026-03-20 cs.CV cs.AI

Mind the Rarities: Can Rare Skin Diseases Be Reliably Diagnosed via Diagnostic Reasoning?

注意罕见病:罕见皮肤疾病能否通过诊断推理可靠诊断?

Yang Liu, Jiyao Yang, Hongjin Zhao, Xiaoyong Li, Yanzhe Ji, Xingjian Li, Runmin Jiang, Tianyang Wang, Saeed Anwar, Dongwoo Kim, Yue Yao, Zhenyue Qin, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Australian National University(澳大利亚国立大学) University of Western Australia(西澳大学) POSTECH Yale University(耶鲁大学)

AI总结 本文提出DermCase基准,通过多模态数据评估罕见皮肤疾病诊断推理能力,揭示现有模型在诊断准确性和临床推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18184 2026-03-20 cs.CL

CWoMP: Morpheme Representation Learning for Interlinear Glossing

CWoMP:形态表示学习用于互线 glossing

Morris Alper, Enora Rice, Bhargav Shandilya, Alexis Palmer, Lori Levin

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Colorado Boulder(科罗拉多大学波德福分校)

AI总结 CWoMP通过对比学习将词素作为原子形式-意义单元进行表示,提升低资源语言的互线 glossing 效率与效果。

Comments Project page: http://cwomp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18079 2026-03-20 cs.LG cs.AI

SLEA-RL: Step-Level Experience Augmented Reinforcement Learning for Multi-Turn Agentic Training

SLEA-RL:基于步骤级经验增强的多轮代理训练强化学习

Prince Zizhuang Wang, Shuli Jiang

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出SLEA-RL框架,通过步骤级经验增强提升多轮代理训练性能,采用动态经验库和策略优化方法,在长周期任务中优于传统强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏