arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

2026-07-30 至 2026-07-30 共收录 8
2607.26886 2026-07-30 cs.CV cs.AI cs.CL cs.CY 新提交

Hearsay: Vision-Language Medical Diagnoses Without an Image

Hearsay:无需图像的视觉-语言医学诊断

Siddharth Vohra

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon Web Services AI Native(亚马逊网络服务AI原生部门)

AI总结 该研究发现前沿视觉-语言模型在无图像时会基于人口统计学特征编造医学诊断,存在不同失败模式,提出需直接审计其结构化输出通道并将探针词敏感性作为核心评估维度。

Comments Peer-reviewed and presented at the 1st Workshop on Toward Trustworthy Vision-Language Models in the Wild (TrustVLM), co-located with ACM ICMR 2026, Amsterdam. Non-archival workshop. Reviews public on OpenReview. 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26350 2026-07-30 cs.SD cs.CL 新提交

Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens

基于神经音频编解码器令牌剖析自监督语音学习对训练语言的敏感性

Daigo Takizawa, Tomohiko Nakamura, Samuele Cornell, William Chen, Satoru Fukayama, Shinji Watanabe

机构 * National Institute of Advanced Industrial Science and Technology (AIST)(日本国立先进工业科学技术研究所) Carnegie Mellon University(卡内基梅隆大学)

AI总结 该研究通过控制变量分析发现,基于神经音频编解码器的自监督语音模型的下游性能依赖SSL预训练语言,不依赖编解码器训练语言,据此提出单个编解码器可跨语言复用,需对齐预训练语言与目标语言。

Comments Accepted to Interspeech2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26337 2026-07-30 cs.RO eess.IV 新提交

Reeling It In: Flexible Needle Pick Up via Thread Manipulation for Autonomous Suturing

收线:通过线操作实现自主缝合的柔性缝针拾取

Emma Huang, Zih-Yun Chiu, Neelay Joglekar, Shanglei Liu, Michael C. Yip

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校) Johns Hopkins University(约翰斯·霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学) UC San Diego Health(加州大学圣迭戈分校健康中心)

AI总结 本研究提出一种基于缝合线辅助的自主缝针拾取框架,通过线操作实现间接拾取,可应对缝针被遮挡或不可接近等场景,提升了自主缝合的鲁棒性。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17100 2026-07-30 cs.MA cs.AI cs.SE 版本更新

Auto Research for Materials: Auditable AI-Scientist Workflows with Held-Out Transfer

材料的自动研究:具有留出转移的可审计人工智能科学家工作流程

Jingjie Ning, Xiaochuan Li, Shanshan Zhong, Ji Zeng, Guolin Ke

机构 * School of Computer Science, Carnegie Mellon University(计算机科学系,卡内基梅隆大学) DP Technology(DP科技)

AI总结 研究材料预测中人工智能代理的工作流程,通过多方面搜索产生评估更改,经留出数据测试,发现不同建模机制下的有效变化,证明闭环代理决策及代码可复用组合,还提供了评估设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12035 2026-07-30 cs.CV 版本更新

When Does Visual Token Pruning Improve Calibration? The Role of Evidence Coverage in MLLMs

视觉标记修剪能否提高校准?关于多模态大语言模型中置信度的实证研究

Kaizhen Tan, Yang Feng, Heqing Du, Hanzhe Hong, Siru Tao, Xin Xu

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文研究视觉标记修剪对模型校准的影响,通过POPE和ScienceQA-IMG数据集评估不同修剪策略下的ECE、Brier分数和AURC,发现修剪能提升校准而非仅牺牲效率,且基于显著性的修剪方法效果较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15284 2026-07-30 cs.CV 版本更新

Walk through Paintings: Egocentric World Models from Internet Priors

穿越绘画:来自互联网先验的自我中心世界模型

Anurag Bagchi, Zhipeng Bao, Homanga Bharadhwaj, Yu-Xiong Wang, Pavel Tokmakov, Martial Hebert

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Toyota Research Institute(丰田研究机构)

AI总结 EgoWM通过利用互联网先验和轻量级条件层,将预训练视频扩散模型转换为自我中心世界模型,实现可控的未来预测,提升结构一致性评分并降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10850 2026-07-30 cs.RO 版本更新

Invariant Extended Kalman Filtering with Partial Orientation Measurement Integration: Theoretical Derivations and Application to Autonomous Surface Vessels

结合部分姿态测量的不变扩展卡尔曼滤波:理论推导及在自主水面船舶中的应用

Derek R. Benham, Easton R. Potokar, Joshua G. Mangelson

机构 * Brigham Young University Carnegie Mellon University

AI总结 本文提出融合部分姿态测量的InEKF框架,结合地平线横滚俯仰与双天线GPS航向测量,经对比实验验证其在开阔海域自主水面船舶状态估计中有效且鲁棒。

Comments Originally presented at the 2025 IEEE ICRA Workshop on Field Robotics, extended to cover real world experiments. 13 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10300 2026-07-30 cs.HC cs.AI 版本更新

AI LEGO: Scaffolding Cross-Functional Collaboration in Industrial Responsible AI Practices during Early Design Stages

AI LEGO:在早期设计阶段为工业负责任的AI实践搭建跨职能协作框架

Muzhe Wu, Yanzhi Zhao, Shuyi Han, Michael Xieyang Liu, Hong Shen

机构 * Carnegie Mellon University(卡内基梅隆大学) Northwestern University(西北大学)

AI总结 针对工业跨职能团队早期设计阶段负责任AI实践的协作难题,开发基于边界对象理论的AI LEGO原型,可提升跨角色危害识别的数量与概率,优化协作效果。

详情

展开后加载摘要…

URL PDF HTML 收藏