arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, San Diego(加州大学圣迭戈分校)

2026-06-08 至 2026-06-08 共收录 6
2606.06534 2026-06-08 eess.IV cs.AI 新提交

Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models

基于视觉基础模型的注意力一致纵向医学视觉问答

Jialin Wu, Qianru Zhang, Georges El Fakhri, Xiaofeng Liu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Yale Biomedical Imaging Institute(耶鲁大学生物医学成像研究所)

AI总结 提出一种注意力引导的编码器-解码器框架,通过轻量级配准和自适应掩码生成,结合辅助损失函数,实现胸部X光片的纵向医学视觉问答,在Medical-Diff-VQA基准上取得优异性能。

Comments Accepted to CVPR 2026 Workshop PHAROS-AIF-MIH

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 6448-6458

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07366 2026-06-08 cs.CV cs.LG cs.RO 新提交

Dash2Sim: Closed-Loop Driving Simulation from in-the-wild Dashcam Videos

Dash2Sim: 来自野外行车记录仪视频的闭环驾驶仿真

Anurag Ghosh, Francesco Pittaluga, Khiem Vuong, Angela Chen, Juan Alvarez-Padilla, Manmohan Chandraker, Srinivasa Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学) NEC Labs America(NEC美国实验室) MIT(麻省理工学院) UC San Diego(加州大学圣地亚哥分校)

AI总结 提出Dash2Sim框架,将单目行车记录仪视频转化为度量级、地理参考的4D驾驶日志,用于闭环仿真,并构建ROADWork4D基准数据集,验证了施工区场景对规划器的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06647 2026-06-08 cs.LG q-bio.NC 新提交

The Identity Trap in EEG Foundation Models: A Diagnostic Audit

脑电图基础模型中的身份陷阱:一项诊断性审计

Jun-You Lin, Ying Choon Wu, Tzyy-Ping Jung

机构 * National Yang Ming Chiao Tung University University of California, San Diego

AI总结 提出FMScope协议,通过方差分解、主题轴擦除等五种诊断方法,揭示EEG基础模型在受试者分离交叉验证中可能依赖受试者身份特征而非临床生物标志物,并验证了该陷阱的普遍性及可移除性。

Comments 28 pages, 6 figures, 8 tables. Code available at https://github.com/Jimmy110101013/fmscope

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08683 2026-06-08 cs.SD cs.AI cs.LG eess.AS 版本更新

Benchmarking Language Modeling for Lossless Compression of Full-Fidelity Audio

全保真音频无损压缩的语言建模基准测试

Phillip Long, Zachary Novack, Chris Donahue

机构 * University of California, San Diego, Computer Science and Engineering Department(加州大学圣地亚哥分校计算机科学与工程系) Carnegie Mellon University, School of Computer Science(卡内基梅隆大学计算机科学学院)

AI总结 提出字节级分词方案Trilobyte,将词汇量从指数级降至常数级,首次实现24位音频的LM无损压缩,并在8位和16位下超越FLAC。

Comments Accepted at Interspeech 2026, 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11201 2026-06-08 cs.CL 版本更新

Mechanistic Evidence for Faithfulness Decay in Chain-of-Thought Reasoning

链式思维推理中忠实度衰减的机制证据

Donald Ye, Max Loffgren, Om Kotadia, Linus Wong, Jonas Rohweder

机构 * Fordham University(福特汉姆大学) Algoverse AI Research(Algoverse AI研究) Rice University(稻子大学) UC San Diego(圣地亚哥大学) Santa Clara University(圣克拉拉大学) LMU Munich(慕尼黑路德维希-马克西米利安大学)

AI总结 提出归一化对数几率差衰减(NLDD)指标,通过破坏推理步骤并测量模型置信度下降,发现链式思维中超过70-85%长度的令牌对最终答案贡献微弱或负面,揭示了忠实度衰减现象。

Comments 16 pages, 16 figures. Accepted to ICLR LIT workshop. Code: https://github.com/donald-ye/NLDD

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01740 2026-06-08 cs.AI cs.CV cs.LG 版本更新

MACD: Model-Aware Contrastive Decoding via Counterfactual Data

MACD:基于反事实数据的模型感知对比解码

Qixin Xiao, Kun Zhou

机构 * University of Michigan, Ann Arbor, MI, USA(密歇根大学,安娜堡分校) University of California San Diego, La Jolla, CA, USA(加州大学圣地亚哥分校)

AI总结 提出MACD方法,利用视频语言模型自身反馈识别导致幻觉的目标区域,生成目标级反事实输入,结合对比解码减少幻觉,提升多模型在复杂场景下的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏