arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Texas at Austin(得克萨斯大学奥斯汀分校)

共收录 1212
2602.20360 2026-06-30 cs.LG cs.CV

Momentum Guidance: Plug-and-Play Guidance for Flow Models

动量引导:用于流模型的即插即用引导

Runlong Liao, Jian Yu, Baiyu Su, Chi Zhang, Lizhang Chen, Qiang Liu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出动量引导方法,通过扩展当前速度远离过去速度的指数移动平均,提升样本质量并保持成本,优于现有引导技术,实验显示在ImageNet-256上FID显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15864 2026-06-30 cs.LG

Improving Rectified Flow with Boundary Conditions

通过边界条件改进校正流

Xixi Hu, Runlong Liao, Keyang Xu, Bo Liu, Yeqing Li, Eugene Ie, Hongliang Fei, Qiang Liu

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Google(谷歌)

AI总结 本文提出边界约束校正流模型,通过强制边界条件提升生成模型性能,在ImageNet上使用ODE和SDE采样分别提升FID分数8.01%和8.98%。

Comments ICCV 2025

Journal ref Proc. IEEE/CVF International Conference on Computer Vision (ICCV), 2025, pp. 18177-18186

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03388 2026-06-30 cs.LG cs.AI cs.CV

A Non-negative VAE:the Generalized Gamma Belief Network

非负变分自编码器:广义伽玛信念网络

Zhibin Duan, Tiansheng Wen, Muyao Wang, Bo Chen, Mingyuan Zhou

机构 * Xidian University(西安电子科技大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出广义伽玛信念网络,通过扩展线性生成模型为非线性模型,解决原有GBN的表达能力限制,并采用Weibull推理网络近似后验分布,实验验证其在表达性和解耦表示学习中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21740 2026-06-30 cs.LG cs.AI cs.CV

Beyond Spectral Decomposition: Bayesian Contrastive Learning and its Non-negative Formulation via Factor Analysis

超越谱分解:通过因子分析的贝叶斯对比学习及其非负形式

Zhibin Duan, Tiansheng Wen, Yifei Wang, Chen Zhu, Bo Chen, Mingyuan Zhou

机构 * Xidian University(西安电子科技大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出对比因子分析框架,结合因子分析和对比学习的优势,通过非负因子分析提升可解释性,验证了其在表达能力、鲁棒性、可解释性和不确定性估计上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28273 2026-06-29 cs.CL 新提交

Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models

视觉默认,先验覆盖:视觉-语言模型中感知-知识冲突的因果机制

Niclas Lietzow, Danielle Bitterman, Carsten Eickhoff, William Rudman, Michal Golovanevsky

机构 * University of Tübingen(图宾根大学) Harvard University(哈佛大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 通过激活修补和消融实验,发现VLM中视觉默认激活,而先验知识依赖少量因果注意力头(2.5-4.8%),形成不对称因果结构。

Comments 14 pages, 11 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27515 2026-06-29 cs.LG physics.geo-ph 新提交

Boundary condition fidelity for bottom-hole pressure and CO2 plume prediction in geological carbon storage

地质碳封存中井底压力与CO2羽流预测的边界条件保真度

Romal Ramadhan, Seyyed A. Hosseini, Larry W. Lake

机构 * Department of Earth and Planetary Sciences, Jackson School of Geosciences, The University of Texas at Austin(德克萨斯大学奥斯汀分校杰克逊地球科学学院地球与行星科学系) Bureau of Economic Geology, The University of Texas at Austin(德克萨斯大学奥斯汀分校经济地质局) Hildebrand Department of Petroleum and Geosystems Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校希尔德布兰德石油与地质系统工程系)

AI总结 研究通过对比十种截断域边界处理方法与全域参考模拟,评估边界条件保真度对井底压力和CO2羽流预测的影响,发现保留角点孔隙体积是关键,而透射率修正并非普遍有益,渐进修正结合透射率修正效果最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26872 2026-06-29 cs.LG cs.AI cs.CL 版本更新

The Strongest Teacher Is Not Always the Best Teacher: Student-Centric Answer Selection

最强的教师并不总是最好的教师:以学生为中心的答案选择

Zhengyu Hu, Zheyuan Xiao, Linxin Song, Fengqing Jiang, Yuetai Li, Zhihan Xiong, Yue Liu, Junhao Lin, Yao Su, Lijie Hu, Kaize Ding, Teng Xiao, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Southern California(南加州大学) Independent Researcher(独立研究者) National University of Singapore(新加坡国立大学) Microsoft(微软) Google(谷歌) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Northwestern University(西北大学) Allen Institute for AI (AI2)(人工智能研究院(AI2))

AI总结 提出以学生为中心的答案采样(SCAS)框架,通过估计学生中心的学习成本选择教师生成的答案,从而提升学生模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03704 2026-06-29 cs.CV 版本更新

QuantV2X: A Fully Quantized Multi-Agent System for Cooperative Perception

QuantV2X:一种用于协同感知的全量化多智能体系统

Seth Z. Zhao, Huizhi Zhang, Zhaowei Li, Juntong Peng, Anthony Chui, Zewei Zhou, Zonglin Meng, Hao Xiang, Zhiyu Huang, Fujia Wang, Ran Tian, Chenfeng Xu, Bolei Zhou, Jiaqi Ma

机构 * UCLA(加州大学洛杉矶分校) UW-Madison(威斯康星大学麦迪逊分校) NCSU(北卡罗来纳州立大学) Purdue University(普渡大学) UC Berkeley(加州大学伯克利分校) UT Austin(德克萨斯大学奥斯汀分校)

AI总结 提出首个全量化多智能体系统QuantV2X,通过端到端量化策略同时降低计算负载和传输带宽,在低比特约束下达到与全精度相当的精度,并显著降低延迟、提升mAP30。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05517 2026-06-29 cs.CV cs.LG cs.RO 版本更新

Web2Grasp: Learning Functional Grasps from Web Images of Hand-Object Interactions

Web2Grasp:从网络手物交互图像中学习功能性抓取

Hongyi Chen, Yunchao Yao, Yufei Ye, Zhixuan Xu, Homanga Bharadhwaj, Jiashun Wang, Arthur Jakobsson, Ruihan Zhao, Shubham Tulsiani, Zackory Erickson, Jeffrey Ichnowski

机构 * Carnegie Mellon University(卡内基梅隆大学) Nvidia(英伟达) National University of Singapore(新加坡国立大学) UT Austin(德克萨斯大学奥斯汀分校)

AI总结 提出从网络图像中提取人手抓取信息,利用3D重建和交互中心模型学习功能性抓取,在仿真和真实实验中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26348 2026-06-26 cs.AI 新提交

What We are Missing in Multimodal LLM Evaluation?

我们在多模态大语言模型评估中缺失了什么?

Po-han Li, Shenghui Chen, Sandeep Chinchali, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文分析现有多模态大语言模型评估基准的不足,识别出时空连贯性、物理世界理解、多模态一致性和选择性注意等关键缺失,强调填补这些空白对衡量多模态智能真实进展的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18195 2026-06-26 cs.CL 新提交

Learning from the Self-future: On-policy Self-distillation for dLLMs

从自我未来学习:面向扩散LLM的在线自蒸馏

Yifu Luo, Zeyu Chen, Haoyu Wang, Xinhao Hu, Yuxuan Zhang, Zhizhou Sha, Shiwei Liu

机构 * Tsinghua University(清华大学) Technical University of Munich(慕尼黑工业大学) Nanyang Technological University(南洋理工大学) University of British Columbia(不列颠哥伦比亚大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) ELLIS Institute Tubingen(ELLIS蒂宾根研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tubingen AI Center(蒂宾根人工智能中心)

AI总结 提出首个面向扩散大语言模型的在线自蒸馏框架d-OPSD,通过自我生成答案作为后缀条件实现从自我未来经验学习,并将监督从词元级转向步骤级,在推理基准上以约10%的优化步骤超越RLVR和SFT基线。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05531 2026-06-26 quant-ph cs.DS cs.LG 版本更新

Efficient learning of bosonic Gaussian unitaries

玻色子高斯酉算子的高效学习

Marco Fanizza, Vishnu Iyer, Junseo Lee, Antonio A. Mele, Francesco A. Mele

机构 * Inria(法国国家信息与自动化技术研究所) Télécom Paris - LTCI(巴黎电信学院 - LTCI) Institut Polytechnique de Paris(巴黎理工学院) Department of Computer Science, The University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系) Institute of Computer Technology, Seoul National University(首尔国立大学计算机技术研究所) Dahlem Center for Complex Quantum Systems, Freie Universitat Berlin(柏林自由大学复杂量子系统中心) NEST, Scuola Normale Superiore and Istituto Nanoscienze(NEST、巴黎高等科学研究所和纳米科学研究所)

AI总结 提出首个高效算法学习玻色子高斯酉算子,使用相干和压缩探针、被动线性光学及外差/零差检测,通过辛正则化后处理实现多项式时间复杂度和高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19274 2026-06-26 cs.RO 版本更新

GO: The Great Outdoors Multimodal Dataset

GO: 大户外多模态数据集

Peng Jiang, Kasi Viswanath, Akhil Nagariya, George Chustz, Maggie Wigness, Philip Osteen, Timothy Overbye, Christian Ellis, Long Quang, Jia Huang, Srikanth Saripalli

机构 * Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University, College Station, TX, USA(迈克·沃克66机械工程系,德克萨斯A&M大学,学院站,德克萨斯州,美国) DEVCOM Army Research Laboratory, Adelphi, MD, USA(陆军研究实验室,阿德菲,马里兰州,美国) University of Texas at Austin Center for Autonomy, Austin, TX, USA(德克萨斯大学奥斯汀分校自主性中心,奥斯汀,德克萨斯州,美国)

AI总结 针对非结构化环境中地面机器人研究,提出包含六种互补传感器模态的大规模多模态越野数据集,支持语义分割、目标检测和SLAM等任务,以提升退化条件下的鲁棒性。

Comments 7 pages, 7 figures, accepted at IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25473 2026-06-25 cs.CV cs.LG 新提交

Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models

Causal-rCM:一种用于流式视频生成和交互式世界模型中自回归扩散蒸馏的统一教师强制与自我强制开放配方

Kaiwen Zheng, Guande He, Min Zhao, Jintao Zhang, Huayu Chen, Jianfei Chen, Chen-Hsuan Lin, Ming-Yu Liu, Jun Zhu, Qianli Ma

机构 * Tsinghua University(清华大学) UT Austin(德克萨斯大学奥斯汀分校) NVIDIA(英伟达)

AI总结 提出Causal-rCM框架,将扩散蒸馏扩展到自回归视频扩散,通过教师强制(前向散度)与自我强制(反向散度)互补,实现流式视频生成和交互式世界模型,在帧级和块级设置中达到最先进性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25306 2026-06-25 cs.CV cs.AI 新提交

Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation

物理问题场景图:文本到视频生成中物理合理性的细粒度评估

Atin Pothiraj, Jaemin Cho, Yue Zhang, Elias Stengel-Eskin, Mohit Bansal

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) AI2(艾伦人工智能研究所) Johns Hopkins University(约翰霍普金斯大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 提出物理问题场景图(PQSG),一种基于层次化问题的评估流程,通过图结构问题检查视频在对象、动作和物理规律上的忠实度,实现细粒度评估。

Comments ECCV 2026. Code and data: https://github.com/atinpothiraj/pqsg

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25136 2026-06-25 cs.RO 新提交

Memory Retrieval in Visuomotor Policies for Long-Horizon Robot Control

视觉运动策略中的记忆检索用于长期机器人控制

Rutav Shah, Yisu Li, Femi Bello, Yuke Zhu, Roberto Martín-Martín

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 提出HALO策略,通过注意力记忆检索机制和视觉语言模型先验蒸馏,解决长期控制中的虚假相关和记忆误差累积问题,实现从长达8分钟历史中检索任务相关信息。

Comments 16 pages, 5 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25123 2026-06-25 cs.RO 新提交

RGB: RL Guided Whole-Body MPPI for Humanoid Control

RGB: 强化学习引导的全身MPPI用于人形机器人控制

Yunsoo Seo, Sol Choi, Euncheol Im, Myo Taeg Lim, Yisoo Lee

机构 * Center for Humanoid Research, Korea Institute of Science and Technology (KIST)(韩国科学技术研究院(KIST)仿人机器人研究中心) University of Texas at Austin(德克萨斯大学奥斯汀分校) Department of Mechanical Engineering, Yonsei University(延世大学机械工程系) School of Electrical Engineering, Korea University(高丽大学电气工程学院)

AI总结 提出RL引导的全身MPPI框架,利用预训练RL策略作为采样先验,通过MPPI成本项在线修正,无需重新训练即可实现鲁棒精确的全身控制。

Comments 7pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22225 2026-06-25 cs.CL cs.SD eess.AS 版本更新

Adapting Self-Supervised Speech Representations for Cross-lingual Dysarthria Detection in Parkinson's Disease

自适应自监督语音表示用于帕金森病跨语言构音障碍检测

Abner Hernandez, Eunjung Yeo, Kwanghee Choi, Chin-Jou Li, Zhengjun Yue, Rohan Kumar Das, Jan Rusz, Mathew Magimai Doss, Juan Rafael Orozco-Arroyave, Tomás Arias-Vergara, Andreas Maier, Elmar Nöth, David R. Mortensen, David Harwath, Paula Andrea Perez-Toro

机构 * FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡大学) UT Austin(奥斯汀大学) CMU(卡内基梅隆大学) Czech Technical University in Prague(布拉格技术大学) Idiap Research Institute(Idiap研究机构) Universidad de Antioquia(安提奥基亚大学) Shenzhen Loop Area Institute(深圳河套学院) Fortemedia(Fortemedia公司)

AI总结 针对构音障碍数据稀缺导致跨语言检测困难,提出基于质心的表示级语言迁移方法,对齐自监督语音表示,在捷克语、德语和西班牙语帕金森病语音数据集上显著提升跨语言检测敏感性和F1值。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24855 2026-06-24 cs.AI 新提交

OpenThoughts-Agent: Data Recipes for Agentic Models

OpenThoughts-Agent: 智能体模型的数据配方

Negin Raoof, Richard Zhuang, Marianna Nezhurina, Etash Guha, Atula Tejaswi, Ryan Marten, Charlie F. Ruan, Tyler Griggs, Alexander Glenn Shaw, Hritik Bansal, E. Kelly Buchanan, Artem Gazizov, Reinhard Heckel, Chinmay Hegde, Sankalp Jajee, Daanish Khazi, Emmanouil Koukoumidis, Xiangyi Li, Hange Liu, Shlok Natarajan, Harsh Raj, Nicholas Roberts, Ethan Shen, Nishad Singhi, Michael Siu, Ashima Suvarna, Hanwen Xing, Patrick Yubeaton, Robert Zhang, Leon Liangyu Chen, Xiaokun Chen, Steven Dillmann, Saadia Gabriel, Xunyi Jiang, Anurag Kashyap, Boxuan Li, Yein Park, Minh Pham, Sujay Sanghavi, Lin Shi, Ke Sun, Yixin Wang, Zhiwei Xu, Erica Zhang, Siyan Zhao, Wanjia Zhao, Jenia Jitsev, Alex Dimakis, Benjamin Feuer, Ludwig Schmidt

机构 * UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) JSC(于利希超级计算中心) LAION University of Texas at Austin(德克萨斯大学奥斯汀分校) Bespoke Labs Laude Institute UCLA(加州大学洛杉矶分校) Harvard University & Harvard Medical School(哈佛大学与哈佛医学院) TU Munich & Munich Center for Machine Learning(慕尼黑工业大学与慕尼黑机器学习中心) New York University(纽约大学) Medical University of South Carolina(南卡罗来纳医科大学) The LLM Data Company BenchFlow Independent Researcher(独立研究员) Northeastern University(东北大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Washington(华盛顿大学) TU Darmstadt(达姆施塔特工业大学) University of Southern California(南加州大学) UC San Diego(加州大学圣地亚哥分校) Amazon(亚马逊) Microsoft(微软) Korea University(高丽大学) Cornell Tech(康奈尔科技) University of Michigan(密歇根大学)

AI总结 提出全开放数据筛选流水线,通过100多次消融实验研究任务来源与多样性,构建10万样本训练集,在7个智能体基准上平均44.8%准确率,较最强开源模型提升3.9个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24781 2026-06-24 cs.AI cs.HC 新提交

Assessing Distribution Shift in Human Activity Recognition for Domain Generalization

评估人类活动识别中的分布偏移以进行域泛化

Rebecca Adaimi, Edison Thomaz

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 系统评估设备类型、传感器位置、采样率和用户行为四种分布偏移对HAR模型的影响,建立统一基准并评估28种域泛化方法,发现现有方法泛化能力有限。

Comments 22 pages with references

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10124 2026-06-24 cs.LG cs.AI 新提交

FedSteer: Taming Extreme Gradient Staleness in Federated Learning with Corrective Projections and Caching

FedSteer: 通过校正投影和缓存驯服联邦学习中的极端梯度陈旧性

Haoran Zhang, Cainã Figueiredo Pereira, Marie Siew, Xutong Liu, Carlee Joe-Wong, Rachid El-Azouzi

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Avignon(阿维尼昂大学) Singapore University of Technology and Design(新加坡科技与设计大学) University of Washington(华盛顿大学)

AI总结 针对联邦学习中客户端参与不均导致的梯度陈旧问题,提出FedSteer方法,利用客户端梯度缓存构建子空间,通过投影和缓存策略校正陈旧梯度,显著提升训练稳定性与精度。

Comments UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16568 2026-06-24 math.ST cs.DS cs.LG math.OC stat.ML stat.TH 版本更新

Separating Oblivious and Adaptive Models of Variable Selection

区分变量选择中的遗忘模型与自适应模型

Ziyun Chen, Jerry Li, Kevin Tian, Yusong Zhu

机构 * University of Washington(华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文研究ℓ∞稀疏恢复的统计与计算复杂性,证明遗忘模型下最优误差可在近线性时间内以约k log d样本达到,而自适应模型至少需要k²样本,与ℓ₂设置形成对比。

Comments 40 pages, Extended abstract accepted for presentation at COLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22976 2026-06-23 cs.LG cs.AI cs.CL 新提交

Understanding Parallel Samplers in Masked Diffusion via Random Walks on Graphs

通过图上的随机游走理解掩码扩散中的并行采样器

Vansh Bansal, Cho Cholyeon, Syamantak Kumar, Sujay Sanghavi, Purnamrita Sarkar

机构 * UT Austin SDS(德克萨斯大学奥斯汀分校统计与数据科学系) UT Austin CS(德克萨斯大学奥斯汀分校计算机科学系) UT Austin ECE(德克萨斯大学奥斯汀分校电气与计算机工程系)

AI总结 提出以图上随机游走为可验证沙盒,研究掩码扩散模型中的并行采样策略,理论上证明最低熵等并行采样并非普遍优于随机采样,并开发了二分采样器,实验表明不同图适用不同采样器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21777 2026-06-23 cs.CL cs.AI 新提交

CalVerT: Augmenting Agents with Calibrated Verifier Telemetry Improves Action and Learning in Knowledge-Intensive Tasks

CalVerT: 通过校准验证器遥测增强智能体在知识密集型任务中的行动与学习

Ashwin Vinod, Ying Ding, Elias Stengel-Eskin

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 提出CalVerT方法,通过向智能体状态添加校准的自信心分数和基础验证器分数,减少过度依赖参数知识或冗余检索,提升知识密集型问答的准确性和效率。

Comments Code: https://github.com/ashwinn-v/CalVerT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21646 2026-06-23 cs.RO 新提交

Energy-based Compositional Diffusion Planning

基于能量的组合扩散规划

Tao Sun, Utkarsh Aashu Mishra, Jiaxin Lu, Danfei Xu, Iro Armeni

机构 * Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 提出能量基组合扩散器(ECD),将全局轨迹建模为局部桥势之和的最小化,通过保守修正场和边界反应项改进启发式拼接,实现线性时间复杂度的马尔可夫分数近似,在OGBench任务中达到最优成功率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20770 2026-06-23 cs.CL cs.AI cs.LG 新提交

Beyond 'One Language, One Script': Quantifying Orthographic Bias in Multilingual VLMs with PuMVR

超越“一种语言,一种文字”:用PuMVR量化多语言视觉语言模型中的正字法偏差

Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina

机构 * RediMinds Inc.(RediMinds公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 提出PuMVR基准,通过旁遮普语三种文字的图像推理任务,量化多语言视觉语言模型中的文字依赖偏差,发现文字一致性率低至24.8%,视觉输入无法消除偏差。

Comments 22 pages, 4 figures. Accepted to the 4th Workshop on Cross-Cultural Considerations in NLP (C3NLP) @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20769 2026-06-23 cs.CL cs.AI cs.LG 新提交

FirstPass: Grounding AI Scientific Judgment in Multi-Round Editorial Outcomes

FirstPass: 在多轮编辑结果中奠定AI科学判断的基础

Prabhjot Singh, Somnath Luitel, Manmeet Singh, Josh Durkee

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) RediMinds Inc.(RediMinds公司) Disaster Science Operations Center, Western Kentucky University(西肯塔基大学灾害科学运营中心)

AI总结 针对同行评审AI在领域覆盖、对话建模和评估标准上的不足,提出FirstPass数据集和微调模型,利用Nature Communications多轮评审对话,通过响应损失掩码实现80.5%的编辑结果预测准确率,并生成接近人类长度的评审意见。

Comments Accepted at the AI for Science Workshop at the 43rd International Conference on Machine Learning (ICML 2026). 9 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20695 2026-06-23 cs.MA cs.AI 新提交

How Much Coordination Gain Is Real? A Paired Noise-Floor Protocol for Multi-Agent LLM Benchmarks

真正的协调增益有多大?多智能体LLM基准测试的配对噪声底线协议

Alibek T Kaliyev, Artem Maryanskyy

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 针对多智能体LLM协调基准测试中微小增量不可靠的问题,提出配对噪声底线协议,通过配置等价对比发现典型效应量低于观测噪声包络,并定义协调活跃pass^k作为最低报告标准。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21951 2026-06-23 cs.LG cs.CR cs.DS math.ST stat.TH 新提交

On the Curse of Dimensionality in Private Sparse Covariance Estimation and PCA

私有稀疏协方差估计与PCA中的维度灾难

Syamantak Kumar, Shourya Pandey, Purnamrita Sarkar, Kevin Tian

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 研究差分隐私下稀疏协方差矩阵估计和PCA的样本复杂度,发现当特征向量稀疏时,poly(k, log d)样本足够,否则需poly(d)样本,揭示了私有与非私有版本间的指数差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28737 2026-06-23 eess.AS cs.AI cs.CL cs.SD 版本更新

ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining

ParaSpeechCLAP:面向丰富风格语言-音频预训练的双编码器语音-文本模型

Anuj Diwan, Eunsol Choi, David Harwath

机构 * Department of Computer Science, The University of Texas at Austin, USA(德克萨斯大学奥斯汀分校计算机科学系) Computer Science and Data Science, New York University, USA(纽约大学计算机科学与数据科学系)

AI总结 提出ParaSpeechCLAP双编码器模型,将语音与文本风格描述映射到共享嵌入空间,支持丰富内在和情境风格描述,在风格描述检索、属性分类及TTS奖励模型中优于基线。

Comments Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏