arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

共收录 830
2305.06426 2026-05-28 cs.AI cs.SY eess.SY math.OC

Planning a Community Approach to Diabetes Care in Low- and Middle-Income Countries Using Optimization

使用优化规划中低收入国家糖尿病护理的社区方法

Katherine B. Adams, Justin J. Boutilier, Sarang Deo, Yonatan Mintz

机构 * Department of Operations and Analytics, University of Texas at San Antonio(运营管理与分析系,德克萨斯大学圣安东尼奥分校) Telfer School of Management, University of Ottawa(奥多恩大学泰弗管理学院) Max Institute of Healthcare Management, Indian School of Business(印度商学院医疗管理研究所) Department of Industrial and Systems Engineering, University of Wisconsin-Madison(工业与系统工程系,威斯康星大学麦迪逊分校)

AI总结 提出一个优化框架,通过个性化社区卫生工作者访视计划,在社区层面最大化血糖控制,并平衡筛查新患者与管理已登记患者的资源分配。

Comments 50 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26797 2026-05-27 cs.LG cs.CL

Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior

潜在循环Transformer:架构探索、训练策略与扩展行为

Zeyi Huang, Xuehai He, LiLiang Ren, Yiping Wang, Baolin Peng, Hao Cheng, Shuohang Wang, Pengcheng He, Jianfeng Gao, Yong Jae Lee, Yelong Shen

机构 * Microsoft(微软公司) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Washington(华盛顿大学)

AI总结 提出潜在循环Transformer(LRT),通过跨层循环潜在路径重用前一token的高层隐藏状态作为记忆,在不增加暂停token或额外深度循环的情况下,以约2倍基线计算实现并行训练,在匹配有效计算下提升语言建模损失和上下文学习能力,仅增加0.3%参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26328 2026-05-27 cs.CV

RadarSim: Simulating Single-Chip Radar via Multimodal Neural Fields

RadarSim: 通过多模态神经场模拟单芯片雷达

Chuhan Chen, Tianshu Huang, Akarsh Prabhakara, Chaithanya Kumar Mummadi, Zhongxiao Cong, Anthony Rowe, Matthew O'Toole, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学) Bosch Research(博世研究) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 提出RadarSim,一种利用RGB相机高角分辨率从相机初始化的神经场生成多普勒雷达距离图像的统一可微渲染器,以解决雷达空间分辨率低的问题,并产生比纯雷达重建更清晰的几何和多普勒距离帧。

Comments Accepted to 3DV 2026. Project website: https://sally-chen.github.io/radar-sim/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26102 2026-05-27 cs.SE cs.CL

SWE-Edit: Rethinking Code Editing for Efficient SWE-Agent

SWE-Edit:重新思考高效SWE智能体的代码编辑

Yikai Zhang, Jiaxin Pei, Kenan Li, Qirui Jin, Maoquan Wang, Jin Pan, Yu Kang, Shengyu Fu, Elsie Nallipogu, Junjie Hu, Yufan Huang, Zijian Jin

机构 * Microsoft(微软) Department of Computer Sciences, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) Stanford Institute for Human-Centered Artificial Intelligence (HAI), Stanford University(斯坦福大学人机交互研究所)

AI总结 提出SWE-Edit框架,通过将代码编辑分解为查看器和编辑器两个子智能体,解决上下文耦合问题,在SWE-Bench Verified上提升解决率2.1个百分点并降低推理成本17.9%,且通过GRPO训练小模型实现高效编辑格式选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06454 2026-05-26 cs.LG cs.AI stat.ML

LETS Forecast: Learning Embedology for Time Series Forecasting

LETS Forecast:用于时间序列预测的嵌入学

Abrar Majeedi, Viswanatha Reddy Gajjala, Satya Sai Srinath Namburi GNVV, Nada Magdi Elkordi, Yin Li

机构 * Department of Biostatistics and Medical Informatics, University of Wisconsin-Madison(生物统计学与医学信息学系,威斯康星大学麦迪逊分校) Department of Computer Sciences, University of Wisconsin-Madison(计算机科学系,威斯康星大学麦迪逊分校)

AI总结 提出DeepEDM框架,结合非线性动力系统建模与深度学习,通过延迟嵌入和核回归学习潜在动态,实现高精度时间序列预测。

Comments Accepted at International Conference on Machine Learning (ICML) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25172 2026-05-26 stat.AP cs.DL cs.LG

Rejoinder: The ICML 2023 Ranking Experiment: Examining Author Self-Assessment in ML/AI Peer Review

回复:ICML 2023 排名实验:审视机器学习/人工智能同行评审中的作者自我评估

Buxin Su, Jiayao Zhang, Natalie Collina, Yuling Yan, Didong Li, Kyunghyun Cho, Jianqing Fan, Aaron Roth, Weijie Su

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) New York University(纽约大学) Princeton University(普林斯顿大学) Associate Chair of ICML 2023(ICML 2023 associate chair) Program Chair of ICML 2023(ICML 2023 program chair)

AI总结 本文回应了关于ICML 2023排名实验的讨论,将同行评审视为统计估计问题,探讨了等渗机制的公平性与策略问题,并提出了结合审稿人排名和生成式AI时代以人为中心的评审框架。

Comments Rejoinder to the JASA Discussion of "The ICML 2023 Ranking Experiment: Examining Author Self-Assessment in ML/AI Peer Review" (arXiv:2408.13430)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24938 2026-05-26 cs.IR cs.AI cs.CV

Your Embedding Model is SMARTer Than You Think

你的嵌入模型比你想象的更聪明

Jianrui Zhang, Hyun Jung Lee, Sukanta Ganguly, Tae-Eui Kam, Donghyun Kim, Yong Jae Lee

机构 * UW-Madison(威斯康星大学麦迪逊分校) Korea University(韩国大学) NetApp, Inc.(NetApp公司)

AI总结 提出SMART框架,通过利用标准单向量模型的隐式多向量能力,在推理时应用后期交互,无需额外训练即可提升多模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24860 2026-05-26 eess.SY cs.AI cs.ET cs.LG cs.RO cs.SY

DBPnet: Damper Characteristics-Based Bayesian Physics-Informed Neural Network for Wheel Load Estimation

DBPnet:基于阻尼特性的贝叶斯物理信息神经网络用于车轮载荷估计

Tianyi Wang, Tianyi Zeng, Zimo Zeng, Feiyang Zhang, Yujin Wang, Xiangyu Li, Yiming Xu, Sikai Chen, Junfeng Jiao, Christian Claudel, Xinbo Chen

机构 * Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校土木、建筑与环境工程系) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) College of Electrical Engineering, Zhejiang University(浙江大学电气工程学院) School of Automotive Studies, Tongji University(同济大学汽车学院) School of Architecture, The University of Texas at Austin(德克萨斯大学奥斯汀分校建筑学院) Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系)

AI总结 提出DBPnet,一种结合阻尼特性嵌入模块的贝叶斯物理信息神经网络,通过悬架连杆级建模和物理信息损失函数,实现鲁棒的车轮载荷估计。

Comments 14 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24753 2026-05-26 cs.CV

Ghosts in the Point Clouds: De-glaring LiDAR in the Transient Domain

点云中的鬼影:瞬态域中的LiDAR去眩光

Avery Gump, Connor Henley, Sungjin Cheong, Akarsh Prabhakara, Mohit Gupta

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 针对固态LiDAR内部多径眩光导致的伪影问题,提出基于瞬态眩光扩散函数(TGSF)的物理模型和无训练算法,在点云形成前抑制眩光,保留真实场景结构。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24261 2026-05-26 cs.LG cs.SY eess.SY

Optimizing Digital Therapeutic Interventions: Online Learning under Endogenous Adherence

优化数字治疗干预:内源性依从性下的在线学习

Eric Pulick, Stephanie Carpenter, Matthew Buman, Yonatan Mintz

机构 * Department of Industrial and Systems Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校工业与系统工程系) College of Health Solutions, Arizona State University(亚利桑那州立大学健康解决方案学院)

AI总结 针对慢性病数字治疗中患者依从性受推荐和过去依从性影响的问题,提出一个包含线性动力系统和logit链接的决策支持框架,并设计基于乐观主义的UCB-BOLD算法实现亚线性遗憾。

Comments 48 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23351 2026-05-25 cs.LG cs.GT

Prudent-Banker: No Extra Fees for Baseline Safety in Adversarial Bandits With and Without Delays

Prudent-Banker: 对抗性赌博机中无延迟与有延迟下的基线安全保障无额外代价

Ting Hu, Luanda Cai, Emmanouil-Vasileios Vlatakis-Gkaragkounis

机构 * Department of Economics University of Wisconsin–Madison(经济学系威斯康星大学麦迪逊分校) Department of Finance University of Wisconsin–Madison(金融系威斯康星大学麦迪逊分校) Department of Computer Sciences University of Wisconsin–Madison(计算机科学系威斯康星大学麦迪逊分校)

AI总结 针对对抗性多臂赌博机问题,提出Prudent-Banker算法,通过延迟校准的在线镜像下降和修改的分阶段攻击机制,在无延迟和有延迟反馈下同时实现最优最坏情况遗憾和近乎恒定的安全基线遗憾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23189 2026-05-25 cs.LG

Empirical Bayes Conformal Prediction for Vision and Language Models

视觉与语言模型的经验贝叶斯共形预测

Jiapeng Zeng, Yogesh Prabhu, Zhanpeng Zeng, Michael A. Newton, Vikas Singh

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California San Diego(加州大学圣地亚哥分校) Xiamen University(厦门大学)

AI总结 提出经验贝叶斯共形预测框架,利用r值将得分变异性转化为不确定性感知的非一致性得分,在保持目标覆盖的同时减少高方差假候选的包含。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23007 2026-05-25 q-fin.TR cs.AI cs.LG q-fin.PM

MadEvolve: Evolutionary Optimization of Trading Systems with Large Language Models

MadEvolve: 基于大型语言模型的交易系统进化优化

Yurii Kvasiuk, Tianyi Li, Owen Colegrove, Moritz Münchmeyer

机构 * Department of Physics, University of Wisconsin–Madison(威斯康星大学麦迪逊分校物理系) Event Horizon Labs(事件地平线实验室)

AI总结 提出 MadEvolve 框架,利用大型语言模型驱动的进化算法优化量化金融中的交易策略与 alpha 生成,以比特币交易为例,在特征集演化、策略组件优化及联合演化上取得显著改进,并对比了其他智能搜索方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05129 2026-05-25 cs.GT cs.LG

No Coin Left Behind: Maximizing Strategic Surplus Against No-Regret Dynamics

不遗漏任何硬币:对抗无遗憾动态的最大化战略剩余

Yiheng Su, Emmanouil-Vasileios Vlatakis-Gkaragkounis

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 研究在零和博弈中,先知优化者对抗恒定步长FTRL学习器所能获取的战略剩余,揭示了剩余规模与学习器次优动作数量的关系,并分析了正则化器陡峭性对剩余饱和的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04390 2026-05-25 cs.CR cs.AI

Through the Stealth Lens: Attention-Aware Defenses Against Poisoning in RAG

通过隐秘视角:检索增强生成中针对投毒攻击的注意力感知防御

Sarthak Choudhary, Nils Palumbo, Ashish Hooda, Krishnamurthy Dj Dvijotham, Somesh Jha

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ServiceNow Research(ServiceNow研究)

AI总结 针对检索增强生成系统在低污染率下仍易受投毒攻击的问题,提出基于注意力权重的归一化段落注意力分数和注意力方差滤波器,实现高精度检测与防御,并揭示真正隐秘投毒的挑战。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17888 2026-05-25 cs.LG cs.AI

ConjNorm: Tractable Density Estimation for Out-of-Distribution Detection

ConjNorm: 面向分布外检测的可处理密度估计

Bo Peng, Yadan Luo, Yonggang Zhang, Yixuan Li, Zhen Fang

机构 * University of Technology Sydney(悉尼大学) The University of Queensland(昆士兰大学) Hong Kong Baptist University(香港 Baptist 大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 提出基于Bregman散度的理论框架,通过共轭约束设计密度函数,并利用蒙特卡洛重要性采样实现可处理归一化,在OOD检测中达到SOTA。

Comments ICLR24 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14652 2026-05-25 cs.AI cs.CL cs.MA

MAS-Orchestra: Understanding and Improving Multi-Agent Reasoning Through Holistic Orchestration and Controlled Benchmarks

MAS-Orchestra:通过整体编排和受控基准理解与改进多智能体推理

Zixuan Ke, Yifei Ming, Austin Xu, Ryan Chin, Xuan-Phi Nguyen, Prathyusha Jwalapuram, Jiayu Wang, Semih Yavuz, Caiming Xiong, Shafiq Joty

机构 * Salesforce Research(Salesforce研究院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Massachusetts Institute of Technology(麻省理工学院)

AI总结 提出MAS-Orchestra框架,将多智能体系统编排形式化为函数调用的强化学习问题,并引入受控基准MASBENCH,揭示MAS收益依赖于任务结构等因素,在数学推理等任务上取得一致改进且效率提升10倍以上。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22650 2026-05-22 cs.CL

Whose Voice Counts? Mapping Stakeholder Perspectives on AI Through Public Submissions to the U.S. Government

谁的声音被听见?通过美国政府公开提交的材料映射利益相关者的AI观点

Alina Karakanta, Alex Christiansen, Tomás Dodds, Bissie Anderson, Matteo Fuoli, Marcus Perlman, Aletta G. Dorst

机构 * Leiden University Centre for Linguistics, Leiden University(莱顿大学语言学中心,莱顿大学) Department of Linguistics and Communication, University of Birmingham(伯明翰大学语言学与交流系) School of Journalism and Mass Communication, University of Wisconsin-Madison(威斯康星大学麦迪逊分校新闻与大众传播学院)

AI总结 本文通过分析美国政府AI行动计划公众咨询期间提交的信件,探讨不同利益相关者对AI的看法,发现个人更关注AI对生活的影响,而其他群体更关注AI发展,揭示了AI行动计划主要反映私营部门的关切。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22357 2026-05-22 cs.CV cs.AI

VEELA: A Clinically-Constrained Benchmark for Liver Vessel Segmentation in Computed Tomography Angiography

VEELA:一种受临床约束的肝血管分割基准数据集

Ziya Ata Yazıcı, N. Sinem Gezer, İlkay Öksüz, İlker Özgür Koska, Tuğçe Toprak, Pervin Bulucu, Ufuk Beşenk, A. Emre Kavur, Pierre-Henri Conze, Hazım Kemal Ekenel, Oğuz Dicle, Mustafa Ege Şeker, Mustafa Said Kartal, Ariorad Moniri, Orhan Özkan, Osman Faruk Bayram, Hakan Polat, Musa Balcı, Ece Tuğba Cebeci, Baran Cılga, Kardelen Peçenek, M. Alper Selver

机构 * Department of Radiology, Dokuz Eylul University(多尔朱·伊勒大学放射科) Department of Computer Engineering, Istanbul Technical University(伊斯坦布尔技术大学计算机工程系) Institute of Natural and Applied Sciences, Dokuz Eylul University(多尔朱·伊勒大学自然科学与应用科学学院) Department of Electrical and Electronics Engineering, Dokuz Eylul University(多尔朱·伊勒大学电气与电子工程系) Department of Radiology, University of Wisconsin-Madison(威斯康星大学麦迪逊分校放射科) School of Medicine, Sivas Cumhuriyet University(萨瓦斯·库尔德大学医学院) School of Medicine, Acibadem Mehmet Ali Aydinlar University(阿克塞姆·梅赫梅特·阿里·阿迪姆大学医学院) Department of Artificial Intelligence Engineering, Bahçeşehir University(巴切希尔大学人工智能工程系) Faculty of Pharmacy, Sivas Cumhuriyet University(萨瓦斯·库尔德大学药学院)

AI总结 本文提出VEELA数据集,用于在CT血管造影中实现肝门静脉分割,通过严格的人工标注和多专家共识,确保标注的临床现实性和准确性,并引入多种评估指标以评估血管分割的多视角性能。

Comments 27 pages, 25 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21606 2026-05-22 cs.LG cs.AI

When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning

何时教师标记可靠?用于推理的基于位置加权的在线自我蒸馏

Xiaogeng Liu, Xinyan Wang, Yingzi Ma, Yechao Zhang, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Nanyang Technological University(南洋理工大学)

AI总结 本文提出了一种基于位置加权的在线自我蒸馏方法,用于改进推理任务中教师标记的可靠性,通过引入分支可行性诊断来识别教师标记的可靠性,并在不同模型上验证了其有效性。

Comments Pre-print. Code is available at https://github.com/SaFo-Lab/PW-OPSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03241 2026-05-22 physics.optics cs.AI

OptiLookUp: An Optical ROM-Based Lookup Table Engine for Photonic Accelerators

OptiLookUp:一种基于光学ROM的查找表引擎用于光子加速器

Ankur Singh, Akhilesh Jaiswal

机构 * Department of Electrical and Computer Engineering, University of Wisconsin–Madison, Madison, WI, USA(电气与计算机工程系,威斯康星大学麦迪逊分校,麦迪逊,威斯康星州,美国)

AI总结 本文提出了一种基于光学ROM的查找表引擎,利用集成的微环谐振器实现高速可重构的光子ROM架构,通过直接在光子设备的频谱响应中编码输入输出映射,实现确定性的查找表操作,并在硅光平台上进行设计和评估,展示了在12.5GHz数据速率下的可靠性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20349 2026-05-22 physics.flu-dyn cs.LG

FD-Bench: A Modular and Fair Benchmark for Data-driven Fluid Simulation

FD-Bench: 一种模块化且公平的用于数据驱动流体模拟的基准测试

Haixin Wang, Ruoyan Li, Fred Xu, Fang Sun, Kaiqiao Han, Zijie Huang, Ching Chang, Xiao Luo, Wei Wang, Yizhou Sun

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Meta University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出FD-Bench,一个模块化、公平、全面且可重复的数据驱动流体模拟基准测试,通过统一的实验设置评估85个基线模型,解决可重复性和可比性问题,为未来数据驱动流体模型的稳健评估奠定基础。

Comments 32 pages, 20 figures, paper accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21428 2026-05-21 cs.LG cs.DS

Polynomial-Time Robust Multiclass Linear Classification under Gaussian Marginals

多项式时间鲁棒多类线性分类下的高斯边缘分布

Ilias Diakonikolas, Giannis Iakovidis, Mingchen Ma

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 研究在高斯分布下多类线性分类器的无偏学习任务,提出了一种多项式时间鲁棒学习算法,解决了多类分类中误差保证的问题,特别是在k≥3的情况下。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18991 2026-05-21 cs.CR cs.AI

Agent Security is a Systems Problem

智能体安全是系统问题

Mihai Christodorescu, Earlence Fernandes, Ashish Hooda, Somesh Jha, Johann Rehberger, Kamalika Chaudhuri, Xiaohan Fu, Khawaja Shams, Guy Amir, Jihye Choi, Sarthak Choudhary, Nils Palumbo, Andrey Labunets, Nishit V. Pandya

机构 * Google(谷歌) University of California San Diego(加州大学圣地亚哥分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) EmbraceTheRed Gray Swan AI Cornell University(康奈尔大学)

AI总结 本文提出智能体安全应作为系统问题来解决,强调通过系统层面的安全不变量来保障AI模型的安全性,而非仅仅依赖模型鲁棒性。文章基于系统安全领域的技术,提出了设计可预测安全保证的智能体系统的核心原则,并分析了实际攻击案例和实现这些原则面临的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20839 2026-05-21 cs.CV cs.LG

Activation-Free Backbones for Image Recognition: Polynomial Alternatives within MetaFormer-Style Vision Models

无需激活的图像识别回骨:在MetaFormer风格视觉模型中的多项式替代方案

Jeffrey Wang, Jonathan Gregory, Grigorios G. Chrysos

机构 * University of Wisconsin--Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出无需激活函数的多项式替代方法,用于在MetaFormer风格的视觉模型中实现图像识别,展示了多项式模块在多个数据集上的优越性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22430 2026-05-21 cs.LG

Inference Time Policy Optimization for Offline RL with Differentiable World Models

基于可微世界模型的离线强化学习推理时间策略优化

Rohan Deb, Stephen J. Wright, Arindam Banerjee

机构 * Siebel School of Computing and Data Science(计算与数据科学学院) Department of Computer Sciences(计算机科学系) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Wisconsin Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出了一种在推理时间利用可微世界模型优化策略参数的方法,通过端到端的梯度计算提升离线强化学习的性能,同时探讨了推理时间适应的计算开销与收益的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20520 2026-05-21 cs.AI

Open-World Evaluations for Measuring Frontier AI Capabilities

面向前沿AI能力的开放世界评估

Sayash Kapoor, Peter Kirgis, Andrew Schwartz, Stephan Rabanser, J. J. Allaire, Rishi Bommasani, Harry Coppock, Magda Dubois, Gillian K Hadfield, Andrew B. Hall, Sara Hooker, Seth Lazar, Steve Newman, Dimitris Papailiopoulos, Shoshannah Tekofsky, Helen Toner, Cozmin Ududec, Arvind Narayanan

机构 * Princeton University(普林斯顿大学) Cornflower Labs(Cornflower实验室) Meridian Labs(Meridian实验室) Stanford University(斯坦福大学) UK AI Security Institute(英国人工智能安全研究所) Johns Hopkins University(约翰霍普金斯大学) Adaption Labs(Adaption实验室) Australian National University(澳大利亚国立大学) Golden Gate Institute for AI(金门人工智能研究所) UW Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院) AI Digest(AI摘要) Georgetown University (CSET)(乔治城大学(CSET))

AI总结 本文提出开放世界评估作为一种补充方法,通过小样本定性分析来评估长期、复杂、现实世界任务,以更准确地衡量AI能力,并介绍了CRUX项目作为定期进行此类评估的尝试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10784 2026-05-21 cs.AI

TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training

TorchUMM: 一个用于评估、分析和训练后处理的统一多模态模型代码库

Yinyi Luo, Wenwen Wang, Hayes Bai, Hongyu Zhu, Hao Chen, Pan He, Marios Savvides, Sharon Li, Jindong Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) William & Mary(威廉与玛丽学院) Auburn University(阿肯色大学欧文分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出TorchUMM,一个统一的多模态模型代码库,用于评估、分析和训练后处理,涵盖多种多模态模型架构、任务和数据集,通过统一接口和标准化评估协议,促进异构模型的公平比较和深入理解,推动更强大的统一多模态系统的发展。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08277 2026-05-21 q-bio.NC cs.AI cs.CL cs.CV cs.LG

Task-conditioned probing of instruction-tuned multimodal LLMs: Region-specific brain alignment patterns under naturalistic stimuli

基于任务的指令调制多模态大语言模型探测:在自然主义刺激下的区域特定大脑对齐模式

Subba Reddy Oota, Khushbu Pahwa, Prachi Jindal, Satya Sai Srinath Namburi, Maneesh Singh, Tanmoy Chakraborty, Bapi S. Raju, Manish Gupta

机构 * Technische Universität Berlin(柏林技术大学) Rice University(Rice 大学) AWS AI Labs, Amazon(Amazon 人工智能实验室) IIT Delhi(德里理工学院) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) Spector Inc(Spector 公司) IIIT-Hyderabad(海得拉巴理工学院) Microsoft(微软)

AI总结 本研究探讨了指令调制多模态大语言模型在自然主义刺激下的大脑对齐模式,通过比较不同模型在视频和音频任务中的表现,揭示了指令调制对模型表示能力的影响。

Comments 57 pages, 39 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20122 2026-05-20 stat.ML cs.CC cs.LG

Optimizing Computational-Statistical Runtime for Wasserstein Distance Estimation

优化Wasserstein距离估计的计算-统计运行时间

Peter Matthew Jacobs, Jeff M. Phillips

机构 * Department of Statistics(统计学系) Kahlert School of Computing(Kahlert计算学院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Utah(犹他大学)

AI总结 本文提出了一种Sample-Sketch-Solve方法,通过引入正则化笛卡尔网格草图来压缩数据并加速Wasserstein距离的计算,实现了在Hölder光滑分布下以更优的运行时间达到ε误差的估计。

详情

展开后加载摘要…

URL PDF HTML 收藏