arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

共收录 830
2604.13151 2026-04-16 cs.AI

Exploration and Exploitation Errors Are Measurable for Language Model Agents

语言模型代理中的探索与利用误差是可测量的

Jaden Park, Jungtaek Kim, Jongwon Jeong, Robert D. Nowak, Kangwook Lee, Yong Jae Lee

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) KRAFTON Ludo Robotics

AI总结 研究探讨了语言模型代理在复杂决策任务中探索与利用误差的测量方法,设计可控环境评估不同模型的表现,发现前沿模型在任务中表现不佳,推理模型更有效,通过少量工程优化可显著提升探索与利用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03610 2026-04-16 cs.AI

Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games

Orak:面向多样化视频游戏的LLM代理训练与评估基础基准

Dongmin Park, Minkyu Kim, Beongjun Choi, Junhyuck Kim, Keon Lee, Jonghyun Lee, Inkyu Park, Byeong-Uk Lee, Jaeyoung Hwang, Jaewoo Ahn, Ameya S. Mahabaleshwarkar, Bilal Kartal, Pritam Biswas, Yoshi Suhara, Kangwook Lee, Jaewoong Cho

机构 * KRAFTON Seoul National University(首尔国立大学) NVIDIA University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Ludo Robotics

AI总结 Orak通过12种主流视频游戏构建基础基准,系统评估LLM代理在不同游戏场景中的能力,提供统一评估框架和细调数据集,推动多样化游戏代理发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05206 2026-04-15 cs.CR cs.AI cs.CL cs.CV

Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety

大规模安全:大型模型和智能体安全的全面综述

Xingjun Ma, Yifeng Gao, Yixu Wang, Ruofan Wang, Xin Wang, Ye Sun, Yifan Ding, Hengyuan Xu, Yunhao Chen, Yunhan Zhao, Hanxun Huang, Yige Li, Yutao Wu, Jiaming Zhang, Xiang Zheng, Yang Bai, Zuxuan Wu, Xipeng Qiu, Jingfeng Zhang, Yiming Li, Xudong Han, Haonan Li, Jun Sun, Cong Wang, Jindong Gu, Baoyuan Wu, Siheng Chen, Tianwei Zhang, Yang Liu, Mingming Gong, Tongliang Liu, Shirui Pan, Cihang Xie, Tianyu Pang, Yinpeng Dong, Ruoxi Jia, Yang Zhang, Shiqing Ma, Xiangyu Zhang, Neil Gong, Chaowei Xiao, Sarah Erfani, Tim Baldwin, Bo Li, Masashi Sugiyama, Dacheng Tao, James Bailey, Yu-Gang Jiang

机构 * Fudan University(复旦大学) The University of Melbourne(墨尔本大学) Singapore Management University(新加坡国立大学) Deakin University(德肯大学) Hong Kong University of Science and Technology(香港科学与技术大学) City University of Hong Kong(香港城市大学) University of Oxford(牛津大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) The University of Sydney(悉尼大学) Griffith University(格里菲斯大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Sea AI Lab(Sea AI实验室) Tsinghua University(清华大学) Virginia Tech(弗吉尼亚理工大学) CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全部) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Purdue University(普渡大学) Duke University(杜克大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) RIKEN(理化学研究所) The University of Tokyo(东京大学)

AI总结 本文综述了大型模型和智能体的安全性,分析了各类攻击威胁及防御策略,指出安全评估、防御机制和数据实践的重要性,强调研究社区和国际合作的必要性。

Comments 706 papers, 60 pages, 3 figures, 14 tables; GitHub: https://github.com/xingjunm/Awesome-Large-Model-Safety

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11978 2026-04-15 cs.AI

The Long-Horizon Task Mirage? Diagnosing Where and Why Agentic Systems Break

长远任务的幻觉?诊断代理系统何时及为何失效

Xinyu Jessica Wang, Haoyue Bai, Yiyou Sun, Haorui Wang, Shuibai Zhang, Wenjie Hu, Mya Schroder, Bilge Mutlu, Dawn Song, Robert D Nowak

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文通过HORIZON基准测试分析LLM代理在长周期任务中的失效模式,提出轨迹驱动的评估方法,并通过人类标注验证其有效性,为构建更可靠的代理系统提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11801 2026-04-14 cs.CL

CLSGen: A Dual-Head Fine-Tuning Framework for Joint Probabilistic Classification and Verbalized Explanation

CLSGen:一种用于联合概率分类和 verbalized 解释的双头微调框架

WonJin Yoon, Kangyu Zhu, Ian Bulovic, Autumn Sehy, Yanjun Gao, Dmitriy Dligach, Majid Afshar, Timothy A. Miller

机构 * Boston Children’s Hospital(波士顿儿童医院) Harvard Medical School(哈佛医学院) University of Colorado Anschutz Medical Campus(科罗拉多大学安施图茨医学院) Loyola University Chicago(芝加哥洛约拉大学) University of Wisconsin Madison(威斯康星大学麦迪逊分校)

AI总结 CLSGen 提出了一种双头微调框架,通过新的架构和方法实现概率估计与解释生成的平衡,实验表明其在分类和解释质量上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08718 2026-04-14 cs.CV cs.AI cs.RO

Accelerating Transformer-Based Monocular SLAM via Geometric Utility Scoring

通过几何效用评分加速基于Transformer的单目SLAM

Xinmiao Xiong, Bangya Liu, Hao Wang, Dayou Li, Nuo Chen, Andrew Feng, Mingyu Ding, Suman Banerjee, Yang Zhou, Zhiwen Fan

机构 * UW–Madison(威斯康星大学麦迪逊分校) Texas A&M(德州农工大学) USC(南加州大学) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文提出LeanGate,通过预测几何效用评分在重特征提取前筛选帧,减少冗余计算,提升SLAM效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10373 2026-04-14 math.OC cs.LG

Shuffling the Data, Stretching the Step-size: Sharper Bias in constant step-size SGD

打乱数据,扩大步长:在固定步长SGD中更精确的偏倚

Konstantinos Emmanouilidis, Emmanouil-Vasileios Vlatakis-Gkaragkounis, Rene Vidal

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Archimedes Research Unit(阿基米德研究单位)

AI总结 本文研究了在有限和最小-最大优化问题中,通过随机重洗数据和Richardson-Romberg外推的组合,提升固定步长SGD的收敛性,提供理论保证和实验验证。

Comments Accepted in ICLR 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20587 2026-04-14 stat.ML cs.LG stat.ME

Unsupervised Domain Adaptation for Binary Classification with an Unobservable Source Subpopulation

无监督领域适应中的二分类问题:不可观测的源子群体

Chao Ying, Jun Jin, Haotian Zhang, Qinglong Tian, Yanyuan Ma, Sharon Li, Jiwei Zhao

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Henry Ford Health(亨利·福特健康) University of Connecticut(康涅狄格大学) University of Waterloo(滑铁卢大学) Pennsylvania State University(宾夕法尼亚州立大学)

AI总结 本文研究了在源域中存在不可观测子群体的无监督领域适应问题,提出通过分布匹配方法估计子群体比例,并理论保证了预测误差上界,实验表明方法在合成和真实数据集上优于传统基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08457 2026-04-13 cs.CV cs.AI cs.RO

CrashSight: A Phase-Aware, Infrastructure-Centric Video Benchmark for Traffic Crash Scene Understanding and Reasoning

CrashSight:面向交通事故场景理解与推理的相位感知、基础设施导向视频基准

Rui Gan, Junyi Ma, Pei Li, Xingyou Yang, Kai Chen, Sikai Chen, Bin Ran

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Wyoming(怀俄明大学) Columbia University(哥伦比亚大学)

AI总结 CrashSight通过真实道路摄像头数据构建大规模视频基准,评估视觉语言模型在交通事故场景中的理解与推理能力,揭示现有模型在时间与因果推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09107 2026-04-13 cs.DC cs.AI

TensorHub: Scalable and Elastic Weight Transfer for LLM RL Training

TensorHub: 用于LLM强化学习训练的可扩展和弹性权重传输

Chenhao Ye, Huaizheng Zhang, Mingcong Han, Baoquan Zhong, Xiang Li, Qixiang Chen, Xinyi Zhang, Weidong Zhang, Kaihua Jiang, Wang Zhang, He Sun, Wencong Xiao, Andrea C. Arpaci-Dusseau, Remzi H. Arpaci-Dusseau

机构 * ByteDance Seed(字节跳动Seed) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 TensorHub通过Reference-Oriented Storage实现高效的权重传输,支持异构计算资源的扩展,减少GPU停滞时间,提升弹性回滚效率,已在生产环境中部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07833 2026-04-13 cs.CV cs.AI cs.LG

Relational Visual Similarity

关系视觉相似性

Thao Nguyen, Sicheng Mo, Krishna Kumar Singh, Yilin Wang, Jing Shi, Nicholas Kolkin, Eli Shechtman, Yong Jae Lee, Yuheng Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Adobe Research(Adobe研究院)

AI总结 本文提出通过关系相似性而非视觉属性来衡量图像相似性,构建了首个基于关系逻辑的图像表示空间,揭示了现有视觉模型在捕捉关系相似性方面的不足。

Comments CVPR 2026 camera-ready; Project page, data, and code: https://thaoshibe.github.io/relsim

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02231 2026-04-13 cs.CV cs.AI cs.LG

See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models

看见、听见与理解:多模态大语言模型中人类语音理解基准测试

Le Thien Phuc Nguyen, Zhuoran Yu, Samuel Low Yu Hang, Subin An, Jeongik Lee, Yohan Ban, SeungEun Chung, Thanh-Huy Nguyen, JuWan Maeng, Soochahn Lee, Yong Jae Lee

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Kookmin University(国民大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出AV-SpeakerBench基准测试,通过3212道多选题评估多模态大语言模型在真实视频中对语音的细粒度理解能力,发现Gemini 2.5 Pro在音频视觉融合方面表现最佳。

Comments Findings of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07517 2026-04-13 cs.AI cs.MA

When Identity Skews Debate: Anonymization for Bias-Reduced Multi-Agent Reasoning

当身份偏见引发争论:为减少偏见的多智能体推理中的匿名化

Hyeong Kyu Choi, Xiaojin Zhu, Sharon Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出了一种框架,通过去除身份标记来减少多智能体推理中的身份偏见,定义了身份偏见系数,并通过实验验证身份偏见普遍存在。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02535 2026-04-10 cs.CL cs.AI

ModeX: Evaluator-Free Best-of-N Selection for Open-Ended Generation

ModeX:无需评估器的开放生成最佳-N选择

Hyeong Kyu Choi, Sharon Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 ModeX提出一种无需外部评估器的最佳-N选择方法,通过识别主导语义共识的模态输出,提升开放生成任务的鲁棒性与效率。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07397 2026-04-10 cs.LG cs.AI

Data Warmup: Complexity-Aware Curricula for Efficient Diffusion Training

数据预热:面向高效扩散训练的复杂度感知课程学习

Jinhong Lin, Pan Wang, Zitong Zhan, Lin Zhang, Pedro Morgado

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Pittsburgh(匹兹堡大学) University at Buffalo, SUNY(纽约州立大学布法罗分校)

AI总结 本文提出Data Warmup方法,通过按复杂度从简到繁安排训练图像,提升扩散模型训练效率,实验表明其在ImageNet上显著提升生成质量并提前达到基线水平。

Comments CVPRW in the proceedings of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15496 2026-04-10 cs.CV cs.AI

Evaluating Low-Light Image Enhancement Across Multiple Intensity Levels

在多种光照级别下评估低光图像增强

Maria Pilligua, David Serrano-Lozano, Pai Peng, Ramon Baldrich, Michael S. Brown, Javier Vazquez-Corral

机构 * Computer Vision Center(计算机视觉中心) Universitat Autònoma de Barcelona(巴塞罗那自治大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) York University(约克大学)

AI总结 本文提出MILL数据集,用于评估图像增强算法在不同光照条件下的性能,通过改进方法在不同设备上提升了PSNR指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04638 2026-04-08 cs.AI cs.CL cs.IR

Advancing AI Research Assistants with Expert-Involved Learning

通过专家参与学习推进AI研究助手

Tianyu Liu, Simeng Han, Hanchen Wang, Xiao Luo, Pan Lu, Biqing Zhu, Yuge Wang, Keyi Li, Jiapeng Chen, Rihao Qu, Yufeng Liu, Xinyue Cui, Aviv Yaish, Yuhang Chen, Minsheng Hao, Chuhan Li, Kexing Li, Yinsheng Lu, Xinyu Wei, Qinzhe Xing, Antonia Panescu, Mengbo Wang, Vibha Annaswamy, Alicia Sanchez, Jack Cloherty, Arman Cohan, Hua Xu, Mark Gerstein, James Zou, Hongyu Zhao

机构 * Yale University(耶鲁大学) Broad Institute of MIT and Harvard(麻省理工学院-哈佛大学博德研究所) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学) Genentech(基因泰克) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) Harvard University(哈佛大学)

AI总结 本文提出ARIEL框架,通过专家验证任务评估大语言模型和多模态模型在生物医学领域的表现,发现提示工程和轻量级微调能提升文本覆盖,计算扩展策略增强视觉问答能力,构建了集成文本和视觉线索的AI助手,提出可检验的机理假设。

Comments 43 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18599 2026-04-07 cs.CV

Restore-R1: Efficient Image Restoration Agents via Reinforcement Learning with Multimodal LLM Perceptual Feedback

Restore-R1: 通过多模态大语言模型感知反馈的强化学习图像修复代理

Jianglin Lu, Yuanwei Wu, Ziyi Zhao, Hongcheng Wang, Felix Jimenez, Abrar Majeedi, Yun Fu

机构 * Amazon(亚马逊) Northeastern University(东北大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出Restore-R1框架,利用强化学习和多模态大语言模型感知反馈,高效解决图像修复问题,无需标注数据即可实现高质量修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03993 2026-04-07 cs.LG cs.AI

Can LLMs Learn to Reason Robustly under Noisy Supervision?

大语言模型能否在噪声监督下实现稳健推理?

Shenzhi Yang, Guangcheng Zhu, Bowen Song, Sharon Li, Haobo Wang, Xing Zheng, Yingfan Ma, Zhongqi Chen, Weiqiang Wang, Gang Chen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文研究了强化学习中可验证奖励在噪声标签下的鲁棒性问题,提出在线标签细化方法,通过动态修正潜在噪声标签提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03939 2026-04-07 stat.ME cs.LG stat.ML

Fused Multinomial Logistic Regression Utilizing Summary-Level External Machine-learning Information

融合外部机器学习信息的多元逻辑回归

Chi-Shian Dai, Jun Shao

机构 * National Cheng Kung University(国立成功大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出一种融合外部机器学习信息的多元逻辑回归框架,通过矩约束整合外部预测,解决数据质量问题并提升统计推断效率。

Comments 24 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03603 2026-04-07 cs.CV cs.LG eess.IV

Stochastic Generative Plug-and-Play Priors

随机生成性插件式先验

Chicago Y. Park, Edward P. Chandler, Yuyang Hu, Michael T. McCann, Cristina Garcia-Cardona, Brendt Wohlberg, Ulugbek S. Kamilov

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Washington University in St. Louis(圣路易斯华盛顿大学) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

AI总结 本文提出随机生成性插件式先验框架,通过引入噪声利用生成式扩散模型先验提升逆问题鲁棒性,实验显示在多通道MRI重建和大遮挡图像修复中优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17491 2026-04-07 cs.CV cs.LG

Robust Adaptation of Foundation Models with Black-Box Visual Prompting

基于黑盒视觉提示的模型鲁棒适应

Changdae Oh, Gyeongdeok Seo, Geunyoung Jung, Zhi-Qi Cheng, Hosik Choi, Jiyoung Jung, Kyungwoo Song

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Seoul(首尔市立大学) Yonsei University(延世大学) University of Washington(华盛顿大学)

AI总结 本文提出BlackVIP方法,通过协调器和SPSA-GC组件实现无需模型参数的PTM适应,通过实验展示其在不同领域和任务中的鲁棒性,同时提供理论分析支持视觉提示方法的鲁棒性。

Comments Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03121 2026-04-06 cs.CR cs.AI cs.CL

An Independent Safety Evaluation of Kimi K2.5

Kimi K2.5 的独立安全性评估

Zheng-Xin Yong, Parv Mahajan, Andy Wang, Ida Caspary, Yernat Yestekov, Zora Che, Mosh Levy, Elle Najt, Dennis Murphy, Prashant Kulkarni, Lev McKinney, Kei Nishimura-Gasparian, Ram Potham, Aengus Lynch, Michael L. Chen

机构 * Constellation Anthropic Fellows Program(Anthropic研究员项目) Brown University(布朗大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Imperial College London(伦敦帝国学院) University of Maryland, College Park(马里兰大学帕克分校) Georgia Institute of Technology(佐治亚理工学院) Bar Ilan University(巴伊兰大学) University of Toronto(多伦多大学) University of Oxford(牛津大学)

AI总结 Kimi K2.5作为开源大模型,在安全评估中显示出潜在风险,包括CBRNE滥用、网络安全漏洞及政治偏见,但其在拒绝恶意请求方面表现较弱,凸显开源模型的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02710 2026-04-06 cs.RO cs.AI cs.CV

V2X-QA: A Comprehensive Reasoning Dataset and Benchmark for Multimodal Large Language Models in Autonomous Driving Across Ego, Infrastructure, and Cooperative Views

V2X-QA:面向自动驾驶多视角的多模态大语言模型综合数据集与基准测试

Junwei You, Pei Li, Zhuoyu Jiang, Weizhe Tang, Zilin Huang, Rui Gan, Jiaxi Liu, Yan Zhao, Sikai Chen, Bin Ran

机构 * Department of Civil and Environmental Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校土木与环境工程系) Department of Civil and Architectural Engineering and Construction Management, University of Wyoming(怀俄明大学土木与建筑工程及施工管理系) School of Transportation, Southeast University(东南大学交通学院)

AI总结 本文提出V2X-QA数据集和基准测试,用于评估多模态大语言模型在自动驾驶中的多视角推理能力,揭示视角对性能的影响,并提出V2X-MoE模型以提升多视角推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25744 2026-04-06 cs.CV

MuRF: Unlocking the Multi-Scale Potential of Vision Foundation Models

MuRF:解锁视觉基础模型的多尺度潜力

Bocheng Zou, Mu Cai, Mark Stanley, Dingfu Lu, Yong Jae Lee

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出MuRF策略,通过多分辨率融合提升视觉基础模型的推理性能,适用于多种任务和模型家族。

Comments Project Page: https://murf-vfm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03909 2026-04-06 cs.CG cs.LG math.AT

Tensor Computation of Euler Characteristic Functions and Transforms

欧拉特征函数和变换的张量计算

Jessi Cisewski-Kehe, Brittany Terese Fasy, Alexander McCleary, Eli Quist

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Montana State University(蒙大拿州立大学)

AI总结 本文提出一种基于张量的框架,用于高效计算欧拉特征函数和变换,适用于任意维度的单纯复形和立方复形,并在GPU上实现显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02324 2026-04-03 cs.CL cs.AI cs.LG

Grounded Token Initialization for New Vocabulary in LMs for Generative Recommendation

为生成推荐系统中的新词汇提供基础性词 token 初始化

Daiwei Chen, Zhoutong Fu, Chengming Jiang, Haichao Zhang, Ran Zhou, Tan Wang, Chunnan Yao, Guoyao Li, Rui Cai, Yihan Cao, Ruijie Jiang, Fedor Borisyuk, Jianqiang Shen, Jingwei Wu, Ramya Korlakai Vinayak

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) LinkedIn Corporation(领英公司) Northeastern University(东北大学) University of California, Davis(加州大学戴维斯分校)

AI总结 本文提出GTI方法,通过在预训练嵌入空间中语义地初始化新词汇,提升生成推荐系统性能,优于传统均值初始化和辅助任务适应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06763 2026-04-03 cs.CV cs.AI

SafePLUG: Empowering Multimodal LLMs with Pixel-Level Insight and Temporal Grounding for Traffic Accident Understanding

SafePLUG: 通过像素级洞察和时间锚定赋能多模态大语言模型以理解交通事故

Zihao Sheng, Zilin Huang, Yansong Qu, Jiancong Chen, Yuhao Luo, Yen-Jung Chen, Yue Leng, Sikai Chen

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Purdue University(普渡大学) Google(谷歌)

AI总结 本文提出SafePLUG框架,通过像素级理解和时间锚定提升多模态大语言模型在交通事故分析中的能力,引入新数据集并实现区域问答、像素分割、时间事件定位等任务的高性能表现。

Comments The code, dataset, and model checkpoints will be made publicly available at: https://zihaosheng.github.io/SafePLUG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01607 2026-04-03 cs.DC cs.AI

ModTrans: Translating Real-world Models for Distributed Training Simulator

ModTrans:用于分布式训练模拟器的现实世界模型翻译

Yi Lyu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 ModTrans通过将现实世界模型转换为分布式训练模拟器输入,解决了现有模拟器无法导入真实模型的问题,降低了ML研究者的使用门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01606 2026-04-03 stat.ML cs.LG math.OC

Random Coordinate Descent on the Wasserstein Space of Probability Measures

在概率测度的Wasserstein空间上的随机坐标下降

Yewei Xu, Qin Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出随机坐标下降框架,针对Wasserstein流形优化问题,提出RWCD和RWCP方法,适用于复合目标,理论分析显示其在非凸、Polyak-Łojasiewicz及仿射凸条件下具有收敛性,实验表明在病态能量下比传统全梯度方法更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏