arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Washington(华盛顿大学)

2026-08-18 至 2026-08-18 共收录 5
2608.12253 2026-08-18 cs.CL cs.AI cs.LG 版本更新

One Frozen Simulator Is Not Enough: Simulator Collapse in Multi-Agent RL

单个冻结模拟器不够:多智能体强化学习中的模拟器崩溃问题

Simon Yu, Nicholas Tomlin, Marwa Abdulhai, Ximing Lu, Derek Chong, Abe Hou, Dilara Soylu, Sergey Levine, Christopher D. Manning, Weiyan Shi

机构 * Northeastern University(东北大学) New York University(纽约大学) UC Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

AI总结 针对人机交互多智能体强化学习中单个LLM模拟器导致的策略泛化缺陷,提出Verbalized Sampling和Co-Training两种方案,在多轮基准测试和真实用户研究中显著提升了性能,发布了开源框架SCOPE。

Comments 42 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22924 2026-08-18 cs.CV 版本更新

Layering Virtual Try-On

分层虚拟试穿

Chun Feng, Bowei Chen, Mengyi Shan, Ira Kemelmacher-Shlizerman

机构 * University of Washington(华盛顿大学)

AI总结 研究针对现实中服装分层搭配的虚拟试穿难题,提出LVTON方法。先通过自动数据生成管道训练获取一般VTON先验知识,再在专用数据集微调学习分层逻辑,在LVTON基准及传统VTON基准上取得优异成果,展现零样本能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03988 2026-08-18 cs.AI 版本更新

Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models

想象感知标记增强多模态语言模型的空间推理能力

Mahtab Bigverdi, Linjie Li, Weikai Huang, Yiming Liu, Jaemin Cho, Tuhin Kundu, Chris Dongjoo Kim, Zelun Luo, Jieyu Zhang, Linda Shapiro, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(Allen人工智能研究所) Microsoft(微软) OpenAI(开放人工智能研究院)

AI总结 提出想象感知标记(IPT)作为中间感知表征,通过监督学习提升多模态语言模型在不可见视角推理、遮挡路径追踪等空间推理任务上的性能,在三个新构建的数据集上优于文本思维链训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04535 2026-08-18 cs.LG cs.DC 版本更新

FDA-Opt: Federated Fine-Tuning via Dynamic Update Schedules

高效通信的联邦微调

Michael Theologitis, Vasilis Samoladas, Antonios Deligiannakis

机构 * University of Washington(华盛顿大学) Technical University of Crete(希腊塞萨洛尼基技术大学)

AI总结 本文提出FDA-Opt算法,解决联邦学习中参数通信频繁和刚性的难题,通过统一FDA和FedOpt方法,提升语言模型在下游NLP任务中的微调性能。

Comments CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24575 2026-08-18 cs.CV cs.AI 版本更新

VFIG: Vectorizing Complex Figures in SVG with Vision-Language Models

VFIG:利用视觉-语言模型矢量化SVG中的复杂图形

Qijia He, Xunmei Liu, Hammaad Memon, Ziang Li, Zixian Ma, Jaemin Cho, Zhongzheng Ren, Daniel S Weld, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能 Allen 机构) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文提出VFIG,一种基于视觉-语言模型的矢量化方法,通过大规模数据集和分层训练策略,实现复杂图形到SVG的高保真转换,并在基准测试中取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏