A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning
多轮代理强化学习实践指南
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; NVIDIA(英伟达)
AI总结 本文提出多轮代理强化学习的训练方法,通过分析环境、奖励和策略三个支柱,总结出训练LLM代理的实践指南。
高校专区
多轮代理强化学习实践指南
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; NVIDIA(英伟达)
AI总结 本文提出多轮代理强化学习的训练方法,通过分析环境、奖励和策略三个支柱,总结出训练LLM代理的实践指南。
通过语言模型构建编译器低资源语言方言的模糊测试器
机构 * University of California San Diego(加州大学圣地亚哥分校) ; Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所)
AI总结 通过语言模型构建编译器低资源语言方言的模糊测试器,利用语法和覆盖引导技术生成种子输入,提升测试效率和覆盖率。
iFinder: 结构化零样本视觉基于LLM的地面定位用于行车记录仪视频推理
机构 * NEC Laboratories, America(NEC美国实验室) ; University of California, Riverside(加州大学河滨分校) ; University of California, San Diego(加州大学圣地亚哥分校)
AI总结 iFinder通过结构化语义接地框架,利用行车记录仪视频中的关键线索提升LLM在驾驶视频推理中的性能。
Comments Accepted at NeurIPS 2025
双目标强化学习与新型哈密顿-雅可比-贝尔曼公式
机构 * University of California, San Diego(加州大学圣地亚哥分校)
AI总结 本文提出基于哈密顿-雅可比-贝尔曼公式的双目标强化学习方法,通过分解方法解决RAA和RR问题,改进了策略性能。
基于局部敏感哈希的高效点变换器用于带电粒子重建
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Purdue University(普渡大学) ; University of Washington(华盛顿大学) ; Princeton University(普林斯顿大学) ; University of California San Diego(加州大学圣地亚哥分校)
AI总结 HEPTv2通过轻量级解码器消除聚类步骤,实现高效端到端推理,提升带电粒子轨迹重建的性能和效率。
Comments Accepted to NeurIPS 2025 Machine Learning and the Physical Sciences Workshop
双元子网络:映射到下一个标记的Transformer语言模型
机构 * Department of Cognitive Science University of California San Diego(认知科学系,加州大学圣地亚哥分校)
AI总结 研究发现Transformer语言模型中存在双元子网络,这些子网络能基于当前标记预测下一个标记,且对模型性能至关重要。
Comments NeurIPS 2025
NavMapFusion: 基于扩散的导航地图融合用于在线向量化的高精度地图构建
机构 * Mercedes-Benz Research & Development North America, USA(梅赛德斯-奔驰北美研究与开发) ; University of Stuttgart, Germany(斯图加特大学) ; University of California, San Diego, USA(加州大学圣地亚哥分校) ; University of Southampton, United Kingdom(南安普顿大学)
AI总结 NavMapFusion通过结合低保真先验与高保真传感器数据,利用扩散模型实现在线高精度地图构建,提升环境表示的准确性和实时性。
Comments Accepted to 2026 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV 2026)
超越最活跃激活:高效且可靠的自动解释性众包评估
机构 * UC San Diego(斯克里普斯海洋研究所)
AI总结 本文提出两种技术,通过模型引导的重要性采样和贝叶斯评分聚合,实现高效且可靠的自动解释性众包评估,显著降低评估成本并提升结果准确性。
ActiveInitSplat: 活动图像选择如何帮助高斯溅射
机构 * University of California San Diego(加州大学圣地亚哥分校) ; University of Minnesota(明尼苏达大学)
AI总结 ActiveInitSplat通过主动选择图像来优化高斯溅射的初始化和训练,提升了渲染性能。
基于视频科学基准的视频生成科学理解与推理评估
机构 * University of California, San Diego(加州大学圣地亚哥分校)
AI总结 VideoScience-Bench是首个评估视频模型科学理解和推理能力的基准测试,通过200个精心设计的提示评估模型在物理和化学领域的科学推理能力。
时空金字塔流匹配用于气候模拟
机构 * Stanford University(斯坦福大学) ; Cornell University(康奈尔大学) ; University of California, San Diego(加州大学圣地亚哥分校)
AI总结 本文提出时空金字塔流匹配方法,用于高效、准确的多时间尺度气候模拟,并通过ClimateSuite数据集验证其有效性。
hls4ml:一种灵活、开源的深度学习在可重构硬件上加速平台
机构 * Purdue University(普渡大学) ; ETH Zurich(苏黎世联邦理工学院) ; California Institute of Technology(加州理工学院) ; Fermi National Accelerator Lab(费米国家加速器实验室) ; European Organization for Nuclear Research (CERN)(欧洲核子研究中心) ; University of California San Diego(加州大学圣地亚哥分校) ; Imperial College London(伦敦帝国理工学院) ; National Technical University of Athens(希腊国家技术大学) ; University of Geneva(日内瓦大学) ; Altera Corporation(阿尔特拉公司) ; Discovery Partners Institute(发现伙伴研究所) ; Massachusetts Institute of Technology(麻省理工学院) ; National Yang Ming Chiao Tung University(国立阳明交通大学) ; Northwestern University(西北大学) ; Princeton University(普林斯顿大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Michigan(密歇根大学) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Washington(华盛顿大学)
AI总结 hls4ml是一种开源平台,用于将深度学习模型转换为可重构硬件上的HLS代码,以实现低延迟、低资源消耗的ML推理加速。
学习大规模多任务世界模型用于连续控制
机构 * University of California San Diego(加州大学圣地亚哥分校)
AI总结 Newt通过大规模预训练和在线交互,实现智能体在数百个任务上的多任务学习,提升连续控制的效率和适应性。
Comments Webpage: https://www.nicklashansen.com/NewtWM
AirSim360:无人机视角下的全景模拟平台
机构 * Insta360 Research(Insta360研究机构) ; Wuhan University(武汉大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; Nanyang Technological University(南洋理工大学) ; University of California, Merced(加州大学默塞德分校) ; Shenzhen University(深圳大学)
AI总结 AirSim360 是一个基于无人机视角的全景模拟平台,通过渲染对齐的数据标注、交互式行人建模和自动轨迹生成,实现全方位场景采样和空间智能研究。
Comments Project Website: https://insta360-research-team.github.io/AirSim360-website/
一种用于自动驾驶赛车的模拟基准测试平台
机构 * UC San Diego(斯克里普斯海洋研究所) ; TU-Graz(格拉茨技术大学) ; Unimore(乌尔比诺大学) ; Know-Center GmbH(Know-Center公司)
AI总结 本文提出基于Assetto Corsa的赛车模拟平台,用于测试和评估强化学习与模型预测控制算法,结合人类驾驶数据集和离线RL设置,推动自动驾驶赛车技术发展。
Comments Project page and code can be found at: \url{https://assetto-corsa-gym.github.io/}
Journal ref Advances in Neural Information Processing Systems 37 (NeurIPS 2024)
ELR-1000:一个社区生成的濒危印度-原住民语言数据集
机构 * Karya ; UC San Diego ; Microsoft Corporation(微软公司)
AI总结 ELR-1000数据集通过众包方式收集10种濒危印度-原住民语言的传统食谱,评估LLMs翻译表现,发现提供文化背景信息可显著提升翻译质量,推动公平的文化敏感语言技术发展。
Comments Accepted at AACL 2025 (Main)
DeepPersona: 一个用于扩展深度合成人设的生成引擎
机构 * UCSD(加州大学圣地亚哥分校) ; KU Leuven(鲁汶大学) ; SJTU(上海交通大学) ; University of Michigan(密歇根大学) ; Denison University(德尼森大学) ; Amazon(亚马逊) ; Meta
AI总结 DeepPersona通过双阶段分类学引导方法生成深度合成人设,提升LLM个性化和人类模拟的准确性与多样性。
Comments add an author[Update], 12 pages, 5 figures, accepted at LAW 2025 Workshop (NeurIPS 2025) Project page: https://deeppersona-ai.github.io/
Journal ref LAW 2025 Workshop, NeurIPS 2025
TRiCo:三元博弈协同训练用于鲁棒半监督学习
机构 * University of Warwick(沃里克大学) ; Emory University(埃默里大学) ; University of Minnesota – Twin Cities(明尼苏达大学双城分校) ; ANU(澳大利亚国立大学) ; Brown University(布朗大学) ; Columbia University(哥伦比亚大学) ; UCSD(加州大学圣地亚哥分校) ; Zhejiang University(浙江大学)
AI总结 TRiCo通过三元博弈协同训练框架提升半监督学习的鲁棒性和性能,实现更稳健的伪标签选择和决策边界优化。
Comments Accepted by NeurIPS 2025
通过神经-注意力分解解释基于ResNet的CLIP
机构 * UC San Diego(圣迭戈大学) ; UC Berkeley(伯克利大学)
AI总结 通过神经-注意力分解解释CLIP-ResNet中的神经元,实现无训练语义分割和分布偏移监控
Comments Accepted at NeurIPS 2025 Workshop on Mechanistic Interpretability. Project page: https://edmundbu.github.io/clip-neur-attn/
量化大语言模型生成内容中的认知偏差诱导
机构 * UC San Diego(加州大学圣地亚哥分校)
AI总结 研究量化了大语言模型生成内容中的认知偏差,发现其在摘要和事实核查任务中存在框架偏差、幻觉和优先偏差,并提出针对性干预方法以减少对人类决策的影响。
Comments 21 pages (including references and appendix), 3figures. accepted to AACL 2025
通过隐式触觉校准确保视觉引导的机器人操作中的力安全
机构 * Sun Yat-sen University(中山大学) ; UC San Diego(加州大学圣地亚哥分校) ; Zhejiang University(浙江大学)
AI总结 本文提出SafeDiff框架,通过隐式触觉校准提升机器人操作中的力安全,结合视觉和触觉数据优化状态规划,减少有害力风险。
Comments Website URL: see https://i-am-future.github.io/safediff/
基于证据的模式规范化用于时间表式推理
机构 * Arizona State University(亚利桑那州立大学) ; UC San Diego(加州大学圣地亚哥分校)
AI总结 本文提出基于SQL的证据引导模式规范化方法,通过优化模式设计提升时间表式推理的问答精度,实验结果显示在EM指标上提升了16.8%。
ThetaEvolve:开放问题的测试时间学习
机构 * Microsoft(微软公司) ; University of Washington(华盛顿大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; University of California, San Diego(加州大学圣地亚哥分校)
AI总结 ThetaEvolve通过测试时间强化学习提升开放问题求解能力,实现开源模型在数学优化问题上的新突破。
Comments 30 pages, link: https://github.com/ypwang61/ThetaEvolve
CoFiRec: 生成推荐中的粗到细分词
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Meta ; University of California San Diego(加州大学圣地亚哥分校)
AI总结 CoFiRec通过粗到细分词提升生成推荐效果,有效捕捉用户意图演变。
MTR-VP: 通过基于上下文的图像编码和多轨迹预测实现端到端轨迹规划
机构 * Machine Intelligence, Interaction, and Imagination (Mi 3 ) Laboratory(机器智能、交互与想象实验室) ; University of California, Merced(加州大学默塞德分校) ; Laboratory for Intelligent & Safe Automobiles (LISA)(智能与安全汽车实验室) ; University of California, San Diego(加州大学圣地亚哥分校)
AI总结 MTR-VP通过基于上下文的图像编码和多轨迹预测实现端到端轨迹规划,利用交叉注意力提升规划性能。
Comments 8 pages, 3 figures, 4 tables
开始理解(s):利用词汇歧义开发注意力专业化探测
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Rutgers University - Newark(新泽西州立大学罗格斯-纽ark分校)
AI总结 通过词汇歧义研究,发现不同大小的Transformer模型在消歧任务中存在不同的注意力机制发展特性。
Comments 13 pages (main text), 5 figures (main text) 6 pages (appendix), 6 figures (appendix), journal submission to TACL ("a" decision: pre-MIT Press publication version)
学习插件式记忆以指导视频扩散模型
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; The University of Tokyo(东京大学)
AI总结 本文提出DiT-Mem,通过学习插件式记忆增强视频扩散模型的物理规则遵循和视频保真度。
staggered 环境重置提升大规模并行 on-policy 强化学习
机构 * Harvard University(哈佛大学) ; UC San Diego(圣迭戈大学)
AI总结 staggered 环境重置通过增加时间多样性减少非平稳性,提升大规模并行 on-policy 强化学习的样本效率和收敛速度
ACE-F: 一种具有力反馈的跨体折叠系统用于灵巧远程操作
机构 * UC San Diego(加州大学圣地亚哥分校)
AI总结 ACE-F是一种具有力反馈的跨体折叠远程操作系统,通过逆运动学和软控制器流水线实现跨体泛化和精确控制,提升机器人灵巧操作的直观性和效率。
从分数匹配到局部内在维度的一种联系
机构 * PNNL(太平洋西北国家实验室) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; UC San Diego(圣地亚哥大学)
AI总结 本文提出利用去噪分数匹配损失作为局部内在维度估计器,通过理论分析和实验验证其在高维数据中的有效性与可扩展性。
Comments Accepted to the 3rd SPIGM Workshop at NeurIPS 2025