RN-D: Discretized Categorical Actors for On-Policy Reinforcement Learning
RN-D:用于同策略强化学习的离散化分类演员
机构 * University of California San Diego, La Jolla, USA(加州大学圣地亚哥分校)
AI总结 提出离散化分类演员替代高斯演员,结合正则化网络形成RN-D,在同策略RL中实现连续控制的最优性能。
Comments Accepted by ICML 2026
高校专区
RN-D:用于同策略强化学习的离散化分类演员
机构 * University of California San Diego, La Jolla, USA(加州大学圣地亚哥分校)
AI总结 提出离散化分类演员替代高斯演员,结合正则化网络形成RN-D,在同策略RL中实现连续控制的最优性能。
Comments Accepted by ICML 2026
OpenThoughts-Agent: 智能体模型的数据配方
机构 * UC Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; JSC(于利希超级计算中心) ; LAION ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Bespoke Labs ; Laude Institute ; UCLA(加州大学洛杉矶分校) ; Harvard University & Harvard Medical School(哈佛大学与哈佛医学院) ; TU Munich & Munich Center for Machine Learning(慕尼黑工业大学与慕尼黑机器学习中心) ; New York University(纽约大学) ; Medical University of South Carolina(南卡罗来纳医科大学) ; The LLM Data Company ; BenchFlow ; Independent Researcher(独立研究员) ; Northeastern University(东北大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; University of Washington(华盛顿大学) ; TU Darmstadt(达姆施塔特工业大学) ; University of Southern California(南加州大学) ; UC San Diego(加州大学圣地亚哥分校) ; Amazon(亚马逊) ; Microsoft(微软) ; Korea University(高丽大学) ; Cornell Tech(康奈尔科技) ; University of Michigan(密歇根大学)
AI总结 提出全开放数据筛选流水线,通过100多次消融实验研究任务来源与多样性,构建10万样本训练集,在7个智能体基准上平均44.8%准确率,较最强开源模型提升3.9个百分点。
MEMPROBE:通过隐藏用户状态恢复探测长期智能体记忆
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; KU Leuven(库尔勒大学) ; UC San Diego(圣地亚哥大学)
AI总结 提出MEMPROBE基准,通过从智能体记忆重建隐藏用户状态来直接评估长期记忆,发现任务完成与记忆可恢复性是不同的能力。
论大语言模型评估中提示排序的稳定性
机构 * University of Amsterdam(阿姆斯特丹大学) ; Northeastern University(东北大学) ; University of California San Diego(加州大学圣迭戈分校) ; Duke University(杜克大学)
AI总结 研究提示排序在常见评估变化下的稳定性,发现顶级提示常变导致选择不可靠,提出基于置信下限的稳定性感知选择策略以提高鲁棒性。
神经网络表示在叠加中的相似性
机构 * Cold Spring Harbor Laboratory(冷泉港实验室) ; UC San Diego(加州大学圣地亚哥分校) ; Anthropic(Anthropic公司) ; New York University Flatiron Institute(纽约大学Flatiron研究所)
AI总结 研究线性对齐度量在神经网络叠加表示中的失效问题,通过理论推导和稀疏自编码器实验证明对齐度量受投影Gram矩阵影响,并展示基于恢复潜在特征的度量能正确反映特征共享。
Comments 17 pages, 4 figures
LLM评估者真的是自恋者吗?对自我偏好评估的健全性检查
机构 * Department of Machine Learning, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学机器学习系) ; Department of Computer Science and Engineering, University of California San Diego, La Jolla, CA, USA(加州大学圣地亚哥分校计算机科学与工程系) ; Department of Computer Science, University of Virginia, Charlottesville, VA, USA(弗吉尼亚大学计算机科学系) ; Martian Research, San Francisco, California, USA(火星研究公司) ; Apart Research, San Francisco, California, USA(Apart研究公司)
AI总结 通过比较评估者自我评价与评价其他模型时的投票分布,发现仅51%的先前结果具有统计显著性,表明自我偏好主要由评估者质量而非自恋驱动。
Comments ICML 2026 Main
基于模型的鲁棒方法用于具有未知Lévy过程动力学的连续时间策略评估
机构 * Department of Mathematics, University of California, San Diego, CA 92093, United States(加州大学圣地亚哥分校数学系) ; Department of Statistics and Data Science, University of California, Los Angeles, CA 90095, United States(加州大学洛杉矶分校统计学与数据科学系)
AI总结 针对含布朗和Lévy噪声的连续时间策略评估问题,提出基于模型的框架,通过最大似然估计与迭代尾部校正机制恢复未知系数,并建立策略评估误差的理论界。
Comments 32 pages, 10 figures
医疗AI的全局日志
机构 * Harvard Medical School(哈佛医学院) ; University of Oxford(牛津大学) ; Institute for Ethics in AI(人工智能伦理研究所) ; Cosmos Institute(宇宙研究所) ; Harvard Medical School and Clalit Research Institute(哈佛医学院和Clalit研究机构) ; University of California, San Diego(加州大学圣地亚哥分校) ; Joan and Irwin Jacobs Center for Health Innovation(乔安和伊万·雅各布健康创新中心) ; Oxford University Clinical Research Unit(牛津大学临床研究中心) ; Icahn School of Medicine at Mount Sinai(辛格纳医学中心) ; The Hasso Plattner Institute for Digital Health at Mount Sinai(辛格纳医学中心数字健康研究所) ; ETH Zurich(苏黎世联邦理工学院) ; University Hospital, University of Bern(伯恩大学医院) ; Beth Israel Deaconess Medical Center(贝斯以色列医疗中心) ; Google DeepMind(谷歌DeepMind) ; The Mount Sinai AI Assurance Lab(辛格纳医学中心人工智能保证实验室) ; University of Birmingham(伯明翰大学) ; PATH(PATH组织) ; Seattle Children’s Hospital(西雅图儿童医院) ; Department of Pediatrics, University of California, San Diego(加州大学圣地亚哥分校儿科部) ; Kaiser Foundation Health and Hospitals(凯撒基金会健康与医院) ; e-Patient Dave, LLC(e-Patient Dave公司) ; Regional Office for Europe, World Health Organization(世界卫生组织欧洲地区办公室) ; University of Malta(马耳他大学) ; Centre for Tropical Medicine and Global Health, University of Oxford(牛津大学热带医学与全球健康中心) ; Healthcare Information and Management Systems Society(医疗信息与管理系统协会) ; Clalit Research Institute, Innovation Division, Clalit Health Services(Clalit研究机构创新部门,Clalit健康服务) ; Microsoft Research(微软研究院) ; Gates Foundation(比尔及梅琳达·盖茨基金会) ; Computational Health Informatics Program, Boston Children’s Hospital(波士顿儿童医院计算健康信息学项目)
AI总结 提出MedLog协议,为医疗AI系统提供事件级日志记录,包含九个核心字段,并在多个部署中验证其监测模型行为、工作流交互及下游结果的能力。
Comments MedLog website: https://medlogprotocol.ai
基于自注意力的策略梯度用于无模型分布式非线性多智能体博弈
机构 * Department of Computer Science and Technology, University of Cambridge(计算机科学与技术系,剑桥大学) ; Department of Electrical and Computer Engineering, University of California San Diego(电气与计算机工程系,加州大学圣地亚哥分校) ; RoPeRt group, at DIIS - I3A, Universidad de Zaragoza(RoPeRt组,DIIS - I3A,阿拉贡大学)
AI总结 提出一种分布式策略结构,通过策略梯度学习,利用自注意力层处理时变通信拓扑,解决无模型非线性多智能体博弈问题,在多种场景中表现优异。
Comments The paper has been accepted and will be presented at IEEE/RSJ IROS 2026
打破镜像:基于激活的LLM评估者自我偏好缓解方法
机构 * University of Virginia(弗吉尼亚大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; Carnegie Mellon University(卡内基梅隆大学) ; School of Computer Science(计算机科学学院)
AI总结 针对LLM评估者自我偏好偏见,提出轻量级引导向量方法,在推理时无需重训练即可将不公正自我偏好降低97%,但存在稳定性问题。
Comments Presented at {Mechanistic Interpretability, Evaluations, Reliable-ML} Workshops, NeurIPS 2025
无需发送视频即可识谎:隐私保护的多模态欺骗检测
机构 * University of California, San Diego(加州大学圣迭戈分校) ; Case Western Reserve University, Ohio(凯斯西储大学) ; WhissleAI, USA(WhissleAI(美国))
AI总结 提出Whissle方法,通过设备端提取文本、情感、行为等紧凑摘要,在无需传输原始视频的情况下实现与云端模型相当的欺骗检测性能(AUC 0.741),并揭示先前75%准确率存在说话者泄露问题。
对话式LLM代理的黑盒取证
机构 * University of California, San Diego(加州大学圣地亚哥分校)
AI总结 研究通过非对抗对话识别对话代理的基座模型(归因)和系统提示(指纹识别),归因准确率达98%,指纹识别对未见提示的AUC达0.943。
概念约束的提示学习用于少样本CLIP适应
机构 * University of California, San Diego(加州大学圣迭戈分校) ; Georgia Institute of Technology(佐治亚理工学院) ; Independent Researcher(独立研究员)
AI总结 提出概念约束提示学习(CCPL),通过轻量级正则化框架将可学习类提示锚定到冻结的概念级文本原型,提升少样本CLIP的基类到新类泛化能力。
$\phi$-Scene: 物理驱动的图像到3D场景重建
机构 * University of California San Diego(加州大学圣地亚哥分校)
AI总结 提出$\phi$-Scene方法,将单图像3D场景重建视为拓扑驱动的物理组装过程,通过SDF优化和刚体仿真解决穿透与不稳定接触问题,在3D-Front数据集上取得最优性能。
Comments Project page: https://phi-scene.github.io/
记住你做了什么?:学习部分可观察物体操作的行为记忆
机构 * UC San Diego(加州大学圣地亚哥分校)
AI总结 针对长时域、接触式操作中的部分可观测问题,提出压缩动作记忆策略(CAMP),通过自监督学习动作历史压缩表示,隐式追踪任务进度并从失败中学习,在多个真实和仿真任务上超越现有方法。
Comments Project website: robo-camp.github.io
Vesta: 一种通用具身推理模型
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California, San Diego(加州大学圣地亚哥分校) ; The Hong Kong Polytechnic University(香港理工大学) ; University of Michigan(密歇根大学) ; Nanyang Technological University(南洋理工大学) ; Johns Hopkins University(约翰霍普金斯大学) ; University of Tübingen(图宾根大学)
AI总结 提出统一的基础模型Vesta,整合定位、空间推理、导航和长时规划能力,通过大规模空间感知语料库和简单多模态记忆机制,在多个基准上平均优于专用模型20%以上,在真实机器人任务中成功率提升35%。
MemoryVAM:将记忆融入视频动作模型以实现机器人操作
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Nirvana Robotics(涅槃机器人) ; University of California, San Diego(加州大学圣迭戈分校) ; University of Utah(犹他大学)
AI总结 提出MemoryVAM,通过Recap-Cue模块将情景记忆注入视频世界模型策略,解决长时域操作中的非马尔可夫性问题,在LIBERO-Mem和真实机器人任务上显著提升成功率。
Comments Project page: https://MemoryVAM.github.io/
高斯设计逻辑回归中梯度下降的有限样本性能
机构 * Department of Mathematics, University of Maryland, College Park(数学系,马里兰大学,College Park分校) ; Halıcıoğlu Data Science Institute, UC San Diego(Halıcıoğlu数据科学研究所,加州大学圣地亚哥分校)
AI总结 针对高斯设计逻辑回归的参数估计问题,证明梯度下降在线性收敛到统计误差率O(√(‖θ*‖₂⁵d/n)),并建立大步长下的更快局部线性收敛,通过近似可逆性条件分析。
数据受限语言模型预训练的数据增强
机构 * UC San Diego(加州大学圣地亚哥分校) ; RMIT University(皇家墨尔本理工大学)
AI总结 针对数据受限下标准自回归预训练严重过拟合的问题,提出三类数据增强方法(token级噪声、序列排列、目标偏移预测),有效降低验证损失并支持数百epoch训练。
面向高效视频大语言模型的sink-token感知剪枝:用于细粒度视频理解
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国高级科学技术研究院) ; Oracle ; University of California, San Diego(加州大学圣地亚哥分校) ; Electronics and Telecommunications Research Institute (ETRI)(电子电信研究院)
AI总结 本文提出Sink-Token-aware Pruning方法,通过识别并抑制semantically uninformative tokens,提升细粒度视频理解性能,在多种基准测试中表现优异。
Comments ECCV 2026
Dextra之家:为灵巧手的跨具身体验共设计
机构 * University of California, San Diego(加州大学圣迭戈分校) ; University of California, Santa Barbara(加州大学圣巴巴拉分校)
AI总结 本文提出一种共设计框架,通过学习任务特定的手形态和互补的灵巧控制策略,实现机器人手的高效设计与控制,可在24小时内完成设计、训练、制造和部署。
Comments Code and videos: https://an-axolotl.github.io/HouseofDextra/
Journal ref International Conference on Learning Representations (ICLR), 2026
StructSAM: 面向分割一切模型的结构与谱保持令牌合并
机构 * University of Stuttgart(斯图加特大学) ; DFKI ; Max Planck Research School(马克斯·普朗克研究学校) ; University of Oldenburg(奥尔登堡大学) ; Technical University of Darmstadt(达姆施塔特技术大学) ; VinRobotics ; VinUniversity(Vin大学) ; Aalto University(阿莱大学) ; Queensland University of Technology(昆士兰技术大学) ; HUST(华中科技大学) ; Technical University of Denmark(丹麦技术大学) ; University of Arkansas(阿肯色大学) ; UC San Diego(圣地亚哥大学) ; Stanford University(斯坦福大学)
AI总结 针对SAM系列模型,提出StructSAM框架,通过基于梯度能量的令牌评分、网格平坦度筛选和合并-恢复机制,在保持边界和提示信息的同时减少计算量,实现25-30% FLOPs降低且性能损失极小。
Comments Second version
统一思维还是孤立代理?探索认知负荷理论下LLM的协调
机构 * Hong Kong University of Science and Technology(香港科技大学) ; University of California San Diego(加州大学圣地亚哥分校) ; Hong Kong Polytechnic University(香港理工大学)
AI总结 受认知负荷理论启发,提出CoThinker多智能体框架,通过智能体分工和结构化通信降低认知负荷,在复杂推理任务上提升性能,但在低负荷任务上协调开销占优。
从人类演示生成机器人手
机构 * University of California San Diego(加州大学圣迭戈分校) ; Amazon Frontier AI & Robotics(亚马逊前沿人工智能与机器人)
AI总结 提出数据驱动框架,利用人类日常操作中超过400万帧指尖运动数据,通过逆运动学匹配指尖位置,优化树状结构机器人手的设计,生成通用6自由度手和低自由度任务专用手,并训练强化学习智能体加速设计搜索。
多模态概念瓶颈模型
机构 * UC San Diego(加州大学圣地亚哥分校)
AI总结 提出多模态概念瓶颈模型(MM-CBM),利用双概念瓶颈层对齐图像和文本嵌入,实现可解释的零样本分类和图像检索,在四个基准上平均准确率提升高达51.26%。
Comments Present at NeurIPS 2025 Mechanistic Interpretability Workshop
流形赌博机:大语言模型潜在几何上的贝叶斯课程学习
机构 * University of California, San Diego(加州大学圣迭戈分校)
AI总结 提出贝叶斯流形课程(BMC)框架,将问题采样建模为流形结构赌博机问题,通过层次任务树和贝叶斯学习引导采样,平衡学习信号、多样性和实用性。
Comments Webpage: https://darrienmckenzie.com/manifold-bandits/
HEPTv2:用于带电粒子重建的端到端高效点变换器
机构 * School of Electrical and Computer Engineering, Georgia Institute of Technology(佐治亚理工学院电气与计算机工程学院) ; Department of Physics and Astronomy, Purdue University(普渡大学物理与天文学系) ; Department of Physics, University of California San Diego(加州大学圣地亚哥分校物理系) ; Department of Physics, University of Washington(华盛顿大学物理系)
AI总结 提出HEPTv2,一种端到端点变换器架构,通过局部敏感哈希编码和扇区化解码,无需图构建即可从探测器击中点直接重建粒子轨迹,在TrackML上以0.8%假率实现98.6%追踪效率,延迟仅15ms。
太阳高能粒子预测的机器学习模型综述
机构 * Department of Astrophysical Sciences, Princeton University, Princeton, NJ, USA ; Computational Physics Branch, NASA Ames Research Center, Moffett Field, CA, USA ; Department of Computer Science, Utah State University, Logan, UT, USA ; Space Radiation Analysis Group, NASA Johnson Space Center, Houston, TX, USA ; Johns Hopkins Applied Physics Lab, 11100 Johns Hopkins Rd, Laurel, MD 20723, United States ; Research Center for Astronomy ; Applied Mathematics of the Academy of Athens, 4 Soranou Efesiou Street, Athens 11527, Greece ; Institute for Astronomy, Astrophysics, Space Applications ; Southwest Research Institute, Boulder, CO, USA ; Space Science Center, University of New Hampshire, Durham, NH, USA ; Department of Physics, New Jersey Institute of Technology, Newark, NJ, USA ; Astronomy Department, Georgia State University, Atlanta, GA, USA ; Department of Computer Science, Princeton University, Princeton, NJ, USA ; Department of Mathematics, Rowan University, Glassboro, NJ, USA ; Astronomy, California Institute of Technology, Pasadena, CA, USA ; Department of Physics, National ; Kapodistrian University of Athens, Athens, Greece ; School of Electrical ; Computer Engineering, Technical University of Crete, Chania, Greece ; Department of Astronomy ; Meteorology, Faculty of Science, Al-Azhar University, Cairo, Egypt ; Space Sciences Lab, University of California, Berkeley, CA, USA ; Research Consultancy, Athens, Greece ; Institute for Space Astrophysics ; Department of Physics ; Astronomy, Georgia State University, Atlanta, GA 30303, USA ; Aryabhatta Research Institute of Observational Sciences (ARIES), Manora Peak, Nainital-263001, Uttarakhand, India ; Department of Computer Science, Oxford University, Oxford, England ; Southwest Research Institute, San Antonio, TX, USA ; Computer Science Department, New Jersey Institute of Technology, Newark, NJ, USA ; Department of Physics, University of California San Diego, La Jolla, CA 92093, USA ; Department of Computer Science, Georgia State University, Atlanta, GA 30303, USA ; Department of Climate ; Engineering, University of Michigan, Ann Arbor, MI, USA ; Department of Statistics, University of Michigan, Ann Arbor, MI, USA ; Department of Electrical Engineering ; Computer Science, Florida Institute of Technology, Melbourne, FL, USA ; Astrophysics Section, School of Cosmic Physics, Dublin Institute for Advanced Studies, DIAS Dunsink Observatory, Dublin D15 XR2R, Ireland ; Institute of Astronomy of the Bulgarian Academy of Sciences, Sofia, Bulgaria ; Center for Solar-Terrestrial Research, New Jersey Institute of Technology, Newark, NJ 07102, USA ; Cooperative Programs for the Advancement of Earth System Science, University Corporation for Atmospheric Research, Boulder, CO, USA ; CIRES, University of Colorado Boulder, Boulder, CO, USA ; Space Weather Prediction Center, NOAA, Boulder, CO, USA ; Astronomy, College of Science, The University of Texas at San Antonio, San Antonio, TX, USA ; Space Weather Prediction Center, National Oceanic ; The University of Texas at San Antonio, San Antonio, TX, USA ; Environmental Research, Inc., MA, USA
AI总结 综述了用于太阳高能粒子预测的机器学习模型,包括数据集、架构、输入输出比较,并提出了未来研究建议。
Comments Review Paper, Maine text: 23 pages, References: 5 pages, Appendix: 42 pages
传递接触,而不仅仅是运动:跨灵巧手的柔顺抓取
机构 * University of California San Diego(加州大学圣迭戈分校)
AI总结 提出跨本体力-位置接口,通过校准力矩和指尖力实现异构灵巧手间的接触感知抓取,结合流匹配视觉运动策略和混合力位控制器,实现可迁移的柔顺抓取。
Comments Website(overview): transferring-contact-not-just-motion.github.io/
PRISM:一种用于可解释形状建模的三维概率神经表示
机构 * Department of Computer Science, University of North Carolina at Chapel Hill, Chapel Hill, USA(北卡罗来纳大学教堂山分校计算机科学系) ; Department of Computer Science, University of California San Diego, La Jolla, USA(加州大学圣地亚哥分校计算机科学系) ; School of Medicine, University of North Carolina at Chapel Hill, Chapel Hill, USA(北卡罗来纳大学教堂山分校医学院)
AI总结 提出PRISM框架,结合隐式神经表示与不确定性感知统计形状分析,通过封闭形式Fisher信息度量实现高效局部时间不确定性量化,在形状演化、个性化预测和异常检测任务中表现优异。
Comments ICML 2026, camera-ready version, 24 pages