CalBench: Evaluating Coordination-Privacy Trade-offs in Multi-Agent LLMs
CalBench: 评估多智能体大语言模型中的协调-隐私权衡
机构 * Stanford University(斯坦福大学)
AI总结 提出CalBench基准,用于在私有信息下评估多智能体日程协调中任务完成、成本、通信、公平性和隐私泄露的权衡。
高校专区
CalBench: 评估多智能体大语言模型中的协调-隐私权衡
机构 * Stanford University(斯坦福大学)
AI总结 提出CalBench基准,用于在私有信息下评估多智能体日程协调中任务完成、成本、通信、公平性和隐私泄露的权衡。
潜在缓存流:无需文本的模型间通信
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出潜在缓存流(LCF)方法,通过联合翻译和压缩键值缓存实现高效模型间通信,在上下文不同场景下比基于文本的通信准确率提高23%、速度提升8.5倍。
Comments 6 pages, 5 figures
通过扩散强迫实现统一且稳健的数据同化:ForcingDAS
机构 * University of Michigan(密歇根大学) ; University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; Massachusetts Institute of Technology(麻省理工学院) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本文提出ForcingDAS,一种基于扩散强迫的统一数据同化框架,能够捕捉长时序依赖并减少误差积累,同时在推理时无需重新训练即可实现滤波到平滑的全谱应用。
通过预训练分子嵌入距离推进基于配体的虚拟筛选和分子生成
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 本文提出预训练嵌入距离作为高效替代方案,用于虚拟筛选和分子生成,展示其在结构信息捕捉和相似性测量方面的有效性。
Comments Accepted by ICML 2026 AI4Science (https://openreview.net/forum?id=HbfrCipfNl). Code and data are available
移动性嵌入的POI:从人类移动中学习场所身份与使用方式
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出ME-POIs框架,通过对比学习将大规模人类移动数据与语言模型嵌入结合,学习场所功能,并在五个地图丰富任务上超越文本或移动性单独基线。
规范性缩放揭示语言模型能力的演变
机构 * Harvard University(哈佛大学) ; Stanford University(斯坦福大学)
AI总结 通过大规模观测评估和分位数回归,提出规范性缩放定律,将预训练计算预算映射到下游准确率,并验证其时间稳定性,引入平衡I-最优采样算法降低评估成本。
Comments ICML 2026 Oral. Blog Post: https://jkjin.com/prescriptive-scaling
当良性输入导致严重危害:引发计算机使用代理的不安全意外行为
机构 * DeepMind, London, UK(深度Mind,伦敦,英国) ; Stanford University, Stanford, CA, USA(斯坦福大学,斯坦福,加利福尼亚州,美国) ; UC Berkeley, Berkeley, CA, USA(加州大学伯克利分校,伯克利,加利福尼亚州,美国)
AI总结 提出AutoElicit框架,通过迭代扰动良性指令并利用CUA执行反馈,自动引发前沿CUAs(如Claude 4.5 Haiku等)的数百种有害意外行为,并验证其跨模型可迁移性。
Comments ICML 2026, Project Homepage: https://osu-nlp-group.github.io/AutoElicit/
条件归一化流用于前向和后向联合状态与参数估计
机构 * Department of Computer Science and Engineering University of Notre Dame(计算机科学与工程系诺特达姆大学) ; Department of Pediatrics Stanford University(儿科系斯坦福大学) ; Department of Applied and Computational Mathematics and Statistics University of Notre Dame(应用与计算数学与统计系诺特达姆大学)
AI总结 针对非线性非高斯系统,提出基于条件归一化流的状态滤波方法,结合MLP、Transformer或Mamba-SSM生成条件嵌入,并引入最优传输动力学损失缓解过参数化,在自动驾驶和COVID-19联合估计中验证有效性。
生理时间序列的自监督动力系统表示
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出PULSE框架,利用动力系统生成模型的信息结构,通过跨重建预训练目标提取共享系统参数信息,丢弃样本特异性噪声,提升生理时间序列的表示学习效果。
Comments Accepted to ICML 2026
社交平台领先滞后预测的基准数据集
机构 * Cornell University(康奈尔大学) ; Stanford University(斯坦福大学) ; Boston University(波士顿大学)
AI总结 本文提出领先滞后预测(LLF)问题,并发布arXiv和GitHub两个大规模基准数据集,通过统计检验验证领先滞后动态,为社交平台时间序列预测提供标准化测试平台。
Comments 11 pages, 8 figures, includes supplementary material (6 pages, 5 figures). Accepted at ACM SIGKDD 2026 (KDD '26). Code and data: https://lead-lag-forecasting.github.io
全频谱神经表示的多分辨率增强
机构 * Linac Coherent Light Source, SLAC National Accelerator Laboratory(直线相干光源,SLAC国家加速器实验室) ; Stanford Institute for Materials and Energy Sciences, Stanford University(斯坦福大学材料与能源科学研究所) ; Walker Department of Mechanical Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校机械工程系) ; Department of Mathematics, University of California Davis(加州大学戴维斯分校数学系) ; Department of Physics, Carnegie Mellon University(卡内基梅隆大学物理系)
AI总结 提出WIEN-INR框架,通过分层增强网络在不同分辨率尺度上建模,提升小网络对多尺度结构和高频细节的表示能力,实现紧凑高保真表示。
非平稳老虎机学习中的预测采样
机构 * Jones Graduate School of Business, Rice University(里士满大学沃森商学院研究生院) ; Stanford Graduate School of Business(斯坦福商学院) ; Department of Management Science and Engineering, Department of Electrical Engineering, Stanford University(斯坦福大学管理科学与工程系、电气工程系)
AI总结 本文提出预测采样算法,通过区分信息快速失效的行动来改进非平稳环境下的老虎机学习,理论证明其性能并验证其在复杂环境中的有效性。
发现数据结构:最近邻搜索及其他
机构 * Université de Montréal(蒙特利尔大学) ; Mila ; HEC Montréal(蒙特利尔高等商学院) ; Microsoft Research(微软研究院) ; University of Southern California(南加州大学) ; Stanford University(斯坦福大学)
AI总结 提出一个端到端学习数据结构的通用框架,自动适应数据分布并控制查询与空间复杂度,在最近邻搜索中逆向工程出二分搜索、插值搜索、k-d树和局部敏感哈希等算法。
Comments Neurips 2025 Version
训练任务多样性对上下文学习的影响:基于低维子空间的视角
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Stanford University(斯坦福大学) ; University of Toronto(多伦多大学)
AI总结 本文通过低秩高斯混合模型分析训练任务多样性(由子空间非重叠列数定义)如何提升线性注意力上下文学习的泛化与优化,解释训练多样性缩短学习平台期及实现分布外泛化的现象,并扩展至非线性场景。
自动驾驶任务级运行时保证框架
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出一种评估驾驶安全与任务完成能力的运行时保证框架,通过监控系统拒绝不可行命令,实验证明其优于仅关注平台安全的方法。
微调陷阱:评估负迁移及PEFT在亚十亿参数数学推理中的作用
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 本研究评估了五种亚十亿参数模型在数学推理任务中的微调策略,发现全量微调对小于3亿参数的模型造成负迁移,而参数高效微调(PEFT)是稳定性要求。
Comments 8 pages, 6 figures, 2 tables
AdaGRPO: 一种面向基于流的GRPO的能力感知自适应增强方法
机构 * Shanghai Jiao Tong University(上海交通大学) ; S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; Shanghai AI Laboratory(上海人工智能实验室) ; University of Science and Technology of China(中国科学技术大学) ; Stanford University(斯坦福大学) ; Shanghai Innovation Institute(上海创新研究院) ; The Chinese University of Hong Kong(香港中文大学) ; Fudan University(复旦大学) ; CPII under InnoHK(InnoHK下的CPII) ; Adobe Research(Adobe研究)
AI总结 提出AdaGRPO,通过在线课程过滤策略和跨层级优势融合,解决流模型GRPO中提示选择随机和优势估计缺乏全局视角的问题,提升训练稳定性和性能。
Comments Project Website: https://bujiazi.github.io/adagrpo.github.io/
MMBU: 大规模多模态生物医学理解基准,用于探测视觉语言模型的感知能力
机构 * Stanford University(斯坦福大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Instituto Tecnológico de Monterrey(蒙特雷技术学院) ; Monash University(墨尔本大学) ; University of Cambridge(剑桥大学) ; Shanghai Jiao Tong University(上海交通大学) ; Shandong University(山东大学)
AI总结 提出MMBU基准,涵盖35个子模态,通过分类、定位和检测任务系统评估VLM在生物医学领域的视觉感知和泛化能力,发现高准确率可能掩盖感知缺陷。
语言模型如何失败:承诺性和持续性推理错误的令牌级特征
机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学) ; Department of Aeronautics and Astronautics, Stanford University(航空航天工程系,斯坦福大学)
AI总结 通过令牌级不确定性信号,将语言模型推理失败分为承诺性失败(早期锁定错误路径)和持续性不确定性(不确定性持续累积),并在23个模型-数据集配置中验证了可预测性,为自我一致性策略提供了指导。
机器人需要的不仅仅是VLA和世界模型
机构 * Motoniq.ai ; Stanford University(斯坦福大学) ; Istituto Italiano di Tecnologia(意大利技术研究院) ; ETH Zurich(苏黎世联邦理工学院) ; Technical University of Darmstadt(德累斯顿技术大学) ; UCL Centre for AI(伦敦大学学院人工智能中心)
AI总结 本文认为机器人通用智能的关键瓶颈不仅是策略学习,还缺乏将非结构化行为数据转化为机器人可用监督的机制,并提出了四种缺失的接口组件。
基于结构化步态-语言表示的LLM条件病理步态合成
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Toronto(多伦多大学) ; MIT Media Lab(麻省理工学院媒体实验室)
AI总结 提出一种多模态LLM引导框架,通过结构化文本描述合成病理步态3D数据,利用运动标记化、病理感知语言条件、LLM语义增强和语言到步态生成,改善下游分类性能。
Comments Accepted at CVPR MOMA Workshop 2026 and selected for spotlight presentation at the workshop
CORE: 对比反思实现推理能力的快速提升
机构 * Stanford University(斯坦福大学)
AI总结 提出对比反思(CORE)非参数学习算法,通过对比成功与失败的推理轨迹生成自然语言洞察,在少量样本和 rollout 下实现比参数方法(GRPO)和非参数方法(GEPA、情景RAG、MemRL)更快的推理性能提升。
CountsDiff: 一种用于计数数据生成和插补的自然数扩散模型
机构 * Princeton University(普林斯顿大学) ; Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 提出CountsDiff扩散框架,通过生存概率调度和显式损失加权简化Blackout扩散,引入连续时间训练、无分类器引导和逆动态,在自然图像和单细胞RNA-seq插补任务中匹配或超越现有方法。
Comments 39 Pages, 11 figures. To appear in the 43rd International Conference on Machine Learning (ICML 2026)
生产环境中的智能体测量
机构 * University of California at Berkeley(加州大学伯克利分校) ; IBM Research(IBM研究院) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Stanford University(斯坦福大学)
AI总结 通过对86个已部署系统的调查和20个案例研究,发现生产环境中的LLM智能体主要采用简单可控的方法,可靠性是首要挑战,并依赖系统级设计和人工评估。
Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026) as Oral Presentation
使用Rashomon分区稳健估计因子数据中的异质性
机构 * Department of Statistics, University of Washington, USA(美国华盛顿大学统计学系) ; Department of Economics, Stanford University, USA(美国斯坦福大学经济学系) ; J-PAL, NBER, USA(美国J-PAL和NBER) ; Department of Sociology, University of Washington, USA(美国华盛顿大学社会学系)
AI总结 提出Rashomon分区集(RPS)贝叶斯框架,通过枚举后验密度接近最大后验模型的所有模型来量化模型不确定性,实现稳健的异质性估计。
ChemQuests: 从ChemRxiv论文中提取的精选化学问答数据库
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出ChemQuests数据集,包含从155篇ChemRxiv论文中提取的952个高质量问答对,覆盖17个化学子领域,用于化学NLP研究。
多目标偏好优化:提升生成模型的人类对齐
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 针对RLHF和偏好优化方法假设单一目标的问题,提出多目标偏好优化框架MOPO,通过约束KL散度最大化主要目标并保障次要目标下限,在合成基准和人类偏好数据上实现帕累托最优策略。
Comments arXiv admin note: text overlap with arXiv:2406.18853 by other authors
分布内与分布外机器遗忘的效用与复杂性
机构 * EPFL(瑞士联邦理工学院) ; Stanford University(斯坦福大学)
AI总结 本文分析近似机器遗忘的效用、时间和空间复杂度权衡,提出输出扰动的经验风险最小化实现分布内遗忘的紧致权衡,并针对分布外遗忘提出鲁棒噪声梯度下降变体以摊销时间复杂性。
Goedel-Architect: 通过蓝图生成与精炼简化形式定理证明
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Science and Technology of China(中国科学技术大学) ; University of Toronto(多伦多大学) ; National University of Singapore(新加坡国立大学) ; University of Tokyo(东京大学) ; University of Washington(华盛顿大学)
AI总结 提出Goedel-Architect框架,通过生成和精炼依赖图蓝图,结合Lean 4证明器并行证明引理,在多个基准测试上达到开源最优性能。
Agent记忆:有状态长时任务工作负载的表征与系统影响
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校) ; MIT Media Lab(麻省理工学院媒体实验室)
AI总结 本文首次对LLM agent记忆系统进行系统级表征,提出四轴分类法,通过阶段感知分析框架评估10种代表性系统,并给出10条系统设计建议。