FASTER: Value-Guided Sampling for Fast RL
FASTER:基于价值引导的快速强化学习采样
机构 * Stanford University(斯坦福大学)
AI总结 FASTER通过建模去噪过程中的动作候选过滤作为马尔可夫决策过程,提升采样测试时间缩放的效率,减少计算成本并提高性能。
高校专区
FASTER:基于价值引导的快速强化学习采样
机构 * Stanford University(斯坦福大学)
AI总结 FASTER通过建模去噪过程中的动作候选过滤作为马尔可夫决策过程,提升采样测试时间缩放的效率,减少计算成本并提高性能。
大语言模型在工业部署中经济上可行吗?
机构 * DSEU-Okhla ; University of Delhi(德里大学) ; Macquarie University(麦考瑞大学) ; Center for SDGC(SDGC研究中心) ; Stanford University(斯坦福大学)
AI总结 本文提出EDGE-EVAL框架,评估大语言模型在工业场景中的全生命周期性能,引入五个部署指标,揭示模型在经济性和能效上的效率前沿及异常现象。
Comments Accepted at ACL 2026 (Industry Track)
ARGUS:通过数据流不变量指导的代理GPU优化
机构 * CausalFlow Inc.(CausalFlow公司) ; HKUST(香港科技大学) ; Tsinghua University(清华大学) ; Stanford University(斯坦福大学) ; UCAS ; UC Riverside(UC河滨分校)
AI总结 ARGUS通过数据流不变量指导代理生成高效GPU内核,解决传统代理在关键计算任务中的性能不足问题,实现接近人工优化的性能和广泛的任务泛化能力。
PhysMem:为机器人操作扩展测试时的物理内存
机构 * Stanford University(斯坦福大学) ; UC San Diego(圣地亚哥大学)
AI总结 PhysMem通过测试时交互学习物理原理,提升机器人在不同环境下的物体操控能力,实验显示其在真实任务和模拟中均优于传统经验检索方法。
FUSE:无需标注数据的验证器集成
机构 * Stanford University(斯坦福大学) ; Google(谷歌)
AI总结 FUSE通过无监督集成验证器提升大语言模型输出验证质量,无需标注数据,在多种生成模型和基准测试中表现优异。
推理时蒸馏:无需微调或手动提示工程的低成本代理
机构 * Stanford University(斯坦福大学)
AI总结 本文提出通过推理时技术实现低成本高准确率的代理,无需微调或手动提示工程,在ALFWorld和AppWorld上分别实现2.5倍和3.5倍的成本降低,同时保持高准确率。
Comments 21 pages, 4 figures
使用大型语言模型进行具身规划引入了系统性的安全风险
机构 * ETH Zurich(苏黎世联邦理工学院) ; University College London(伦敦大学学院) ; Stanford University(斯坦福大学) ; Northwestern University(西北大学) ; National University of Singapore(新加坡国立大学)
AI总结 研究评估了大型语言模型在机器人规划中的安全性,发现即使规划能力高,安全风险仍显著存在,揭示了规划能力与安全意识之间的乘法关系。
Comments Project page: https://despite-safety.github.io/
渐进式在线视频理解与证据对齐的透明决策
机构 * University of Science and Technology of China(中国科学技术大学) ; Harvard University(哈佛大学) ; Department of CV, MBZUAI(MBZUAI计算机视觉部门) ; Dalian University of Technology(大连理工大学) ; Stanford University(斯坦福大学) ; Chicago University(芝加哥大学)
AI总结 本文提出一种新型框架,通过分离推理控制与记忆整合,解决在线视频理解中的决策透明、时间对齐和计算预算限制问题,显著提升了性能。
人们会喜欢机器人教练吗?一项与Snoopie的Pacerbot的案例研究
机构 * Stanford University(斯坦福大学)
AI总结 本文探讨机器人四足机器人能否作为有效的个人训练设备,通过间隔训练案例研究,展示机器人教练在一致性与遵守节奏方面的优势,并证明用户更偏好机器人教练。
Comments 8 pages, 4 figures. To appear at ICRA 2026
神经垃圾回收:在学习推理的同时学习遗忘
机构 * Stanford University(斯坦福大学)
AI总结 本文提出神经垃圾回收(NGC),通过端到端学习使语言模型在推理时自动管理内存,无需人工设计规则,实现内存压缩与效率提升。
XOXO:针对AI编码助手的隐蔽跨域上下文污染攻击
机构 * Columbia University(哥伦比亚大学) ; Stanford University(斯坦福大学)
AI总结 本文提出XOXO攻击,通过隐蔽的跨域上下文污染使AI编码助手生成漏洞代码。引入GCGS算法,利用Cayley图系统搜索变换空间,实现75.72%的攻击成功率,传统防御方法无效。
Comments Accepted to ACL 2026 (main)
AnyLift: 通过2D扩散模型从互联网视频中扩展运动重建
机构 * Stanford University(斯坦福大学)
AI总结 本文提出AnyLift框架,利用2D扩散模型从互联网视频中重建3D人体运动和人-物交互,通过合成多视角2D运动数据和训练相机条件多视角2D运动扩散模型,提升动态摄像下运动重建的准确性和鲁棒性。
Comments CVPR 2026. Project website: https://awfuact.github.io/anylift/ The first two authors contribute equally
Poly-EPO:训练探索性推理模型
机构 * Stanford University(斯坦福大学)
AI总结 本文提出Poly-EPO框架,通过集强化学习提升语言模型的探索与利用协同,增强推理能力与泛化性能。
HorizonBench: 长时间跨度个性化与演变偏好
机构 * University of Washington(华盛顿大学) ; Meta ; OpenAI ; Stanford University(斯坦福大学)
AI总结 本文提出HorizonBench,通过生成6个月时间线的对话数据,提供长时间跨度个性化研究的测试平台,揭示状态跟踪能力是长周期个性化的主要瓶颈。
Comments 19 pages, 5 figures, 8 tables
MoCo:模型协作研究的一站式解决方案
机构 * University of Washington(华盛顿大学) ; University of Notre Dame(诺特大学) ; University of Virginia(弗吉尼亚大学) ; New York University(纽约大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Harvard University(哈佛大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; University of California Irvine(加州大学尔湾分校) ; Stanford University(斯坦福大学)
AI总结 本文提出MoCo库,提供26种模型协作方法及25个评估数据集,验证协作策略在多数场景下优于非协作模型,分析协作系统的有效性及未来研究方向。
Comments Moco is available at https://github.com/BunsenFeng/model_collaboration
当更多词语说更少:在图像描述评估中解耦长度与特异性
机构 * Stanford University(斯坦福大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 本文提出通过对比集定义描述特异性,验证人们更偏好信息密集的描述,无论长度如何,且长度分配影响特异性差异。
测试时对齐 via 假设重加权
机构 * Stanford University(斯坦福大学)
AI总结 本文提出HyRe方法,通过重加权集成成员实现实时个性化,仅需1-5个标记示例即可超越现有奖励模型。
Comments TMLR 2026
图-智能体:一种基于图的多智能体LLM协作框架
机构 * UNC Chapel Hill(UNC夏洛茨维尔分校) ; Eigent AI(Eigent人工智能) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) ; Stanford University(斯坦福大学)
AI总结 本文提出Graph-of-Agents框架,通过节点采样、边构建和消息传递提升多智能体协作效率,仅用3个智能体在多个基准测试中优于使用全部6个智能体的基线方法。
Comments ICLR 2026
D-Prism:用于结构动态建模的可微原始体
机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) ; Stanford University(斯坦福大学) ; Hangzhou Dianzi University(杭州电子科技大学)
AI总结 本文提出D-Prism框架,通过扩展可微原始体到动态领域,实现高保真的结构动态建模,结合3DGS和原始体的优势,引入变形网络和自适应控制策略,提升结构动态建模的精度和效率。
Comments Accepted to CVPR 2026. Project page: https://zju3dv.github.io/d-prism/
基于图变换器的通路嵌入用于癌症预后
机构 * Iowa State University(爱荷华州立大学) ; Stanford University(斯坦福大学)
AI总结 本文提出PATH方法,通过基因共享基础嵌入与患者特定信号动态适应,提升癌症预后预测的准确性与生物学意义。
Comments 25 pages, 5 figures
梯度偏移:理解防御性训练方法如何保护语言模型完整性
机构 * Stanford University(斯坦福大学) ; MATS
AI总结 本文通过对比PPS和IP两种防御性训练方法,揭示其在保护语言模型完整性上的不同机制,发现PPS通过调整激活梯度抑制特质表达,而IP则通过解释数据中的特质表达来减少预测损失。
机械智能跨学科研讨会:总结报告
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Pittsburgh(匹兹堡大学) ; Purdue University(Purdue 大学) ; University of Michigan(密歇根大学) ; Tufts University(塔夫茨大学) ; Oregon State University(俄勒冈州立大学) ; Case Western Reserve University(凯斯西储大学) ; John’s Hopkins University(约翰·霍普金斯大学) ; Boston University(波士顿大学) ; University of Southern California(南加州大学) ; University of California at Berkeley(加州大学伯克利分校) ; Penn State University(宾夕法尼亚州立大学) ; Northeastern University(东北大学) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Colorado Boulder(科罗拉多大学 Boulder 分校) ; New Mexico State University(新墨西哥州立大学) ; University of Notre Dame(诺丁汉大学) ; Stanford University(斯坦福大学)
AI总结 本报告总结了2024年机械智能跨学科研讨会的成果,探讨了机械结构自身通过响应性、适应性、记忆和学习编码智能的现象,以及其与计算智能的区别。
临床笔记去冗余以提高大语言模型使用效率
机构 * Department of Biomedical Data Science, Stanford University, Stanford, CA(斯坦福大学生物医学数据科学系) ; Department of Pathology, Stanford University, Stanford, CA(斯坦福大学病理学系) ; Department of Anesthesiology, Perioperative and Pain Medicine, Stanford University, Stanford, CA(斯坦福大学麻醉学、围术期医学与疼痛医学系) ; Department of Radiology, Stanford University, Stanford, CA(斯坦福大学放射学系) ; Department of Obstetrics and Gynecology, Stanford University, Stanford, CA(斯坦福大学妇产科学系) ; Division of Gastroenterology and Hepatology, Stanford University, Stanford, CA(斯坦福大学消化内科与肝病学系) ; Department of Computer Science, Stanford University, Stanford, CA(斯坦福大学计算机科学系) ; Weill Cancer Hub West(韦尔癌症中心西区)
AI总结 本文提出TRACE方法,通过EHR元数据去除临床笔记中的冗余文本,降低LLM计算成本,实验证明在保持信息提取和预测性能的同时,减少47.3%的文本量,节省每年约950万美元的推理成本。
收割AlphaEarth:评估用于农业下游任务的地理空间基础模型
机构 * Department of Earth System Science and Center on Food Security and the Environment, Stanford University, USA(地球系统科学系和食品安全与环境中心,斯坦福大学,美国) ; Corteva Agriscience™, USA(科特维亚农业科学公司,美国)
AI总结 本文评估了AlphaEarth基础模型在农业下游任务中的表现,包括作物产量预测、耕作 mapping 和覆盖作物 mapping,揭示了其在农业应用中的优势与局限。
LiveResearchBench: 一个用于真实世界中以用户为中心的深度研究的实时基准
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Stanford University(斯坦福大学) ; Salesforce AI Research(Salesforce AI研究院)
AI总结 本文提出LiveResearchBench,一个包含100个专家精选任务的实时基准,涵盖日常生活、企业与学术领域,要求进行广泛、动态的实时网络搜索与综合。通过DeepEval评估17个前沿深度研究系统,揭示其优势、失败模式及关键组件。
Comments Accepted to ICLR 2026
通过AI反馈提升文本到视频生成中动态物体交互
机构 * Google DeepMind(谷歌DeepMind) ; The University of Tokyo(东京大学) ; Stanford University(斯坦福大学)
AI总结 本文研究如何利用反馈提升文本到视频模型中动态物体交互的质量,提出利用视觉语言模型提供针对性反馈,实验表明该方法在视频交互场景质量上有显著提升。
Comments Website: https://sites.google.com/view/aif-dynamic-t2v/
基于神经网络的扩散模型分数估计:优化与泛化
机构 * Department of Management Science and Engineering, Stanford University(斯坦福大学管理科学与工程系) ; Daniel J. Epstein Department of Industrial and Systems Engineering, University of Southern California(南加州大学工业与系统工程系)
AI总结 本文提出基于梯度下降训练的神经网络分数估计框架,解决扩散模型中优化与泛化问题,通过参数化方法将去噪分数匹配转化为回归问题,并建立首个最小最大最优泛化界限。
Comments 58 pages
AdaBoost 不总是循环:一个计算机辅助的反例
机构 * Department of Computer Science, Stanford University(斯坦福大学计算机科学系)
AI总结 本文通过计算机辅助构造反例,证明了AdaBoost在某些情况下不会收敛到有限循环,核心方法基于块积装置的线性化返回映射具有无理数比值的主导特征值。
人为区域适应于多模态视觉-语言模型
机构 * Cohere ; SEACrowd ; AI Singapore ; Universiti Teknologi PETRONAS ; Oracle ; Carnegie Mellon University(卡内基梅隆大学) ; Monash University, Indonesia(莫纳什大学(印尼)) ; King Mongkut’s University of Technology Thonburi(泰国孔敬大学) ; Nara Institute of Science and Technology(奈良科学技術大學) ; Stanford University(斯坦福大学) ; MBZUAI ; National University of Singapore(新加坡国立大学) ; Monash University, Australia(莫纳什大学(澳大利亚)) ; Brown University(布朗大学) ; University of Bath(巴斯大学) ; Mila - Quebec AI Institute(蒙特利尔AI研究所) ; Institut Teknologi Bandung(Bandung 工程技术大学) ; Ateneo de Manila University(马尼拉亚特内奥大学) ; Universitas Pelita Harapan(Pelita Harapan 大学) ; Seoul National University of Science and Technology(首尔科学技术大学) ; Thammasat University(泰国 Thammasat 大学) ; Independent(独立) ; University College London(伦敦大学学院) ; Nanyang Technological University(南洋理工大学) ; MiroMind AI ; University of Indonesia(印度尼西亚大学) ; University of New Haven(纽黑文大学) ; INTI International University and Colleges(INTI 国际大学和学院) ; Binus University(Binus 大学) ; National University Philippines(菲律宾国家大学) ; ThoughtFull
AI总结 本文提出人为区域适应框架,通过地理通用化简化方法提升多模态模型在特定区域的文化相关性,实验显示在东南亚地区提升5-15%的同时保持全球性能。
COMPOSITE-STEM基准:通过70个专家编写的任务评估AI代理的科学推理能力
机构 * PortexAI ; University of Milano-Bicocca(米兰-比科卡大学) ; University of Calgary(卡尔加里大学) ; University of Chicago(芝加哥大学) ; Inria(法国国家信息与自动化技术研究院) ; Fraunhofer Institute for Individualized Medical Technology IMTE(弗劳恩霍夫个性化医疗技术研究所) ; University of Cambridge(剑桥大学) ; Independent(独立) ; McGill University(麦吉尔大学) ; Massachusetts Institute of Technology(麻省理工学院) ; École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) ; Queen Mary University of London(伦敦大学玛丽女王学院) ; Dot Ingredients ; National University of Singapore(新加坡国立大学) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Edinburgh(爱丁堡大学) ; Murdoch University(墨尔本大学) ; University of Porto(波尔图大学) ; Stanford University(斯坦福大学) ; Stony Brook University(史泰津布鲁克大学)
AI总结 本文提出COMPOSITE-STEM基准,通过70个专家编写任务评估AI代理的科学推理能力,结合精确匹配评分和LLM作为评委的协议,展示AI在科学领域的能力突破。