Policy-based Foveated Imaging and Perception
基于策略的中央凹成像与感知
机构 * Stanford University USA(斯坦福大学)
AI总结 提出一种实时、预测且任务感知的中央凹成像系统,通过强化学习策略动态分配像素带宽到任务相关区域,在严格像素预算下实现高任务性能。
Comments Project website at https://howardxiao.ca/foveated/
高校专区
基于策略的中央凹成像与感知
机构 * Stanford University USA(斯坦福大学)
AI总结 提出一种实时、预测且任务感知的中央凹成像系统,通过强化学习策略动态分配像素带宽到任务相关区域,在严格像素预算下实现高任务性能。
Comments Project website at https://howardxiao.ca/foveated/
SkillHarm: 通过自动化构建实现生命周期感知的基于技能的攻
机构 * The Ohio State University(俄亥俄州立大学) ; Amazon AGI(亚马逊人工智能实验室) ; Stanford University(斯坦福大学)
AI总结 提出SkillHarm基准,通过固定载荷投毒和自我变异投毒两种攻击场景,系统评估基于技能的攻击在技能使用生命周期中的风险,并构建自动化管道AutoSkillHarm生成大规模攻击样本。
Comments Work in Progress
“我知道这会如何发展”:通过渐进条件惊奇度刻画多样性
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; Stanford University(斯坦福大学)
AI总结 提出一种基于上下文学习的多样性度量方法 Decan(D_{Ca_n}),通过单次前向传递计算每个字节的得分,无需嵌入模型、参考语料或人工标注,在多个基准上验证了其有效性。
Comments 28 pages, 18 figures, 9 tables. Accepted to the Workshop on Generative AI, Creativity, and Human-AI Co-Creation @ ICML 2026 (non-archival). Code and data: https://github.com/AMindToThink/icl-diversity
揭示具有内在测地耦合的多模态生物分子协同设计
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 针对生物分子协同设计中模态间时间耦合被忽视的问题,提出GeoCoupling框架优化异构模态的时间耦合,在基于结构的药物设计和无条件蛋白质设计中提升物理有效性和多样性。
Comments Accepted to ICML 2026
LEGS: 在具身高斯泼溅世界中免遥操作微调VLA用于人形机器人全身操控
机构 * Stanford University(斯坦福大学)
AI总结 提出LEGS混合模拟器,通过程序化运动基元生成器和两阶段颜色校准,无需遥操作即可合成训练数据,使VLA策略在真实人形机器人操控任务中达到或超越遥操作训练效果。
Comments https://legsvla.github.io/
Dr. DocBench:专家级与困难文档解析的综合基准
机构 * Stanford University(斯坦福大学) ; MIT(麻省理工学院) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Southern California(南加州大学) ; Harvard University(哈佛大学) ; IBM Research(IBM研究院) ; University of Arizona(亚利桑那大学) ; Duke University(杜克大学) ; UC Berkeley(加州大学伯克利分校) ; LMU Munich(慕尼黑路德维希-马克西米利安大学)
AI总结 提出Dr. DocBench基准,通过基于解析器失败的采样从多语言书籍语料库中选取挑战性文档,包含52个BISAC主题领域和65k高质量标注,用于评估专家级文档解析能力。
Comments 27 pages, 13 figures, 14 tables
Momento:评估多会话代理对话中的持久记忆与推理
机构 * Institut Teknologi Bandung(万隆技术大学) ; Stanford University(斯坦福大学) ; Capital One
AI总结 提出Momento基准,通过多会话服务环境评估代理在跨会话中利用持久记忆和推理完成个性化任务的能力,发现现有代理因误估用户状态而表现不佳。
Comments Preprint
ASAP: 基于解剖感知语义自适应预训练的医学体素表示学习
机构 * School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(生物医学工程学院,生命科学与医学系,中国科学技术大学) ; Medical Imaging, Robotics, Analytic Computing & Learning (MIRACLE) Lab, YRD-RIGHT, USTC Suzhou Institute for Advanced Research(医学影像、机器人、分析计算与学习(MIRACLE)实验室,YRD-RIGHT,中国科学技术大学苏州研究院) ; Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology(江苏省多模态数字孪生技术重点实验室) ; Biomedical Basic Research Center (BBRC) of Jiangsu Province(江苏省生物医学基础研究中心) ; Department of Radiology, The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, USTC(放射科,中国科学技术大学第一附属医院,生命科学与医学系,中国科学技术大学) ; Anhui IFLYTEK CO., Ltd(安徽科大讯飞股份有限公司) ; School of Medicine, Stanford University(医学院,斯坦福大学) ; State Key Laboratory of Precision and Intelligent Chemistry, Hefei, Anhui, China(安徽省精密与智能化学重点实验室,合肥,安徽,中国)
AI总结 提出ASAP框架,通过解剖感知知识注入、语义自适应对齐与融合,从胸部CT扫描和放射学报告中学习可迁移且可解释的体素表示,在15个数据集和22个下游任务上取得最先进性能。
Comments MICCAI2025 extention
学习用于训练数据选择的元网络的困难性
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 针对元学习训练数据选择(MTS)在实践中表现不佳的问题,本文通过数学分析揭示了梯度信噪比低和缺乏信息特征两大障碍,并提出增大批大小和利用信息特征作为解决方案。
医学预测模型中选择偏差影响的一个实用上界
机构 * Stanford University(斯坦福大学)
AI总结 针对选择偏差导致模型泛化性差的问题,提出在仅部分观测选择机制和目标分布的现实条件下,对目标群体最差模型性能的一个新上界,并通过合成数据和真实数据验证其有效性和实用性。
Comments 32 pages, 27 figures, will be published at ACM SIGKDD '26
用于植入尖峰模型的简单、鲁棒近似消息传递
机构 * Stanford University(斯坦福大学)
AI总结 针对含对抗性噪声的尖峰矩阵模型,提出一种结合谱预处理与鲁棒谱初始化的算法,使近似消息传递(AMP)在无需修改的情况下实现鲁棒性,输出与无噪声AMP结果接近的向量。
Comments 32 pages
文本编辑能否泛化到视觉生成?统一多模态模型中的跨模态知识编辑基准
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Toronto(多伦多大学) ; University of Washington(华盛顿大学)
AI总结 提出跨模态知识编辑基准UniKE,发现文本编辑在图像生成中效果显著下降(VQA准确率仅18.5%),并提出推理增强参数编辑方法提升跨模态迁移效果。
Comments Published at ICML 2026; Code and data available at https://github.com/gxx27/UniKE
SDR:用于放射学报告生成的集合距离奖励
机构 * Stanford University(斯坦福大学) ; Stanford University School of Medicine(斯坦福大学医学院) ; Ghent University(根特大学)
AI总结 针对胸部X光报告生成中标准奖励不兼容的问题,提出基于集合距离的连续置换不变奖励,通过GRPO后训练和测试时缩放显著提升性能。
基于物理可控世界模型的物理对象理解
机构 * Stanford University(斯坦福大学) ; OpenAI(开放人工智能公司) ; Noetik Inc.(Noetik公司) ; Google(谷歌)
AI总结 提出一类概率世界模型,通过自回归序列建模高效训练,从视频中推断对象及其物理交互,实现对象发现、3D操控和物理关系计算。
Comments CVPR 2026 Highlight. Project page at: https://neuroailab.github.io/psi-website/blog.html
人形机器人的约束全身跟踪
机构 * Stanford University(斯坦福大学) ; NVIDIA Research(NVIDIA研究)
AI总结 提出 ConstrainedMimic 框架,结合操作空间控制与控制障碍函数,在强化学习跟踪策略中实现实时约束满足,用于人形机器人全身运动跟踪与遥操作。
跨层学习率平衡:线性神经网络中的精确两步动力学与最优缩放
机构 * Dartmouth College(达特茅斯学院) ; Stanford University(斯坦福大学)
AI总结 本文通过精确推导线性神经网络在梯度下降两步后的梯度和测试损失闭式表达式,研究了层间学习率的最优选择,揭示了初始步骤不等学习率可最小化测试损失而后续步骤等学习率最优的早期训练机制。
Comments ICML 2026
通过Rockafellar-Uryasev共形推断的条件风险价值对抗鲁棒控制
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出一种在线无分布框架,通过结合共形尾风险控制、在线学习和CVaR的变分表示,在非平稳和对抗环境下实现对条件风险价值(CVaR)的鲁棒控制,并提供渐近保证。
StressDream: 引导视频世界模型实现鲁棒的策略评估与改进
机构 * Carnegie Mellon University(卡内基梅隆大学) ; NVIDIA Research(NVIDIA研究) ; University of Washington(华盛顿大学) ; Stanford University(斯坦福大学)
AI总结 提出StressDream方法,通过优化扩散视频世界模型的初始噪声,在推理时引导生成高影响且合理的未来场景,以支持鲁棒的策略评估与改进。
Comments Project page: https://junwon.me/StressDream/
从Rashomon理论到PRAXIS:高效决策树Rashomon集
机构 * Stanford University(斯坦福大学)
AI总结 针对决策树Rashomon集计算开销大的问题,提出PRAXIS算法,在运行时和内存使用上实现数量级改进,并能恢复几乎完整的Rashomon集。
Comments Accepted to ICML 2026
一种用于定量扩散MRI的物理信息基础模型
机构 * School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程系) ; Oxford Centre for Integrative Neuroimaging, FMRIB, Nuffield Department of Clinical Neurosciences, University of Oxford(牛津大学整合神经影像中心、FMRIB、临床神经科学系) ; Department of Radiology, West China Second University Hospital, Sichuan University(四川大学华西第二医院放射科) ; School of Biomedical Engineering and the Institute of Medical Robotics, Shanghai Jiaotong University(上海交通大学生物医学工程学院和医学机器人研究院) ; Department of Radiology, Institution of Radiology and Medical Imaging, West China Hospital, Sichuan University(四川大学华西医院放射科、放射医学与影像研究所) ; Department of Radiology and Biomedical Imaging, University of California San Francisco(加州大学旧金山分校放射科和生物医学影像系) ; Department of Psychiatry and Behavioral Sciences, Stanford University School of Medicine(斯坦福大学医学院精神病学与行为科学系)
AI总结 提出物理信息生成微结构网络(PIGMENT),通过零样本适应实现从稀疏数据中恢复可靠的定量扩散MRI参数映射。
全面的人工智能治理需要解决非模型增益问题
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校) ; Open Philanthropy(开放哲学基金会)
AI总结 本文提出非模型增益的概念,包括推理增益、系统增益和资产增益,并论证这些增益会削弱以模型为中心的治理有效性,进而提出超越模型层面的治理方法。
Comments This paper has been accepted to ICML 2026 (Position paper track): https://openreview.net/forum?id=V3O1sHpKxX
为什么更大的模型学习得更多:容量、干扰和稀有任务保留的影响
机构 * Stanford University(斯坦福大学) ; Kempner Institute at Harvard University(哈佛大学凯普纳研究所) ; MIT(麻省理工学院) ; Anthropic
AI总结 通过理论分析和合成实验,研究模型规模对学习能力的影响,发现更大模型通过减少梯度干扰来学习稀有和复杂任务,并在OLMo模型上验证。
WorldMemArena: 通过动作-世界交互评估多模态智能体记忆
机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) ; J.P. Morgan Chase(摩根大通) ; ETH Zurich(苏黎世联邦理工学院) ; Stanford University(斯坦福大学) ; Johns Hopkins University(约翰霍普金斯大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出WorldMemArena基准,通过动作-世界交互循环的四阶段生命周期评估多模态智能体记忆,揭示现有方法在写入、维护、检索和使用中的失败点。
Comments 25 pages, 8 figures
揭秘可合并性:预测模型合并成功的可解释属性
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 通过架构无关框架和L1正则化线性优化,发现合并成功取决于合并方法和伙伴任务,梯度对齐是最基本的兼容性信号。
Comments 9 pages of main paper, 3 figures in the main paper, 4 tables in the main paper, many more figures and tables in the appendix
笛卡尔捷径:在极坐标空间中重新评估视觉推理
机构 * Stanford University(斯坦福大学) ; Google Research(谷歌研究院)
AI总结 针对多模态大语言模型在视觉推理中利用笛卡尔坐标捷径的问题,提出Polaris-Bench基准,将任务转换至极坐标空间,揭示模型缺乏拓扑不变性视觉推理。
RadAgent:一种用于胸部CT逐步解读的工具型AI智能体
机构 * Department of Biosystems Science and Engineering, ETH Zurich(生物系统科学与工程系,苏黎世联邦理工学院) ; ETH AI Center, Zurich(ETH人工智能中心,苏黎世) ; Department of Computer Science, ETH Zurich(计算机科学系,苏黎世联邦理工学院) ; Faculty of Computer Science and Mathematics, Heidelberg University(计算机科学与数学学院,海德堡大学) ; Stanford Center for Artificial Intelligence in Medicine and Imaging, Stanford University(斯坦福大学人工智能在医学和影像中的中心) ; Department of Radiology, Stanford University(放射科,斯坦福大学) ; Department of Quantitative Biomedicine, University of Zurich(定量生物医学系,苏黎世大学) ; Institute of Computer Science, Zurich University of Applied Sciences(应用科学大学计算机科学研究所)
AI总结 提出RadAgent,一种通过逐步、可解释过程生成CT报告的工具型AI智能体,在临床准确性、鲁棒性和忠实度上优于3D VLM方法。
自动猜想解决与形式化验证
机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) ; Westlake Institute for Advanced Study, Westlake University(西拉雅大学先进研究所) ; School of Mathematics, Tianjin University(天津大学数学学院) ; Research Institute for Mathematical Sciences, Kyoto University(京都大学数学研究所) ; Department of Mathematics, Stanford University(斯坦福大学数学系) ; IQuest Research(IQuest研究) ; New Cornerstone Science Laboratory, School of Mathematical Sciences, Peking University(北京大学数学科学学院新基石科学实验室) ; Beijing International Center for Mathematical Research and the New Cornerstone Science Laboratory, Peking University(北京大学国际数学研究所以及新基石科学实验室) ; Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) ; Center for Intelligent Computing, Great Bay Institute for Advanced Study, Great Bay University(大湾大学先进研究所智能计算中心) ; Zhongguancun Academy(中关村学院)
AI总结 提出一个集成非形式化推理与形式化验证的自动框架,通过两个组件Rethlas和Archon解决研究级数学问题,并成功解决交换代数中的开放问题并在Lean 4中形式化验证。
Comments Code and resources are available at: Rethlas (https://github.com/frenzymath/Rethlas), Rethlas Results (https://github.com/frenzymath/Rethlas_results), Archon (https://github.com/frenzymath/Archon), and the formalization results (https://github.com/frenzymath/Anderson-Conjecture)
RenoBench: 引文解析基准
机构 * Graduate School of Education, Stanford University(斯坦福大学教育研究生院) ; Public Knowledge Project, Simon Fraser University(公共知识项目,西蒙弗雷泽大学) ; DataCite, Hannover, Germany(DataCite,德国汉诺威) ; California Digital Library, University of California Office of the President(加州数字图书馆,加州大学校长办公室)
AI总结 针对现有引文解析评估方法不可泛化、基于合成数据或不可公开获取的问题,提出从四个出版生态系统收集的公开基准RenoBench,通过自动验证和特征采样构建多语言、多类型数据集,并评估多种解析系统,结果表明语言模型(尤其微调后)表现优异,为可重复标准化评估奠定基础。
Comments Presented as a conference paper at CiteX 2026
MiNI-Q:一种微型、无线四足机器人,具有无界、独立驱动的腿关节
机构 * Stanford University(斯坦福大学)
AI总结 本文提出MiNI-Q^2微型无线四足机器人,通过无界独立驱动腿关节设计实现多种运动模式,速度达0.46 m/s,可折叠至2.5 cm高度,并开源所有设计文件。
Comments 7 pages, 11 figures. Submitted to the IEEE RAS Conference on Ubiquitous Robots (UR 2026)
HALO:通过异质智能体李雅普诺夫策略优化学习人机协作
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 针对人机协作中人类行为多样性和环境变化导致的泛化与鲁棒性问题,提出异质智能体李雅普诺夫策略优化(HALO)框架,通过李雅普诺夫收缩稳定去中心化多智能体强化学习,并利用最优二次投影修正梯度,实现理性差距的单调收缩,提升协作性能。
Comments https://HaoZhang-THU.github.io/HALO/