RAG over Thinking Traces Can Improve Reasoning Tasks
RAG 基于思考轨迹可提升推理任务
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出检索思考轨迹而非文档,通过 T3 方法将其转化为结构化表示,在推理任务上显著提升性能,超越标准 RAG 和无 RAG 基线。
高校专区
RAG 基于思考轨迹可提升推理任务
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出检索思考轨迹而非文档,通过 T3 方法将其转化为结构化表示,在推理任务上显著提升性能,超越标准 RAG 和无 RAG 基线。
双曲神经群体几何结构有益于计算
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文提出海马体群体活动诱导双曲几何的理论框架,证明现代Hopfield网络更新规则计算最小均方误差估计,并引入双曲空间中的新联想记忆模型,其容量显著优于现有模型。
Comments Accepted at ICML 2026, 37 pages, 5 figures
强化学习中流策略的测试时梯度引导
机构 * UC Berkeley(加州大学伯克利分校) ; Physical Intelligence
AI总结 提出QGF算法,通过预训练参考流策略和价值函数,在测试时利用价值梯度引导策略生成高价值动作,无需额外策略学习,在离线RL基准上优于现有测试时方法且与训练时方法竞争力相当。
谁把复活节彩蛋带到了开斋节?跨语言和地区数学应用题的文化翻译审计
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 本研究审计了三个大型语言模型将60个英语数学应用题翻译为7种语言时的文化适应性,发现模型在62.5%的案例中一致,但仅33.5%有相同替换,且所有组合均出现熵塌缩,优先改变表面标记而保留深层结构,导致文化多样性压缩和区域误归因。
Comments 17 pages total with references and appendix, 9 figures, under review
基于信息增益规划与信念融合的多无人机主动感知
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出多无人机主动感知框架,利用信息增益路径规划与概率信念融合实现二元地形映射,在合成和真实农业图像上验证,相比随机游走和扫描覆盖降低熵与误差。
缩小零样本HAR中的模态差距:基于IMU数据的对比训练与可分性优化原型
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 针对IMU基零样本人体活动识别中的模态差距问题,提出对比训练与描述性原型结合的方法,在PAMAP2数据集上实现73.2%准确率和0.583宏F1,并指出宏F1更适合作为评估指标。
Comments 17 pages, 7 figures
基于自举流Q学习的离线强化学习快速且高表达性策略学习
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出自举流Q学习(BFQ),通过分治位移向量并自举短程分量,实现单步动作生成,无需辅助网络或蒸馏,显著降低计算成本并提升性能。
Comments ICML 2026, 19 pages
Journal ref ICML 2026
GaussTrace:基于证据的LLM推理的3D高斯泼溅模型溯源分析
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出GaussTrace框架,通过属性统计分析和假设驱动的编辑模拟,结合大语言模型链式推理,构建3D高斯泼溅模型的有向溯源图,无需训练或编辑历史。
Comments Accepted by ICML2026
将混合系统嵌入连续潜在向量场
机构 * University of California, Berkeley, CA, USA(加州大学伯克利分校) ; University of Michigan, Ann Arbor, MI, USA(密歇根大学安娜堡分校)
AI总结 证明当m>2n时,n维混合系统可嵌入m维欧氏空间中的连续向量场,并基于此提出一种潜在神经ODE方法,从时间序列数据中准确恢复混合系统流,优于现有方法。
Comments Accepted to ICML 2026
面向多样化科学假设搜索的大语言模型
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 针对科学假设搜索中多样性崩溃问题,提出基于并行回火的多温度进化框架,在固定验证预算下提升假设质量与多样性。
Comments ICML 2026
LieIPM:用于刚体直接轨迹优化的李群内点法
机构 * University of California, Berkeley(加州大学伯克利分校) ; MIT(麻省理工学院) ; Ohio University(俄亥俄大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校)
AI总结 提出一种基于李群结构的约束轨迹优化框架LieIPM,利用二阶刚体模型和变分积分器,实现无奇异、快速收敛的牛顿型更新。
测试时对抗接管:针对机器人扩散策略的实时劫持接口
机构 * Tsinghua University(清华大学) ; Independent Researcher(独立研究员) ; Johns Hopkins University(约翰霍普金斯大学) ; UC Berkeley(加州大学伯克利分校)
AI总结 提出测试时对抗接管(TAKO)方法,通过可微扩散推理学习可重复使用的通用补丁,在测试时切换补丁以劫持机器人策略,实现远程操控,在多种任务和模型上达到100%接管成功率。
SARM2: 多任务阶段感知奖励建模用于自我改进的机器人操作
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 提出多任务阶段感知奖励模型RM,结合动作基元阶段估计器和多门控专家混合值头,为机器人操作任务提供密集逐步奖励,并基于RM构建SPIRAL框架,通过廉价自主轨迹改进VLA策略,在10任务基准上显著提升成功率。
基准测试与探索LLM在攻击调查中的能力
机构 * University of Chicago(芝加哥大学) ; University of California, Berkeley(加州大学伯克利分校) ; Google(谷歌)
AI总结 提出AuditBench基准数据集,评估LLM在安全审计日志分析中的性能,涵盖四种常见调查任务,揭示模型在不同设计选择下的表现差异与错误类型。
对齐防御LLM免受属性推断攻击
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Carnegie Mellon University(卡内基梅隆大学) ; Simons Institute, UC Berkeley(伯克利大学Simons研究所)
AI总结 提出基于对齐的防御方法,通过后训练调整模型输出分布,在不修改训练数据的情况下缓解属性推断攻击,并保持效用与机密性的平衡。
本地并非充分的隐私边界:治理操作系统集成的设备端AI
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文提出一个以操作系统为中心的隐私框架,将隐私视为制度问责问题而非部署属性,通过威胁模型、六部分隐私风险分类、隐私架构控制和四级审计标准来治理设备端AI。
DB-3DME:从数据集到基准测试,实现与人类对齐的自动3D网格评估
机构 * University of California, Berkeley(加州大学伯克利分校) ; Roblox Corporation(Roblox公司)
AI总结 提出DB-3DME数据集与基准,包含2619个合成3D网格及其人类评分,通过微调视觉编码器优化VLM评估性能,显著超越现有模型。
Comments CVPR 2026 workshop paper. 10 pages, 3 figures, 6 tables. Dataset available at GitHub and Hugging Face
公共医学视觉语言基准中预训练污染的受控审计
机构 * Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校) ; Mayo Clinic(梅奥诊所)
AI总结 审计发现公共医学VLM基准存在图像源重叠和文本规范顺序交换性信号,但确认的像素级重复罕见,且现有成员推理检测器在小规模医学VLM队列中不可靠。
Comments 30 pages, 7 figures, 9 tables. Preprint
FailureScope: 语言模型弱点的跨机制行为诊断
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出FailureScope方法,通过跨模型通过/失败模式聚类评估探针,在单轮基准、多轮对话和对抗性代理攻击三种机制下稳定生成可解释的失败分类,实现高效任务采样和跨模型失败预测。
对话者效应:为什么LLMs向智能体泄露的个人数据比向人类多
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 研究发现LLMs在与AI智能体对话时比与人类对话更易泄露个人身份信息,通过注意力抑制假说解释该现象,实验表明安全对齐注意力头在智能体交互中失活导致泄露增加23个百分点。
范围惩罚:理论洞见及其在联邦学习中的应用
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出范围正则化方法,通过极值聚类实现跨客户端正则化,并开发非渐近统计精度与模式恢复的新证明技术,以及利用局部强凸性的快速优化算法。
SynIB: 多模态学习中最大化协同的信息瓶颈
机构 * University of California, Berkeley(加州大学伯克利分校) ; Google Research(谷歌研究院) ; University of Amsterdam(阿姆斯特丹大学)
AI总结 提出SynIB方法,通过信息瓶颈理论直接优化多模态协同,在训练中屏蔽单模态时惩罚高置信度,提升跨模态推理能力,在合成和真实任务上准确率提升达7.8%。
LLM引导的神经架构搜索用于物理神经网络的鲁棒协同设计
机构 * University of California, Berkeley(加州大学伯克利分校) ; DeepMind(深度思维)
AI总结 提出UH-NAS框架,利用大语言模型作为进化算子,协同优化任务准确率和推理能耗,实现跨硬件平台的公平比较,在光学MZI硬件上发现更鲁棒的架构。
通过Lingua Franca实现ROS 2应用的确定性执行
机构 * TU Dortmund University(多特蒙德工业大学) ; University of California, Berkeley(加州大学伯克利分校) ; RWTH Aachen University(亚琛工业大学)
AI总结 提出框架将未修改的ROS 2应用转换为Lingua Franca程序,利用逻辑时间实现确定性执行,解决ROS 2中回调执行顺序和消息交织的非确定性问题。
注意力电路何时形成?三种1B级架构中能力和注意力汇出现的发育轨迹
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文追踪三种1B级语言模型中注意力头电路的形成轨迹,发现归纳电路形成早于注意力汇形成10-20倍令牌,且电路识别无需最终模型。
Comments 27pages, 3 figures
通信动力学神经网络:用于改进Hessian条件数并减少参数数量的FFT对角化层
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出CDLinear块循环线性层,通过FFT对角化Hessian矩阵,在参数减少3.8倍下保持高精度,并给出显式条件数分析。
Comments 17 pages, 5 figures. Includes NumPy implementation, gradient checks, MNIST experiments, and reference PyTorch CD-Transformer implementation
不耐烦的用户混淆AI智能体:用于测试智能体的高保真人类特质模拟
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出TraitBasis方法,通过控制用户特质向量(如不耐烦、不连贯)对AI智能体进行压力测试,发现性能下降2%-30%,揭示当前智能体对用户行为变化的脆弱性。
Comments ACL 2026 [Oral]
AnomaMind:基于工具增强推理的智能体时间序列异常检测
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出AnomaMind框架,将时间序列异常检测重构为顺序决策过程,通过粗到细的工作流(定位可疑区间、工具交互构建诊断证据、自我反思细化决策)结合知识记忆与数值诊断工具包,并采用混合推理机制,显著提升域内和跨域异常检测性能与泛化能力。
通过检索增强生成和多目标对齐统一查询自动补全中的排序与生成
机构 * Apple(苹果公司) ; UC Berkeley(加州大学伯克利分校)
AI总结 提出一个统一框架,通过检索增强生成(RAG)和多目标直接偏好优化(DPO)将查询自动补全重构为端到端列表生成,解决传统流水线长尾覆盖不足和生成方法幻觉风险的问题,并在大规模商业搜索平台上验证了有效性。
Comments 11 pages, 4 figures
Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea
子采样自然梯度算法的草图-投影分析
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 通过将子采样自然梯度下降(SNG)视为草图-投影方法,提出基于平方体积采样的新代理,证明单小批量下SNG方向期望等于预处理梯度下降步,给出全局收敛保证和显式收敛率,并解释SNG相对于SGD的优势在于更有效利用模型雅可比矩阵的谱衰减。
Comments 26 pages, 7 figures