arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

共收录 1883
2605.05945 2026-07-09 cs.CV cs.CL

MobileEgo Anywhere: Open Infrastructure for long horizon egocentric data on commodity hardware

MobileEgo Anywhere:基于商用硬件的长时域自我中心数据开放基础设施

Senthil Palanisamy, Abhishek Anand, Satpal Singh Rathore, Pratyush Patnaik, Shubhanshu Khatana, Ekaksh Janweja

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校) University of California, Santa Barbara(加州大学圣巴巴拉分校)

AI总结 提出MobileEgo Anywhere框架,利用智能手机传感器实现超过一小时的自我中心轨迹采集,并发布开源处理流水线STERA、移动应用及200小时数据集,验证其在视觉-语言-动作模型训练中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18164 2026-07-09 cs.RO 版本更新

GrandTour: A Legged Robotics Dataset in the Wild for Multi-Modal Perception and State Estimation

GrandTour: 一种用于多模态感知与状态估计的野外腿式机器人数据集

Turcan Tuna, Jonas Frey, Frank Fu, Katharine Patterson, Tianao Xu, Maurice Fallon, Cesar Cadena, Marco Hutter

机构 * ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) UC Berkeley(伯克利大学) Oxford University(牛津大学)

AI总结 GrandTour数据集为多模态感知与状态估计提供了大规模野外腿式机器人数据,支持SLAM和高精度状态估计的研究与开发。

Comments Turcan Tuna, and Jonas Frey contributed equally. Submitted to Sage The International Journal of Robotics Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21556 2026-07-09 cs.AI cs.GT 版本更新

Power and Limitations of Aggregation in Compound AI Systems

复合人工智能系统中聚合的力量与局限性

Nivasini Ananthakrishnan, Meena Jagadeesan

机构 * UC Berkeley(伯克利大学) Stanford University(斯坦福大学)

AI总结 研究复合人工智能系统中聚合的力量与局限性,在委托 - 代理框架内揭示可行性扩展等三种机制,证明其对引出能力扩展的作用,通过玩具任务实证说明结果,朝表征系统克服相关局限迈进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05088 2026-07-09 cs.AI 版本更新

AI Chatbot Suicide Risk Detection and Response: Human Validation Study of the Open-Source VERA-MH Safety Evaluation

人工智能聊天机器人自杀风险检测与应对:开源VERA-MH安全评估的人工验证研究

Kate H. Bentley, Luca Belli, Adam M. Chekroud, Emily J. Ward, Emily R. Dworkin, Emily Van Ark, Kelly M. Johnston, Will Alexander, Millard Brown, Matt Hawrilenko

机构 * Spring Health Harvard Medical School(哈佛医学院) UC Berkeley(加州大学伯克利分校) Yale University(耶鲁大学)

AI总结 研究针对人工智能聊天机器人用于心理支持时的安全性评估问题,以VERA-MH为基准,模拟用户与聊天机器人对话,通过持牌临床医生和基于LLM的评估器评级,验证了VERA-MH在检测自杀风险方面的可靠性,为后续研究指明方向。

Journal ref JMIR AI. 2026;5

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05908 2026-07-08 cs.LG 新提交

Drift Happens: An Empirical Study of Neural Architecture Robustness to Temporal Distribution Shift

漂移会发生:对神经架构对时间分布变化的鲁棒性的实证研究

Robin Holzinger, Riccardo Colletti

机构 * Department of Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电气工程与计算机科学系)

AI总结 研究现实世界数据分布随时间演变带来的时间分布变化对机器学习系统可靠性的影响,通过统一评估框架比较不同模型家族的时间鲁棒性,发现架构归纳偏差塑造时间鲁棒性,为现实系统选架构提供指导。

Comments 33 pages, 28 figures. Extended version of the QCDS 2026 proceedings paper; proceedings version to appear in Springer LNCS. Interactive website: https://drift-happens.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05711 2026-07-08 cs.LG cs.CV 新提交

FourTune: Towards Fully 4-Bit Efficient Post-Training for Diffusion Models

FourTune:迈向扩散模型的全4位高效训练后优化

Bowen Xue, Zihan Min, Xingyang Li, Zhekai Zhang, Haocheng Xi, Lvmin Zhang, Maneesh Agrawala, Jun-Yan Zhu, Song Han, Yujun Lin, Muyang Li

机构 * Nunchux AI MIT(麻省理工学院) CMU(卡内基梅隆大学) UC Berkeley(加州大学伯克利分校)

AI总结 针对大型扩散模型训练后优化的挑战,提出FourTune框架,基于端到端W4A4G4范式,引入三分支混合管道、硬件高效量化等,在多任务中质量与全精度微调相当,在特定数据集上降低内存开销、提高训练吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05404 2026-07-08 cs.CY cs.AI 新提交

The Jagged Global Economy: Frontier AI Unevenly Exposes National Economies

参差不齐的全球经济:前沿人工智能对各国经济的不均衡影响

Arul Murugan, Tomás Aguirre, Abhishek Nagaraj, Rishi Bommasani

机构 * UC Berkeley(伯克利大学) University of São Paulo(圣保罗大学) Stanford University(斯坦福大学)

AI总结 研究前沿人工智能对各国经济的影响,引入国家人工智能暴露度量指标,结合职业暴露分数与就业数据,发现高收入国家暴露程度高、存在性别差距,有间接暴露新机制,指出针对欧美劳动力市场的政策无法推广。

Comments Website (including code and data): https://jagged-global-economy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05391 2026-07-08 cs.AI cs.CL cs.LG cs.MA cs.RO 新提交

LLM-as-a-Verifier: A General-Purpose Verification Framework

LLM-as-a-Verifier:一种通用验证框架

Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) NVIDIA Research(英伟达研究院)

AI总结 该工作将验证确定方案正确性的能力作为大模型新扩展轴,提出无需额外训练的通用LLM验证框架,生成连续评分,在多基准上取得SOTA性能,还可用于强化学习等场景。

Comments Code: https://github.com/llm-as-a-verifier/llm-as-a-verifier Website: https://llm-as-a-verifier.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00476 2026-07-08 cs.AI 版本更新

Doing What They Say, Not What They Reason: Locating the Faithfulness Gap in LLM Agents

做他们所说的,而不是他们所推理的:定位LLM智能体中的忠实性差距

Yufeng Wang

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 通过将忠实性差距分解为推理-结论和结论-行动两个步骤,在可控的德克萨斯扑克模拟器中研究LLM智能体是否按照其陈述的推理行动。

Comments submitted to COLM social simulation with LLM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10439 2026-07-08 cs.CV 版本更新

Filtering Memorization from Parameter-Space in Diffusion Models

从参数空间过滤记忆化在扩散模型中

Yu Zhe, Yang Jiayan, Wei Junhao, Yu-Lin Tsai, Wang Chen

机构 * RIKEN AIP(理化学研究所Advanced Institute for Peripheral Research) Science of Tokyo(东京科学大学) University of California, Berkeley(加州大学伯克利分校) Zhejiang University(浙江大学)

AI总结 本文提出BAF框架,通过分解LoRA更新并测量其与预训练骨干的主子空间对齐度,实现训练后记忆抑制,减少生成内容中的版权或敏感内容复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05369 2026-07-07 cs.RO cs.AI cs.CL cs.LG 新提交

GaP: A Graph-as-Policy Multi-Agent Self-Learning Harness For Variational Automation Tasks

GaP:面向变分自动化任务的图即策略多智能体自学习框架

Kaiyuan Chen, Shuangyu Xie, Letian Fu, Justin Yu, William Pacini, Sandeep Bajamahal, Hudson Kim, Jaimyn Drake, Daehwa Kim, Haoru Xue, Jonathan Francis, Christian Juette, Peter Schaldenbrand, Muhammet Yunus Seker, Ruwan Wickramarachchi, Uksang Yoo, Guanzhi Wang, Adithyavairavan Murali, Balakumar Sundaralingam, S. Shankar Sastry, Spencer Huang, Yuke Zhu, Linxi "Jim" Fan, Ken Goldberg

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校) NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) Bosch(博世)

AI总结 针对变分自动化任务无模型策略可靠性不足问题,提出图即策略多智能体编码框架GaP,通过生成计算图并行迭代优化,在虚实8项基准上表现远超基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04686 2026-07-07 cs.CL cs.AI cs.SE 新提交

ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents

ToolFailBench:诊断大语言模型智能体中的工具使用失败

Harsh Soni

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 介绍ToolFailBench诊断基准,用于衡量金融、医学等领域1000个任务中的工具使用失败情况。通过规则分类器和大语言模型裁判标注失败类型,发现模型工具使用存在差异,强调评估应考量多方面。

Comments 18 pages, 3 figures. Published at the Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) and the Workshop on Failure Modes of Agentic AI (FAGEN) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04610 2026-07-07 cs.RO 新提交

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications

RoboVista:评估用于各种机器人应用的视觉语言模型

Shuangyu Xie, Kaiyuan Chen, Ziyang Chen, Simeon Adebola, Yixuan Huang, Zehan Ma, Tianshuang Qiu, Wentao Yuan, Dhruv Shah, Pannag R. Sanketi, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

AI总结 研究针对机器人多样应用,提出模块化评估框架Robot Question Answering及基准RoboVista,其源于真实机器人系统等,含多任务类型VQA实例,实验表明现有视觉语言模型有差距,且与现实任务执行相关。

Comments Accepted to RSS 2026. Project website: https://berkeleyautomation.github.io/robovista/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03903 2026-07-07 cs.LG 新提交

CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning

CDCP:用于多任务离线安全强化学习的带上下文提示的条件扩散模型

Jiayi Guan, Tianle Zhang, Li Shen, Ruiqi Zhang, Ao Zhou, Lusong Li, Guai Chen, Mengjie Li, Alois Knoll, Xiaodong He, Changjun Jiang

机构 * Tongji University(同济大学) JD Explore Academy(京东探索研究院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院) Berkeley AI Research Lab, University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究实验室) Technical University of Munich(慕尼黑工业大学)

AI总结 针对多任务离线安全强化学习面临的挑战,提出CDCP模型。通过重新审视需求建立目标,用扩散模型转化问题,设计策略并引入新方法,提升性能与安全性,提供灵活成本约束解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03377 2026-07-07 cs.CL cs.AI 新提交

Spectral Signatures of Large Language Models

大语言模型的频谱特征

Zhuoying Zhang, Ishan V. Prasad, Yuanzhe Hu, Zihang Liu, Hengrui Luo, Pu Ren, Yaoqing Yang

机构 * Rice University(莱斯大学) Dartmouth College(达特茅斯学院) Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

AI总结 针对大规模管理和量化大语言模型的挑战,采用基于重尾自正则化理论的频谱形状指标,以权重经验谱密度形状信息为模型频谱特征,可用于模型谱系追踪等,还构建语料库进行基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03513 2026-07-07 physics.chem-ph cs.LG 新提交

AquaGen: Scaling generative models to molecular dynamics precision on thousands of atoms

AquaGen:将生成模型扩展到数千个原子的分子动力学精度

Emmanuel Bengio, Sanjeev Raja, Yui Tik Pang, Kerstin Klaeser, Cristian Gabellini, Nikhil Shenoy, Francesco Di Giovanni, Prudencio Tossou

机构 * Valence Labs(Valence实验室) UC Berkeley(加州大学伯克利分校)

AI总结 介绍AquaGen,首个全原子、显式溶剂、周期边界条件感知生成模型,以低成本从玻尔兹曼分布生成分子构型,用于后处理和预测相关属性,在绝对水合自由能预测上展示效用。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06667 2026-07-07 cs.CL 新提交

The Piggyback Hypothesis of Generalization: Explaining and Mitigating Emergent Misalignment

泛化的搭便车假说:解释和缓解涌现的错位

Jiachen Zhao, Zhengxuan Wu, Aryaman Arora, Yiyou Sun, David Bau, Weiyan Shi

机构 * Northeastern University(东北大学) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 提出搭便车假说,认为聊天模板标记导致微调行为泛化到无关领域,并设计TReFT方法通过正则化标记表示缓解涌现错位,在多个数据集上有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01908 2026-07-07 cs.LG cs.CV 版本更新

Private and Stable Test-Time Adaptation with Differential Privacy

具有差分隐私的私有且稳定的测试时自适应

Zefeng Li, Qiaoyue Tang, Mathias Lecuyer, Evan Shelhamer

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出将多种测试时自适应方法转化为差分隐私形式,通过逐样本梯度裁剪和高斯噪声保护测试数据隐私,在ImageNet-C上实现隐私与精度的平衡,并发现裁剪机制能提升连续自适应的准确性和稳定性。

Comments ICML 2026. Code: https://github.com/van-hammerheads/private-stable-tta

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08678 2026-07-07 cs.LG 版本更新

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI

MLS-Bench:对构建更好AI的AI系统的全面且严格评估

Bohan Lyu, Yucheng Yang, Siqiao Huang, Jiaru Zhang, Qixin Xu, Xinghan Li, Xinyang Han, Yicheng Zhang, Huaqing Zhang, Runhan Huang, Kaicheng Yang, Zitao Chen, Wentao Guo, Junlin Yang, Xinyue Ai, Wenhao Chai, Yadi Cao, Ziran Yang, Kun Wang, Dapeng Jiang, Huan-ang Gao, Shange Tang, Chengshuai Shi, Simon S. Du, Max Simchowitz, Jiantao Jiao, Dawn Song, Chi Jin

机构 * UC Berkeley(伯克利大学) Princeton University(普林斯顿大学) Tsinghua University(清华大学) University of Washington(华盛顿大学) Purdue University(Purdue 大学) Harvard University(哈佛大学) University of Pennsylvania(宾夕法尼亚大学) Shanghai Jiao Tong University(上海交通大学) UC San Diego(圣地亚哥大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出MLS-Bench基准,包含12个领域140个任务,评估AI系统能否发明通用且可扩展的机器学习方法,发现当前智能体在方法发明上仍远逊于人类,瓶颈在于科学洞察而非单纯搜索或计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19048 2026-07-07 cs.CV 版本更新

Measuring 3D Spatial Geometric Consistency in Dynamic Video Generation

动态生成视频中3D空间几何一致性的测量

Weijia Dou, Wenzhao Zheng, Weiliang Chen, Yu Zheng, Jie Zhou, Jiwen Lu

机构 * Tongji University(同济大学) Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出SGC指标,用于评估动态生成视频中的3D空间几何一致性,通过分析多个相机姿态的分歧度来量化几何不一致问题,实验证实其能有效识别现有方法遗漏的关键故障。

Comments Accepted at ECCV 2026. Code is available at https://github.com/tj12323/SGC

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13259 2026-07-07 cs.CL cs.AI 版本更新

How Transformers Reject Wrong Answers: Rotational Dynamics of Factual Constraint Processing

Transformer 如何拒绝错误答案:事实约束处理的旋转动力学

Javier Marín

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 研究揭示了Transformer在处理事实性问题时,隐藏状态空间中正确与错误延续路径的旋转分离现象,揭示了模型在深层结构中对错误延续的非局部化偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08982 2026-07-07 cs.CV 版本更新

SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing

SVG-EAR:通过误差感知路由实现稀疏视频生成的无参数线性补偿

Xuanyi Zhou, Qiuyang Mang, Shuo Yang, Haocheng Xi, Jintao Zhang, Huanzhi Mao, Joseph E. Gonzalez, Kurt Keutzer, Ion Stoica, Alvin Cheung

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 研究视频生成中扩散变换器二次注意力成本瓶颈问题,提出SVG-EAR,利用语义聚类后块内键值相似性,通过质心近似跳过块,用误差感知路由计算需精确补偿块,提升质量效率权衡并提高吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08150 2026-07-07 stat.ML cs.LG stat.ME 版本更新

CLEAR: Calibrated Learning for Epistemic and Aleatoric Risk

CLEAR:认知风险和偶然风险的校准学习

Ilia Azizi, Juraj Bodik, Jakob Heiss, Bin Yu

机构 * Department of Operations, HEC, University of Lausanne(洛桑大学运营管理系) Department of Statistics, University of California, Berkeley(加州大学伯克利分校统计系) Department of Electrical Engineering and Computer Science, University of California, Berkeley(加州大学伯克利分校电气工程与计算机科学系) BegooAI

AI总结 提出校准方法CLEAR,用两个参数结合测量噪声偶然不确定性与数据有限认知不确定性,提升回归任务预测区间条件覆盖率,与多种估计器兼容,在多数据集上效果良好。

Comments Project page: https://unco3892.github.io/clear/

Journal ref Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09530 2026-07-07 cs.LG cs.AI cs.NA math.NA 版本更新

Learning to Discover Iterative Spectral Algorithms

学习发现迭代谱算法

Zihang Liu, Oleg Balabanov, Yaoqing Yang, Michael W. Mahoney

机构 * International Computer Science Institute(国际计算机科学研究所) University of California Berkeley(加州大学伯克利分校) Dartmouth College(达特茅斯学院) Lawrence Berkeley National Laboratory(伯克利国家实验室)

AI总结 介绍用于发现大规模数值线性代数和数值优化迭代谱算法的神经网络框架AutoSpec,用粗谱信息适应输入算子,预测递归系数,应用于代表性任务有显著改进,还与经典理论有联系。

Comments Code available at: https://github.com/zihanghliu/AutoSpec

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13680 2026-07-07 cs.LG stat.ME

Hybrid Meta-learners for Estimating Heterogeneous Treatment Effects

混合元学习器用于估计异质处理效应

Zhongyuan Liang, Lars van der Laan, Ahmed Alaa

机构 * UC Berkeley(伯克利大学) UCSF(旧金山加州大学) University of Washington(华盛顿大学)

AI总结 本文提出混合学习器,通过结合直接和间接正则化策略,改进异质处理效应估计的偏差-方差权衡,实验证明其在半合成和真实数据集上均处于帕累托前沿。

Journal ref Proceedings of the 29th International Conference on Artificial Intelligence and Statistics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01251 2026-07-07 cs.RO 版本更新

Towards Data-Driven Metrics for Social Robot Navigation Benchmarking

迈向用于社交机器人导航基准测试的数据驱动指标

Pilar Bachiller-Burgos, Ulysses Bernardet, Luis V. Calderita, Pranup Chhetri, Anthony Francis, Noriaki Hirose, Noé Pérez, Dhruv Shah, Phani T. Singamaneni, Xuesu Xiao, Luis J. Manso

机构 * Aston University(阿斯顿大学) Logical Robotics(逻辑机器人公司) University of California Berkeley(加州大学伯克利分校) TOYOTA Motor North America(丰田北美公司) Princeton University(普林斯顿大学) LAAS-CNRS(LAAS-CNRS研究所) George Mason University(乔治·梅森大学)

AI总结 致力于开发数据驱动的社交机器人导航指标以促进地面机器人基准测试和策略优化,介绍方法动机、数据集格式等,给出首个全面的学习社交机器人导航指标及相关结果。

Comments This work was presented at the 18th International Conference on Social Robotics (ICSR'2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15061 2026-07-07 cs.RO cs.CV 版本更新

Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue

Ask-to-Clarify: 通过多轮对话解决指令歧义

Xingyao Lin, Xinghao Zhu, Tianyi Lu, Guojin Zhong, Sicheng Xie, Hui Zhang, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Mechanical Systems Control Lab, UC Berkeley, California, USA(伯克利机械系统控制实验室)

AI总结 本文提出Ask-to-Clarify框架,通过多轮对话解决指令歧义问题,结合视觉语言模型和扩散模型,采用两阶段知识绝缘策略训练,实现多任务中更高效的协作式具身代理。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23845 2026-07-07 cs.LG cs.AI cs.CL cs.CY 版本更新

Position: Use Sparse Autoencoders to Discover Unknowns

定位:使用稀疏自编码器发现未知因素

Kenny Peng, Rajiv Movva, Jon Kleinberg, Emma Pierson, Nikhil Garg

机构 * Cornell University(康奈尔大学) UC Berkeley(伯克利大学)

AI总结 研究围绕稀疏自编码器(SAEs)的不同观点,指出其虽在作用于已知概念时效果欠佳,但在发现未知概念上很强大,还给出了在机器学习及社会健康科学等方面的应用案例。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08928 2026-07-07 cs.LG stat.ME stat.ML

Local MDI+: Local Feature Importances for Tree-Based Models

Local MDI+: 基于树的模型的局部特征重要性

Zhongyuan Liang, Zachary T. Rewolinski, Abhineet Agarwal, Tiffany M. Tang, Bin Yu

机构 * Department of Computational Precision Health(计算精准健康系) UC Berkeley(伯克利大学) UCSF(旧金山分校) Department of Statistics(统计系) Department of Applied and Computational Mathematics and Statistics(应用与计算数学和统计系) University of Notre Dame(诺特大学) Department of Statistics and EECS(统计系和电子工程与计算机科学系)

AI总结 提出Local MDI+ (LMDI+)方法,通过扩展MDI+框架到局部特征重要性,在12个基准数据集上平均提升10%的预测性能,并展现出更高的稳定性和可解释性。

Journal ref Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19625 2026-07-07 cs.LG

Revealing Treatment Non-Adherence Bias in Clinical Machine Learning Using Large Language Models

利用大语言模型揭示临床机器学习中的治疗不依从偏差

Zhongyuan Liang, Arvind Suresh, Irene Y. Chen

机构 * UC Berkeley and UCSF(伯克利大学和旧金山加州大学)

AI总结 本文研究了治疗不依从如何通过EHR数据引入隐性偏差,影响因果推断和预测模型。通过LLM提取临床笔记,发现21.7%患者存在药物不依从,揭示了与不依从相关的关键因素及患者报告的原因,强调了在开发负责任且公平的临床机器学习系统中考虑治疗不依从的重要性。

Journal ref Proceedings of the 5th Conference on Health, Inference, and Learning, PMLR 287:430-442, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏