arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

共收录 1883
2608.13522 2026-08-14 cs.LG cs.AI cs.LO cs.PL cs.SE 新提交

Vero: Can AI Agents Build Formally Verified Software Repositories?

Vero:AI智能体能否构建形式化验证的软件仓库?

Zhe Ye, Hantao Lou, Yuechun Sun, Peiyang Song, Zhengxu Yan, Timothe Kasriel, Qingyang Zhang, Kaiyu Yang, Soonho Kong, Jingxuan He, Dawn Song

机构 * University of Chicago(芝加哥大学) California Institute of Technology(加州理工学院) Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Amazon Web Services(亚马逊云计算服务) Apodex

AI总结 研究推出首个仓库级验证软件综合基准Vero,含43个多模块实例,评估发现前沿智能体仅解决27个实例,为相关研究提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16878 2026-08-14 cs.LG 版本更新

OC-Distill: Ontology-aware Contrastive Learning with Cross-Modal Distillation for ICU Risk Prediction

OC-Distill:基于跨模态蒸馏的面向本体的对比学习用于ICU风险预测

Zhongyuan Liang, Junhyung Jo, Hyang-Jung Lee, Sang Kyu Kim, Irene Y. Chen

机构 * UC Berkeley(伯克利大学) UCSF(旧金山大学) Samsung Advanced Institute of Technology (SAIT)(三星先进技术研究所)

AI总结 OC-Distill通过两阶段框架提升ICU风险预测性能,利用本体感知对比学习和跨模态知识蒸馏,提高模型对患者相似性的捕捉能力及预测效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15076 2026-08-14 cs.LG cs.DM cs.DS 版本更新

Online Correlation Clustering: Simultaneously Optimizing All $\ell_p$-norms

Sami Davies, Benjamin Moseley, Heather Newman

机构 * Department of EECS at UC Berkeley(伯克利大学电子工程与计算机科学系) RelationalAI Tepper School of Business, Carnegie Mellon University(卡内基梅隆大学泰珀商学院) Carnegie Mellon University(卡内基梅隆大学) Department of Computer Science, Vassar College(瓦萨学院计算机科学系)

Comments 67 pages, appeared in ICALP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12253 2026-08-13 cs.CL cs.AI cs.LG 新提交

One Frozen Simulator Is Not Enough: Simulator Collapse in Multi-Agent RL

单个冻结模拟器不够:多智能体强化学习中的模拟器崩溃问题

Simon Yu, Nicholas Tomlin, Marwa Abdulhai, Ximing Lu, Derek Chong, Abe Hou, Dilara Soylu, Sergey Levine, Christopher D. Manning, Weiyan Shi

机构 * Northeastern University(东北大学) New York University(纽约大学) UC Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

AI总结 针对人机交互多智能体强化学习中单个LLM模拟器导致的策略泛化缺陷,提出Verbalized Sampling和Co-Training两种方案,在多轮基准测试和真实用户研究中显著提升了性能,发布了开源框架SCOPE。

Comments 41 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23733 2026-08-13 cs.CL 版本更新

Multimodal QUD: Inquisitive Questions from Scientific Figures

多模态QUD:来自科学图表的探究性问题

Yating Wu, William Rudman, Venkata S Govindarajan, Alexandros G. Dimakis, Junyi Jessy Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Ithaca College(伊萨卡学院) UC Berkeley, BespokeLabs.ai(伯克利大学,BespokeLabs.ai)

AI总结 本文提出多模态QUD数据集,通过结合图表与文本上下文生成探究性问题,提升多模态推理能力,实现更高质量的视觉 grounding。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06710 2026-08-13 cs.RO 版本更新

RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models

RLinf-VLA: 一种用于视觉-语言-动作模型强化学习的统一高效框架

Hongzhi Zang, Mingjie Wei, Si Xu, Yongji Wu, Zhen Guo, Yuanqing Wang, Hao Lin, Peihong Wang, Liangzhi Shi, Yuqing Xie, Zhexuan Xu, Zhihao Liu, Kang Chen, Wenhao Tang, Quanlu Zhang, Weinan Zhang, Chao Yu, Yu Wang

机构 * Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Infinigence AI Peking University(北京大学) UC Berkeley(加州大学伯克利分校) Harbin Institute of Technology(哈尔滨工程学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 RLinf-VLA是一种统一高效的框架,用于提升视觉-语言-动作模型在具身环境中的强化学习性能,通过统一接口和高效资源分配实现统一和可扩展的训练。

Comments Accepted to RSS 2026. This is the technical report of the RLinf Team, focusing on the algorithm side. For the system-level design, please refer to arXiv:2509.15965. The open-sourced code link: https://github.com/RLinf/RLinf

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13450 2026-08-13 cs.AI cs.CL cs.LG 版本更新

SteeringSafety: Benchmarking Representation Steering in LLMs Across Safety Perspectives

SteeringSafety:针对大语言模型在多安全视角下的表征引导基准测试

Vincent Siu, Nicholas Crispino, David Park, Nathan W. Henry, Zhun Wang, Yang Liu, Dawn Song, Chenguang Wang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Washington University in St. Louis(华盛顿大学圣路易斯分校) University of California, Berkeley(加州大学伯克利分校)

AI总结 本研究推出SteeringSafety基准,测试DIM等引导方法在3款大模型的9种安全视角表现,发现方法与模型、视角的匹配影响性能,且存在多视角纠缠问题,需多安全角度评估引导方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10492 2026-08-12 cs.AI cs.CY 新提交

INSIDE the Student's Mind: Jointly Modeling Latent Reasoning and Action in LLM Student Simulators

洞察学生的思维:在LLM学生模拟器中联合建模潜在推理与行动

Rose Niousha, Minwoo Kang, Narges Norouzi

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校)

AI总结 该研究针对LLM学生模拟器仅复现学生行动却未捕捉其潜在推理的问题,提出INSIDE框架,通过在配对思考轨迹与行动上微调LLM,提升了模拟行动保真度与推理对齐度,最高对齐度达57.9%。

Comments Accepted at the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00135 2026-08-12 cs.LG cs.AI 版本更新

On Effectiveness and Efficiency of Agentic Tool-calling and RL Training

论智能体工具调用与强化学习训练的有效性与效率

Tong Liu, Cheng Qian, Matej Cief, Yuan He, Daniele Dan, Nikolaos Aletras, Gabriella Kazai

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Toronto(多伦多大学)

AI总结 本文系统分析工具调用评估中的实现选择对结果敏感性的影响,并针对强化学习训练中的计算浪费提出两种加速技术。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23146 2026-08-12 cs.LG cs.AI 版本更新

Infra-Bayesian Reinforcement Learning Agents Outperform Classical RL For Worst-Case Robustness

Infra-Bayesian 强化学习智能体在最坏情况鲁棒性上优于经典强化学习

Manish Aryal, Faiyaz Azam, Agnivo Banerjee, Syed Mahir Ahamed, Sai Sidhanth Manoharan Jayanthi, Allegra Laro, Clément Legentilhomme, Andrew Lin, Florian Lorkowski, Marina Pérez del Valle, Radman Rakhshandehroo, Patric Rommel, Emanuel Ruzak, Nathan Theng, Paul Yushin Rapoport

机构 * Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学) WorldQuant University(WorldQuant大学) UC Berkeley(加州大学伯克利分校) Aix-Marseille University(阿维尼翁-马赛大学) MIT(麻省理工学院) University of Zurich(苏黎世大学) University of British Columbia(不列颠哥伦比亚大学) University of Stuttgart(斯图加特大学) University of Buenos Aires(布宜诺斯艾利斯大学) California State University, Fresno(弗雷斯诺加州州立大学) University of Chicago(芝加哥大学)

AI总结 针对经典强化学习在模型误设和策略依赖不确定性下的失败,提出 Infra-Bayesian 框架,通过区分概率不确定性和 Knightian 不确定性并采用最坏情况决策,在有限状态无状态决策问题中实现更低的最坏情况遗憾。

Comments RLC 2026: Accepted to Finding the Frame Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09874 2026-08-11 cs.AI cs.AR 新提交

ArchAgent v2: A Case Study with the Data Prefetching Championship

ArchAgent v2:数据预取锦标赛的案例研究

Abraham Gonzalez, Raghav Gupta, Akanksha Jain, Hanna Alam, Alexander Novikov, Po-Sen Huang, Matej Balog, Marvin Eisenberger, Sergey Shirobokov, Ngân Vũ, Hank Levy, Borivoje Nikolić, Sagar Karandikar, Martin Dixon, Parthasarathy Ranganathan

机构 * Google(谷歌公司) University of California, Berkeley(加州大学伯克利分校) Google DeepMind(谷歌DeepMind)

AI总结 本研究提出ArchAgent v2框架,通过级联进化搜索和硬件可实现性反馈循环,在DPC4中自动设计出性能优于人工方案的三级预取器,为计算机架构师提供了自动化智能体发现的实用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09438 2026-08-11 cs.CV 新提交

Unveiling the Secret of AdaLN-Zero in Diffusion Transformer

揭示扩散Transformer中AdaLN-Zero的秘密

Jie Zhu, Mingyu Ding, Boqiang Duan, Leye Wang, Jingdong Wang

机构 * Peking University(北京大学) UC Berkeley(加州大学伯克利分校) Baidu(百度)

AI总结 本研究探究扩散Transformer(DiT)中AdaLN-Zero性能优于AdaLN的原因,发现零初始化是关键要素,提出AdaLN-Gaussian初始化策略与SE-adaLN-Zero机制,经多数据集实验验证其有效性与泛化性。

Comments Accept by IEEE TPAMI 2026, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09031 2026-08-11 cs.LG 新提交

HOPPER: Learnable Hop Extraction for Linearized Graph Sequence Models

HOPPER:用于线性化图序列模型的可学习跳提取方法

Isuru Herath, Arin Gopakumar, Sharan Sahu

机构 * Carnegie Mellon University(卡内基梅隆大学) UC Berkeley(加州大学伯克利分校) Cornell University(康奈尔大学)

AI总结 HOPPER是LGSM的可学习扩展,可提取跳序列以实现自适应图传播,在ECHO-Synth基准表现最优或具竞争力,调整结构记忆窗口可优化LRIM基准准确率,为长距离图表示学习提供灵活方法。

Comments 24 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08802 2026-08-11 cs.AI 新提交

Improving Generalization Robustness of Multimodal RLVR

提升多模态RLVR的泛化鲁棒性

Pengfei Zhou, Zhiwei Tang, Xiaopeng Peng, Chenrui Zhou, Lama Moukheiber, Yixing Ma, Bin Xu, Jiajun Song, Zhenglin Wan, Wangbo Zhao, Jiasheng Tang, Bohan Zhuang, Fan Wang, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学) University of California Berkeley(加州大学伯克利分校) Rochester Institute of Technology(罗切斯特理工学院) Georgia Institute of Technology(佐治亚理工学院) Renmin University of China(中国人民大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 针对多模态RLVR泛化鲁棒性不足的问题,提出含动态三元奖励与一致性正则化器的PIRL方法,压力测试与动态评估中其性能下降幅度均小于GRPO。

Comments 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07859 2026-08-11 cs.LG stat.ML 新提交

Adaptive KappaSharp: Condition-Number Shaping for Preferential Bayesian Optimization

自适应KappaSharp:用于偏好贝叶斯优化的条件数塑形

Ketong Shao, Jialu Wang, Xuekai Pei, Ali Mesbah

机构 * University of California, Berkeley(加州大学伯克利分校) Wuhan University(武汉大学)

AI总结 针对偏好贝叶斯优化中海森矩阵秩亏的结构性缺陷,提出自适应KappaSharp方法,通过条件数塑形优化,在11个含等离子医学控制器调优的基准上优于标准PBO基线,性能提升最高10.9%

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07600 2026-08-11 cs.RO eess.IV 新提交

AdaDexGrasp: Adaptive Dexterous Grasping via 3D Visuo-Tactile Representation Fusion

AdaDexGrasp:基于3D视觉-触觉表示融合的自适应灵巧抓取

Xirui Liang, Jiaqi Liang, Jingkai Xu, Yuran Wang, Ruochong Li, Yuanpei Chen, Masayoshi Tomizuka, Wei Zhan, Ruihai Wu

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 针对机器人抓取难以复刻人类视觉-触觉融合自适应能力的问题,提出AdaDexGrasp视觉-触觉融合抓取框架,通过3D表示融合实现接触感知抓取生成与优化,实验验证其提升了抓取成功率与泛化性。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07558 2026-08-11 cs.RO cs.CV 新提交

Learning Physical Interaction: A Survey of Tactile- and Force-aware Robot Learning

学习物理交互:触觉与力感知机器人学习综述

Shilin Shan, Chuhao Zhou, Ruize Wang, Xinyan Chen, Xiangyu Chen, Xinyu Zhou, Boyu Ma, Iris Yuxuan Hu, Jingliang Li, Celeste Yuxuan Hu, Geng Li, Guohao Chen, Tianrui Zhu, Zhe Li, Yanjie Ze, Haoran Geng, Zhiyang Dou, Jianxin Bi, Yuejiang Liu, Jianshu Zhou, Jiachen Li, Paul Liang, Tatsuya Harada, Robert Katzschmann, Harold Soh, Na Li, Edward Johns, Danica Kragic, Jan Peters, Wojciech Matusik, Masayoshi Tomizuka, Jitendra Malik, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) Stanford University(斯坦福大学) University of California, Berkeley(加利福尼亚大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Georgia Institute of Technology(佐治亚理工学院) The University of Tokyo(东京大学) ETH Zurich(苏黎世联邦理工学院) Harvard University(哈佛大学) Imperial College London(伦敦帝国学院) KTH Royal Institute of Technology(瑞典皇家理工学院) Technical University of Darmstadt(达姆施塔特工业大学)

AI总结 本综述针对力与触觉感知机器人学习研究的空白,提出TF-ART分类法,整合多模态感知与多阶段系统设计视角,兼具算法与实践意义。

Comments 53 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02587 2026-08-11 cs.SE cs.LG 版本更新

The Moving Target: A Longitudinal Audit of Trust-Benchmark Score Drift Across Open-Source Chat LLM Release Lines

移动目标:对开源聊天语言模型十二个检查点的可信度漂移进行纵向审计

Zhichao Fan, Yanhang Li, Zexin Zhuang, Xian Sun, Yingshuo Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南方 Methodist 大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 通过对四个开源版本系列在多提示模板下的信任基准测试,发现相邻版本间存在显著漂移,结论是发布线的信任分数应重新测量,而非沿用,应作为检查点相关的日期化工件报告。

Comments 6 pages, 1 figure; accepted at IEEE ICMLA 2026; title, presentation, and formatting revised from v1; empirical results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11949 2026-08-11 cs.LG cs.CR stat.ML 版本更新

Online Shift Detection and Conformal Adaptation for Deployed Safety Classifiers

已部署安全分类器的在线漂移检测与共形自适应

Jun Wen Leong

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出在线监测系统,使用校准序列统计检测分布漂移,并通过共形弃权层自适应阈值恢复目标错误率,在800个实验单元中实现86.6%有效检测。

Comments 38 pages, 8 figures, 18 tables. Code and pre-registration at https://github.com/junwenleong/safety-classifier-shift-monitor

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00959 2026-08-11 cs.AI 版本更新

Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition

通过部分信息分解理解多模态语言模型中的模态交互

Wanlong Fang, Tianle Zhang, Wen Tao, Alvin Chan

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 引入部分信息分解(PID)框架,分离感官和语言输入的独特、冗余和协同贡献,揭示多模态大模型中的模态使用模式,并扩展至三模态系统。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08116 2026-08-11 cs.LG cs.AI 版本更新

The Safety-Aware Denoiser for Text Diffusion Models

文本扩散模型的安全感知去噪器

Amman Yusuf, Zhejun Jiang, Mijung Park

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出安全感知去噪器(SAD),在文本扩散模型的迭代去噪过程中引导生成文本进入安全区域,无需重训练即可实现灵活的安全约束,有效降低不安全生成同时保持生成质量。

Comments 31 pages, 12 figures. Code available at: https://github.com/ParkLabML/SAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15062 2026-08-11 cs.CL cs.AI 版本更新

SAKE: Structured Agentic Knowledge Extrapolation for Complex LLM Reasoning via Reinforcement Learning

SAKE:通过强化学习进行复杂LLM推理的结构代理知识外推

Jiashu He, Jinxuan Fan, Bowen Jiang, Ignacio Houine, Dan Roth, Alejandro Ribeiro

机构 * University of Pennsylvania(宾夕法尼亚大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 SAKE通过强化学习训练LLM自主检索和外推结构化知识,提升生物医学和常识领域推理性能,同时减少90%以上token使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03685 2026-08-11 cs.LG cs.AI stat.ML 版本更新

Universal One-third Time Scaling in Learning Peaked Distributions

学习尖峰分布中的普适三分之一时间缩放

Yizhou Liu, Ziming Liu, Cengiz Pehlevan, Jeff Gore

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文通过理论分析和实验验证,揭示了使用softmax和交叉熵学习尖峰分布时,损失和梯度呈幂律衰减,导致损失时间缩放指数为1/3的普适瓶颈,为神经缩放现象提供了机理解释。

Comments Camera-ready version, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15941 2026-08-11 cs.LG cs.AI 版本更新

iLTM: Integrated Large Tabular Model

iLTM:集成式大规模表格模型

David Bonet, Marçal Comajoan Cara, Alvaro Calafell, Daniel Mas Montserrat, Alexander G. Ioannidis

机构 * Stanford University(斯坦福大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, Berkeley(加州大学伯克利分校) École Polytechnique(巴黎高等理工学院)

AI总结 iLTM通过集成树派生嵌入、维度无关表示和超网络,提供了一个统一的表格学习框架,实现优于传统GBDT和深度表格模型的性能。

Comments Extended version of a paper accepted at KDD '26

Journal ref Proc. 32nd ACM SIGKDD Conf. on Knowledge Discovery and Data Mining, 2, 186-197 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06772 2026-08-10 cs.LG 新提交

ArchEGraph: A Large-Scale Graph Dataset for Geometry-Topology-Physics Aligned Building Energy Modeling

ArchEGraph:用于几何-拓扑-物理对齐的建筑能源建模的大规模图数据集

Yihui Li, Yihui Chen, Kaidi Zha, Xiaoyue Yan, Zhexuan Yu, Shiqi Dai, Jun Xiao, Jun Yin, Ramon Elias Weber, Borong Lin

机构 * Tsinghua University(清华大学) UC Berkeley(加州大学伯克利分校) MIT(麻省理工学院)

AI总结 研究提出ArchEGraph大规模图数据集,定义两个基准任务并开展泛化实验,为建筑能源建模的几何-拓扑-物理耦合研究提供统一测试平台,支持替代模型开发评估。

Comments 26 pages, 13 figures, submitted to a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27924 2026-08-10 cs.LG cs.CV cs.RO 版本更新

ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow

ODEWorld:一种基于物理时间流的连续预测架构

Dongxiu Liu, Haoyi Niu, Peng Cheng, Yuan Gao, Xirui Kang, Sangli Teng, Koushil Sreenath, Xianyuan Zhan

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Berkeley Artificial Intelligence Research (BAIR), University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究院(BAIR))

AI总结 研究针对现有世界建模机器学习范式局限于离散时间预测的问题,提出基于PT-Flow的连续时间潜在世界模型ODEWorld,解决表示崩溃问题,在视频生成和机器人控制任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15485 2026-08-10 cs.CY cs.AI cs.HC cs.LG cs.SE 版本更新

The Perils of Agency: How Developers Perceive, Prioritize, and Address Risks in Agentic AI Products

代理的风险:开发者如何感知、优先级排序和应对代理型AI产品中的风险

Hao-Ping Lee, Jessica He, David Piorkowski, Thomas Serban von Davier, Jodi Forlizzi, Sauvik Das

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 通过35位行业开发者的研究,发现开发者对代理型AI风险的感知与自主性、工具使用等代理特性紧密相关,他们优先考虑产品和业务风险,缺乏成熟的控制手段,揭示了代理能力与风险控制之间的张力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04754 2026-08-10 cs.LG 版本更新

Beyond Structural Symmetries: Linear Mode Connectivity via Neuron Identifiability

超越结构对称性:通过神经元可辨识性实现线性模式连通性

Vincent Bürgin, Daniel Herbst, Ya-Wei Eileen Lin, Stefanie Jegelka

机构 * DeepMind, London, UK(伦敦英国深Mind公司) University of Cambridge(剑桥大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文通过提出有效函数类理论框架并形式化神经元可辨识性,揭示了神经网络中即使结构不对称也存在大量近似等价解,并展示了神经元可辨识性如何无需先验对齐即可实现表示合并及线性低损失路径。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01295 2026-08-10 cs.CV 版本更新

UniREditBench: A Unified Reasoning-based Image Editing Benchmark

UniREditBench: 一个基于推理的图像编辑统一基准

Feng Han, Yibin Wang, Chenglin Li, Zheming Liang, Dianyi Wang, Yang Jiao, Zhipeng Wei, Chao Gong, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) UC Berkeley(伯克利大学)

AI总结 UniREditBench通过多模态双参考评估和大规模合成数据集,提升图像编辑模型在复杂推理场景中的评估可靠性与性能表现。

Comments Project page: https://maplebb.github.io/UniREditBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06377 2026-08-07 cs.CL cs.AI cs.LG 新提交

Learning When to Trust via Selective Context Preference Optimization

通过选择性上下文偏好优化学习何时信任

Xian Sun, Wei Chow, Yingshuo Wang, Junhao Liu, Wei Gao, Qing Wu, Lingdong Kong

机构 * Duke University(杜克大学) National University of Singapore(新加坡国立大学) UC Berkeley(加州大学伯克利分校) UC Irvine(加州大学欧文分校) Northeastern University(东北大学) Nanyang Technological University(南洋理工大学)

AI总结 本研究针对语言模型易受误导性外部信号影响的问题,提出SCOPE方法,在含四种条件的MIST基准上优化DPO目标,降低SC2W的同时保持正常上下文下的准确率,主张以选择性信任评判模型。

Comments Project Page at https://worldbench.github.io/scope GitHub Repo at https://github.com/worldbench/SCOPE HF Dataset at https://huggingface.co/datasets/worldbench/MIST-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏