Causally Evaluating the Learnability of Formal Language Tasks
因果评估形式语言任务的可学习性
机构 * ETH Zürich(苏黎世联邦理工学院) ; University of Copenhagen(哥本哈根大学)
AI总结 通过引入分箱半环控制目标属性频率,结合因果图模型和分解KL散度,证明标准相关性评估在形式语言任务可学习性分析中存在混淆偏差。
高校专区
因果评估形式语言任务的可学习性
机构 * ETH Zürich(苏黎世联邦理工学院) ; University of Copenhagen(哥本哈根大学)
AI总结 通过引入分箱半环控制目标属性频率,结合因果图模型和分解KL散度,证明标准相关性评估在形式语言任务可学习性分析中存在混淆偏差。
通过动态等距保持持续学习中的可塑性
机构 * University of Amsterdam(阿姆斯特丹大学) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 本文通过动态等距机制保持深度神经网络在持续学习中的可塑性,提出等距正则化方法和AdamO优化器,在多个基准上匹配或超越现有方法。
Comments ICML26
Journal ref Forty-Third International Conference on Machine Learning (ICML 2026)
HDSL:一种用于结构化3D室内场景生成和基于LLM智能体局部编辑的层次化领域特定语言
机构 * SIGS, Tsinghua University(清华大学深圳国际研究生院) ; Nankai University(南开大学) ; University of Arizona(亚利桑那大学) ; Zhejiang University(浙江大学) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 提出HDSL语言,以树结构表示室内场景,结合LLM智能体生成、多模态检索和力导向布局优化,实现结构化场景生成与局部编辑,显著提升对象覆盖率和编辑效率。
基于事件的光学触觉传感器的稠密力估计
机构 * Sony Advanced Visual Sensing, Zurich, Switzerland(索尼高级视觉传感公司,苏黎世,瑞士) ; ETH Zürich(苏黎世联邦理工学院)
AI总结 提出首个利用事件相机重建稠密3D力场的方法,通过事件数据估计表面位移并映射为力,平均误差(0.14N,0.10N,0.93N),工作频率100Hz。
现在你(仍然)能看到我:检测大语言模型中的隐蔽隐写载荷
机构 * UCL Centre for AI(UCL人工智能中心) ; University College London(伦敦大学学院) ; ML Alignment Theory Scholars(机器学习对齐理论学者) ; Department of Computer Science(计算机科学系) ; School of Computing and Communications(计算与通讯学院) ; ETH Zürich(苏黎世联邦理工学院) ; University of Sussex(Sussex大学) ; Imperial College London & University of Oxford(伦敦帝国学院与牛津大学)
AI总结 针对大语言模型隐写外泄风险,提出一种基于非线性MLP探针的对抗性微调方法可系统规避现有线性探针检测,但通过信息论指导的数据级干预可恢复检测能力。
我们能否利用飞行时间相机的反馈来稳定倒立摆?
机构 * Institute for Dynamic Systems and Control, ETH Zürich(苏黎世联邦理工学院动态系统与控制研究所)
AI总结 本文证明低成本、低分辨率的飞行时间相机能够提供足够反馈,可靠且精确地平衡推车上的倒立摆,挑战了其无法用于精确反馈控制的普遍观点。
反事实传输流用于离线保守轨迹细化
机构 * ETH Zürich(苏黎世联邦理工学院) ; University of Science and Technology of China(中国科学技术大学)
AI总结 提出反事实传输流框架,通过检索高反馈轨迹构建局部偏好对,实现离线决策的保守轨迹细化,在D4RL基准上提升历史回报表现。
Comments accepted at RLxF @ ICML 2026
主动流扩展用于分布外发现:从理论到分子
机构 * ETH Zurich(苏黎世联邦理工学院) ; ETH AI Center(ETH AI 中心) ; University of Pennsylvania(宾夕法尼亚大学) ; Caltech(加州理工学院) ; FutureHouse
AI总结 提出Active Flow Expansion (ActFlow)方法,通过验证器反馈和主动探索扩展预训练流模型的生成集,覆盖更多有效设计空间,理论证明统计学习保证,在分子和蛋白质任务上优于现有方法。
长会议文档摘要的段级树搜索
机构 * GSAI, POSTECH(浦项科技大学人工智能研究院) ; CSE, POSTECH(浦项科技大学计算机科学与工程系) ; ETH Zurich(苏黎世联邦理工学院) ; ETH AI Center(苏黎世联邦理工学院人工智能中心) ; Agentic AI Lab, KT(KT公司智能体人工智能实验室) ; LILT(LILT公司)
AI总结 提出基于蒙特卡洛树搜索的段级摘要框架S3,无需训练即可组合段级候选摘要,使用7B模型达到72B模型性能。
Comments INTERSPEECH 2026
利用SySRs降低LLM评估成本:一种可证明利用模型相似性的Bandit算法
机构 * ETH Zurich(苏黎世联邦理工学院) ; Centrale Supélec(中央理工-高等电力学院) ; ENS de Cachan(卡尚高等师范学校) ; MPI for Intelligent Systems, Tübingen(马克斯·普朗克智能系统研究所,图宾根)
AI总结 提出SySRs算法,通过配对比较和自适应分配评估预算,利用模型相似性降低LLM评估成本,在15个基准上平均错误率最低。
Comments Published at ICML 2026
GNSS-FM:用于日常GNSS位移时间序列的自监督基础模型
机构 * Institute of Geodesy and Photogrammetry, ETH Zurich(大地测量与摄影测量研究所,苏黎世联邦理工学院) ; ETH AI Center(ETH人工智能中心)
AI总结 提出GNSS-FM自监督基础模型,通过双流输入和掩码潜在预测预训练,在位移预测和地震阶跃定位任务上优于强基线。
针对瑞士德语音识别的Whisper字幕对齐微调:基准污染、惯例不匹配以及25.6% WER(13.8% cWER)的诚实基线
机构 * Independent Researcher, Zurich, Switzerland(独立研究员,瑞士苏黎世) ; ETH Zürich(苏黎世联邦理工学院) ; University of Bern(伯尔尼大学) ; FHNW(西北应用科学与艺术大学) ; CeTIM Leiden/Munich(CeTIM 莱顿/慕尼黑)
AI总结 通过1,367小时广播语音与标准德语字幕的弱监督,系统微调Whisper large-v3用于瑞士德语音识,发现公开结果因基准污染被高估,并发布两个诚实评估的模型。
Comments 15 pages, 21 tables. Models available at https://huggingface.co/Flix-AI