Causally Evaluating the Learnability of Formal Language Tasks
因果评估形式语言任务的可学习性
机构 * ETH Zürich(苏黎世联邦理工学院) ; University of Copenhagen(哥本哈根大学)
AI总结 通过引入分箱半环控制目标属性频率,结合因果图模型和分解KL散度,证明标准相关性评估在形式语言任务可学习性分析中存在混淆偏差。
高校专区
因果评估形式语言任务的可学习性
机构 * ETH Zürich(苏黎世联邦理工学院) ; University of Copenhagen(哥本哈根大学)
AI总结 通过引入分箱半环控制目标属性频率,结合因果图模型和分解KL散度,证明标准相关性评估在形式语言任务可学习性分析中存在混淆偏差。
通过动态等距保持持续学习中的可塑性
机构 * University of Amsterdam(阿姆斯特丹大学) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 本文通过动态等距机制保持深度神经网络在持续学习中的可塑性,提出等距正则化方法和AdamO优化器,在多个基准上匹配或超越现有方法。
Comments ICML26
Journal ref Forty-Third International Conference on Machine Learning (ICML 2026)
HDSL:一种用于结构化3D室内场景生成和基于LLM智能体局部编辑的层次化领域特定语言
机构 * SIGS, Tsinghua University(清华大学深圳国际研究生院) ; Nankai University(南开大学) ; University of Arizona(亚利桑那大学) ; Zhejiang University(浙江大学) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 提出HDSL语言,以树结构表示室内场景,结合LLM智能体生成、多模态检索和力导向布局优化,实现结构化场景生成与局部编辑,显著提升对象覆盖率和编辑效率。
基于事件的光学触觉传感器的稠密力估计
机构 * Sony Advanced Visual Sensing, Zurich, Switzerland(索尼高级视觉传感公司,苏黎世,瑞士) ; ETH Zürich(苏黎世联邦理工学院)
AI总结 提出首个利用事件相机重建稠密3D力场的方法,通过事件数据估计表面位移并映射为力,平均误差(0.14N,0.10N,0.93N),工作频率100Hz。
现在你(仍然)能看到我:检测大语言模型中的隐蔽隐写载荷
机构 * UCL Centre for AI(UCL人工智能中心) ; University College London(伦敦大学学院) ; ML Alignment Theory Scholars(机器学习对齐理论学者) ; Department of Computer Science(计算机科学系) ; School of Computing and Communications(计算与通讯学院) ; ETH Zürich(苏黎世联邦理工学院) ; University of Sussex(Sussex大学) ; Imperial College London & University of Oxford(伦敦帝国学院与牛津大学)
AI总结 针对大语言模型隐写外泄风险,提出一种基于非线性MLP探针的对抗性微调方法可系统规避现有线性探针检测,但通过信息论指导的数据级干预可恢复检测能力。
我们能否利用飞行时间相机的反馈来稳定倒立摆?
机构 * Institute for Dynamic Systems and Control, ETH Zürich(苏黎世联邦理工学院动态系统与控制研究所)
AI总结 本文证明低成本、低分辨率的飞行时间相机能够提供足够反馈,可靠且精确地平衡推车上的倒立摆,挑战了其无法用于精确反馈控制的普遍观点。
反事实传输流用于离线保守轨迹细化
机构 * ETH Zürich(苏黎世联邦理工学院) ; University of Science and Technology of China(中国科学技术大学)
AI总结 提出反事实传输流框架,通过检索高反馈轨迹构建局部偏好对,实现离线决策的保守轨迹细化,在D4RL基准上提升历史回报表现。
Comments accepted at RLxF @ ICML 2026
主动流扩展用于分布外发现:从理论到分子
机构 * ETH Zurich(苏黎世联邦理工学院) ; ETH AI Center(ETH AI 中心) ; University of Pennsylvania(宾夕法尼亚大学) ; Caltech(加州理工学院) ; FutureHouse
AI总结 提出Active Flow Expansion (ActFlow)方法,通过验证器反馈和主动探索扩展预训练流模型的生成集,覆盖更多有效设计空间,理论证明统计学习保证,在分子和蛋白质任务上优于现有方法。
长会议文档摘要的段级树搜索
机构 * GSAI, POSTECH(浦项科技大学人工智能研究院) ; CSE, POSTECH(浦项科技大学计算机科学与工程系) ; ETH Zurich(苏黎世联邦理工学院) ; ETH AI Center(苏黎世联邦理工学院人工智能中心) ; Agentic AI Lab, KT(KT公司智能体人工智能实验室) ; LILT(LILT公司)
AI总结 提出基于蒙特卡洛树搜索的段级摘要框架S3,无需训练即可组合段级候选摘要,使用7B模型达到72B模型性能。
Comments INTERSPEECH 2026
利用SySRs降低LLM评估成本:一种可证明利用模型相似性的Bandit算法
机构 * ETH Zurich(苏黎世联邦理工学院) ; Centrale Supélec(中央理工-高等电力学院) ; ENS de Cachan(卡尚高等师范学校) ; MPI for Intelligent Systems, Tübingen(马克斯·普朗克智能系统研究所,图宾根)
AI总结 提出SySRs算法,通过配对比较和自适应分配评估预算,利用模型相似性降低LLM评估成本,在15个基准上平均错误率最低。
Comments Published at ICML 2026
GNSS-FM:用于日常GNSS位移时间序列的自监督基础模型
机构 * Institute of Geodesy and Photogrammetry, ETH Zurich(大地测量与摄影测量研究所,苏黎世联邦理工学院) ; ETH AI Center(ETH人工智能中心)
AI总结 提出GNSS-FM自监督基础模型,通过双流输入和掩码潜在预测预训练,在位移预测和地震阶跃定位任务上优于强基线。
针对瑞士德语音识别的Whisper字幕对齐微调:基准污染、惯例不匹配以及25.6% WER(13.8% cWER)的诚实基线
机构 * Independent Researcher, Zurich, Switzerland(独立研究员,瑞士苏黎世) ; ETH Zürich(苏黎世联邦理工学院) ; University of Bern(伯尔尼大学) ; FHNW(西北应用科学与艺术大学) ; CeTIM Leiden/Munich(CeTIM 莱顿/慕尼黑)
AI总结 通过1,367小时广播语音与标准德语字幕的弱监督,系统微调Whisper large-v3用于瑞士德语音识,发现公开结果因基准污染被高估,并发布两个诚实评估的模型。
Comments 15 pages, 21 tables. Models available at https://huggingface.co/Flix-AI
OpenGlass:用于设备上基于事件的手势识别的开源智能眼镜
机构 * Department of Information Technology and Electrical Engineering, ETH Zürich(信息科技与电气工程系,瑞士联邦理工学院)
AI总结 提出开源智能眼镜平台OpenGlass,采用模块化设计、事件驱动电源管理和GAP9 RISC-V SoC,实现低功耗设备上ML,在LynX数据集上达到83.94%的跨主体手势识别准确率。
ThinkBooster: 一种用于LLM推理无缝测试时扩展的统一框架
机构 * MBZUAI ; ETH Zürich(苏黎世联邦理工学院) ; Imperial College London(伦敦帝国理工学院) ; NUS(国立大学新加坡) ; Accenture(埃森哲) ; Innopolis University(因诺普里斯大学) ; Independent Researcher(独立研究者)
AI总结 提出ThinkBooster框架,通过模块化库、联合评估基准和可部署代理服务,实现LLM推理的测试时计算扩展,在数学和编码任务上验证了性能-计算权衡。
AI天气模型能否预测两周以上?长期推演的定量基准与分析
机构 * ETH AI Center(ETH人工智能中心) ; ETH Zurich(苏黎世联邦理工学院) ; Swiss Data Science Center(瑞士数据科学中心) ; Scalable Parallel Computing Lab(可扩展并行计算实验室) ; Dep. of Applied Mathematics and Theoretical Physics(应用数学与理论物理系) ; University of Cambridge(剑桥大学) ; Institute of Geodesy and Photogrammetry(大地测量与摄影测量研究所) ; Seminar for Applied Mathematics(应用数学研讨会)
AI总结 通过九种AI天气模型的一年推演,将长期不稳定性分类为爆发、漂移和季节性丧失三种模式,并发现稳定性取决于对小时空尺度的处理。
SwAIther-Precip:考虑提前时间的偏倚校正实现瑞士全球AI降水预报的公里级降尺度
机构 * European Centre for Medium-Range Weather Forecasts(欧洲中期天气预报中心) ; University of Geneva(日内瓦大学) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 本文提出SwAIther-Precip框架,通过校正提前时间依赖性偏倚,提升全球AI降水预报的公里级概率降尺度能力,实验显示CRPS降低48%。
CodeTaste:LLM能否生成人类级别的代码重构?
机构 * University of California, Berkeley(加州大学伯克利分校) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 研究LLM代理在代码重构中的能力,通过CodeTaste基准测试发现,代理在详细指定重构时表现良好,但难以自主发现人类选择的重构,提出“先提议后实现”分解可改善对齐。
常微分方程的基础推理模型
机构 * University of Cambridge(剑桥大学) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 提出FIM-ODE,一种预训练的基础推理模型,通过单次前向传播从含噪轨迹直接预测向量场,实现零样本性能匹配并超越ODEFormer,微调后优于现代神经和GP基线。
Comments Published in ICML 2026
Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)
基于多任务潜在空间目标的自监督学习
机构 * ESAT-PSI, KU Leuven, Belgium(KU莱顿大学ESAT-PSI实验室) ; VIB.AI, KU Leuven, Belgium(KU莱顿大学VIB.AI实验室) ; CVL, ETH Zürich, Switzerland(苏黎世联邦理工学院CVL实验室) ; INSAIT, Sofia University, Bulgaria(保加利亚索菲亚大学INSAIT研究所) ; TRACE vzw(TRACE非营利组织)
AI总结 提出自预测孪生SSL的多任务公式,通过为每种空间变换分配专用预测器解决多裁剪训练失败问题,提升线性评估3.8-4%,并引入非对称裁剪视图实现语义修复预训练。