arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

ETH Zurich(苏黎世联邦理工学院)

2026-05-19 至 2026-05-19 共收录 18
2605.18547 2026-05-19 cs.AI

VISAFF: Speaker-Centered Visual Affective Feature Learning for Emotion Recognition in Conversation

VISAFF: 以说话者为中心的视觉情感特征学习用于对话中的情感识别

Linan ZHU, Zihao Zhai, Xiao Han, Yuqian Fu, Xiangfan Chen, Xiangjie Kong, Guojiang Shen

机构 * Zhejiang University of Technology(浙江工业大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 本文提出VISAFF框架,通过以说话者为中心的视觉情感特征学习方法,解决对话中情感识别中的复杂场景问题,提升计算效率并避免大规模模型微调的高成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18374 2026-05-19 cs.LG cs.AI

Beyond Inference-Time Search: Reinforcement Learning Synthesizes Reusable Solvers

超越推理时间搜索:强化学习合成可重用求解器

Soheyl Massoudi, Gabriel Apaza, Milad Habibi, Mark Fuge

机构 * ETH Zürich(苏黎世联邦理工学院) University of Maryland(马里兰大学)

AI总结 本文探讨了强化学习能否将组合优化的推理成本转移到代码LLM的权重中,从而合成可重用的求解器。通过Synergistic Dependency Selection问题,研究发现强化学习能有效生成约束感知的模拟退火模板,并在多个领域展示出更高的效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13339 2026-05-19 cs.CL cs.AI

Probing Persona-Dependent Preferences in Language Models

探测语言模型中依赖人格的偏好

Oscar Gilg, Pierre Beckmann, Daniel Paleka, Patrick Butlin

机构 * MATS EPFL(瑞士联邦理工学院) ETH Zürich(苏黎世联邦理工学院) Eleos AI Research(Eleos AI研究)

AI总结 本文通过训练线性探针来探测语言模型中不同人格下的偏好表示,发现偏好向量在不同人格间具有共享特性,并能通过调整偏好向量来影响模型的输出选择。

Comments 41 pages, 45 figures. Code: https://github.com/oscar-gilg/Preferences. Earlier write-up on LessWrong: https://www.lesswrong.com/posts/pxC2RAeoBrvK8ivMf/models-have-linear-representations-of-what-tasks-they-like-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29868 2026-05-19 cs.AI cs.LO

Spatiotemporal Robustness of Temporal Logic Tasks using Multi-Objective Reasoning

基于多目标推理的时序逻辑任务时空鲁棒性

Oliver Schön, Lars Lindemann

机构 * Automatic Control Laboratory, ETH Zürich(自动化控制实验室,苏黎世联邦理工学院)

AI总结 本文研究了通过多目标推理处理时序逻辑任务的时空鲁棒性,提出了一种新的时空鲁棒性定义,能够同时考虑空间和时间扰动,并展示了其在多智能体机器人、智慧城市和空中交通管制等交互系统中的应用。

Comments 30 pages, 6 figures, to be published at the 38th International Conference on Computer Aided Verification 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17577 2026-05-19 cs.LG cs.AI stat.ML

Identifying Latent Actions and Dynamics from Offline Data via Demonstrator Diversity

通过示范多样性从离线数据中识别潜在动作和动态

Felix Schur

机构 * ETH Zürich(苏黎世联邦理工学院)

AI总结 本文研究了在不观察动作的情况下从离线轨迹中恢复潜在动作和环境动态的问题,通过示范多样性假设,证明了在满足特定条件时,潜在转移和示范策略可以被唯一确定,从而为从离线强化学习数据中学习潜在动作和动态提供了新的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22244 2026-05-19 cs.CV

FlashEdit: Decoupling Speed, Structure, and Semantics for Precise Image Editing

FlashEdit: 解耦速度、结构和语义以实现精确图像编辑

Junyi Wu, Zhiteng Li, Haotong Qin, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) ETH Zürich(苏黎世联邦理工学院)

AI总结 本文提出FlashEdit,一种高效的局部图像编辑框架,通过解耦速度、结构和语义来实现精确编辑,实验表明其在保真度和效率之间取得了良好的平衡。

Comments Our code will be made publicly available at https://github.com/JunyiWuCode/FlashEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15878 2026-05-19 cs.LO cs.AI cs.CL cs.LG

Lean Meets Theoretical Computer Science: Scalable Synthesis of Theorem Proving Challenges in Formal-Informal Pairs

Lean 与理论计算机科学的交汇:形式-非形式对中可扩展的定理证明挑战合成

Terry Jingchen Zhang, Wenyuan Jiang, Rongchuan Liu, Yisong Wang, Junran Yang, Ning Wang, Nicole Ni, Yinya Huang, Mrinmaya Sachan

机构 * D-CHAB, ETH Zurich, Zurich, Switzerland. D-INFK, ETH Zurich, Zurich, Switzerland. ETH AI Center, Zurich, Switzerland. University of Pennsylvania, PA, USA. Independent Researcher.

AI总结 本文提出利用理论计算机科学作为可扩展的严谨证明问题来源,通过算法定义自动生成大量挑战性定理-证明对,展示了在Busy Beaver问题和混合布尔算术问题上的应用,并揭示了自动定理证明在复杂问题上的局限性。

Comments Accepted to AI4MATH@ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17638 2026-05-19 cs.CV

TouchMap-OR: Multi-View 3D Mapping of Hand-Surface Contacts

TouchMap-OR: 医院内多视角手-表面接触的3D映射

Sophokles Ktistakis, Rui Wang, Bastian Grande, Hugo Sax

机构 * ETH Zurich(苏黎世联邦理工学院) Institute for Anesthesiology and Perioperative Medicine, University Hospital Zurich(苏黎世大学麻醉学与围术期医学研究所) Department of Public and Global Health, University of Zurich(苏黎世大学公共卫生与全球健康系)

AI总结 本文提出TouchMap-OR系统,通过多视角RGB-D视觉系统实现手术室中身份分辨的手-表面接触重建,利用临床环境的语义结构推断接触时间和位置,通过多视角手部重建与追踪医生获得一致的手部轨迹,并建立手术室的语义3D模型以将手部轨迹映射到特定表面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17478 2026-05-19 cs.CV

Mamba-VGGT: Persistent Long-Sequence Video Geometry Grounded Transformer via External Sliding Window Mamba Memory

Mamba-VGGT: 通过外部滑动窗口Mamba内存实现持久长序列视频几何 grounded 变换器

Tianchen Deng, Zhenxiang Xiong, Nailin Wang, Fangjinhua Wang, Jiuming Liu, Jianfei Yang, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) ETH Zurich(苏黎世联邦理工学院) Cambridge University(剑桥大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出Mamba-VGGT框架,通过引入滑动窗口Mamba内存模块,解决传统VGGT在长序列视频中几何遗忘和累积漂移问题,提升3D场景重建的精度与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10236 2026-05-19 cs.LG cs.AI

When Does Non-Uniform Replay Matter in Reinforcement Learning?

在强化学习中非均匀回放何时起作用?

Michal Korniak, Mikołaj Czarnecki, Yarden As, Piotr Miłoś, Pieter Abbeel, Michal Nauman

机构 * ETH Zurich(苏黎世联邦理工学院) University of Warsaw(华沙大学) UC Berkeley(伯克利加州大学) Amazon FAR(亚马逊FAR)

AI总结 本文研究了非均匀回放在强化学习中的有效性,发现回放体积、预期近期性和回放分布熵是决定因素,并提出了一种简单有效的截断几何回放策略以提高样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00304 2026-05-19 cs.LG cs.AI

Barriers for Learning in an Evolving World: Mathematical Understanding of Loss of Plasticity

在不断变化的世界中学习的障碍:对学习能力丧失的数学理解

Amir Joudaki, Giulia Lanzillotta, Mohammad Samragh Razlighi, Iman Mirzadeh, Keivan Alizadeh, Thomas Hofmann, Mehrdad Farajtabar, Fartash Faghri

机构 * ETH Zürich(苏黎世联邦理工学院) Apple(苹果公司)

AI总结 本文研究了在非平稳环境中深度学习模型因学习能力丧失(LoP)而失效的问题,通过动力系统理论分析了LoP的两个主要机制,并探讨了缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04941 2026-05-19 cs.LG cs.AI

TOAST: Transformer Optimization using Adaptive and Simple Transformations

TOAST: 使用自适应和简单变换的Transformer优化

Irene Cannistraci, Simone Antonelli, Emanuele Palumbo, Thomas M. Sutter, Emanuele Rodolà, Bastian Rieck, Julia E. Vogt

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) CISPA Helmholtz Center for Information Security(信息安全赫尔姆霍兹中心) Sapienza University of Rome(罗马大学萨皮恩扎大学) University of Fribourg(弗里堡大学)

AI总结 本文提出TOAST框架,通过利用Transformer内部的冗余性,用轻量级闭式映射(如线性变换或身份函数)近似整个Transformer块,从而在不额外训练的情况下减少参数和计算量,同时保持甚至提升下游性能。

Comments 33 pages, 16 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17014 2026-05-19 cs.CV

RHINO: Reconstructing Human Interactions with Novel Objects from Monocular Videos

RHINO:从单目视频中重建人类与新物体的交互

Lixin Xue, Chengwei Zheng, Georgios Paschalidis, Chen Guo, Manuel Kaufmann, Juan Zarate, Dimitrios Tzionas

机构 * ETH Zürich(苏黎世联邦理工学院) The University of Tokyo(东京大学) University of Amsterdam(阿姆斯特丹大学) Aristotle University of Thessaloniki(希腊塞萨洛尼基阿里斯托芬大学)

AI总结 本文提出RHINO框架,通过三步方法从单目视频中重建3D人类、新物体和静态场景,解决了视频中物体和人类交互的重建问题,提升了4D重建和新视角合成的性能。

Comments CVPR 2026. Project page: https://lxxue.github.io/RHINO

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16911 2026-05-19 cs.CV

VGGT-Occ: Geometry-Grounded and Density-Aware Gated Fusion for 3D Occupancy Prediction

VGGT-Occ:基于几何和密度的门控融合用于3D占用预测

Xun Chen, Tianchen Deng, Rui Wang, Fangjinhua Wang, Junyi Ma, Hongming Shen, Hesheng Wang, Danwei Wang

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 本文提出VGGT-Occ,通过在整个管道中嵌入几何标记,引入投影感知可变形注意力(PA-DA)以注入几何信息,结合视图质量语义门控实现跨视图一致性,采用顺序粗到细解码器与门控融合优化效率和性能,实验证明其在3D语义占用预测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16828 2026-05-19 stat.ML cs.AI cs.LG stat.ME

Prediction-Intervention Games and Invariant Sets

预测-干预博弈与不变集

Linus Kühne, Felix Schur, Jonas Peters

机构 * Seminar for Statistics and ETH AI Center(统计研究所和ETH人工智能中心) ETH Zurich(苏黎世联邦理工学院)

AI总结 本文研究了预测-干预博弈中的领导方如何通过选择预测函数来应对跟随方的干预,证明了基于稳定毯的预测在某些情况下优于因果父母的预测,并讨论了实际应用中的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07501 2026-05-19 cs.LG cs.CL

ExpThink: Experience-Guided Reinforcement Learning for Adaptive Chain-of-Thought Compression

ExpThink:基于经验的强化学习用于自适应思路链压缩

Tingcheng Bian, Yuzhe Zhang, Jing Jin, Jinchang Luo, MingQuan Cheng, Haiwei Wang, Wenyuan Jiang, Miaohui Wang

机构 * Baidu Inc.(百度公司) Shenzhen University(深圳大学) Peking University(北京大学) Tsinghua University(清华大学) D-INFK, ETH Zürich(ETH Zürich 计算机科学与技术研究所)

AI总结 本文提出ExpThink框架,通过经验引导奖励塑造和难度自适应优势机制,实现思路链压缩的准确优先、压缩次之的训练目标,实验表明其在多个数学推理基准上显著提升压缩效率和准确性。

Comments 39 pages, 18 figures. Code and model checkpoints will be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16339 2026-05-19 cs.LG

Preference Instability in Reward Models: Detection and Mitigation via Sparse Autoencoders

奖励模型中的偏好不稳定性:通过稀疏自编码器进行检测与缓解

Shunchang Liu, Xin Chen, Belen Martin Urcelay, Francesco Croce

机构 * ETH Zürich(苏黎世联邦理工学院) Georgia Institute of Technology(佐治亚理工学院) ELLIS Institute Finland(芬兰ELLIS研究所) Aalto University(阿alto大学)

AI总结 本文研究了大型语言模型中奖励模型的偏好不稳定性问题,提出通过稀疏自编码器检测并缓解这种不稳定性,通过隔离不稳定特征来提升模型的偏好准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17007 2026-05-19 cs.LG cs.AI stat.ML

Uncertainty Quantification as a Principled Foundation for Explainable Artificial Intelligence: A Case Study of Counterfactual Explanations

不确定性量化作为可解释人工智能的原理性基础:反事实解释的案例研究

Kacper Sokol, Santo M. A. R. Thies, Eyke Hüllermeier

机构 * Department of Informatics, USI Lugano(乌里大学信息学院) Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) Institute of Informatics, LMU Munich(慕尼黑大学信息研究所)

AI总结 本文通过反事实可解释性中的不确定性量化,展示其作为统一框架的潜力,提出两种解释器变体,并证明其在性能上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏