arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

ETH Zurich(苏黎世联邦理工学院)

2026-05-28 至 2026-05-28 共收录 8
2605.28812 2026-05-28 cs.RO cs.AI cs.LG

Beyond Binary: Sim-to-Real Dexterous Manipulation with Physics-Grounded Contact Representation

超越二元:基于物理接触表示的仿真到现实灵巧操作

Jiahe Pan, Stelian Coros, Jitendra Malik, Toru Lin

机构 * ETH Zürich(苏黎世联邦理工学院) UC Berkeley(伯克利加州大学)

AI总结 提出基于物理原理的中心压力(CoP)触觉表示,结合可微动力学传感器标定,实现多指手的零样本仿真到现实迁移,在插销入孔和球平衡任务中优于二元接触和原始触觉基线。

Comments Project site: https://mpan31415.github.io/tactile_rep/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28480 2026-05-28 eess.AS cs.SD

Audio-Mind: An Auditable Agentic Framework for Audio Understanding

Audio-Mind: 一种可审计的音频理解智能体框架

Yucheng Wang, Jing Peng, Hanqi Li, Chenghao Wang, Wenming Tu, Yu Xi, Zhaokai Sun, Kai Yu, Shuai Wang

机构 * School of Intelligence Science and Technology, Nanjing University, China(南京大学智能科学与技术学院) Department of Computer Science, ETH Zürich, Switzerland(苏黎世联邦理工学院计算机科学系) X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, China(上海交通大学计算机科学学院X-LANCE实验室) School of Automation Science and Engineering, Xi’an Jiaotong University, China(西安交通大学自动化科学与工程学院) School of Computer Science, Northwestern Polytechnical University, China(西北工业大学计算机科学学院)

AI总结 提出Audio-Mind框架,通过条件性证据获取动态结合强前端与规划器引导的工具使用,解决音频理解中智能体证据获取的时机问题,在MMAR和MSU-Bench上分别达到80.4%和82.8%的准确率,并生成可审计的推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28227 2026-05-28 cs.CL

Why We Need Speech to Evaluate Speech Translation

为什么我们需要语音来评估语音翻译

Maike Züfle, Danni Liu, Vilém Zouhar, Jan Niehues

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ETH Zurich(苏黎世联邦理工学院)

AI总结 本文通过元评估发现现有文本和语音质量估计指标在评估语音翻译中的语音特有信息(如性别一致性和韵律)时均存在不足,并提出SpeechCOMET模型,分析其失败原因,强调需要专用训练数据和真正基于语音的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26368 2026-05-28 cs.CV cs.AI

Unified Panoramic Geometry Estimation via Multi-View Foundation Models

统一全景几何估计:基于多视角基础模型

Vukasin Bozic, Isidora Slavkovic, Dominik Narnhofer, Nando Metzger, Denis Rozumny, Konrad Schindler, Nikolai Kalischek

机构 * ETH Zürich(苏黎世联邦理工学院) Google(谷歌)

AI总结 提出PaGeR框架,利用预训练3D基础模型,从单张全景图像中统一预测尺度不变深度、度量深度、表面法线和天空掩码,实现360度场景重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28007 2026-05-28 cs.LG cs.AI

Learning Compositional Latent Structure with Vector Networks

学习带有向量网络的组合潜在结构

Niclas Pokel, Benjamin F. Grewe

机构 * Institute of Neuroinformatics, UZH / ETH Zurich(神经信息学研究所,苏黎世联邦理工学院/苏黎世联邦理工人工智能中心) ETH AI Center Zurich, Switzerland(苏黎世联邦理工人工智能中心,瑞士)

AI总结 提出向量网络(VN),一种层级循环架构,通过可重用的秩1权重原子库实现组合泛化,在分布外任务中误差降低约一个数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27644 2026-05-28 cs.RO cs.AI cs.LG

Trinity: Unifying Class-Agnostic Terrain and Semantic Segmentation for Unstructured Outdoor Environments by Leveraging Synthetic Data

Trinity:通过利用合成数据统一非结构化户外环境中的类无关地形与语义分割

Marcus G Müller, Wout Boerdijk, Maximilian Durner, Riccardo Giubilato, Abel Gawel, Wolfgang Stürzl, Roland Siegwart, Rudolph Triebel

机构 * Institute of Robotics and Mechatronics, German Aerospace Center (DLR)(机器人与机电系统研究所,德国航空航天中心(DLR)) Federal Institute of Technology Zurich (ETH Zurich)(苏黎世联邦理工学院(ETH Zurich)) Robotics and AI Institute (RAI)(机器人与人工智能研究所(RAI))

AI总结 提出基于Transformer的统一网络Trinity,联合执行类特定语义分割和类无关地形分割,利用合成数据集RUGDSynth和真实数据集EXTerra实现机器人无关的地形先验学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26391 2026-05-28 cs.GR cs.CV

Garment Particles: A 2D--3D Symmetric Garment Representation for Generation and Editing

Garment Particles: 一种用于生成和编辑的2D-3D对称服装表示

Kiyohiro Nakayama, I-Chao Shen, Ruofan Liu, Yiming Wang, Gordon Wetzstein, Takeo Igarashi

机构 * Stanford University USA(斯坦福大学) The University of Tokyo Japan(东京大学) Institute of Science Tokyo Japan(东京科学研究所) ETH Zurich Switzerland(苏黎世联邦理工学院)

AI总结 提出Garment Particles,一种5D点云表示,联合编码2D裁剪图和3D几何,通过Garment Particles Flow框架支持从高级输入生成和多种编辑操作,实现最先进的服装生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19743 2026-05-28 cs.AI cs.LG cs.MA

EngiAI: A Multi-Agent Framework and Benchmark Suite for LLM-Driven Engineering Design

EngiAI: 面向LLM驱动工程设计的智能体框架与基准测试套件

Gioele Molinari, Florian Felten, Soheyl Massoudi, Mark Fuge

机构 * IDEAL Chair of Artificial Intelligence in Engineering Design(人工智能与工程设计理想 chair) ETH Zurich(苏黎世联邦理工学院) Autom8.build

AI总结 提出EngiAI多智能体系统框架和包含工作流、RAG、HPC三维度的基准套件,通过监督架构协调七个专业智能体,验证了LLM在工程设计中的能力与局限。

Comments 26 pages, 10 figures, to be published at IDETC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏