arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

ETH Zurich(苏黎世联邦理工学院)

共收录 1404
2607.08741 2026-07-10 cs.GR cs.CV cs.LG cs.RO 新提交

ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation

ARDY:用于交互式人体运动生成的具有混合表示的自回归扩散

Kaifeng Zhao, Mathis Petrovich, Haotian Zhang, Tingwu Wang, Siyu Tang, Davis Rempe

机构 * NVIDIA(英伟达) ETH Zürich(苏黎世联邦理工学院)

AI总结 研究旨在解决交互式应用中人体运动生成问题,提出ARDY框架,采用混合表示和两阶段自回归变压器去噪器,能通过在线文本提示和运动学约束实现高保真运动生成,经评估验证了有效性和实用性。

Comments ACM Transactions on Graphics (SIGGRAPH 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08427 2026-07-10 cs.AR cs.LG 新提交

FPGN: Redefining Ultra-Fast Programmable Gate-based Neural Acceleration with Differentiable LUTs

FPGN:用可微查找表重新定义基于超快速可编程门的神经加速

Jiawei Liang, Haotong Qin, Linfeng Du, Xingyu Liu, Shangkun Li, Hui Yu, Michele Magno, Xinyu Chen, Jiang Xu, Wei Zhang

机构 * HKUST(香港科技大学) ETH Zurich(苏黎世联邦理工学院) HKUST (GZ)(香港科技大学(广州))

AI总结 研究旨在实现DNN纳秒级推理延迟,针对传统FPGA加速器局限,提出FPGN框架。通过硬件对齐可微公式、结构化拓扑和延迟驱动编译器,弥合差距。实验表明其相比其他加速器延迟降低205倍,LUT效率高30倍,且推理精度有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07953 2026-07-10 cs.LG cs.AI 新提交

Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing

线性注意力架构:机制、权衡与跨层路由

Tommaso Cerruti, Tim Rieder, George Rowlands, Lingfeng Jin, Imanol Schlag

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center, ETH Zurich(苏黎世联邦理工学院ETH人工智能中心)

AI总结 研究对softmax注意力和四种循环线性注意力架构比较,用通用符号表达机制差异。通过训练350M参数模型实验,发现不同架构在损失、吞吐量等方面表现不同,还引入评估跨层路由机制,如CLVR可降低DeltaNet和门控DeltaNet的最终验证损失。

Comments 20 pages, 6 figures, 8 tables. Code available at https://github.com/tommasocerruti/linear-attention-architectures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03330 2026-07-10 cs.CV 新提交

GrowFields: Compositional 4D Neural Fields for Topology-Changing Plant Growth

GrowFields:用于拓扑变化植物生长的组合式4D神经场

Joaquin Gajardo, Michele Volpi, Marko Mihajlovic, Siyu Tang, Lukas Roth, Sergey Prokudin

机构 * ETH Zürich(苏黎世联邦理工学院) Swiss Data Science Center(瑞士数据科学中心) Martin-Luther-Universität Halle-Wittenberg(马丁-路德-哈雷-维滕贝格大学)

AI总结 针对从稀疏纵向3D观测量化植物生长动力学的难题,提出GrowFields,将植物分解为器官并对齐到规范坐标系,学习共享神经变形场,在植物器官跟踪中表现优于现有表示。

Comments ECCV 2026 paper (main conference). v2 corrects the vertical guide lines in supplementary Figures 5-7. Project page and code available at https://joaquin-gajardo.github.io/growfields/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16481 2026-07-10 cs.LG cs.SY eess.SY math.OC 版本更新

Optimal uncertainty bounds for multivariate kernel regression under bounded noise: A Gaussian process-based dual function

有界噪声下多元核回归的最优不确定性界:基于高斯过程的对偶函数

Amon Lahr, Anna Scampicchio, Johannes Köhler, Melanie N. Zeilinger

机构 * Institute for Dynamical Systems and Control, ETH Zurich(动态系统与控制研究所,苏黎世联邦理工学院) Department of Electrical Engineering, Chalmers University of Technology(电气工程系,查尔姆斯理工大学) Department of Mechanical Engineering, Imperial College London(机械工程系,伦敦帝国理工学院)

AI总结 针对有界噪声下再生核希尔伯特空间中的多输出函数,提出一种紧致、确定性的不确定性界,通过无约束对偶公式获得,具有与经典高斯过程置信界相同的结构,便于集成到下游优化中。

Comments Extended version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12857 2026-07-10 cs.CY cs.AI 版本更新

Adaptive Generation of Bias-Eliciting Questions for LLMs

为大语言模型自适应生成偏差引发问题

Robin Staab, Jasper Dekoninck, Maximilian Baader, Martin Vechev

机构 * ETH Zurich, Switzerland(苏黎世联邦理工学院)

AI总结 针对大语言模型固有偏差问题,引入反事实框架,通过迭代问题变异生成开放式问题评估偏差,构建CAB基准,评估发现模型在某些场景有持续偏差,凸显公平性研究需求。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26076 2026-07-10 cs.CL 版本更新

IMProofBench: Benchmarking AI on Research-Level Mathematical Proof Generation

IMProofBench:在研究级数学证明生成上对人工智能进行基准测试

Johannes Schmitt, Gergely Bérczi, Jasper Dekoninck, Jeremy Feusi, Tim Gehrunger, Raphael Appenzeller, Pieter Belmans, Alessio Bottini, Jim Bryan, João Camarneiro, Ana Cannas da Silva, Niklas Canova, Ana-Maria Castravet, Timo de Wolff, Claudio Fontanari, Filippo Gaia, Baran Hashemi, Daniel Holmes, David Holmes, Aitor Iribar Lopez, Victor Jaeck, Martina Jørgensen, Steven Kelk, Martijn Kool, Stefan Kuhlmann, Adam Kurpisz, Johannes Lengler, Chiara Meroni, Ingmar Metzler, Martin Möller, Samuel Muñoz-Echániz, David Muñoz-Lahoz, Robert Nowak, Georg Oberdieck, Daniel Platt, Dylan Possamaï, Gabriel Ribeiro, Aluna Rizzoli, Daria Sakhanda, Raúl Sánchez Galán, Zheming Sun, Diaaeldin Taha, Josef Teichmann, Richard P. Thomas, Henk van der Pol, Michel van Garrel, Charles Vial, Ignacio Barros, Benjamin Doerr, Peter Grünwald, Henry Liu, David Martins, Aleksandar Mijatović, Sergej Monavari, Marc Roth, Patrick Schnider, Yannik Schuler, Pim Spelier, Yuuji Tanaka, Ronald van Luijk

机构 * ETH Zurich(苏黎世联邦理工学院) Aarhus University(奥胡斯大学)

AI总结 针对大语言模型数学能力评估,引入IMProofBench基准测试,由专家开发77个经同行评审问题,涵盖详细证明及子问题,模拟现实研究环境,结果显示当前LLMs能解决不少研究级问题,该基准测试将持续发展。

Comments v2: benchmark expanded from 39 to 77 problems; evaluation extended to 14 models including GPT-5.4, Gemini 3.1 Pro, and Claude Opus 4.6; new analyses (IRT-based score aggregation, inter-rater reliability, tool/token usage, non-agentic ablation); contributor author list updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07895 2026-07-10 cs.LG 版本更新

Precise localization within the GI tract by combining classification of CNNs and time-series analysis of HMMs

通过结合卷积神经网络分类与隐马尔可夫模型的时间序列分析在胃肠道内进行精确定位

Julia Werner, Christoph Gerum, Moritz Reiber, Jörg Nick, Oliver Bringmann

机构 * Department of Computer Science, University of Tübingen, Germany(图宾根大学计算机科学系) Department of Mathematics, ETH Zürich, Switzerland(苏黎世联邦理工学院数学系)

AI总结 研究通过结合CNN分类与HMM时间序列分析,有效分类VCE图像的胃肠部分,连续时间序列分析可纠正CNN错误,该方法在数据集上准确率达98.04%,仅需约100万个参数,能在胃肠道内精确定位,适用于低功耗设备。

Comments Accepted at MLMI 2023, Code on Github: https://github.com/juliawerner/cnn-hmm-viterbi

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07683 2026-07-09 cs.LG 新提交

ECGLight: Compute-Light Framework For Paper ECG Digitization and Myocardial Infarction Screening

ECGLight:用于纸质心电图数字化和心肌梗死筛查的轻计算框架

Shreyasvi Natraj, Cyrus Achtari, Felice Gragnano, Andrea Milzi, Marco Valgimigli, Diego Paez-Granados

机构 * ETH Zürich(苏黎世联邦理工学院) Swiss Paraplegic Research(瑞士截瘫研究中心) University of Campania “Luigi Vanvitelli”(坎帕尼亚“路易吉·万维泰利”大学) University of Italian Switzerland, Cardiocentro Ticino Institute(意大利瑞士大学提契诺心脏中心研究所)

AI总结 针对偏远诊所因资源限制无法利用AI分析纸质心电图的问题,提出端到端轻量级设备端数字化到诊断管道,能将纸质心电图转换为校准信号并筛查病变,经数据集验证,准确率高且运行快,可普及纸质记录并提供决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07521 2026-07-09 cs.HC cs.AI 新提交

Creativity from Friction: Human-AI Interaction for Exploratory Structural Design

摩擦产生创造力:用于探索性结构设计的人机交互

Ricardo Maia Avelino, Rita Sevastjanova, Tom Van Mele, Philippe Block, Mennatallah El-Assady

机构 * Block Research Group, Department of Architecture, ETH Zurich(建筑系,苏黎世联邦理工学院) IVIA Lab, Department of Computer Science, ETH Zurich(计算机科学系,苏黎世联邦理工学院)

AI总结 探讨当前生成式AI目标与结构设计师等创作者需求的偏差,提出允许受限人机共同创作的系统设计维度,通过试点设计界面和专家研究,展示其对设计空间探索的支持及设计师看法。

Comments Accepted at ICML 2026, Workshop on Human-AI Co-Creativity

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06701 2026-07-09 cs.CV cs.AI cs.GR cs.LG cs.RO 新提交

SPEAR: A Simulator for Photorealistic Embodied AI Research

SPEAR:用于逼真的具身人工智能研究的模拟器

Mike Roberts, Renhan Wang, Rushikesh Zawar, Rachith Dey-Prakash, Quentin Leboutet, Stephan R. Richter, Matthias Müller, German Ros, Rui Tang, Stefan Leutenegger, Yannick Hold-Geoffroy, Kalyan Sunkavalli, Vladlen Koltun

机构 * Adobe Research(Adobe研究院) Intel Labs(英特尔实验室) Manycore Tech Inc(众核科技公司) Adobe(Adobe公司) NVIDIA(英伟达公司) ETH Zurich(苏黎世联邦理工学院) Imperial College London(伦敦帝国学院)

AI总结 研究针对现有逼真模拟器局限,提出SPEAR这一Python库,通过模块化插件架构连接控制UE应用程序,提升可编程性与渲染速度,还提供新图像模态和高级编程模型,经多样示例应用展示了其效用。

Comments Accepted for publication at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06691 2026-07-09 cs.CV 新提交

CoMind: Understanding Collaborative Human Activity from Multiple Minds and Views

CoMind:从多视角理解人类协作活动

Alexey Gavryushin, Dingxi Zhang, Zhao Huang, Alexandros Delitzas, Jiaqi Chen, Ben Ellis, Cedric Zöllner, Manthan Patel, Manuel Kaufmann, Marc Pollefeys, Xi Wang

机构 * ETH Zurich(苏黎世联邦理工学院) MPI for Informatics(马克斯·普朗克信息研究所) Microsoft Switzerland(微软瑞士公司) TU Munich(慕尼黑工业大学)

AI总结 研究旨在填补人类协作认知过程研究空白,引入CoMind数据集,整合多模态数据并标注,建立相关基准,有助于开发和评估能建模复杂社会互动及推理人类行为的AI系统。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30170 2026-07-09 cs.MM cs.CV cs.LG 版本更新

Unveiling the Visual Counting Bottleneck in Vision-Language Models

揭示视觉语言模型中的视觉计数瓶颈

Xingzhou Pang, Yifan Hou, Junling Wang, Mrinmaya Sachan

机构 * Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)

AI总结 通过分解视觉计数为三个认知阶段,发现视觉语言模型在符号映射阶段失败,提出断裂数量假说:模型学习到分离的模态特定统计流形,无法实现跨模态对齐。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18734 2026-07-09 cs.CV 版本更新

EgoExoMem: Cross-View Memory Reasoning over Synchronized Egocentric and Exocentric Videos

EgoExoMem: 跨视角记忆推理 over 同步的自身视角和外部视角视频

Ruiping Liu, Junwei Zheng, Yufan Chen, Di Wen, Shaofang Quan, Chengzhi Wu, Jiaming Zhang, Kailun Yang, Kunyu Peng, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ETH Zurich(苏黎世联邦理工学院) University of Oxford(牛津大学) Hunan University(湖南大学)

AI总结 本文提出EgoExoMem,首个跨视角记忆推理基准,通过同步自身视角和外部视角视频进行跨视角记忆推理,利用E$^2$-Select方法实现高效的帧选择,实验表明自身和外部视角提供互补的记忆线索,但现有模型在基准测试中表现有限。

Comments The source code and dataset can be found at https://github.com/RuipingL/EgoExoMem

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25739 2026-07-09 cs.CV 版本更新

MegaFlow: Zero-Shot Large Displacement Optical Flow

MegaFlow:零样本大位移光流

Dingxi Zhang, Fangjinhua Wang, Marc Pollefeys, Haofei Xu

机构 * ETH Zurich(苏黎世联邦理工学院) Microsoft(微软) University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心)

AI总结 MegaFlow通过预训练视觉先验解决大位移零样本光流问题,利用全局Vision Transformer实现全局匹配,结合轻量迭代优化提升精度,实验显示其在多个光流基准和长距离点跟踪任务中表现优异。

Comments [ECCV 2026] Project Page: https://kristen-z.github.io/projects/megaflow Code: https://github.com/cvg/megaflow

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06445 2026-07-09 cs.CV 版本更新

What if? Emulative Simulation with World Models for Situated Reasoning

如果呢?基于世界模型的仿真模拟用于情境推理

Ruiping Liu, Yufan Chen, Yuheng Zhang, Junwei Zheng, Kunyu Peng, Chengzhi Wu, Chenguang Huang, Di Wen, Jiaming Zhang, Kailun Yang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) ETH Zürich(苏黎世联邦理工学院) INSAIT, Sofia University ``St. Kliment Ohridski''(INSAIT,索菲亚大学『圣克莱门特·奥赫里迪斯』) RAI Institute(RAI研究所)

AI总结 提出WanderDream数据集,利用世界模型进行心理探索的仿真模拟,使代理无需主动探索即可回答空间假设问题,实验证明心理探索对情境推理至关重要。

Comments Accepted at ECCV 2026. The data and code are available at: https://github.com/RuipingL/WanderDream

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18164 2026-07-09 cs.RO 版本更新

GrandTour: A Legged Robotics Dataset in the Wild for Multi-Modal Perception and State Estimation

GrandTour: 一种用于多模态感知与状态估计的野外腿式机器人数据集

Turcan Tuna, Jonas Frey, Frank Fu, Katharine Patterson, Tianao Xu, Maurice Fallon, Cesar Cadena, Marco Hutter

机构 * ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) UC Berkeley(伯克利大学) Oxford University(牛津大学)

AI总结 GrandTour数据集为多模态感知与状态估计提供了大规模野外腿式机器人数据,支持SLAM和高精度状态估计的研究与开发。

Comments Turcan Tuna, and Jonas Frey contributed equally. Submitted to Sage The International Journal of Robotics Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01683 2026-07-09 cs.CV 版本更新

ROAD-Waymo: A Large-Scale Action Awareness Dataset for Autonomous Driving

ROAD-Waymo:一个用于自动驾驶的大规模动作感知数据集

Salman Khan, Izzeddin Teeti, Reza Javanmard Alitappeh, Mihaela C. Stoian, Eleonora Giunchiglia, Gurkirt Singh, Andrew Bradley, Fabio Cuzzolin

机构 * Oxford Brookes University(奥克斯福德布鲁克斯大学) MAZUST University of Oxford(牛津大学) Imperial College London(伦敦帝国学院) ETH Zurich(苏黎世联邦理工学院)

AI总结 本文提出ROAD-Waymo数据集,用于道路场景中代理、动作等检测技术开发与基准测试,比现有数据集更大更具挑战性,含大量标注数据,通过新注释管道增强完整性,还能解决不同国家道路场景的域适应问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05609 2026-07-08 stat.ML cs.AI cs.LG 新提交

To Retain or to Adapt? Generalizing Continual Learning

保留还是适应?泛化持续学习

Giulia Lanzillotta, Mandana Samiei, Doina Precup, Razvan Pascanu, Claire Vernade

机构 * ETH AI Center, Department of Computer Science, ETH Zürich(苏黎世联邦理工学院人工智能中心,计算机科学系) Mila - Quebec AI Institute, School of Computer Science, McGill University(魁北克人工智能研究所,麦吉尔大学计算机科学系) University of Technology Nuremberg(纽伦堡技术大学)

AI总结 该研究挑战持续学习以保留知识为中心的前提,将其形式化为在线优化问题,引入转移效率指标,得出关键任务持续时间,验证理论预测,还提出预测持续学习算法类别及窗口算法,在受控分布漂移下有良好表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06464 2026-07-08 cs.RO 新提交

Hilti-Trimble-Oxford Dataset: 360 Visual-Inertial Benchmark with Floor Plan Priors for SLAM and Localization

Hilti-Trimble-牛津数据集:用于SLAM和定位的带有平面图先验的360视觉惯性基准测试

Samuele Centanni, Yuhao Zhang, Yifu Tao, Julien Kindle, Frank Neuhaus, Tilman Koß, Aryaman Patel, Michael Helmberger, Emilia Szymańska, Torben Gräber, Maurice Fallon

机构 * Hilti AG(喜利得集团) University of Oxford(牛津大学) ETH Zürich(苏黎世联邦理工学院) Vision & Robotics GmbH(视觉与机器人有限公司) Trimble Inc.(天宝公司)

AI总结 本文介绍了Hilti-Trimble-牛津数据集,用于支持建筑工地的视觉SLAM和定位。它收集于活跃建筑工地,包含30个视觉惯性序列及地面真值轨迹。通过开放研究挑战评估相关系统,反映出SLAM方法更成熟,凸显定位任务难度,为持续研究提供支持,数据集公开可用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06048 2026-07-08 stat.ML cs.IT cs.LG math.CA math.IT 新提交

Separation Capacity of Scattering Networks on Low-Dimensional Datasets

低维数据集上散射网络的分离能力

Konstantin Häberle, Helmut Bölcskei

机构 * ETH Zurich(苏黎世联邦理工学院)

AI总结 研究低维数据集上散射网络的分离能力,通过刻画一般特征提取器的分离能力,针对散射网络得出滤波器要在多频率与数据匹配、耦合矩阵要有良好条件数这两个设计准则。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07607 2026-07-08 cs.RO cs.CV 版本更新

EgoVerse: An Egocentric Human Dataset for Robot Learning from Around the World

EgoVerse:一个用于机器人学习的视点人类数据集

Ryan Punamiya, Simar Kareer, Zeyi Liu, Josh Citron, Ri-Zhao Qiu, Xiongyi Cai, Alexey Gavryushin, Jiaqi Chen, Davide Liconti, Lawrence Y. Zhu, Patcharapong Aphiwetsa, Baoyu Li, Aniketh Cheluva, Pranav Kuppili, Yangcen Liu, Dhruv Patel, Aidan Gao, Hye-Young Chung, Ryan Co, Renee Zbizika, Jeff Liu, Xiaomeng Xu, Haoyu Xiong, Geng Chen, Sebastiano Oliani, Wenkai Xuan, Chenyu Yang, Xi Wang, James Fort, Richard Newcombe, Josh Gao, Jason Chong, Garrett Matsuda, Aseem Doriwala, Marc Pollefeys, Robert Katzschmann, Xiaolong Wang, Shuran Song, Judy Hoffman, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学) University of California San Diego(加州大学圣地亚哥分校) ETH Zürich(苏黎世联邦理工学院) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Meta Reality Labs Research(Meta现实实验室) Mecka AI Scale AI

AI总结 EgoVerse通过统一的数据收集、处理和访问框架,提供丰富的人类操作行为数据,促进机器人学习,并通过大规模研究验证了人类数据与机器人学习目标的一致性对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07400 2026-07-08 cs.LG cs.ET cs.PF 版本更新

BitLogic: Training Framework for Gradient-Based FPGA-Native Neural Networks

BitLogic:基于梯度的FPGA原生神经网络训练框架

Simon Bührer, Andreas Plesner, Aczel Till, Roger Wattenhofer

机构 * ETH Zurich(苏黎世联邦理工学院)

AI总结 研究基于梯度的FPGA原生神经网络训练框架选择对精度和硬件成本的影响,提出统一框架BitLogic,将领域分解为五轴设计空间并在共享协议下实例化先前方法,结合各轴获胜者确定新配置,评估后得出该配置在多数据集上表现优且能耗低的结论。

Comments Accepted at TMLR (Transactions on Machine Learning Research)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05277 2026-07-07 cs.CR cs.LG 新提交

Untrusted Content Masking for Web Agents with Security Guarantees

具备安全保证的Web智能体不可信内容掩码技术

Kristina Nikolić, Egor Zverev, Javier Rando, Matthew Jagielski, Edoardo Debenedetti, Florian Tramèr

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心) ISTA(瑞士信息科学与技术学院) Anthropic(Anthropic公司)

AI总结 针对Web智能体的提示注入安全边界缺失问题,提出UCM方法,利用网页DOM区分内容区域,通过掩码与沙箱交互恢复安全边界,实现带安全保障的Web环境交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05090 2026-07-07 cs.CV 新提交

Be Indiscrete: The Benefits of Learning Continuous Spine Degeneration Severity Scores

保持离散:学习连续脊柱退变严重程度评分的益处

Maria Monzon, Andrew Zisserman, Robin Y. Park, Catherine R. Jutzeler, Amir Jamaludin

机构 * Biomedical Data Science Lab, Dept. D-HEST, ETH Zurich(生物医学数据科学实验室,D-HEST系,苏黎世联邦理工学院) Swiss Institute of Bioinformatics (SIB)(瑞士生物信息学研究所) Visual Geometry Group, Dept. of Engineering Science, University of Oxford(视觉几何组,工程科学系,牛津大学)

AI总结 研究将脊柱退变建模为连续严重程度排序问题,介绍SpineRankNet框架从腰椎MRI学习标量严重程度分数,与多类分类和序数回归对比,表明排序损失训练的模型可实现MRI扫描细粒度排序,分数能恢复分级且提升类间区分度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05077 2026-07-07 cs.CV 新提交

LangLoc: "Tell Me What You See"

LangLoc:“告诉我你看到了什么”

Shaurya Kishore Panwar, Roham Zendehdel Nobari, Shirley Feng Yi Lau, Abu Bakr Rahman Shaik, Manuel Günther, Marc Pollefeys, Daniel Barath

机构 * ETH Zürich(苏黎世联邦理工学院) University of Zürich(苏黎世大学) Microsoft(微软公司) HUN-REN SZTAKI(匈牙利科学院计算机与自动化研究所)

AI总结 研究从自然语言进行室内细粒度定位,用含CLIP语义特征的双分支GATv2编码器检索场景,通过射线投射物体可见性估计位置和方向,用贝叶斯对话模块解决歧义,贡献基准数据集。

Comments Accepted at the European Conference of Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04993 2026-07-07 cs.LG cs.AI 新提交

The Map Behind the Flow: Finite-Step Gradient Descent as a Dynamical System

流动背后的映射:作为动力系统的有限步梯度下降

Thomas Hofmann

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系)

AI总结 研究固定步长梯度下降作为离散动力系统,在可精确求解模型层次中,从深度线性链平衡标量约简出发,分析其动力学行为及对学习的影响,指出学习率是训练动力学的结构参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04655 2026-07-07 cs.CL 新提交

FormalRx: Rectify and eXamine Semantic Failures in Autoformalization

FormalRx:纠正和检查自动形式化中的语义错误

Haocheng Wang, Baiyu Huang, Yingjia Wan, Xiao Zhu, Xiaoyang Liu, Yinya Huang, Zhijiang Guo

机构 * LARK Lab, HKUST(GZ)(香港科技大学(广州)LARK实验室) ETH Zurich(苏黎世联邦理工学院) UCLA(加州大学洛杉矶分校) SJTU(上海交通大学) ETH AI Center(苏黎世联邦理工学院人工智能中心) HKUST(香港科技大学)

AI总结 研究自动形式化中语义对齐问题,提出FormalRx框架,核心是SCI错误分类法,能实现对齐判定、错误分类、定位及纠正,通过实例验证性能优于基线,助力自动形式化系统诊断与改进。

Comments 44 pages, 5 figures. Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04546 2026-07-07 cs.RO cs.AI cs.CV cs.LG 新提交

Mask2Real-WM: Segmentation Masks as a Sim-to-Real Bridge for Controllable Dexterous World Models

Mask2Real-WM:作为可控灵巧世界模型的模拟到现实桥梁的分割掩码

Riccardo O. Feingold, Davide Liconti, Chenyu Yang, Robert K. Katzschmann

机构 * Soft Robotic Lab, Department of Mechanical and Process Engineering ETH Zurich, Switzerland(苏黎世联邦理工学院机械与过程工程系软机器人实验室)

AI总结 提出Mask2Real-WM,一种用于灵巧操纵的两阶段动作条件世界模型,将像素预测解耦为动力学和渲染模型,利用分割空间较小的模拟到现实差距,通过合成数据预训练和真实演示微调实现各自由度动作可控。

Comments 23 pages, 24 figures, 4 tables. Preprint. Project page: https://srl-ethz.github.io/Mask2Real-WM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04501 2026-07-07 cs.HC cs.LG 新提交

From Interaction to Intent: Inferring User Objectives from Provenance Logs

从交互到意图:从溯源日志中推断用户目标

Steffen Holter, Tobias Stähle, Arpit Narechania, Mennatallah El-Assady

机构 * ETH Zurich(苏黎世联邦理工学院) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 研究能否用溯源日志对视觉探索任务中的用户意图分类,记录参与者交互,发现不同分析目标有不同行为特征,嵌入上下文信息可使分类器跨数据集和投影方法预测用户目标。

Comments 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏