arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

ETH Zurich(苏黎世联邦理工学院)

2026-05-20 至 2026-05-20 共收录 13
2605.19929 2026-05-20 cs.CV cs.AI

Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models

打破大视觉-语言模型低比特量化中的模态异质性

Yi Zhong, Haotong Qin, Xindong Zhang, Lei Zhang, Guolei Sun

机构 * VCIP, College of Computer Science, Nankai University(南开大学计算机科学学院VCIP) D-ITET, ETH Zürich(苏黎世联邦理工学院D-ITET) OPPO Research Institute(OPPO研究院) Department of Computing, Hong Kong Polytechnic University(香港理工大学计算机系)

AI总结 本文提出SplitQ框架,通过通道分割和自适应跨模态校准模块,解决大视觉-语言模型在低比特量化中因模态异质性导致的精度下降问题,显著提升了在多种多模态数据集上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19866 2026-05-20 cs.CV

Structured Layout Priors for Robust Out-of-Distribution Visual Document Understanding

用于鲁棒性文档理解的结构化布局先验

Peter El Hachem, Ahmed Nassar, A. Said Gurbuz, Christoph Auer, Peter W. J. Staar

机构 * ETH Zurich(苏黎世联邦理工学院) IBM Research(IBM研究院)

AI总结 本文提出了一种结构化布局先验,通过在解码器之外运行轻量级RT-DETR检测器,将检测结果转换为解析器的DocTags词汇,并注入到提示中,以解决文档布局解析中的两跳瓶颈问题,从而提升文档理解的鲁棒性。

Comments 18 pages, 7 figures. Main text: 9 pages (4 figures); Appendix: 9 pages (3 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19812 2026-05-20 cs.LG cs.AI stat.AP stat.ML

FLUXtrapolation: A benchmark on extrapolating ecosystem fluxes

FLUXtrapolation:一个用于外推生态系统通量的基准测试

Anya Fries, Jacob A Nelson, Martin Jung, Markus Reichstein, Jonas Peters

机构 * Seminar for Statistics, ETH Zürich(统计研究所,苏黎世联邦理工学院) Max Planck Institute for Biogeochemistry(生物地球化学研究所)

AI总结 该研究提出FLUXtrapolation基准测试,旨在外推生态系统通量,通过分析分布偏移对通量上推的挑战,评估机器学习方法在分布偏移下的表现,以促进通量上推的科学目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19804 2026-05-20 cs.CV cs.AI cs.LG

Stitched Value Model for Diffusion Alignment

用于扩散对齐的拼接价值模型

Hyojun Go, Hyungjin Chung, Prune Truong, Goutam Bhat, Li Mi, Zhaochong An, Zixiang Zhao, Dominik Narnhofer, Serge Belongie, Federico Tombari, Konrad Schindler

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌) University of Copenhagen(哥本哈根大学)

AI总结 本文提出StitchVM,一种将预训练的干净图像奖励模型转移到噪声潜在空间的拼接框架,通过高效转移和微调,提升扩散对齐的效率和效果。

Comments Project page: https://gohyojun15.github.io/StitchVM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20529 2026-05-20 cs.RO cs.MA

A Practical Framework of Key Performance Indicators for Multi-Robot Lunar and Planetary Field Tests

多机器人月球和行星实地测试的关键绩效指标实用框架

Julia Richter, David Oberacker, Gabriela Ligeza, Valentin T. Bickel, Philip Arm, William Talbot, Marvin Grosse Besselmann, Florian Kehl, Tristan Schnell, Hendrik Kolvenbach, Rüdiger Dillmann, Arne Roennau, Marco Hutter

机构 * Robotic Systems Lab (RSL), ETH Zürich(罗伯特系统实验室(RSL),苏黎世联邦理工学院) FZI Research Center for Information Technology(信息技术研究所以及中心) Machine Intelligence and Robotics Lab (MaiRo), Karlsruhe Institute for Technology (KIT)(机器智能与机器人实验室(MaiRo),卡尔斯鲁厄理工学院) Department of Environmental Sciences, University of Basel(巴塞尔大学环境科学系) European Space Agency/ESTEC(欧洲航天局/ESTEC) Center for Space and Habitability, University of Bern(伯尔尼大学空间与宜居性中心) Space Instruments Group, University of Zürich(苏黎世大学空间仪器组) Space Science and Technology, ETH Zürich(苏黎世联邦理工学院空间科学与技术)

AI总结 本文提出了一种基于多机器人月球场景的KPI框架,用于评估和比较不同实地测试的性能,强调效率、鲁棒性和精度的场景依赖性优先级,并通过实地测试验证了其在实际应用中的有效性。

Comments Presented at ICRA 2026 Workshop on Multi-Agent Robotic Systems: Real-World Collaboration and Interaction

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19469 2026-05-20 cs.LG cs.AI cs.RO

Sampling-Based Safe Reinforcement Learning

基于采样的安全强化学习

Luca Vignola, Bruce D. Lee, Manish Prajapat, Manuel Wendl, Melanie Zeilinger, Andreas Krause, Yarden As

机构 * ETH Zurich(苏黎世联邦理工学院)

AI总结 本文提出了一种基于采样的安全强化学习方法,通过在有限的动力学样本集上联合施加约束,确保学习过程中的安全性,并在连续域中提供实用的安全保证,同时通过限制认知不确定性实现了高效的探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19247 2026-05-20 cs.CV

Structuring Open-Ended NAS: Semi-Automated Design Knowledge Structuring with LLMs for Efficient Neural Architecture Search

结构化开放端NAS:利用LLM进行半自动设计知识结构化以实现高效的神经架构搜索

Yuiko Sakuma, Masakazu Yoshimura, Marcel Gröpl, Zitang Sun, Junji Otsuka, Atsushi Irie, Takeshi Ohashi

机构 * Sony Group Corporation(索尼集团公司) ETH Zurich(苏黎世联邦理工学院)

AI总结 本文提出一种半自动方法,利用LLM结构化模型设计知识,以指导神经架构搜索过程,通过定义高层结构模板和引入FairNAD算法,实现了高效的开放端搜索空间探索,提升了在多个数据集上的性能。

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19150 2026-05-20 cs.LG cs.AI

Flash PD-SSM: Memory-Optimized Structured Sparse State-Space Models

Flash PD-SSM: 一种内存优化的结构稀疏状态空间模型

Aleksandar Terzić, Francesco Carzaniga, Nicolas Menet, Yannick Biehl, Michael Hersche, Thomas Hofmann, Abbas Rahimi

机构 * IBM Research – Zurich(IBM瑞士研究中心) Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)

AI总结 本文提出Flash PD-SSM,一种内存优化的结构稀疏状态空间模型,通过在保持高效的同时提升表达能力,实现了与传统结构化状态空间模型相当的吞吐量,并在多个任务中展示了更高的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19127 2026-05-20 cs.AI

POLAR-Bench: A Diagnostic Benchmark for Privacy-Utility Trade-offs in LLM Agents

POLAR-Bench: 一个用于LLM代理隐私-效用权衡的诊断基准

Qiaoyuan Zheng, Yiqu Yang, Qi Gao, Imanol Schlag

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(ETH人工智能中心)

AI总结 本文提出POLAR-Bench基准,用于评估LLM代理在隐私和效用之间的权衡。通过在10个领域和7,852个样本上进行测试,该基准通过确定性集合成员hip评分隐私和效用,并在两个正交轴上变化隐私策略维度和攻击策略,生成5x5的诊断表面。结果揭示了当前前沿模型在保护属性上隐瞒超过99%,而较小的开放权重模型在1-30B范围内表现更差,泄露率高达一半。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18431 2026-05-20 cs.CV

Seeing Together: Multi-Robot Cooperative Egocentric Spatial Reasoning with Multimodal Large Language Models

协同视见:基于多模态大语言模型的多机器人协作自体空间推理

Kunyu Peng, Zhikun Zhou, Kailun Yang, Di Wen, Ruiping Liu, Yufan Chen, Junwei Zheng, Hao Shi, Yi Zhou, M. Saquib Sarfraz, Danda Pani Paudel, Luc Van Gool

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) University of Oxford(牛津大学) Zhejiang University(浙江大学) ETH Zurich(苏黎世联邦理工学院) Ant Group(蚂蚁集团)

AI总结 本文研究了多机器人协作动态空间推理问题,提出了首个针对该任务的基准CoopSR以及多机器人自体问答数据集EgoTeam,通过引入SP-CoR框架实现了细粒度的协作空间推理,显著提升了多机器人协作推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18413 2026-05-20 cs.CV

Cracks in the Foundation: A Civil Infrastructure Dataset to Challenge Vision Foundation Models

基础的裂缝:一个挑战视觉基础模型的民用基础设施数据集

Nicola Farronato, Niccolo Avogaro, Thomas Frick, Mattia Rigotti, Rizwan Ullah Khan, Michele Magno, Konrad Schindler, Cristiano Malossi, Florian Scheidegger

机构 * IBM Research(IBM研究院) ETH Zürich(苏黎世联邦理工学院) University of Twente(特文特大学)

AI总结 本文提出Cracks in the Foundation数据集,通过高分辨率图像挑战视觉基础模型在民用基础设施中的密集图像理解能力,揭示了现有模型在真实世界中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17326 2026-05-20 hep-lat cs.LG

Noise scheduling and linear dynamics in diffusion models on Lie groups

在李群上扩散模型中的噪声调度与线性动力学

Javad Komijani

机构 * Institute for Theoretical Physics, ETH Zurich, 8093 Zurich, Switzerland(理论物理研究所,苏黎世联邦理工学院,瑞士苏黎世,8093)

AI总结 本文研究了在李群上扩散过程中噪声调度的作用,特别关注其在格点规范理论中的应用。研究发现特定的噪声调度可使Wilson作用量的期望值随扩散时间线性衰减,与欧几里得扩散模型相比,这种行为在李群设置中自然产生,而后者需要显式设计漂移项。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01529 2026-05-20 cs.LG

Learning Abstract World Models with a Group-Structured Latent Space

通过组结构潜在空间学习抽象世界模型

Thomas Delliaux, Nguyen-Khanh Vu, Vincent François-Lavet, Elise van der Pol, Emmanuel Rachelson

机构 * ISAE-SUPAERO ETH Zürich(瑞士联邦理工学院) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Microsoft Research AI for Science(微软研究院人工智能科学部)

AI总结 该研究通过在低维表示流形上引入几何先验,改进了马尔可夫决策过程的抽象模型学习,从而提升有限数据下的泛化能力,并在具有旋转和翻译特征的环境中实现了更有效的强化学习任务学习。

Comments 20 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏