arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

ETH Zurich(苏黎世联邦理工学院)

共收录 187
2606.21458 2026-06-23 cs.LG 新提交

Post-Training Speech Enhancement Language Models with Perceptual Rewards

基于感知奖励的语音增强语言模型后训练

Frédéric Berdoz, Luca A. Lanzendörfer, Antonis Asonitis, Roger Wattenhofer

机构 * ETH Zürich(苏黎世联邦理工学院)

AI总结 提出使用组序列策略优化(GSPO)结合多指标感知奖励对自回归语音增强语言模型进行后训练,直接优化非可微质量指标,在DNS2020基准上达到最优,且多奖励优化优于单指标变体。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21406 2026-06-23 cs.RO cs.CV 新提交

Robot Self-Improvement via Human-Video Dynamics Models

机器人通过人类视频动力学模型自我改进

Hanzhi Chen, Anran Zhang, Simon Schaefer, Kejia Chen, Shi Chen, Daniel Cremers, Oier Mees, Stefan Leutenegger

机构 * ETH Zurich(苏黎世联邦理工学院) Technical University of Munich(慕尼黑工业大学) Microsoft(微软) MCML(慕尼黑机器学习中心)

AI总结 提出DGAC方法,利用人类视频学习跨本体的动作、动力学和价值表征,使机器人能从自身失败中自主改进,在7个真实操作任务中将成功率从40%提升至81%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21321 2026-06-23 cs.LG 新提交

Objective-Behavior Alignment: Diagnostics for MORL Policy Selection

目标-行为对齐:多目标强化学习策略选择的诊断方法

Antonio Mone, Zuzanna Osika, Florian Felten, Pradeep K. Murukannaiah, Mark Fuge, Frans A. Oliehoek, Luciano Cavalcante Siebert

机构 * Delft University of Technology(代尔夫特理工大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 提出一种诊断工作流,自动揭示帕累托前沿上仅靠目标值无法体现的行为差异,通过定量和可视化工具辅助策略选择,在简单网格和连续控制基准上验证有效性。

Comments 22 pages, 41 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20736 2026-06-23 cs.CV 新提交

REKEY: Metadata-Grounded Visual-Key Regeneration for Contamination-Resilient VQA Evaluation

REKEY: 基于元数据的视觉键再生方法用于抗污染的VQA评估

Tengjie Lin, Yutao Sun, Jingwei Ni, Shuhan Ge, Hao-Xuan Ma, Yanting Miao, Wangyue Lu, Mingshuai Chen, Tiancheng Zhao, Jianwei Yin

机构 * Zhejiang University(浙江大学) ETH Zürich(苏黎世联邦理工学院) Nanjing University of Science and Technology(南京理工大学) Nanjing University(南京大学) University of Waterloo(滑铁卢大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院)

AI总结 提出ReKey协议,通过随机再生图像中的视觉键来防止VQA基准测试泄露,实验显示原始项目得分比再生变体高9.5-18.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23637 2026-06-23 cs.LG math.OC 新提交

Muown Implicitly Performs Angular Step-size Decay

Muown 隐式执行角步长衰减

Florian Hübler, Kai Lion, Antonio Orvieto, Niao He

机构 * ETH Zurich(苏黎世联邦理工学院) ELLIS Institute Tübingen(蒂宾根ELLIS研究所) MPI-IS Tübingen AI Center(马克斯·普朗克智能系统研究所蒂宾根人工智能中心)

AI总结 本文揭示 Muown 优化器的方向更新等价于归一化方向上的黎曼步长,其未归一化参数幅度仅调节角步长,据此提出显式角步长的 AngularMuown 方法,在 nanoGPT 竞赛和 Qwen2 等模型上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23346 2026-06-23 astro-ph.CO cs.AI 新提交

Field-level weak lensing cosmology with $<100$ simulations using multifidelity simulation-based inference

使用少于100次模拟的多保真度基于模拟推理的场级弱引力透镜宇宙学

Alex A. Saoulis, Kiyam Lin, Niall Jeffrey, Maximilian von Wietersheim-Kramsta, Davide Piras, Alessio Spurio Mancini, Ana M. G. Ferreira, Benjamin Joachimi

机构 * Department of Physics & Astronomy, University College London(物理与天文学系,伦敦大学学院) Department of Earth Sciences, University College London(地球科学系,伦敦大学学院) Department of Physics & King’s Institute for Artificial Intelligence, King’s College London(物理系及国王学院人工智能研究所,国王学院) Institute for Computational Cosmology (ICC) & the Centre for Extragalactic Astronomy (CEA), Durham University(计算宇宙学研究所(ICC)及(extragalactic astronomy)天文中心(CEA),杜伦大学) Département de Physique Théorique, Université de Genève(理论物理系,日内瓦大学) ETH Zurich, Institute for Particle Physics and Astrophysics(苏黎世联邦理工学院,粒子物理与天体物理学研究所) Department of Physics, Royal Holloway, University of London(物理系,伦敦皇家霍洛威大学)

AI总结 提出多保真度基于模拟推理方法,用60-100次高保真N体模拟实现场级弱引力透镜宇宙学推断,显著降低模拟成本。

Comments 19 + 7 pages, 13 + 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13102 2026-06-23 cs.RO 新提交

FTP-1: A Generalist Foundation Tactile Policy Across Tactile Sensors for Contact-Rich Manipulation

FTP-1:一种跨触觉传感器的通用基础触觉策略,用于密集接触操作

Chengbo Yuan, Zicheng Zhang, Mingjie Zhou, Wendi Chen, Yi Wang, Zhuoyang Liu, Dantong Niu, Shuo Wang, Hui Zhang, Wenkang Zhang, Yingdong Hu, Yuanqing Gong, Wanli Xing, Chuan Wen, Cewu Lu, Kaifeng Zhang, Yang Gao

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海期智研究院) Sharpa Shanghai Jiao Tong University(上海交通大学) University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 提出FTP-1,首个通用基础触觉策略,通过异构编码器和共享Transformer专家,跨21种传感器和3000小时数据预训练,实现触觉操作技能的跨传感器迁移,在未见传感器上成功率提升31%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20140 2026-06-19 cs.CV 新提交

SA-VIS: Sparse frame Annotations for training Video Instance Segmentation

SA-VIS: 用于训练视频实例分割的稀疏帧标注

Edoardo Mello Rella, Ajad Chhatkuli, Shipra Jain, Ender Konukoglu, Luc Van Gool

机构 * CVL, ETH Zurich(计算机视觉实验室,苏黎世联邦理工学院) Align Technology VISICS, KU Leuven(VISICS,鲁汶大学) INSAIT, Sofia(INSAIT,索非亚)

AI总结 提出稀疏帧标注的SA-VIS方法,通过过去帧特征传播模块利用低维特征,在仅使用1/5标注帧时性能仅下降0.4%,显著降低标注成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20104 2026-06-19 cs.LG cs.AI 新提交

Sensorimotor World Models: Perception for Action via Inverse Dynamics

传感器运动世界模型:通过逆动力学实现面向行动感知

Petr Ivashkov, Randall Balestriero, Bernhard Schölkopf

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Department of Computer Science, Brown University(布朗大学计算机科学系) ELLIS Institute(ELLIS研究所) ETH Zürich(苏黎世联邦理工学院)

AI总结 提出传感器运动世界模型(SMWM),通过逆动力学正则化端到端训练潜空间世界模型,防止表示崩溃并学习与行动对齐的紧凑表示,在2D和3D控制任务中实现竞争性规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19697 2026-06-19 cs.LG cs.AI cs.CL 新提交

Efficiently Representing Algorithms With Chain-of-Thought Transformers

高效表示链式思维Transformer中的算法

Yanhong Li, Anej Svete, Ashish Sabharwal, William Merrill

机构 * Allen Institute for AI(艾伦人工智能研究所) ETH Zürich(苏黎世联邦理工学院)

AI总结 本文证明链式思维Transformer能以多对数开销高效模拟Word RAM算法,包括排序和Dijkstra算法,优于模拟图灵机的二次开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19468 2026-06-19 cs.CL 新提交

Characterizing Narrative Content in Web-scale LLM Pretraining Data

网络规模LLM预训练数据中的叙事内容特征化

Teagan Johnson, Elliott Ash, Andrew Piper, Maria Antoniak

机构 * University of Colorado Boulder(科罗拉多大学波尔德分校) ETH Zürich(苏黎世联邦理工学院) McGill University(麦吉尔大学)

AI总结 首次细粒度研究LLM预训练语料库Dolma的叙事特征,提出涵盖三个核心叙事元素(能动性、场景、事件)的框架,构建NarraBERT模型并发布NarraDolma数据集,揭示叙事结构在异构数据中可测量且分布不均。

Comments 8 pages of main content, 28 total pages. 30 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19344 2026-06-19 cs.CL cs.AI 新提交

Exposing the Unsaid: Visualizing Hidden LLM Bias through Stochastic Path Aggregation

揭示未言明之事:通过随机路径聚合可视化隐藏的LLM偏见

Matteo Pelossi, Rita Sevastjanova, Thilo Spinner, Mennatallah El-Assady

机构 * ETH Zurich(苏黎世联邦理工学院)

AI总结 提出TreeTracer工具,通过系统扰动分析、语法对齐聚合和分类感知节点合并,利用桑基图对比不同语义上下文,揭示LLM中隐藏的代表性和句法偏见。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19156 2026-06-18 cs.CV 新提交

Hand-4DGS: Feed-Forward 3D Gaussian Splatting for 4D Hand Reconstruction from Egocentric Videos

Hand-4DGS: 用于从第一人称视频进行4D手部重建的前馈3D高斯泼溅方法

Jeongmin Bae, Seoha Kim, Marc Pollefeys, Mahdi Rad, Youngjung Uh, Taein Kwon

机构 * Yonsei University(延世大学) Electronics and Telecommunications Research Institute(电子电信研究院) ETH Zurich(苏黎世联邦理工学院) Microsoft Spatial AI Lab(微软空间AI实验室) VGG, University of Oxford(VGG,牛津大学)

AI总结 提出Hand-4DGS,首个前馈框架,从第一人称视频直接重建动态4D手部,利用网格引导表示和时间卷积,实现快速推理和强泛化,无需3D真值标注。

Comments Project page: https://jeongminb.github.io/hand-4dgs/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18959 2026-06-18 cs.RO 新提交

TactSpace: Learning a Physics-enriched Shared Latent Space for Tactile Sim-to-Real Transfer

TactSpace: 学习富含物理信息的共享潜在空间以实现触觉模拟到现实的迁移

Arunim Joarder, Arjun Bhardwaj, René Zurbrügg, Mayank Mittal, Florin Püntener, Sira Bielefeldt, Cosmin Roman, Vaishakh Patil, Marco Hutter

机构 * Robotic Systems Lab, ETH Zürich(瑞士苏黎世联邦理工学院机器人系统实验室) Micro- and Nanosystems Lab, ETH Zürich(瑞士苏黎世联邦理工学院微纳系统实验室) ETH AI Center(苏黎世联邦理工学院人工智能中心) NVIDIA(NVIDIA公司)

AI总结 提出多模态表示学习框架TactSpace,通过共享潜在空间对齐异构触觉模态,实现零样本模拟到现实迁移,在力预测和形状重建任务中分别降低误差16.7%和45.8%。

Comments 9 pages, 6 figures, 4 tables, accepted into IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18312 2026-06-18 cs.CR cs.DC cs.LG 新提交

TIGER: Inverting Transformer Gradients via Embedding-Subspace Distance Optimization

TIGER:通过嵌入子空间距离优化反转Transformer梯度

William Kalikman, Ivo Petrov, Dimitar I. Dimitrov, Martin Vechev

机构 * ETH Zürich(苏黎世联邦理工学院) INSAIT, Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱门特·奥赫里茨基")

AI总结 提出TIGER攻击,通过将子空间信号转化为可微目标,直接优化令牌嵌入以最小化到子空间的距离,在编码器模型上提升重建质量和速度,在解码器模型上增强对差分隐私的鲁棒性。

Comments 16 pages, 13 pages main text,

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11918 2026-06-18 cs.AI 新提交

The Art of Interrogation: Consistency Amplifies Factuality in Spatial Reasoning

提问的艺术:一致性增强空间推理中的事实性

Theo Uscidda, Marta Tintore Gazulla, Maks Ovsjanikov, Federico Tombari, Leonidas Guibas

机构 * The University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院) University of Oxford(牛津大学) Stanford University(斯坦福大学)

AI总结 提出自监督强化学习框架,通过几何与语义一致性验证器(如图像翻转、文本对象顺序交换)对齐预训练模型的内在空间推理能力,无需标注数据即可达到接近监督方法的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18206 2026-06-17 cs.AI 新提交

Fixed-Point Reasoners: Stable and Adaptive Deep Looped Transformers

不动点推理器:稳定且自适应的深度循环Transformer

Sajad Movahedi, Vera Milovanović, Shlomo Libo Feigin, Alexander Theus, Thomas Hofmann, Valentina Boeva, T. Konstantin Rusch, Antonio Orvieto

机构 * ELLIS Institute Tübingen, Max Planck Institute for Intelligent Systems, Tübingen AI Center(ELLIS研究所蒂宾根,马克斯·普朗克智能系统研究所,蒂宾根人工智能中心) ETH Zurich(苏黎世联邦理工学院) Swiss Institute of Bioinformatics(瑞士生物信息学研究所) Université Paris Cité(巴黎西岱大学) Liquid AI

AI总结 针对循环架构中深度导致的信号传播问题,提出基于预层归一化和残差缩放的FPRM模型,利用不动点收敛作为端到端停止机制,在Sudoku、Maze等推理基准上自适应计算并有效提升性能。

Comments Code available at https://github.com/nilskiKonjIzDunava/fprm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18119 2026-06-17 cs.AI 新提交

First Proof Second Batch

首次证明第二批

Mohammed Abouzaid, Nikhil Srivastava, Rachel Ward, Lauren Williams

机构 * Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) Harvard University(哈佛大学) Polish Academy of Sciences(波兰科学院) UC Berkeley(加州大学伯克利分校) Brown University(布朗大学) ETH Zürich(苏黎世联邦理工学院) MIT(麻省理工学院) Weierstrass Institute(魏尔斯特拉斯研究所) Duke University(杜克大学) Sorbonne Université(索邦大学) Boston College(波士顿学院) Université du Québec à Montréal(魁北克大学蒙特利尔分校) UCLA(加州大学洛杉矶分校) University of Michigan(密歇根大学) University of Maryland(马里兰大学)

AI总结 测试多个AI系统在十个数学研究问题上的解题能力,评估当前AI解决研究级数学问题的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18043 2026-06-17 cs.RO cs.LG 新提交

Uncertainty Quantification for Flow-Based Vision-Language-Action Models

基于流的视觉-语言-动作模型的不确定性量化

Ralf Römer, Maximilian Seeliger, Saida Liu, Ben Sturgis, Marco Bagatella, Daniel Marta, Andreas Krause, Angela P. Schoellig

机构 * TU Munich(慕尼黑工业大学) ETH Zurich(苏黎世联邦理工学院) MPI IS Tübingen(马克斯·普朗克智能系统研究所)

AI总结 提出利用速度场差异(VFD)量化流匹配模型中的认知不确定性,用于故障检测和主动微调,在LIBERO基准上实现高效任务适应。

Comments Project page: tum-lsy.github.io/uq_vla/. 28 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17786 2026-06-17 cs.HC cs.CL 新提交

Toward Accessible Psychotherapy Training Using AI-Driven Interactive Patient Avatars

利用AI驱动的交互式患者化身实现可及的心理治疗培训

Pascal Riachi, Sofie Kamber, Stella Brogna, Andrew Gloster, Rafael Wampfler

机构 * ETH Zurich(苏黎世联邦理工学院) University of Lucerne(卢塞恩大学)

AI总结 提出一个通过具身虚拟患者进行对话训练ACT心理治疗师的系统,利用大语言模型模拟患者行为,并提供基于ACT保真度标准的逐轮反馈,专家评估证实了高真实性和培训效果。

Journal ref 2026 IEEE 14th International Conference on Healthcare Informatics (ICHI), Minneapolis, MN, June 1-3, 2026, pp. 990-995

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17767 2026-06-17 cs.HC cs.AI 新提交

Talking to Your Data: Exploring Embodied Conversation as an Interface for Personal Health Reflection

与你的数据对话:探索具身对话作为个人健康反思的界面

Nikola Kovacevic, Bastien Husler, Di Zhuang, Rafael Wampfler, Barbara Solenthaler

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系)

AI总结 提出一种通过具身对话代理与可穿戴健康数据交互的新范式,采用双代理设计(观察者提取统计特征,呈现者以“口语化统计”沟通),通过模拟自我用户研究(N=5)与传统仪表盘对比,评估感知理解、行动具体性和认知转变。

Journal ref Joint Proceedings of the ACM Intelligent User Interfaces (IUI) Workshops 2026, Paphos, Cyprus, July 13-16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17427 2026-06-17 cs.CV cs.HC 新提交

Impact of Hand Impairment and Occlusions on Hand Pose Estimation Accuracy in Augmented Reality Applications

手部损伤和遮挡对增强现实应用中手部姿态估计精度的影响

Damian M. Manzone, Mathew Szymanowski, Olga Taran, Shuo Cai, Melissa Marquez-Chin, Tammy Zeng, Hardeep Singh, Cesar Marquez-Chin, José Zariffa

机构 * KITE Research Institute, Toronto Rehabilitation Institute, University Health Network(大学健康网络多伦多康复研究所KITE研究所) Institute of Biomedical Engineering, University of Toronto(多伦多大学生物医学工程研究所) Department of Health Sciences and Technology, ETH Zürich(苏黎世联邦理工学院健康科学与技术系) Department of Occupational Science & Occupational Therapy and the Rehabilitation Sciences Institute, University of Toronto(多伦多大学职业科学与职业治疗系及康复科学研究所)

AI总结 研究评估了HoloLens 2和多种姿态估计算法在手部损伤和物体遮挡条件下的精度,发现算法可泛化至手部损伤人群,透明物体略有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09770 2026-06-17 q-bio.NC cs.LG 新提交

Discovering Functionally Selective Brain Regions with a Deep Topographic Multimodal Model

发现功能选择性脑区:一种深度地形多模态模型

Badr AlKhamissi, Johannes Mehrer, Lara Marinov, Ahmed Abdelaal, Abdulkadir Gokce, Martin Schrimpf

机构 * University of California, Berkeley(加州大学伯克利分校) Max Planck Institute for Human Cognitive and Brain Sciences(马克斯·普朗克人类认知与脑科学研究所) ETH Zurich(苏黎世联邦理工学院)

AI总结 提出Topo-Omni模型,通过空间平滑微调预训练基础模型,在单一连续虚拟皮层上整合视觉、听觉和语言/认知处理,产生与人类神经影像一致的多模态聚类,并用于发现新脑区。

Comments Preprint. First two author contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16771 2026-06-16 cs.LG 新提交

GD$^2$PO: Mitigating Multi-Reward Conflicts via Group-Dynamic reward-Decoupled Policy Optimization

GD$^2$PO: 通过组动态奖励解耦策略优化缓解多奖励冲突

Haotian Liu, Yihao Liu, Jingwei Ni, Siyuan Huang, Xinpeng Liu, Pengyu Cheng, Jiajun Song, Ruijin Ding, Junfeng Li, Zhechao Yu, Mengyu Zhou, Hongteng Xu, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) Renmin University of China(中国人民大学) Peking University(北京大学) ETH Zürich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出GD$^2$PO算法,通过冲突感知过滤机制屏蔽奖励不一致的rollout,并结合查询级重加权,解决多奖励优化中的信号抵消问题,提升RL训练效率。

Comments 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16569 2026-06-16 cs.CV cs.RO 新提交

PROSE: Training-Free Egocentric Scene Registration with Vision-Language Models

PROSE: 基于视觉语言模型的无训练自我中心场景配准

Zhiang Chen, Nahyuk Lee, Boyang Sun, Taein Kwon, Marc Pollefeys, Zuria Bauer, Sunghwan Hong

机构 * ETH Zurich(苏黎世联邦理工学院) VGG, University of Oxford(牛津大学VGG实验室) ETH AI Center(苏黎世联邦理工学院人工智能中心)

AI总结 提出PROSE方法,利用预训练视觉语言模型将RGB序列提升为对象级3D场景图,通过对象高度先验和相同/不同查询匹配实例,无需训练或深度传感器即可实现自我中心场景配准,在Aria基准上超越几何和场景图基线。

Comments Project page: https://rckola.github.io/prose/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16031 2026-06-16 cs.CV 新提交

The Third Challenge on Image Denoising at NTIRE 2026: Methods and Results

NTIRE 2026图像去噪挑战赛第三轮:方法与结果

Lei Sun, Hang Guo, Bin Ren, Shaolin Su, Xian Wang, Danda Pani Paudel, Luc Van Gool, Radu Timofte, Yawei Li

机构 * ETH Zurich(苏黎世联邦理工学院) University of Würzburg(维尔茨堡大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tianjin University(天津大学) Nanjing University of Science and Technology(南京理工大学) University of Beira Interior(贝拉内大学) Siddaganga Institute of Technology(西达甘加理工学院) National Institute of Technology Karnataka(卡纳塔克邦国立理工学院) Sardar Vallabhbhai National Institute of Technology(萨达尔·瓦拉巴伊·帕特尔国立理工学院) University of Luxembourg(卢森堡大学) University of Twente(特温特大学) University of Kragujevac(克拉古耶瓦茨大学) Prince Sultan University(苏丹王子大学) University of Tunis El Manar(突尼斯埃尔马纳尔大学) University of Electronic Science and Technology of China(电子科技大学) Wuhan University(武汉大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peng Cheng Laboratory(鹏城实验室)

AI总结 报告NTIRE 2026高噪声图像去噪挑战赛,参赛团队采用先进神经网络架构,以PSNR为指标,在无约束条件下实现最先进性能。

Comments accepted by cvprw2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15575 2026-06-16 cs.AI cs.HC 新提交

Do we have the knowledge we need? Rethinking human-AI decision-making in corporations

我们是否拥有所需的知识?重新思考企业中的人机决策

Anne S. R. Marx, Ricardo M. Avelino, Torbjørn Netland, Mennatallah El-Assady

机构 * ETH Zurich(苏黎世联邦理工学院) Department of Computer Science & ETH AI Center, ETH Zurich(苏黎世联邦理工学院计算机科学系与ETH AI中心) Department of Computer Science & Architecture, ETH Zurich(苏黎世联邦理工学院计算机科学与建筑系) Department of Management, Technology, and Economics, ETH Zurich(苏黎世联邦理工学院管理、技术与经济系) Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系)

AI总结 本文提出一个框架,根据任务属性和知识可用性推荐人机代理分配与控制机制,并应用于制造任务示例。

Comments Proceedings of AutomationXP26 Workshop of the 2026 CHI Conference on Human Factors in Computing Systems, April 14, 2026, Barcelona, Spain. ACM, New York, NY, USA, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15417 2026-06-16 cs.CV 新提交

From Frames to Temporal Graphs: In-Context Egocentric Action Recognition with Vision-Language Models

从帧到时间图:基于视觉语言模型的上下文第一人称动作识别

Bessie Dominguez-Dager, Francisco Gomez-Donoso, Miguel Cazorla, Marc Pollefeys, Daniel Barath, Zuria Bauer

机构 * University of Alicante(阿利坎特大学) ETH Zürich(苏黎世联邦理工学院) Microsoft(微软)

AI总结 提出将视频转换为时间动作图,通过多阶段提示生成自然语言叙述并结构化,实现上下文学习,在EGTEA和Epic-Kitchens-100上显著提升零样本和少样本动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15366 2026-06-16 eess.SY cs.RO cs.SY math.OC 新提交

Robust Conformal CBF and CLF Controllers via Iterative Policy Updates

通过迭代策略更新的鲁棒共形CBF和CLF控制器

Omid Mirzaeedodangeh, Eliot Shekhtman, Nikolai Matni, Lars Lindemann

机构 * Automatic Control Laboratory, ETH Zürich(瑞士苏黎世联邦理工学院自动控制实验室) Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) Electrical and Systems Engineering, University of Pennsylvania(宾夕法尼亚大学电气与系统工程系)

AI总结 针对共形预测嵌入鲁棒控制时因分布偏移导致安全/稳定性保证失效的问题,提出迭代更新策略框架,结合对抗鲁棒共形预测与分布偏移预算,实现跨回合保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14757 2026-06-16 cs.CV cs.LG 新提交

Spatial Priors via Space Filling Curves for Small and Limited Data Vision Transformers

基于空间填充曲线的小型与有限数据视觉Transformer的空间先验

Leyla Naz Candogan, Arshia Afzal, Pol Puigdemont, Volkan Cevher

机构 * ETH Zürich(苏黎世联邦理工学院)

AI总结 提出VIOLIN,一种轻量级掩码注意力机制,通过空间填充曲线编码空间结构,以极小的参数和计算开销为视觉Transformer注入空间归纳偏置,在小模型和有限数据场景下显著提升性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏