arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-02 至 2026-06-02 共收录 848 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 202 篇

2606.00113 2026-06-02 cs.RO 67%

World Models for Robotic Manipulation: A Survey

机器人操作的世界模型:综述

Fangyuan Wang, Ziyuan Wang, Guorui Pei, Mengshi Zhang, Canxi Liang, Jun Hu, Zhongxuan Li, Jinsong Wu, Ning Han, Zeqing Zhang, Jiaming Qi, Hongmin Wu, Shiyao Zhang, Pai Zheng, Jia Pan, David Navarro-Alarcon, Sichao Liu, Peng Zhou

机构 * Department of Mechanical Engineering, The Hong Kong Polytechnic University(香港理工大学机械工程系) Department of Mechanical Engineering and Automation, Harbin Institute of Technology(哈尔滨工业大学机械工程与自动化系) School of Advanced Engineering, Great Bay University(大湾大学先进工程学院) College of Robotics Science and Engineering, Taiyuan University of Technology(太原科技大学机器人科学与工程学院) School of Data Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)数据科学学院) Department of Mechatronic Engineering, Guangdong Polytechnic Normal University(广东 polytechnic 正常大学机电工程系) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) College of Mechanical and Electrical Engineering, Northeast Forestry University(东北林业大学机械与电气工程学院) Greater Bay Area National Center of Technology Innovation(粤港澳大湾区国家技术创新中心) Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University(香港理工大学工业与系统工程系)

专题命中 评测与基准 :pretraining(abstract);post-training(abstract)

AI总结 本文通过三个问题(预测什么未来表示、预测如何与动作连接、何时在机器人学习流程中使用预测)系统综述了机器人操作中的世界模型,将其定义为动作条件预测系统,并分类为五种表示族,提出了功能分类法,总结了基础设施角色、数据集和评估协议,揭示了从任务特定动力学预测器向预测基础设施的演变及开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27645 2026-06-02 cs.CV 67%

OpenDPR: Open-Vocabulary Change Detection via Vision-Centric Diffusion-Guided Prototype Retrieval for Remote Sensing Imagery

OpenDPR:面向遥感影像的基于视觉中心扩散引导原型检索的开放词汇变化检测

Qi Guo, Jue Wang, Yinhe Liu, Yanfei Zhong

机构 * Wuhan University(武汉大学) Beijing Institute of Technology(北京理工大学)

专题命中 评测与基准 :language model(abstract);foundation model(abstract)

AI总结 提出OpenDPR框架,通过扩散模型构建原型并检索视觉相似性,解决开放词汇变化检测中类别识别瓶颈,并设计S2C模块增强变化定位能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04094 2026-06-02 cs.CV 67%

VideoBrain: Learning Adaptive Frame Sampling for Long Video Understanding

VideoBrain: 学习自适应帧采样以理解长视频

Junbo Zou, Ziheng Huang, Shengjie Zhang, Liwen Zhang, Weining Shen

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(abstract_cn);language model(abstract)

AI总结 提出VideoBrain框架,通过CLIP和均匀采样双智能体策略,使视觉语言模型自适应获取关键帧,在减少30-40%帧数的同时提升长视频理解准确率3.5%-9.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01992 2026-06-02 cs.CV cs.AI cs.LG 62%

A Structured Benchmark for Text-Guided Anomaly Detection: When Language Stops Conditioning the Decision

文本引导异常检测的结构化基准:当语言停止条件化决策时

Stefano Samele, Eugenio Lomurno, Teodora Jovanovic, Sanjay Shivakumar Manohar, Alberto Crivellaro, Matteo Matteucci

机构 * Politecnico di Milano, AIRLab(米兰理工学院,AIRLab) S&H – Software & Hardware(S&H – 软件与硬件)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出结构化基准TGAD,通过三个场景逐步增加语言功能角色,评估多模态异常检测系统的文本引导能力,发现当前系统仅表面受语言条件化,标准基准高估了其能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01901 2026-06-02 cs.CV cs.AI cs.CL 62%

The Image Reconstruction Game: Drawing Common Ground Through Iterative Multimodal Dialogue

图像重建游戏:通过迭代多模态对话建立共同基础

Sherzod Hakimov, Mattia D'Agostini, Ivan Samodelkin, David Schlangen

机构 * Computational Linguistics, Department of Linguistics University of Potsdam(波恩大学语言学系计算语言学部) German Research Center for Artificial Intelligence (DFKI), Berlin(德国人工智能研究中心(DFKI)柏林)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出图像重建游戏基准,通过多轮迭代中视觉语言模型向图像生成器发出纠正指令,使累积的共同基础直接可视化为重建图像,发现描述器是重建质量的主导因素,而生成器决定迭代改进的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01725 2026-06-02 cs.AI cs.LG 62%

Characterization of Multi-Model Agentic AI Systems on General Tasks via Trace-Driven Simulation

基于迹驱动仿真的通用任务多模型智能体AI系统特征分析

Donghwan Kim, Prakhar Singh, Younghoon Min, Jongryool Kim, Jongse Park, Kiwan Maeng

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) SK Hynix(SK海力士) KAIST(韩国科学技术院)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出GAIATrace数据集和Vidur-Agent仿真器,通过迹驱动仿真分析多模型智能体AI系统在通用任务上的行为特征。

Comments 13 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01393 2026-06-02 cs.CL cs.AI cs.CV 62%

Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing

Dr. DocBench:专家级与困难文档解析的综合基准

Minglai Yang, Xinyan Velocity Yu, Pengyuan Li, Xinyu Guo, Zhenting Qi, Konwoo Kim, Longtian Ye, Xiaolong Luo, Jinhe Bi, Henry Zhang, Haris Riaz, Xuan Zhang, Yunze Xiao, Bangya Liu, Tom Tang, Yunfei Zhao, Qunshu Lin, Zihan Wang, Minghao Liu, Michael Lingzhi Li, Yilun Du, Jesse Thomason, Rogerio Feris, Alex Pentland, Zexue He

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院) Carnegie Mellon University(卡内基梅隆大学) University of Southern California(南加州大学) Harvard University(哈佛大学) IBM Research(IBM研究院) University of Arizona(亚利桑那大学) Duke University(杜克大学) UC Berkeley(加州大学伯克利分校) LMU Munich(慕尼黑路德维希-马克西米利安大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Dr. DocBench基准,通过基于解析器失败的采样从多语言书籍语料库中选取挑战性文档,包含52个BISAC主题领域和65k高质量标注,用于评估专家级文档解析能力。

Comments 27 pages, 13 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01057 2026-06-02 cs.CV cs.AI cs.GR cs.LG 62%

3DCodeBench: Benchmarking Agentic Procedural 3D Modeling Via Code

3DCodeBench:通过代码进行智能体程序化3D建模的基准测试

Yipeng Gao, Lei Shu, Genzhi Ye, Xi Xiong, Ameesh Makadia, Meiqi Guo, Laurent Itti, Jindong Chen

机构 * Google DeepMind(谷歌DeepMind) University of Southern California(南加州大学) Google Research(谷歌研究)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出3DCodeBench基准,评估12种视觉语言模型将文本和图像参考转换为程序化3D建模代码的能力,并构建基于人类偏好的3DCodeArena排名平台。

Comments Project Page: https://www.3dcodebench.com/; 11 pages (main), with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00548 2026-06-02 cs.CV cs.AI cs.LG 62%

CAFOSat: A Strongly Annotated Dataset for Infrastructure-Aware CAFO Mapping Using High-Resolution Imagery

CAFOSat:用于基于高分辨率影像的基础设施感知型CAFO制图的高质量标注数据集

Oishee Bintey Hoque, Nibir Chandra Mandal, Mandy L Wilson, Samarth Swarup, Madhav Marathe, Abhijin Adiga

机构 * University of Virginia(弗吉尼亚大学) Biocomplexity Institute, University of Virginia(弗吉尼亚大学生物复杂性研究所)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对集中式动物饲养操作(CAFO)大规模制图困难,提出CAFOSat数据集,集成高分辨率NAIP影像与多源CAFO清单,通过人机协同标注、GradCAM定位和几何聚类优化弱定位记录,并引入合成增强管道,实现基础设施级标注和鲁棒分类。

Comments Accepted at CVPR Workshop-2026. First two authors has equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00267 2026-06-02 cs.CV cs.AI cs.LG cs.RO 62%

StressDream: Steering Video World Models for Robust Policy Evaluation and Improvement

StressDream: 引导视频世界模型实现鲁棒的策略评估与改进

Junwon Seo, Sushant Veer, Ran Tian, Wenhao Ding, Apoorva Sharma, Karen Leung, Edward Schmerling, Marco Pavone, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学) NVIDIA Research(NVIDIA研究) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出StressDream方法,通过优化扩散视频世界模型的初始噪声,在推理时引导生成高影响且合理的未来场景,以支持鲁棒的策略评估与改进。

Comments Project page: https://junwon.me/StressDream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00080 2026-06-02 cs.CV cs.AI cs.LG cs.NE 62%

Planktonzilla: Multimodal dataset and models for understanding plankton ecosystems

Planktonzilla: 用于理解浮游生态系统的多模态数据集与模型

Alan Gerson Contreras Montanares, Luis Valenzuela, Luis Martí, Nayat Sanchez-Pi

机构 * Inria Chile Research Center(Inria智利研究中心)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 为解决浮游生物分类模型泛化性差的问题,提出统一数据集Planktonzilla-17M(含1740万张图像,涵盖602个分类类群),并对比监督学习与CLIP风格训练,发现基于分类谱系的监督学习优于CLIP,且现有生物基础模型在海洋成像领域表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00029 2026-06-02 cs.CL cs.AI 62%

TCAR-Gen: Temporal Graph Retrieval with Evidence Fusion for Knowledge-Grounded Generation

TCAR-Gen: 基于证据融合的时间图检索用于知识增强生成

Sidra Nasir, Muhammad Noman Zahid, Rizwan Ahmed Khan

机构 * Dipartimento di Informatica, Università di Verona(威尼斯大学计算机科学系) School of Advanced Studies, University of Camerino(坎皮诺大学高级研究学院) Department of Computer Science, School of Mathematics and Computer Science, Institute of Business Administration (IBA), Karachi, Pakistan(卡拉奇工商管理学院(IBA)数学与计算机科学学院计算机科学系)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出TCAR-Gen框架,结合查询条件图神经网络、时间证据融合和树链推理,在历史犯罪叙事问答中实现时间推理和多源证据融合,优于现有RAG方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00017 2026-06-02 cs.AI cs.CL cs.MA 62%

MindGames Arena Generalization Track: In2AI Solution with Delayed Per-Step Reward Attribution

MindGames Arena 泛化赛道:具有延迟每步奖励归因的 In2AI 解决方案

Aliaksei Korshuk, Alexander Buyantuev, Ilya Makarov

机构 * iMak AI Lab(iMak人工智能实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出延迟每步奖励归因方法,结合资格门控、异步rollout生成和课程对手采样,实现多智能体环境中稳定高效的强化学习训练,并在NeurIPS 2025的MindGames Arena基准测试中取得领先。

Comments 18 pages, 2 figures, 9 tables. Technical report. First place in both Open and Efficient tracks of MindGames Arena Generalization Track at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00016 2026-06-02 cs.CL cs.AI 62%

AEyeDE: An Attention-Based Attribution Framework for AI-Generated Text Detection

AEyeDE:一种基于注意力的人工智能生成文本检测归因框架

Aria Nourbakhsh, Adelaide Danilov, Christoph Schommer, Salima Lamsiyah

机构 * University of Luxembourg(卢森堡大学) Department of Computer Science(计算机科学系)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出AEyeDE框架,利用代理Transformer模型的注意力归因矩阵,通过轻量级CNN区分人类与AI生成文本,在多种设置下优于文本基线,并揭示注意力图的局部结构差异。

Comments 24 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26068 2026-06-02 cs.LG cs.AI 62%

Rethinking Weak Supervision in Anomaly Detection: A Comprehensive Benchmark

重新思考异常检测中的弱监督:一个综合基准

Xu Yao, Siyuan Zhou, Zhenbo Wu, Chaochuan Hou, Shuang Liang, Shiping Wang, Hailiang Huang, Songqiao Han, Minqi Jiang

机构 * Shanghai University of Finance and Economics(上海金融学院) Ant Group(蚂蚁集团) Key Laboratory of Interdisciplinary Research of Computation and Economics(计算与经济交叉学科重点实验室)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出WSADBench,首个统一评估不完全、不精确和不准确三种弱监督异常检测场景的基准,通过系统变化标签数量、粒度和质量,揭示36种算法在4种模态上的性能边界,并发现弱监督场景间存在强相关性、专用WSAD算法仅在极端标签稀缺时占优等关键洞察。

Comments Accepted at KDD 2026 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30188 2026-06-02 cs.LG cs.AI stat.ML 62%

CalArena: A Large-Scale Post-Hoc Calibration Benchmark

CalArena:大规模事后校准基准

Eugène Berta, David Holzmüller, Francis Bach, Michael I. Jordan

机构 * Inria - Ecole Normale Supérieure PSL Research University(法国国家科学研究中心-巴黎高等师范学院-巴黎-萨克雷大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出CalArena大规模标准化基准,涵盖近2000个实验,通过事后改进(PHI)原则比较多种校准方法,发现平滑校准函数优于分箱方法,专用多类方法在高维场景中至关重要。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03312 2026-06-02 cs.CL cs.AI cs.HC eess.AS q-bio.NC 62%

Escaping the BLEU Trap: A Signal-Grounded Framework with Decoupled Semantic Guidance for EEG-to-Text Decoding

逃离BLEU陷阱:一种基于信号锚定与解耦语义引导的脑电解码文本框架

Yuchen Wang, Haonan Wang, Yu Guo, Honglong Yang, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 针对脑电解码文本中语义偏差、信号忽略和BLEU陷阱问题,提出SemKey多阶段框架,通过解耦语义目标(情感、主题、长度、意外性)和主动检索解码机制,强制生成基于信号而非语言先验,并采用检索和分布度量(如Fréchet距离)建立评估协议,有效缓解幻觉并达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05613 2026-06-02 cs.CY cs.AI cs.LG 62%

Who Evaluates AI's Social Impacts? Mapping Coverage and Gaps in First and Third Party Evaluations

谁在评估人工智能的社会影响?第一方和第三方评估的覆盖范围与差距分析

Anka Reuel, Avijit Ghosh, Jenny Chim, Andrew Tran, Yanan Long, Jennifer Mickel, Usman Gohar, Srishti Yadav, Pawan Sasanka Ammanamanchi, Mowafak Allaham, Hossein A. Rahmani, Mubashara Akhtar, Felix Friedrich, Robert Scholz, Michael Alexander Riegler, Jan Batzner, Eliya Habba, Arushi Saxena, Anastassia Kornilova, Kevin Wei, Prajna Soni, Yohan Mathew, Kevin Klyman, Jeba Sania, Subramanyam Sahoo, Olivia Beyer Bruvik, Pouya Sadeghi, Sujata Goswami, Angelina Wang, Yacine Jernite, Zeerak Talat, Stella Biderman, Mykel Kochenderfer, Sanmi Koyejo, Irene Solaiman

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 通过分析186份第一方发布报告和248份第三方评估来源,结合开发者访谈,揭示了第一方报告稀疏且流于表面,而第三方评估更广泛深入,但数据溯源、内容审核劳动等关键领域存在披露缺口,呼吁政策强制开发者透明化并加强独立评估生态。

Comments Accepted at the Forty-Third International Conference on Machine Learning (ICML), 2026, in Seoul, Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02556 2026-06-02 cs.CL 57%

HERO'S JOURNEY: Testing Complex Rule Induction with Text Games

英雄之旅:用文本游戏测试复杂规则归纳

Anshun Asher Zheng, Kanishka Misra, David I. Beaver, Junyi Jessy Li

机构 * Department of Linguistics(语言学系) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 本文提出HERO'S JOURNEY基准,通过目标导向的文本游戏评估大型语言模型在属性与程序归纳任务中的规则推理能力,发现模型虽能进行规则归纳但能力有限且不均衡,程序执行成为瓶颈,而表面语义影响较小。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02384 2026-06-02 cs.LG 57%

TabPrep: Closing the Feature Engineering Gap in Tabular Benchmarks

TabPrep: 弥合表格基准测试中的特征工程差距

Andrej Tschalzev, Nick Erickson, Yuyang Wang, Huzefa Rangwala, Stefan Lüdtke, Heiner Stuckenschmidt, Christian Bartelt

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文提出TabPrep,一个轻量级预处理流程,通过针对三种特定数据模式设计的特征生成器,系统性地进行特征工程,显著提升多种模型在表格基准测试中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01279 2026-06-02 cs.AI 57%

ANDES: Agent Native Data Evolving Synthesis Tool for Autonomous Instruction Alignment

ANDES:用于自主指令对齐的智能体原生数据演化合成工具

Zhengyang Zhao, Shengjie Ye, Lu Ma, Hao Liang, Hengyi Feng, Wentao Zhang

机构 * Peking University(北京大学) Sichuan University, Chengdu(四川大学,成都)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 提出ANDES框架,通过自进化世界树路由和可操作诊断报告,将数据生成重构为即插即用的智能体技能,使基础较弱的智能体在严格计算约束下实现自动对齐,在PostTrainBench上取得最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00987 2026-06-02 cs.CV cs.AI 57%

An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation

多时相指代分割的开源基准与基线

Bingyu Li, Da Zhang, Tao Huo, Zhiyuan Zhao, Junyu Gao, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究所) China Telecom(中国电信) School of Artificial Intelligence, Optics and Electronics (iOPEN)(人工智能、光学与电子学院) Northwestern Polytechnical University(西北工业大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出多时相指代分割任务,通过自动化数据构建管道CRAFT-Agent生成首个基准MTRefSeg-21K,并设计两阶段训练的变化感知LVLM框架MTRefSeg-R1,实现优于现有基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00775 2026-06-02 cs.CV cs.AI 57%

GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval

GIRL-DETR: 梯度隔离强化学习用于视频时刻检索

Shihang Zhang, Mingjin Kuai, Ye Wei, Zhen Zhang, Wei Ji

机构 * College of Electronics and Information Engineering, Sichuan University(四川大学电子信息工程学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 针对视频时刻检索中连续代理损失与非可微指标不匹配导致的优化停滞问题,提出梯度隔离强化学习框架GIRL-DETR,通过冻结骨干网络并采用三阶段渐进强化学习策略直接优化tIoU指标,在轻量级模型中实现定位精度提升。

Comments 13 pages, 6 figures. Submitted to IEEE Transactions on Image Processing (TIP). Code is available at: https://github.com/Z-Shihang/GIRL-DETR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00447 2026-06-02 cs.CV cs.AI 57%

GeoSAM-3D: Geodesic Prompt Propagation for Open-Vocabulary 3D Scene Segmentation from Monocular Video

GeoSAM-3D: 用于从单目视频进行开放词汇3D场景分割的测地线提示传播

Arun Sharma

机构 * University of Minnesota, Twin Cities(明尼苏达大学,双城分校)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 提出GeoSAM-3D方法,利用冻结的视觉基础模型和单目3D高斯泼溅重建,通过可微分的图-测地线传播核在场景图上传播用户提示,实现从单目视频的开放词汇3D场景分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00404 2026-06-02 cs.CV cs.LG 57%

Rethinking Amortized Neural Representations for High-Resolution Terrain Elevation Data

重新思考高分辨率地形高程数据的摊销神经表示

Haoan Feng, Xin Xu, Leila De Floriani

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 评测与基准 :post-training(abstract);分类 cs.LG

AI总结 针对地形高程数据,提出HUVR+SIREN超网络方法,通过替换坐标解码器为平滑可微版本,在统一基准上实现最佳高度和导数保真度,且支持后训练量化压缩。

Comments 12 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00090 2026-06-02 cs.RO cs.AI 57%

Silent Failures in Physical AI: A Literature Review of Runtime Action Authorization for Autonomous Systems

物理AI中的静默故障:自主系统运行时动作授权的文献综述

Barak Or

机构 * STATE16

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文综述了物理AI系统中黑箱模型发出看似合理但实际错误的物理动作导致的静默故障问题,提出了运行时防护栏的分类和评估要求。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00054 2026-06-02 cs.RO cs.AI cs.CV 57%

From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data

从人类视频到机器人操作:基于人类中心数据的可扩展视觉-语言-动作学习综述

Zhiyuan Feng, Qixiu Li, Huizhi Liang, Rushuai Yang, Yichao Shen, Zhiying Du, Zhaowei Zhang, Yu Deng, Li Zhao, Hao Zhao, Zongqing Lu, Oier Mees, Marc Pollefeys, Jiaolong Yang, Baining Guo

机构 * Tsinghua University(清华大学) HKUST(香港科技大学) Xi’an Jiaotong University(西安交通大学) Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) Microsoft Zurich Project(微软苏黎世实验室)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

AI总结 本文综述了如何将丰富的人类视频转化为视觉-语言-动作(VLA)模型的有效知识,分类了四种方法(潜在动作表示、预测世界模型、显式2D监督、显式3D重建),并指出了结构化非结构化视频、跨具身和视角的动作映射、以及评估协议设计三大挑战。

Comments Accepted to IJCAI 2026 Survey Track. Project page: https://aaronfengzy.github.io/HumanCentricToVLA-Survey/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12768 2026-06-02 stat.ML cs.LG 57%

ISOMORPH: A Supply Chain Digital Twin for Simulation, Dataset Generation, and Forecasting Benchmarks

ISOMORPH:用于仿真、数据集生成和预测基准的供应链数字孪生

Zhizhen Zhang, Hyemin Gu, Benjamin J. Zhang, Daniel Elenius, Michael Tyrrell, Theo J. Bourdais, Houman Owhadi, Markos A. Katsoulakis, Tuhin Sahai

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of North Carolina(北卡罗来纳大学) SRI International(SRI国际) California Institute of Technology(加州理工学院)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文提出ISOMORPH,首个公开的多级物流网络数字孪生,通过可配置参数和模块化拓扑生成具有牛鞭效应等动态特性的数据集,并评估基础模型的零样本预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07061 2026-06-02 cs.SD cs.AI cs.CV cs.MM 57%

Do Joint Audio-Video Generation Models Understand Physics?

联合音视频生成模型是否理解物理?

Zijun Cui, Xiulong Liu, Hao Fang, Mingwei Xu, Jiageng Liu, Zexin Xu, Weiguo Pian, Shijian Deng, Feiyu Du, Chenming Ge, Yapeng Tian

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对联合音视频生成模型,提出AV-Phys Bench基准测试其物理常识,发现所有模型在物理一致性上表现不足,尤其是事件驱动和环境驱动转换场景。

Comments Preprint. Project Page: https://zijuncui.com/AV-Phys/. Full abstract appears in the PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14514 2026-06-02 cs.AI cs.CE 57%

Perspective on Bias in Biomedical AI: Preventing Downstream Healthcare Disparities

生物医学AI中的偏见视角:防止下游医疗保健差异

Michal Rosen-Zvi, Yoav Kan-Tor, Michael Danziger, Agata Ferretti, Javier Aula-Blasco, Julia Falcao, Ron Shamir, Mira Marcus-Kalish, Mordechai Muszkat

机构 * Weizmann Institute of Science(魏茨曼科学研究院) Hebrew University of Jerusalem(特拉维夫大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文通过分析2015-2024年4514篇组学出版物和大型数据集,揭示数据收集和研究中存在的严重人口偏见,并提出通过来源、开放性和评估透明度三个原则来预防下游医疗保健差异。

Comments This manuscript has been accepted for publication in the 2026 IEEE International Conference on Digital Health (ICDH). The final version will appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏