arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1356 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1356 篇

2407.11691 2026-07-07 cs.CV 版本更新 50%

VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models

VLMEvalKit:用于评估大型多模态模型的开源工具包

Haodong Duan, Xinyu Fang, Junming Yang, Xiangyu Zhao, Zerun Ma, Yuxuan Qiao, Mo Li, Tianhao Liang, Lin Zhu, Amit Agarwal, Xiaozhe Li, Shengyuan Ding, Jiazi Bu, Ziyu Liu, Zhangyang Qi, Yifei Li, Yuhang Zang, Zhe Chen, Lin Chen, Yuan Liu, Yubo Ma, Hailong Sun, Yifan Zhang, Shiyin Lu, Tack Hwa Wong, Weiyun Wang, Peiheng Zhou, Chaoyou Fu, Junbo Cui, Jixuan Chen, Enxin Song, Song Mao, Junming Lin, Xilin Wei, Jinsong Li, Zeyi Sun, Zhaowei Wang, Zicheng Zhang, Xiaoyi Dong, Junjun He, Pan Zhang, Jiaqi Wang, Dahua Lin, Kai Chen

机构 * VLMEvalKit Team(VLMEvalKit团队) Community Contributors(社区贡献者)

专题命中 评测与基准 :language model(abstract)

AI总结 VLMEvalKit是基于PyTorch的开源工具包,为评估多模态模型提供框架。实现450+模型配置,支持330+基准测试,有单一接口,自动处理多项任务,还扩展到多领域,基于其结果有OpenVLM Leaderboard。

Comments Updated on 2026.07.05

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29616 2026-07-03 cs.CV 版本更新 50%

Video-Oasis: Rethinking Evaluation of Video Understanding

Video-Oasis:重新审视视频理解的评估

Geuntaek Lim, Sungjune Park, Jaeyun Lee, Inwoong Lee, Taeoh Kim, Dongyoon Wee, Minho Shim, Yukyung Choi

机构 * Sejong University(世宗大学) NAVER Cloud

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出Video-Oasis,通过系统评估现有评估方法,揭示视频理解中的时空挑战,发现54%的基准样本无需视觉输入即可解决,先进模型表现仅略超随机猜测。

Comments Accepted at ECCV2026; Project page: https://limgeuntaekk.github.io/Video-Oasis/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08907 2026-07-03 cs.CV 版本更新 50%

Towards Interactive Global Geolocation Assistant

迈向交互式全球地理定位助手

Zhiyang Dou, Zipeng Wang, Xumeng Han, Guorong Li, Zhipei Huang, Zhenjun Han

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences (UCAS)(中国科学院大学先进交叉学科学院) School of Electronic, Electrical and Communication Engineering, UCAS(中国科学院大学电子、电气与通信工程学院) School of Computer Science and Technology, UCAS(中国科学院大学计算机科学与技术学院)

专题命中 评测与基准 :language model(abstract)

AI总结 提出基于大型视觉语言模型的交互式全球地理定位助手GaGA,通过挖掘图像地理线索并结合世界知识进行定位,支持用户交互,在GWS15k数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17920 2026-07-02 cs.CV 版本更新 50%

SegFly: A Dataset and 2D-3D-2D Paradigm for Aerial RGB-Thermal Semantic Segmentation at Scale

SegFly:大规模航空RGB-热红外语义分割的数据集与2D-3D-2D范式

Markus Gross, Sai Bharadhwaj Matha, Rui Song, Viswanathan Muthuveerappan, Conrad Christoph, Julius Huber, Daniel Cremers

机构 * Fraunhofer Institute IVI(弗劳恩霍夫交通与基础设施系统研究所) TU Munich(慕尼黑工业大学) MCML(慕尼黑机器学习中心) UCLA(加州大学洛杉矶分校) Uni Cambridge(剑桥大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对航空RGB-T数据集规模小、标注成本高和对齐困难的问题,提出几何驱动的2D-3D-2D范式,通过少量RGB标注自动生成密集伪标签并实现跨模态对齐,构建含2万+RGB图像和1.5万+RGB-T对的SegFly基准,实验表明该范式有效提升分割性能。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09803 2026-07-01 cs.SD 版本更新 50%

MAGE: Modality-Agnostic Music Generation and Target-Source Extraction

MAGE:模态无关的音乐生成与编辑

Muhammad Usama Saleem, Tejasvi Ravi, Tianyu Xu, Rajeev Nongpiur, Ishan Chatterjee, Mayur Jagdishbhai Patel, Pu Wang

机构 * Google(谷歌) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 评测与基准 :prompting(abstract)

AI总结 MAGE提出了一种模态无关框架,统一了多模态音乐生成与混合编辑,通过可控多模态FluxFormer和音频视觉 nexus 对齐机制,实现灵活且高效的音乐生成与编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21173 2026-07-01 cs.RO cs.CV 版本更新 50%

Multimodal Benchmark for Safety Assessment in Industrial Inspection Scenarios

工业检测场景安全评估的多模态基准

Zeyi Liu, Shuang Liu, Jihai Min, Zhaoheng Zhang, Jun Cen, Pengyu Han, Songqiao Hu, Zihan Meng, Xiao He, Donghua Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所) TetraBOT Intelligence Co., Ltd.(天博智能科技有限公司) DAMO Academy, Alibaba Group(阿里巴巴达摩院) School of Automation, Southeast University(东南大学自动化学院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对工业现场多模态安全评估缺乏真实数据的问题,构建了首个包含真实机器人巡检数据、像素级标注和七种同步模态的基准数据集InspecSafe-V1,覆盖五个典型场景,支持多模态异常识别与安全评估。

Comments 14 pages, 6 figures, Accepted by Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05219 2026-06-26 cs.HC 版本更新 50%

Conversational AI increases political knowledge as effectively as self-directed internet search

对话式AI在提高政治知识方面与自主网络搜索同样有效

Lennart Luettgau, Hannah Rose Kirk, Kobi Hackenburg, Jessica Bergs, Henry Davidson, Henry Ogden, Divya Siddarth, Saffron Huang, Christopher Summerfield

专题命中 评测与基准 :prompting(abstract)

AI总结 研究探讨对话式AI在政治信息获取中的使用情况及其对政治知识的影响,发现其效果与自主搜索相当,表明公众正越来越多地依赖AI获取政治信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13731 2026-06-25 cs.CV 版本更新 50%

GeoRanker: Distance-Aware Ranking for Worldwide Image Geolocalization

GeoRanker:面向全球图像地理定位的距离感知排序

Pengyue Jia, Seongheon Park, Song Gao, Xiangyu Zhao, Sharon Li

机构 * Department of Data Science, City University of Hong Kong(城市大学数据科学系) Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Department of Geography, University of Wisconsin-Madison(威斯康星大学麦迪逊分校地理系)

专题命中 评测与基准 :language model(abstract)

AI总结 提出GeoRanker框架,利用大视觉语言模型联合编码查询-候选交互并预测地理邻近性,引入多阶距离损失以建模结构化空间关系,在IM2GPS3K和YFCC4K基准上达到最优。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27259 2026-06-23 cs.CV 版本更新 50%

Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark

看到场景才重要:通过场景感知的长视频基准揭示视频理解模型中的遗忘现象

Seng Nam Chen, Hao Chen, Chenglam Ho, Xinyu Mao, Jinping Wang, Yu Zhang, Chao Li

机构 * CUHK (SZ)(香港中文大学(深圳)) University of Cambridge(剑桥大学) UESTC(电子科技大学) CUHK(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出SceneBench基准,揭示视频理解模型在长场景上下文中的遗忘问题,并提出Scene-RAG方法提升性能2.50%。

Comments Accepted to CVPR 2026 (Highlight)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23729 2026-06-23 cs.CV 版本更新 50%

DynProto: Dynamic Prototype Evolution for Out-of-Distribution Detection

DynProto: 动态原型进化用于分布外检测

Yanqi Wu, Xinhua Lu, Runhe Lai, Qichao Chen, Jia-Xin Zhuang, Wei-Shi Zheng, Ruixuan Wang

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) University of Nottingham Malaysia(诺丁汉马来西亚大学) Hong Kong University of Science and Technology(香港科学与技术大学) Key Laboratory of Machine Intelligence and Advanced Computing(智能与先进计算关键实验室)

专题命中 评测与基准 :language model(abstract)

AI总结 DynProto通过动态学习分布内信息生成原型,提升分布外检测性能,减少FPR95并提升AUROC。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19925 2026-06-23 eess.IV cs.CV 版本更新 50%

ReconMIL: Synergizing Latent Space Reconstruction with Bi-Stream Mamba for Whole Slide Image Analysis

ReconMIL: 协同潜在空间重建与双流Mamba的全切片图像分析

Lubin Gan, Jing Zhang, Heng Zhang, Xin Di, Zhifeng Wang, Wenke Huang, Xiaoyan Sun

机构 * USTC(中国科学技术大学) NUDT(南京理工大学) SCNU(华南师范大学) NTU(南洋理工大学) Anhui Province Key Laboratory of Biomedical Imaging and Intelligent Processing(安徽省生物医学成像与智能处理重点实验室)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出ReconMIL框架,通过潜在空间重建模块适配任务特定特征,并设计双流架构(Mamba全局流+CNN局部流)平衡全局与局部特征,有效抑制背景噪声并定位细粒度诊断区域,在多个基准上超越现有方法。

Comments This paper has been withdrawn by the authors due to identified issues in the evaluation protocol in Section Exp. , which may affect the interpretation of the experimental results. The authors are preparing a substantially revised version addressing these issues

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04205 2026-06-23 cs.CV 版本更新 50%

Real5-OmniDocBench: A Full-Scale Physical Reconstruction Benchmark for Robust Document Parsing in the Wild

Real5-OmniDocBench:面向野外鲁棒文档解析的全尺度物理重建基准

Changda Zhou, Ziyue Gao, Xueqing Wang, Tingquan Gao, Cheng Cui, Jing Tang, Yi Liu

机构 * PaddlePaddle Team, Baidu Inc.(百度公司PaddlePaddle团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :language model(abstract)

AI总结 提出首个对OmniDocBench v1.5进行全尺度一对一物理重建的基准Real5-OmniDocBench,覆盖扫描、弯曲、屏幕摄影、光照和倾斜五种真实场景,通过完整真值映射实现性能退化的因子级归因,揭示文档解析中的“现实鸿沟”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15651 2026-06-23 q-bio.QM cond-mat.dis-nn 版本更新 50%

From Scarce Functional Labels to Label-Aware Generation in Homologous Protein Families

从同源蛋白家族中的稀缺功能标签到标签感知生成

Lorenzo Rosset, Martin Weigt, Francesco Zamponi

专题命中 评测与基准 :language model(abstract)

AI总结 研究两阶段轻监督策略,比较不同序列表示在有限监督下预测功能标签,并利用推断标签训练标签感知RBM进行条件生成,揭示稀缺标签在准确传播下可支持标签感知设计。

Comments 13 pages, 4 figures + SI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12870 2026-06-19 cs.CE 版本更新 50%

Text2Structure3D: Graph-Based Generative Modeling of Equilibrium Structures with Diffusion Transformers

Text2Structure3D: 基于扩散变换器的图生成建模平衡结构

Lazlo Bleker, Zifeng Guo, Kaleb E. Smith, Kam-Ming Mark Tam, Karla Saldaña Ochoa, Pierluigi D'Acunto

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出Text2Structure3D,结合潜在扩散、变分图自编码器和图变换器,从自然语言提示生成接近平衡状态的结构图,并通过残余力优化确保完全满足静力平衡。

Journal ref Results in Engineering 31 (2026) 111375

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05527 2026-06-18 cs.CV 版本更新 50%

Prior-guided Fusion of Multimodal Features for Change Detection from Optical-SAR Images

先验引导的多模态特征融合用于光学-SAR图像变化检测

Xuanguang Liu, Lei Ding, Yujie Li, Chenguang Dai, Zhenchao Zhang, Mengmeng Li, Ziyi Yang, Yifan Sun, Yongqi Sun, Hanyun Wang, Lorenzo Bruzzone

机构 * Institute of Geospatial Information, Information Engineering University(地理信息研究所,信息工程大学) Academy of Digital China (Fujian), Fuzhou University(数字中国研究院(福建),福州大学) The School of Electronics and Communication Engineering, Sun Yat-sen University(电子与通信工程学院,中山大学) The Department of Information Engineering and Computer Science, University of Trento(信息工程与计算机科学系,特伦托大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出STSF-Net框架,联合建模模态特定和时空共同特征,并利用视觉基础模型的语义先验自适应融合多模态特征,在三个数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05128 2026-06-18 eess.AS cs.SD 版本更新 50%

PolyBench: A Benchmark for Compositional Reasoning in Polyphonic Audio

PolyBench:多声部音频中组合推理的基准测试

Yuanjian Chen, Yang Xiao, Han Yin, Xubo Liu, Jinjie Huang, Ting Dang

机构 * Harbin University of Science and Technology(哈尔滨理工大学) The University of Melbourne(墨尔本大学) KAIST(韩国成均馆大学) University of Surrey(萨里大学)

专题命中 评测与基准 :language model(abstract)

AI总结 针对多声部音频中组合推理评估缺失的问题,提出PolyBench基准,包含计数、分类、检测、并发和时长估计五个子集,评估发现现有大音频语言模型在多声部场景下性能持续下降。

Comments Accepted by INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24696 2026-06-17 cs.CV 版本更新 50%

NeuroClaw Technical Report

NeuroClaw 技术报告

Cheng Wang, Zhibin He, Zhihao Peng, Shengyuan Liu, Yufan Hu, Carl Yang, Lifang He, Lichao Sun, Xiang Li, Yixuan Yuan

机构 * Electronic Engineering Department, The Chinese University of Hong Kong, China(香港中文大学电子工程系) School of Electronic Information, Northwest University, China(西北大学电子信息学院) Department of Computer Science, Emory University, Atlanta, GA, USA(埃默里大学计算机科学系) Computer Science and Engineering, Lehigh University, Bethlehem, PA, USA(莱斯利大学计算机科学与工程系) Department of Radiology, Massachusetts General Hospital, Boston, MA, USA(麻省总医院放射科) Kempner Institute for Natural and Artificial Intelligence, Harvard University, Cambridge, MA, USA(哈佛大学自然与人工智能研究所)

专题命中 评测与基准 :LLM(abstract_cn)

AI总结 针对神经影像学中多模态数据、长流程和可重复性挑战,提出NeuroClaw多智能体研究助手,通过数据驱动决策、环境管理和三层技能架构实现可执行可复现的神经影像分析,并在NeuroBench基准上显著优于直接调用智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03447 2026-06-16 cs.CV 版本更新 50%

Proact-VL: A Proactive VideoLLM for Real-Time AI Companions

Proact-VL:用于实时AI伴侣的主动式视频大语言模型

Weicai Yan, Yuhong Dai, Qi Ran, Haodong Li, Wang Lin, Tao Jin, Xing Xie, Hao Liao, Jianxun Lian

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出Proact-VL框架,通过游戏场景中的评论和引导任务,解决实时AI伴侣在低延迟推理、自主响应决策和内容质量控制方面的挑战,实现了主动式实时交互。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09977 2026-06-16 cs.CV 版本更新 50%

A Survey on 3D Gaussian Splatting Applications: Segmentation, Editing, and Generation

3D高斯泼溅应用综述:分割、编辑与生成

Shuting He, Peilin Ji, Yitong Yang, Changshuo Wang, Jiayi Ji, Yinglin Wang, Henghui Ding

机构 * Shanghai University of Finance and Economics(上海财经大学) University College London(伦敦大学学院) Xiamen University(厦门大学) Fudan University(复旦大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 综述3D高斯泼溅在分割、编辑和生成三大任务中的应用,总结代表性方法、监督策略和学习范式,并分析公共基准上的比较结果。

Comments IEEE TPAMI, GitHub Repo: https://github.com/heshuting555/Awesome-3DGS-Applications

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03584 2026-06-16 cs.CV 版本更新 50%

FrameOracle: Learning What to See and How Much to See in Videos

FrameOracle: 学习在视频中看什么以及看多少

Chaoyu Li, Tianzhi Li, Fei Tao, Zhenyu Zhao, Ziqian Wu, Maozheng Zhao, Juntong Song, Cheng Niu, Pooyan Fazli

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出FrameOracle轻量模块,预测相关帧及其数量,通过课程学习从弱代理信号到强监督,在多个VLM和基准上以更少帧数保持或提升精度。

Comments ICML 2026. Project page: https://people-robots.github.io/frameoracle/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00885 2026-06-16 cs.CV 版本更新 50%

HanDyVQA: A Video QA Benchmark for Fine-Grained Hand-Object Interaction Dynamics

HanDyVQA:面向细粒度手-物交互动态的视频问答基准

Masatoshi Tateno, Gido Kato, Hirokatsu Kataoka, Yoichi Sato, Takuma Yagi

机构 * Institute of Industrial Science, The University of Tokyo(东京大学工业科学研究所) National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院) Waseda University(早稻田大学) Visual Geometry Group, University of Oxford(牛津大学视觉几何组)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出HanDyVQA基准,通过六类问题(11.1K QA对)和10.3K分割掩码,全面评估视频模型对手-物交互中操作与效果的细粒度时空推理能力,发现最佳模型Gemini-2.5-Pro仅73%准确率(人类97%)。

Comments CVPR 2026, Project page: https://masatate.github.io/HanDyVQA-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05230 2026-06-15 cs.CV cs.RO 版本更新 50%

Digital Twin Driven Textile Classification and Foreign Object Recognition in Automated Sorting Systems

数字孪生驱动的自动化分拣系统中的纺织品分类与异物识别

Serkan Ergun, Tobias Mitterer, Hubert Zangl

机构 * Institute of Smart Systems Technologies(智能系统技术研究所) University of Klagenfurt(克雷格弗特大学) AAU SAL USE Laboratory(AAU SAL USE实验室) Silicon Austria Labs(硅 Austria 实验室)

专题命中 评测与基准 :language model(abstract)

AI总结 提出一种数字孪生驱动的机器人分拣系统,结合抓取预测、多模态感知和视觉语言模型,实现纺织品分类与异物检测,Qwen模型准确率达87.9%。

Comments 10 pages,single column, 5 figures, preprint for Photomet Edumet 2026 (Klagenfurt, Austria)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05025 2026-06-15 cs.CV 版本更新 50%

RAMEN: Resolution-Adjustable Multimodal Encoder for Earth Observation

RAMEN: 面向地球观测的分辨率可调多模态编码器

Nicolas Houdré, Diego Marcos, Hugo Riffaud de Turckheim, Dino Ienco, Laurent Wendling, Camille Kurtz, Sylvain Lobry

机构 * Institut National des Sciences de l'Univers (INSU), France(法国国家科学研究院) CNRS, France(法国国家科学研究中心)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出RAMEN,一种传感器无关的分辨率可调多模态编码器,通过将分辨率作为可控参数,在统一潜空间中实现多模态地球观测数据的连贯分析,并在PANGAEA基准上优于现有模型。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06113 2026-06-12 cs.CV 版本更新 50%

Where, What, Why, and Importance: Structured Defect Grounding for Text-to-Image Feedback

位置、类型、原因与重要性:面向文本到图像反馈的结构化缺陷定位

Huaisong Zhang, Hao Yu, Yuxuan Zhang, Jiahe Wang, Xinrui Chen, Haoxiang Cao, Feng Lu, Wendong Zhang, Changqian Yu, Chun Yuan

机构 * Tsinghua University(清华大学) Kolors Team, Kuaishou Technology(快手科技Kolors团队) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) South China Normal University(华南师范大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出结构化缺陷定位(SDG)方法,将文本到图像生成中的缺陷诊断建模为结构化集合预测,通过构建SDG-30K数据集和SDG-Eval评估协议,并利用视觉语言模型作为检测器,结合BoxFlow-GRPO将预测的缺陷集合转化为空间奖励以改进扩散模型对齐。

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03377 2026-06-12 cs.HC cs.CY 版本更新 50%

Intellectual Humility as a Cognitive Filter for AI-Generated Health Misinformation. An Evolutionary Perspective on Epistemic Vigilance

智力谦逊作为AI生成健康错误信息的认知过滤器:基于进化视角的认知警觉研究

Marcin Rządeczka, Maciej Wodziński, Kacper Zacharski, Marcin Moskalewicz

专题命中 评测与基准 :foundation model(abstract)

AI总结 通过实验(N=99)发现,智力谦逊(对认知局限的元认知意识)能选择性过滤AI生成的健康对话中的伪科学内容,但对准确内容的可信度评估无显著影响,且谦逊与识别AI来源的能力无关,表明认知警觉作用于内容质量而非来源归因。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23502 2026-06-12 cs.CV 版本更新 50%

OccAny: Generalized Unconstrained Urban 3D Occupancy

OccAny: 广义无约束城市3D占据预测

Anh-Quan Cao, Tuan-Hung Vu

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出首个广义无约束城市3D占据模型OccAny,通过分割强制和新视图渲染技术,在无标定场景下实现度量占据预测与分割特征完成,跨域泛化优于视觉几何基线。

Comments Accepted to CVPR 2026. Project page: https://valeoai.github.io/OccAny/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02419 2026-06-11 physics.chem-ph cond-mat.mtrl-sci physics.comp-ph 版本更新 50%

DPA4: Pushing the Accuracy-Cost Frontier of Interatomic Potentials with EMFA SO(2) Convolution

DPA4: 利用EMFA SO(2)卷积推动原子间势的精度-成本前沿

Tiancheng Li, Wentao Li, Anyang Peng, Jianming Xue, Linfeng Zhang, Duo Zhang, Han Wang

专题命中 评测与基准 :pretraining(abstract)

AI总结 本文提出DPA4架构,通过EMFA SO(2)等变卷积和编译器友好的训练路径,在降低参数和训练成本的同时,在Matbench Discovery等基准上达到最优精度-成本平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20795 2026-06-11 cs.CV 版本更新 50%

What Semantics Survive the Connector? Diagnosing VLM-to-DiT Alignment in Video Editing

什么语义能经受住连接器的考验?视频编辑中VLM到DiT对齐的诊断

Hangyu Lin, Chao Wen, Chengming Xu, Jianxiong Gao, Jiangning Zhang, Xiaobin Hu, Yanwei Fu

机构 * HKUST(香港理工大学) FDU(福建大学) ZJU(浙江大学) NUS(新加坡国立大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本研究探讨了视频生成模型中VLM与DiT对齐过程中的语义瓶颈问题,通过提出TRACE-Edit数据集和诊断协议,发现连接器模块会导致细粒度结构语义的严重退化,挑战了原有假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16287 2026-06-11 cs.SD 版本更新 50%

NaijaS2ST: A Multi-Accent Benchmark for Speech-to-Speech Translation in Low-Resource Nigerian Languages

NaijaS2ST:低资源尼日利亚语言的多口音语音到语音翻译基准

Marie Maltais, Yejin Jeon, Min Ma, Shamsuddeen Hassan Muhammad, Idris Abdulmumin, Maryam Ibrahim Mukhtar, Daud Abolade, Joel Okepefi, Johnson Sewedo, David Ifeoluwa Adelani

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学) Google DeepMind(谷歌DeepMind) Hausa NLP(豪萨自然语言处理) Imperial College(帝国理工学院) University of Pretoria(南非彼得里亚大学) Masakhane NLP(马萨坎自然语言处理) Naijá Wikipedia Community(尼日利亚维基百科社区) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 评测与基准 :LLM(abstract)

AI总结 针对低资源非洲语言语音翻译数据稀缺问题,构建了涵盖伊博语、豪萨语、约鲁巴语和尼日利亚皮钦语的平行语音数据集NaijaS2ST(每语种约50小时),并系统评估了级联、端到端及音频大模型方法,发现少样本音频大模型在语音到文本翻译中更优,而语音到语音翻译中所有范式性能相近。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25371 2026-06-10 cs.RO 版本更新 50%

FOUND-IT: Foundation-model-first Task-driven 3D Scene Graphs with Granularity on Demand

FOUND-IT: 基于基础模型优先、按需粒度的任务驱动3D场景图

Dominic Maggio, Nicolas Gorlo, Kris Hauser, Luca Carlone

机构 * Laboratory for Information & Decision Systems, Massachusetts Institute of Technology(信息与决策系统实验室,麻省理工学院) Samsung Research America(三星美国研究院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出首个基于未标定单目相机实时构建任意室内外环境分层任务驱动3D场景图的方法,通过几何基础模型和可调整粒度支持动态任务,并在ASHiTA SG3D基准上提升79%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏