arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-11 至 2026-05-11 共收录 415 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 102 篇

2407.04183 2026-05-11 cs.CL cs.AI cs.CY cs.HC 73%

Seeing Like an AI: How LLMs Apply (and Misapply) Wikipedia Neutrality Norms

像AI一样看待:LLMs如何应用(并误用)维基百科中立规范

Joshua Ashkinaze, Ruijia Guan, Laura Kurek, Eytan Adar, Ceren Budak, Eric Gilbert

机构 * University of Michigan(密歇根大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究评估LLMs在检测和纠正偏见维基百科编辑时的表现,发现其在中立性检测上准确率低,但生成任务表现较好,但存在额外非中立性修改,引发对社区规范执行与公众认知之间差异的思考。

Comments Appeared at ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00568 2026-05-11 cs.CL 70%

ReSeek: A Self-Correcting Framework for Search Agents with Instructive Rewards

ReSeek:一种具有指导性奖励的自我纠正搜索代理框架

Shiyu Li, Yang Tang, Yifan Wang, Peiming Li, Xi Chen

机构 * Basic Algorithm Center, PCG, Tencent, Shenzhen, China(腾讯基本算法中心、PCG、腾讯,深圳,中国) Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生学院,清华大学,深圳,中国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ReSeek框架,通过引入自我纠正机制和密集指导性奖励函数,提升搜索代理在复杂任务中的表现和路径忠实度。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07299 2026-05-11 cs.CV cs.AI 70%

EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video Streams

EgoPro-Bench:基于眼动视频流的个性化主动交互基准测试

Dongchuan Ran, Linyu Ou, Xueheng Li, Wenwen Tong, Chenxu Guo, Hewei Guo, Kaibing Wang, Lewei Lu

机构 * Beijing Institute of Technology(北京理工大学) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出EgoPro-Bench,通过模拟用户画像生成多样化意图,构建高保真人机交互数据,评估主动交互能力,提升多模态大语言模型的意图理解与交互时机识别能力。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06115 2026-05-11 cs.AI 70%

CrossCult-KIBench: A Benchmark for Cross-Cultural Knowledge Insertion in MLLMs

CrossCult-KIBench:一种用于多模态大语言模型跨文化知识插入的基准测试

Zhen Zeng, Leijiang Gu, Feng Li, Jing Yu, Zenglin Shi

机构 * Hefei University of Technology(合肥工业大学) Key Laboratory of Ethnic Language Intelligent Analysis and Security Governance of MOE, Minzu University of China(民族语言智能分析与安全治理国家重点实验室,中央民族大学) School of Information Engineering, Minzu University of China(中央民族大学信息工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CrossCult-KIBench基准测试,用于评估跨文化知识插入的有效性及非目标文化的影响,通过9800个图像场景测试不同语言文化的适应性,提出MCKI方法并揭示了当前模型在文化适应与行为保持间的平衡难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05340 2026-05-11 cs.CR cs.AI 70%

How Far Are VLMs from Privacy Awareness in the Physical World? An Empirical Study

VLMs在物理世界中离隐私意识还有多远?一项实证研究

Junran Wang, Xinjie Shen, Zehao Jin, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :language model(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过实证研究揭示VLMs在物理环境中隐私意识的不足,提出ImmersedPrivacy框架评估模型在复杂场景中的隐私感知能力,发现现有模型在感知和隐私冲突处理上存在显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01619 2026-05-11 cs.CV cs.AI 70%

Automatic Image-Level Morphological Trait Annotation for Organismal Images

自动图像级形态学特征标注方法用于生物体图像

Vardaan Pahuja, Samuel Stevens, Alyson East, Sydne Record, Yu Su

机构 * The Ohio State University(俄亥俄州立大学) University of Maine(缅因大学)

专题命中 评测与基准 :foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出了一种基于稀疏自编码器的图像级形态学特征标注方法,通过构建Bioscan-Traits数据集,实现了对19000张昆虫图像的80000个特征标注,为大规模生态研究提供了可扩展的生物特征监督方法。

Comments ICLR 2026

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19254 2026-05-11 cs.CL 70%

FinReasoning: A Hierarchical Benchmark for Reliable Financial Research Reporting

FinReasoning:一种用于可靠金融研究报告的分层基准

Yiyun Zhu, Yidong Jiang, Ziwen Xu, Yinsheng Yao, Dawei Cheng, Jinru Ding, Jie Xu

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出FinReasoning分层基准,用于评估金融研究中的核心能力,区分模型在基础阶段如审计和修正中的表现,揭示模型能力分层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21858 2026-05-11 cs.AI 70%

ProactiveMobile: A Comprehensive Benchmark for Boosting Proactive Intelligence on Mobile Devices

ProactiveMobile: 一个全面的基准,用于提升移动设备上的主动智能

Dezhi Kong, Zhengzhao Feng, Qiliang Liang, Hao Wang, Haofei Sun, Changpeng Yang, Yang Li, Peng Zhou, Shuai Nie, Hongzhen Wang, Linfeng Zhou, Hao Jia, Jiaming Xu, Runyu Shi, Ying Huang

机构 * HyperAI Team, Xiaomi Corporation(小米公司HyperAI团队) Zhejiang University(浙江大学) Peking University(北京大学) Northeastern University(东北大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ProactiveMobile基准,通过多模态大语言模型在移动代理中实现主动智能,通过63个API生成可执行函数序列,实验表明Qwen2.5-VL-7B-Instruct在主动智能任务中表现优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15356 2026-05-11 eess.IV cs.AI 70%

Q-Probe: Scaling Image Quality Assessment to High Resolution via Context-Aware Agentic Probing

Q-Probe:通过上下文感知代理探测扩展图像质量评估至高分辨率

Xiang Li, Xueheng Li, Yu Wang, Xuanhua He, Zhangchi Hu, Weiwei Yu, Chengjun Xie

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Institute of Intelligent Machines, Chinese Academy of Sciences(中国科学院智能 Machines 研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Q-Probe通过上下文感知探测方法解决高分辨率图像质量评估中的局部退化捕捉问题,提出Vista-Bench基准和三阶段训练框架,实现高分辨率下的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15204 2026-05-11 cs.CV cs.AI 70%

Physics-Based Benchmarking Metrics for Multimodal Synthetic Images

基于物理的多模态合成图像基准度量指标

Kishor Datta Gupta, Marufa Kamal, Md. Mahfuzur Rahman, Fahad Rahman, Mohd Ariful Haque, Sunzida Siddique

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出结合大语言模型与推理、知识映射和视觉语言模型的物理约束多模态数据评估指标,以提升多模态合成图像的语义和结构准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11101 2026-05-11 cs.CV cs.AI cs.MM 70%

Consensus Entropy: Harnessing Multi-VLM Agreement for Self-Verifying and Self-Improving OCR

共识熵:利用多视觉语言模型一致性的自验证和自改进OCR

Yulong Zhang, Tianyi Liang, Xinyue Huang, Erfei Cui, Guoqing Wang, Xu Guo, Chenhui Li, Gongshen Liu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Sun Yat-sen University(中山大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出共识熵,一种无需训练的指标,通过测量多模型一致性熵来估计输出可靠性,开发了CE-OCR框架,通过多模型共识验证输出、选择最佳输出并提升效率,实验表明CE在质量验证中鲁棒,提升F1分数42.1%,优于自一致性及单模型基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05085 2026-05-11 cs.CL cs.SD eess.AS 70%

S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models

S2S-Arena:评估语音到语音模型的副语言指令遵循

Feng Jiang, Zhiyu Lin, Yiyang Liu, Liumeng Xue, Fan Bu, Yuhao Du, Xiangying Chen, Benyou Wang, Haizhou Li

机构 * Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanjing University(南京大学) Shenzhen Loop Area Institute(深圳河套学院) CentraleSupélec, Université Paris-Saclay(巴黎萨克雷大学CentraleSupélec分校) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 S2S-Arena通过四级交互协议和双阶段数据构建流程,评估语音模型在语义理解和副语言表达上的能力,揭示了现有系统在复杂副语言需求下的性能差距。

Comments Accepted by ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07836 2026-05-11 cs.SE 67%

Unsafe by Flow: Uncovering Bidirectional Data-Flow Risks in MCP Ecosystem

流式安全:揭示MCP生态系统中的双向数据流风险

Xinyi Hou, Yanjie Zhao, Haoyu Wang

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出MCP-BiFlow框架,通过双向静态分析检测MCP接口中的数据流安全风险,准确识别30个已知漏洞,优于现有工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07477 2026-05-11 cs.CV 67%

ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning

ReasonEdit:通过强化学习实现可解释图像编辑评估

Honghua Chen, Zitong Xu, Huiyu Duan, Xinyun Zhang, Xiongkuo Min, Guangtao Zhai

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出ReasonEdit,通过引入ReasonEdit-22K数据集和RE-Reward模型,训练出可解释的图像编辑评估模型,提升评估的可解释性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07338 2026-05-11 cs.CV 67%

ShellfishNet: A Domain-Specific Benchmark for Visual Recognition of Marine Molluscs

ShellfishNet:面向海洋软体动物视觉识别的领域专用基准数据集

Ziheng Zhou, Yang Wang, Nan Wang, Chengliang Wu, Jun Yan

机构 * IT College, Shanghai Ocean University(上海海洋大学信息学院) Fudan University(复旦大学) DP Technology(DP技术)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文构建了ShellfishNet数据集,包含8691张图像,用于评估视觉模型在真实环境下的泛化能力,测试了80种神经网络模型及多模态大语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07178 2026-05-11 cs.CV 67%

Masks Can Talk: Extracting Structured Text Information from Single-Modal Images for Remote Sensing Change Detection

掩码可以说话:从单模图像中提取结构化文本信息用于遥感变化检测

Kai Zheng, Hang-Cheng Dong, Jiatong Pan, Zhenkai Wu, Fupeng Wei, Wei Zhang

机构 * Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院) North China University of Water Resources and Electric Power(华北水利水电大学) University of Auckland(奥克兰大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出S2M框架,通过零额外标注成本从变化标签中直接提取结构化文本特征,提升遥感变化检测的多模态监督效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06731 2026-05-11 cs.CR cs.CL cs.LG 62%

When Routine Chats Turn Toxic: Unintended Long-Term State Poisoning in Personalized Agents

当常规聊天变得有毒:个性化代理中无意的长期状态污染

Xiaoyu Xu, Minxin Du, Qipeng Xie, Haobin Ke, Qingqing Ye, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) Hong Kong University of Science and Technology, HKUST (Guangzhou)(香港科学与技术大学(广州))

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了个性化代理中因常规交互导致的长期状态污染问题,提出ULSPB基准和Harm Score指标,并通过StateGuard防御机制降低安全风险。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01240 2026-05-11 cs.LG cs.AI 62%

Rhamba: Region-Aware Hybrid Attention-Mamba Framework for Self-Supervised Learning in Resting-State fMRI

Rhamba:基于区域意识的混合注意力-马尔可夫框架用于静息态fMRI的自监督学习

Ruthwik Reddy Doodipala, Pankaj Pandey, Pratheek Eranki, Carolina Torres-Rojas, Manob Jyoti Saikia, Ranganatha Sitaram

机构 * St. Jude Children’s Research Hospital(圣犹大儿童研究医院) The University of Memphis(孟菲斯大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 Rhamba结合解剖引导的掩码与混合注意力-马尔可夫架构,通过ABIDE数据集预训练,利用不同掩码策略提升静息态fMRI分析性能,最终在COBRE和ADHD-200数据集上实现优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13224 2026-05-11 cs.AI cs.CL 62%

A Geometric Taxonomy of Hallucinations in LLMs

大语言模型幻觉的几何分类

Javier Marín

机构 * Javier Marín

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于嵌入空间几何的幻觉检测方法,通过三种操作类型区分可检测与不可检测的幻觉,验证了在不同领域数据集上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18744 2026-05-11 cs.AI cs.LG 62%

TSRBench: A Comprehensive Multi-task Multi-modal Time Series Reasoning Benchmark for Generalist Models

TSRBench: 一个全面的多任务多模态时间序列推理基准,用于通用模型

Fangxu Yu, Xingang Guo, Lingzhi Yuan, Haoqiang Kang, Hongyu Zhao, Lianhui Qin, Furong Huang, Bin Hu, Tianyi Zhou

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Illinois at Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Maryland, College Park(马里兰大学学院公园分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 TSRBench通过4125个问题和15个任务评估通用模型的时间序列推理能力,揭示了感知和推理中的缩放定律失效以及多模态融合的不足。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07640 2026-05-11 cs.CV cs.AI 57%

LithoBench: Benchmarking Large Multimodal Models for Remote-Sensing Lithology Interpretation

LithoBench:用于遥感岩石学解释的大型多模态模型基准测试

Jun Wang, Fengpeng Li, Hang Dong, Tianjin Huang, Wei Han

机构 * School of Computer Science, China University of Geosciences(中国地质大学(北京)计算机学院) PRADA Lab, King Abdullah University of Science and Technology(科廷大学PRADA实验室) Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出LithoBench,一个用于评估遥感岩石学解释中地质语义理解的多级基准,包含10000个专家标注实例,涵盖12种岩石类型,通过专家反馈的半自动化流程提升评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07378 2026-05-11 cs.LG 57%

Zero-Shot Neural Network Evaluation with Sample-Wise Activation Patterns

基于样本激活模式的零样本神经网络评估

Yameng Peng, Andy Song, HaythamM. Fayek, Vic Ciesielski, Xiaojun Chang

机构 * School of Computing Technologies, RMIT University(计算技术学院,皇家墨尔本理工大学) Department of Electronic Engineering and Information Science, University of Science and Technology of China(电子工程与信息科学系,中国科学技术大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文提出SWAP及其衍生指标SWAP-Score,用于评估神经网络性能,克服了传统零样本指标的局限性,展现强预测能力。

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence. This article is a journal extension of arXiv:2403.04161

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12602 2026-05-11 cs.LG 57%

Exact Flow Linear Attention: Exact Solution from Continuous-Time Dynamics

精确流线性注意力:从连续时间动态中获得精确解

Jingdi Lei, Di Zhang, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Fudan University(复旦大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文提出EFLA,通过连续时间动态的精确闭式流替代delta规则线性注意力的一阶更新,保持其代数结构和效率,提升稳定性和性能。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07335 2026-05-11 cs.LG cs.SE 57%

CellScientist: Dual-Space Hierarchical Orchestration for Closed-Loop Refinement of Virtual Cell Models

细胞科学家:双空间分层协调用于虚拟细胞模型的闭环细化

Mengran Li, Bo Li, Jiaying Wang, Wenbin Xing, Yixuan Dong, Chengyang Zhang, Hongliang Zhang, Yuzhong Peng, Jinlin Wu, Bob Zhang, Bingo Wing-Kuen Ling, Fuji Yang, Zhen Lei, Jiebo Luo, Zelin Zang

机构 * Center for Artificial Intelligence and Robotics(人工智能与机器人中心) Hong Kong Institute of Science and Innovation(香港科学与创新研究院)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 本文提出CellScientist框架,通过双空间分层协调实现虚拟细胞模型的闭环细化,解决模型预测误差的反馈路由问题,提升模型修订效率和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07268 2026-05-11 cs.CL 57%

From 0-Order Selection to 2-Order Judgment: Combinatorial Hardening Exposes Compositional Failures in Frontier LLMs

从零阶选择到二阶判断:组合硬化揭示前沿大语言模型的组成性失败

Hanmeng Liu, Shichao Weng, Xiulai Liu, Zhicai Zhang, Anli Yan, Xiaozhang Liu

机构 * Hainan University(海南大学) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 本文提出LogiHard框架,通过确定性转换零阶选择为二阶逻辑判断,显著增加推理难度,验证了大语言模型在组合硬化任务中的表现下降,揭示了训练诱导的完整性验证缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06906 2026-05-11 cs.LG 57%

TraXion: Rethinking Pre-training Frameworks for Mobility and Beyond

TraXion:重新思考移动性及其他领域的预训练框架

Shang-Ling Hsu, Mark Tenzer, Cyrus Shahabi, Khurram Shafique

机构 * University of Southern California(南加州大学) Novateur Research Solutions(Novateur研究解决方案)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文提出TraXion框架,针对多实体时空事件流(MESES)的三个特性设计预训练目标和架构,在六个公开移动数据集上表现优异,并成功应用于企业认证日志和ICU死亡预测等不同领域。

Comments 31 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02206 2026-05-11 cs.CV cs.LG 57%

Metric Unreliability in Multimodal Machine Unlearning: A Systematic Analysis and Principled Unified Score

多模态机器去学习中的度量不可靠性:系统分析与原则统一分数

Abdullah Ahmad Khan, Hamid Laga, Ferdous Sohel

机构 * Murdoch University(墨尔本大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文系统分析了多模态去学习中度量可靠性问题,提出统一质量评分(UQS)以解决不同度量标准间的冲突,通过实验验证了UQS在稳定排序方面的有效性。

Comments 9 Pages , 6 figures, Neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01999 2026-05-11 cs.AI 57%

TumorXAI: Self-Supervised Deep Learning Framework for Explainable Brain MRI Tumor Classification

TumorXAI: 基于自监督深度学习的可解释性脑部MRI肿瘤分类框架

Abrar Hossain Zahin, Amit Kumar Saha, Tanvir Mridha, Saifur Rahman, Jannatul Ferdous Prome, Raima Husna, Israt Jahan, Ahmed Wasif Reza

机构 * Department of Computer Science and Engineering, East West University(东-西大学计算机科学与工程系)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

AI总结 本文提出TumorXAI框架,利用自监督学习对脑部MRI肿瘤进行多类分类,通过预处理、微调和线性评估等步骤,展示自监督模型在有限标注数据下优于监督方法的性能,并结合Grad-CAM等技术提升可解释性。

Comments 16 pages, 9 figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21824 2026-05-11 cs.CV cs.AI 57%

SteelDefectX: A Multi-Form Vision-Language Dataset and Benchmark for Steel Surface Defect Analysis

SteelDefectX:一种用于钢铁表面缺陷分析的多形式视觉-语言数据集和基准

Shuxian Zhao, Jie Gui, Baosheng Yu, Dacheng Tao

机构 * Southeast University(东南大学) Purple Mountain Laboratories(紫金山实验室) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出SteelDefectX数据集,包含7778张图像和25种缺陷类别,提供多形式文本标注,涵盖视觉-语言分类、分割及跨数据集迁移等任务,揭示文本设计对工业视觉-语言学习的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18085 2026-05-11 cs.RO cs.AI 57%

Continually Evolving Skill Knowledge in Vision Language Action Model

视觉语言动作模型中的持续演进技能知识

Yuxuan Wu, Guangming Wang, Zhiheng Yang, Tianchen Deng, Maoqing Yao, Brian Sheil, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) University of Cambridge(剑桥大学) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学) MIT SMART(麻省理工学院SMART实验室) AgiBot

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

AI总结 本文提出Stellar VLA框架,通过无需增加参数的持续模仿学习方法,实现视觉语言动作模型的持续知识积累,实验表明其在任务专精和知识转移方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏