arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-14 至 2026-05-14 共收录 354 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 65 篇

2605.13596 2026-05-14 cs.CL 81%

Creativity Bias: How Machine Evaluation Struggles with Creativity in Literary Translations

创造力偏差:机器评估在文学翻译中难以应对创造力

Kyo Gerrits, Rik van Noord, Ana Guerberof Arenas

机构 * Centre for Language and Cognition, University of Groningen(语言认知中心,格罗宁根大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文研究了自动评估指标和LLM作为评判者在多语言、多体裁和翻译模式下的文学翻译表现,发现其在评估创造力时与专业评估存在显著偏差,且对机器翻译文本存在系统性偏好。

Comments This paper has been accepted to the EAMT Conference 2026 in Tilburg on June 15-18 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12838 2026-05-14 cs.AI 81%

Multimodal Hidden Markov Models for Persistent Emotional State Tracking

多模态隐马尔可夫模型用于持久情绪状态跟踪

Anamika Ragu, Aneesh Jonelagadda

机构 * Kaliber AI, San Mateo, California, USA(Kaliber AI,美国加利福尼亚州圣马特奥)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出基于多模态valence- arousal表示的轻量框架,利用sticky factorial HDP-HMM实现对话情绪的持续状态跟踪,通过LLM-as-a-Judge等指标验证其比基线Gaussian HMM更高效且可解释。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10267 2026-05-14 cs.AI 81%

IndustryBench: Probing the Industrial Knowledge Boundaries of LLMs

IndustryBench: 探索大语言模型在工业知识边界的限制

Songlin Bai, Xintong Wang, Linlin Yu, Bin Chen, Zhiang Xu, Yuyang Sheng, Changtong Zan, Xiaofeng Zhu, Yizhe Zhang, Jiru Li, Mingze Guo, Ling Zou, Yalong Li, Chengfu Huo, Liang Ding

机构 * Multimodal and Industrial AI Team(多模态与工业AI团队)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 IndustryBench通过中国国家标准和工业产品记录构建2049项工业采购问答基准,揭示LLM在工业QA中的可靠性问题,发现标准与术语能力最弱,扩展推理降低安全调整分数,安全违规率影响排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00200 2026-05-14 cs.CL 81%

Confidence Estimation in Automatic Short Answer Grading with LLMs

基于大语言模型的自动简答评分中的置信度估计

Longwei Cong, Sonja Hahn, Sebastian Gombert, Leon Camus, Hendrik Drachsler, Ulf Kroehne

机构 * DIPF | Leibniz Institute for Research and Information in Education(莱布尼茨教育研究与信息研究所) Faculty of Computer Science, Goethe University Frankfurt(弗赖堡大学计算机科学系) Chemnitz University of Technology(化学工业大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了基于大语言模型的自动简答评分中的置信度估计,结合模型内置置信信号和数据集衍生的不确定性,提出混合置信框架以提升评分选择性。

Comments accepted to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00072 2026-05-14 cs.AI 81%

Test of Time: Rethinking Temporal Signal of Benchmark Contamination

时间检验:重新思考基准污染的时序信号

Terry Jingchen Zhang, Gopal Dev, Ning Wang, Max Obreiter, Punya Syon Pandey, Keenan Samway, Wenyuan Jiang, Yinya Huang, Bernhard Schölkopf, Mrinmaya Sachan, Zhijing Jin

机构 * Jinesis Lab, University of Toronto & Vector Institute(Jinesis实验室、多伦多大学及向量研究所) ETH Zürich & ETH AI Center(苏黎世联邦理工学院及ETH人工智能中心) Max Planck Institute for Intelligent Systems, Tübingen, Germany(智能系统马克斯·普朗克研究所,图宾根,德国) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文质疑LLM后截止性能衰减作为基准污染时序信号的假设,发现该信号对问题构造方式敏感,通过LLM转换问题可改变时序模式,验证了其对评估可靠性的启示。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22123 2026-05-14 cs.CL 79%

Multilingual Vision-Language Models, A Survey

多语言视觉-语言模型:综述

Andrei-Alexandru Manea, Jindřich Libovický

机构 * Faculty of Mathematics and Physics, Charles University, V Holešovičkách 747/2, Prague, Czech Republic(数学与物理系,查尔斯大学,V Holešovičkách 747/2,布拉格,捷克共和国)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文综述了处理多语言文本和图像的视觉-语言模型,分析了语言中立性与文化意识之间的矛盾,指出对比学习在训练中的主导地位及文化适应性的数据依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13334 2026-05-14 cs.CL 79%

LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs

基于大语言模型的说服能克服前沿大语言模型的限制

Rodrigo Nogueira, Thales Sales Almeida, Giovana Kerche Bonás, Andrea Roque, Ramon Pires, Hugo Abonizio, Thiago Laitz, Celio Larcher, Roseval Malaquias Junior, Marcos Piau

机构 * Maritaca AI JusBrasil

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 研究展示通过大语言模型作为模拟用户进行说服对话,可使其他大语言模型生成争议性文本,采用自然语言压力策略,如同行比较和认知责任重构,实现说服效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18951 2026-05-14 cs.LG 79%

Benchmarking Attribute Discrimination in Infant-Scale Vision-Language Models

对婴儿级视觉-语言模型属性辨别能力的基准测试

Patrick Batsell, Satoshi Tsutsui, Bihan Wen

机构 * Rice University(里士大学) ROSE Lab(ROSE实验室) School of EEE, Nanyang Technological University(南洋理工大学电子工程学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 研究通过合成渲染对比颜色、尺寸和纹理属性,评估婴儿训练模型在属性辨别上的能力,发现其在视觉和语言属性信息上存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05094 2026-05-14 cs.SD 78%

TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling

TW-Sound580K:一种带有验证引导编纂的区域音频-文本数据集,用于本地化音频-语言建模

Hao-Hui Xie, Ho-Lam Chung, Yi-Cheng Lin, Ke-Han Lu, Wenze Ren, Xie Chen, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出TW-Sound580K数据集,通过验证生成批判流程编纂,用于本地化音频语言模型,展示Tai-LALM在TAU基准上达到49.1%准确率,比零样本基线提升6.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15642 2026-05-14 cs.CV 78%

UNIV: Unified Foundation Model for Infrared and Visible Modalities

UNIV:用于红外和可见模态的统一基础模型

Fangyuan Mao, Shuo Wang, Jilin Mei, Shun Lu, Chen Min, Fuyang Liu, Xiaokun Feng, Meiqi Wu, Yu Hu

机构 * Research Center for Intelligent Computing Systems, CAS ICT(智能计算系统研究所以及中国科学院信息科技研究院) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 UNIV通过跨模态对比学习提升红外与可见光感知的鲁棒性,解决模态偏差问题,实验显示在红外任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19651 2026-05-14 cs.CV 78%

Scalable Object Detection in the Car Interior With Vision Foundation Models

在汽车内部实现可扩展的目标检测与定位:基于视觉基础模型

Sebastian Schmidt, Bálint Mészáros, Ahmet Firintepe, Stephan Günnemann

机构 * Technical University of Munich, School of Computation, Information and Technology(慕尼黑技术大学,计算、信息与技术学院) BMW Group(宝马集团)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出ODAL框架,利用分布式架构结合视觉基础模型,在车载与云平台间分配计算任务,通过ODALbench评估,轻量模型经微调后在检测和定位任务中表现优异,性能优于GPT-4o。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14129 2026-05-14 cs.CV 78%

PVLM: Parsing-Aware Vision Language Model with Dynamic Contrastive Learning for Zero-Shot Deepfake Attribution

PVLM:面向零样本深度伪造属性识别的解析感知视觉语言模型

Yaning Zhang, Jiahe Zhang, Chunjie Ma, Weili Guan, Tian Gan, Zan Gao

机构 * Faculty of Computer Science and Technology, Qilu University of Technology (Shandong Academy of Sciences)(计算机科学与技术学院,齐鲁工业大学(山东省科学院)) Shandong University of Science and Technology(山东科技大学) Shandong Artificial Intelligence Institute, Qilu University of Technology (Shandong Academy of Sciences)(山东省人工智能研究院,齐鲁工业大学(山东省科学院)) School of Electronics and Information Engineering, Harbin Institute of Technology(电子与信息工程学院,哈尔滨工业大学(深圳)) School of Computer Science and Technology, Shandong University(计算机科学与技术学院,山东大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出PVLM模型,通过动态对比学习实现对未知高级生成器的细粒度追踪,利用面部解析特征捕捉伪造表示,提升深度伪造属性识别性能。

Comments Accepted to IEEE Transactions on Dependable and Secure Computing 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13817 2026-05-14 cs.SE cs.AI 77%

Neurosymbolic Auditing of Natural-Language Software Requirements

神经符号自然语言软件需求审计

Bethel Hall, William Eiers

机构 * Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出神经符号方法用于审计自然语言软件需求,通过形式逻辑转换和SMT求解器检测歧义与不一致,提升医疗设备软件需求的严谨性。

Comments 10

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15761 2026-05-14 cs.DC cs.AI cs.GR cs.HC 77%

AIvaluateXR: An Evaluation Framework for on-Device AI in XR with Benchmarking Results

AIvaluateXR: 一个用于XR设备上AI评估的评估框架及基准测试结果

Dawar Khan, Xinyu Liu, Omar Mena, Donggang Jia, Alexandre Kouyoumdjian, Ivan Viola

机构 * King Abdullah University of Science and Technology (KAUST)(卡布斯大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AIvaluateXR框架,用于评估XR设备上大语言模型的性能,通过部署17个模型在四个平台进行测试,分析性能一致性、处理速度、内存使用和电池消耗等指标,提出基于3D帕累托最优的统一评估方法,比较设备端与云端部署的效率和准确性。

Comments AIvaluateXR is updated version of LoXR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13536 2026-05-14 cs.LG cs.AI 73%

HLS-Seek: QoR-Aware Code Generation for High-Level Synthesis via Proxy Comparative Reward Reinforcement Learning

HLS-Seek: 一种基于代理比较奖励强化学习的面向高质量结果的高层次综合代码生成

Qingyun Zou, Feng Yu, Hongshi Tan, Yao Chen, Bingsheng He, WengFai Wong

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 HLS-Seek通过代理比较奖励强化学习方法,实现了高质量结果导向的高层次综合代码生成,其在语法正确性和功能准确性上超越了GPT-5.1等前沿模型,并在训练速度和QoR评估中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13484 2026-05-14 cs.LG cs.AI stat.ME 73%

Discovery of Hidden Miscalibration Regimes

发现隐藏的校准失真区域

Katarzyna Kobalczyk, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种无需预定义数据切片的方法,发现隐藏的校准失真区域,通过学习输入空间的校准感知表示,利用核平滑估计局部校准误差,实验证明输入依赖的校准异质性普遍存在,并支持局部置信度修正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23018 2026-05-14 cs.CV cs.AI cs.LG 73%

AmaraSpatial-10K: A Spatially and Semantically Aligned 3D Dataset for Spatial Computing and Embodied AI

AmaraSpatial-10K:一个空间和语义对齐的3D数据集用于空间计算和具身AI

Mohammad Sadegh Salehi, Alex Perkins, Igor Maurell, Ashkan Dabbagh, Raymond Wong

机构 * Zero One Creative(Zero One创意)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出AmaraSpatial-10K数据集,包含10000多个合成3D资产,优化零样本部署,通过精确锚点、PBR贴图和文本元数据提升CLIP召回率和物理稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02038 2026-05-14 cs.CL cs.AI cs.DB 73%

BEAVER: An Enterprise Benchmark for Text-to-SQL

BEAVER:一个企业文本到SQL基准测试

Peter Baile Chen, Devin Yang, Weiyue Li, Fabian Wenz, Yi Zhang, Nesime Tatbul, Michael Cafarella, Çağatay Demiralp, Michael Stonebraker

机构 * MIT(麻省理工学院) Harvard University(哈佛大学) Greenshoe, Inc.(Greenshoe公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 BEAVER是首个基于企业私有数据仓库构建的文本到SQL基准测试,包含9128个问题-SQL对和19个领域的812张表,通过合成高质量查询和细粒度评估方法,揭示了现有模型在复杂企业场景下的性能差距。

Comments Dataset and code are available at https://beaverbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12922 2026-05-14 cs.AI cs.CL 73%

When Attention Closes: How LLMs Lose the Thread in Multi-Turn Interaction

当注意力关闭:LLMs在多轮交互中如何失去线索

Vardhan Dongre, Joseph Hsieh, Viet Dac Lai, Seunghyun Yoon, Trung Bui, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(Adobe研究)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示LLMs在多轮对话中因注意力关闭导致任务目标丢失的现象,提出目标可访问性比率(GAR)及通道转换框架,分析不同架构下目标相关行为的生存机制及失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12525 2026-05-14 cs.SI cs.AI cs.CL 73%

PERCEIVE: A Benchmark for Personalized Emotion and Communication Behavior Understanding on Social Media

PERCEIVE:面向社交媒体个性化情绪与交流行为理解的基准测试

Jian Liao, Yujin Zheng, Suge Wang, Jianxing Zheng, Deyu Li

机构 * School of Computer and Information Technology, Shanxi University, China(山西大学计算机与信息学院) Key Laboratory of Computational Intelligence and Chinese Information Processing of Ministry of Education, Shanxi University, China(教育部计算智能与中文信息处理重点实验室,山西大学,中国) Joint Laboratory of Tourism Big Data in Shanxi Province, China(山西省旅游大数据联合实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 PERCEIVE是首个整合五维社交感知的双语大规模基准,通过真实用户互动捕捉读者个性化情绪响应,推动社交智能NLP研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13173 2026-05-14 cs.DB 71%

OxyEcomBench: Benchmarking Multimodal Foundation Models across E-Commerce Ecosystems

OxyEcomBench:跨电子商务生态系统的多模态基础模型基准测试

Yong Liu, Ximan Liu, Guoqing Yang, Bing Bai, Xiaoqiang Xu, Zhen Chen, Ke Zhang, Yan Li

专题命中 评测与基准 :foundation model(title)

AI总结 本文提出OxyEcomBench,一个涵盖6300个高质量实例的多模态基准,用于评估模型在电子商务场景中的表现,通过覆盖平台运营者、商家和消费者六个能力方面和29项任务,验证模型在多模态输入下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13167 2026-05-14 cs.CL 70%

GeoBuildBench: A Benchmark for Interactive and Executable Geometry Construction from Natural Language

GeoBuildBench:一个用于从自然语言构建可执行几何构造的基准

Jinwoong Kim, Rui Yang, Huishuai Zhang

机构 * Peking University(北京大学) Wangxuan Institute of Computer Technology(王璇计算机技术研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 GeoBuildBench评估大语言模型能否将自然语言几何问题转化为可执行构造,包含489道中文教材问题,验证了多模态模型在交互构造任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12882 2026-05-14 cs.CL cs.CV 70%

CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence

CiteVQA:可信赖文档智能的证据归因基准测试

Dongsheng Ma, Jiayu Li, Zhengren Wang, Yijie Wang, Jiahao Kong, Weijun Zeng, Jutao Xiao, Jie Yang, Wentao Zhang, Bin Wang, Conghui He

机构 * Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CiteVQA通过要求模型返回元素级边界框引用,评估文档理解中的证据归因,揭示了现有评估方法的可靠性缺口,主要贡献是引入Strict Attributed Accuracy指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12684 2026-05-14 cs.CV cs.AI cs.HC 70%

Visual Aesthetic Benchmark: Can Frontier Models Judge Beauty?

视觉审美基准:前沿模型能评判美吗?

Yichen Feng, Yuetai Li, Chunjiang Liu, Yuanyuan Chen, Fengqing Jiang, Yue Huang, Hang Hua, Zhengqing Yuan, Kaiyuan Zheng, Luyao Niu, Bhaskar Ramasubramanian, Basel Alomair, Xiangliang Zhang, Misha Sra, Zichen Chen, Radha Poovendran, Zhangchen Xu

机构 * Bake AI University of Washington(华盛顿大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Stanford University(斯坦福大学) University of Notre Dame(诺丁汉大学) Carnegie Mellon University(卡内基梅隆大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Western Washington University(西雅图华盛顿大学) King Abdulaziz City for Science and Technology(国王阿卜杜勒阿齐兹科技城)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出视觉审美基准(VAB),通过比较选择评估审美,发现前沿模型在判断最佳和最差图像时表现逊于人类专家,表明需进一步改进。

Comments Project page: https://vab.bakelab.ai. Code: https://github.com/BakeLab/Visual-Aesthetic-Benchmark. Dataset: https://huggingface.co/datasets/BakeLab/Visual-Aesthetic-Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27389 2026-05-14 cs.CV cs.AI 70%

COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts

COHERENCE:在交错多模态上下文中细粒度图像-文本对齐的基准测试

Bingli Wang, Huanze Tang, Haijun Lv, Zhishan Lin, Lixin Gu, Lei Feng, Qipeng Guo, Kai Chen

机构 * Southeast University Shanghai AI Laboratory(上海大学上海人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 COHERENCE旨在评估MLLM在交错多模态上下文中恢复细粒度图像-文本对应关系的能力,涵盖四个领域,包含6161个高质量问题,并进行六类错误分析以识别当前MLLM的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02022 2026-05-14 cs.AI 70%

ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis

ATBench:一个多样且现实的代理轨迹基准,用于安全评估与诊断

Yu Li, Haoyu Luo, Yuejin Xie, Yuqian Fu, Zhonghao Yang, Shuai Shao, Qihan Ren, Wanying Qu, Yanwei Fu, Yujiu Yang, Jing Shao, Xia Hu, Dongrui Liu

机构 * Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) KAUST(卡塔尔人工智能科学中心) East China Normal University(华东师范大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 ATBench通过多样化的轨迹和现实场景评估代理安全,包含1000条轨迹,挑战性强,支持跨基准比较和长周期故障诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23013 2026-05-14 cs.CV cs.LG 70%

SubspaceAD: Training-Free Few-Shot Anomaly Detection via Subspace Modeling

SubspaceAD:通过子空间建模实现无训练少样本异常检测

Camile Lendering, Erkut Akdag, Egor Bondarev

机构 * AIMS Group, Department of Electrical Engineering, Eindhoven University of Technology(AIMS组,电气工程系,埃因霍温理工大学)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 SubspaceAD提出一种无需训练的少样本异常检测方法,通过冻结DINOv2模型提取正常图像的补丁特征,并利用PCA建模估计正常变化的低维子空间,从而在无训练、提示微调或内存库的情况下实现最先进的性能。

Comments Accepted to CVPR 2026. Revised version with corrected AU-PRO evaluation and recomputed metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13365 2026-05-14 cs.NE 67%

The Geno-Synthetic Algorithm: Type-Factored Coevolutionary Optimization for Heterogeneous Genotypes and Assembled Phenotypes

基因合成算法:面向异构基因型和组装表型的类型分层共进化优化

Alex Bogdan

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出基因合成算法,通过类型分层共进化框架处理异构参数,实现基因族并行进化与表型组装,验证了其在复杂描述符和嵌入向量问题中的有效性。

Comments 28 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10755 2026-05-14 cs.CV 67%

MMRareBench: A Rare-Disease Multimodal and Multi-Image Medical Benchmark

MMRareBench: 一种罕见疾病多模态和多图像医学基准

Junzhi Ning, Jiashi Lin, Yingying Fang, Wei Li, Jiyao Liu, Cheng Tang, Chenglong Ma, Wenhao Tang, Tianbin Li, Ziyan Huang, Guang Yang, Junjun He

机构 * Shanghai AI Laboratory(上海人工智能实验室) Imperial College London(帝国理工学院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出MMRareBench,首个评估多模态和多图像临床能力的罕见疾病基准,包含1756个问题-答案对和7958张医学图像,揭示23个MLLMs在多图像任务中表现低下,存在能力稀释效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10187 2026-05-14 cs.CV 67%

SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation

SciVQR:一个多学科多模态基准用于高级科学推理评估

Longteng Guo, Xuanxu Lin, Dongze Hao, Tongtian Yue, Pengkang Huo, Jiatong Ma, Yuchen Liu, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) OPPO AI Center(OPPO AI中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 SciVQR通过54个学科的多模态任务评估科学推理能力,包含专家解答的复杂推理挑战,揭示了多模态大语言模型在复杂推理和跨学科整合方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏