arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-13 至 2026-05-13 共收录 421 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 92 篇

2605.10865 2026-05-13 cs.AI cs.CV cs.SE 70%

BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD

BenchCAD: 一个全面的、行业标准的程序化CAD基准测试

Haozhe Zhang, Kaichen Liu, Miaomiao Chen, Lei Li, Shaojie Yang, Cheng Peng, Hanjie Chen

机构 * University of Virginia(弗吉尼亚大学) University of California, San Diego(加州大学圣地亚哥分校) Rice University(莱斯大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 BenchCAD通过视觉问答、代码问答、图像到代码生成和指令引导的代码编辑评估模型,发现当前系统在生成精确参数化CAD程序方面存在不足,需进一步改进工业应用能力。

Comments 9 page 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10357 2026-05-13 cs.MM cs.AI 70%

RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild

RW-Post: 实时可审计的多模态事实核查证据基础

Danni Xu, Shaojing Fan, Harry Cheng, Mohan Kankanhalli

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 RW-Post提出一个可审计的多模态事实核查基准,通过人机协同提取和审计流程,链接社交媒体帖子与推理轨迹及证据项,评估不同场景下的视觉 grounding 和证据利用能力。

Comments This submission was made in error. It was intended to replace the existing submission arXiv:2512.22933 rather than create a new submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10032 2026-05-13 cs.CL 70%

PlantMarkerBench: A Multi-Species Benchmark for Evidence-Grounded Plant Marker Reasoning

PlantMarkerBench: 一个多物种证据导向植物标记推理基准

Sajib Acharjee Dip, Song Li, Liqing Zhang

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工学院计算机科学系) School of Plant and Environmental Sciences, Virginia Tech(弗吉尼亚理工学院植物与环境科学学院) Fralin Biomedical Research Institute, Virginia Tech(弗吉尼亚理工学院弗拉林生物医学研究学院) FBRI Cancer Research Center, Washington, DC(华盛顿特区FBRI癌症研究中心)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出PlantMarkerBench,通过整合文献检索与生物 grounding,构建了包含4种植物的基准,评估文献支持的植物标记证据解释,发现模型在功能、间接和弱支持证据上表现欠佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12501 2026-05-13 cs.CV 67%

Covering Human Action Space for Computer Use: Data Synthesis and Benchmark

为计算机使用覆盖人类动作空间:数据合成与基准

Miaosen Zhang, Xiaohan Zhao, Zhihong Tan, Zhou Huoshen, Yijia Fan, Yifan Yang, Kai Qiu, Bei Liu, Justin Wagle, Chenzhong Yin, Mingxi Cheng, Ji Li, Qi Dai, Chong Luo, Xu Yang, Xin Geng, Baining Guo

机构 * Southeast University(东南大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Wuhan University(武汉大学) Sun Yat-sen University(中山大学) Microsoft(微软公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出CUActSpot基准,通过数据合成覆盖复杂交互,提升模型在多模态任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12326 2026-05-13 cs.NE 67%

Black-Box Optimization of Mixed Binary-Continuous Variables: Challenges and Opportunities in Evolutionary Model Merging

混合二进制-连续变量的黑盒优化:进化模型融合中的挑战与机遇

Md. Robiul Islam Niloy

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文探讨了进化模型融合中混合二进制-连续变量的黑盒优化挑战,提出结构化方法提升融合效果并减少搜索空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11960 2026-05-13 cs.CV 67%

Chronicles-OCR: A Cross-Temporal Perception Benchmark for the Evolutionary Trajectory of Chinese Characters

Chronicles-OCR: 中国文字演变轨迹的跨时代感知基准

Gengluo Li, Shangpin Peng, Xingyu Wan, Chengquan Zhang, Hao Feng, Xin Xu, Pian Wu, Bang Li, Zengmao Ding, Yongge Liu, Yipei Ye, Yang Yang, Zhan Shu, Guojun Yan, Zhe Li, Can Ma, Weiping Wang, Yu Zhou, Han Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) Tencent(腾讯) Anyang Normal University(安阳师范学院) The Palace Museum(故宫博物院) Nankai University(南开大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 Chronicles-OCR通过跨时代视觉感知任务评估VLLMs在汉字演变中的鲁棒性,包含2800张平衡图像和四个量化任务,推动历史文本感知研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11782 2026-05-13 cs.CV 67%

Urban Risk-Aware Navigation via VQA-Based Event Maps for People with Low Vision

面向低视力人群的基于VQA的事件地图城市风险感知导航

Antoni Valls, Jordi Sanchez-Riera

机构 * Institut de Robòtica i Informàtica Industrial, CSIC-UPC(机器人与信息技术研究所,CSIC-UPC)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出基于视觉问答的事件地图框架,利用视觉语言模型进行行人场景描述和危险识别,通过三级查询结构实现细粒度场景理解,生成风险感知导航地图,验证多模态大语言模型在助视导航中的有效性。

Comments 10 pages, 6 figures, submitted to IEEE T-ITS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11477 2026-05-13 cs.CV 67%

LDDR: Linear-DPP-Based Dynamic-Resolution Frame Sampling for Video MLLMs

LDDR:基于线性DPP的动态分辨率帧采样用于视频MLLMs

Jingfeng Chen, Jiawen Qian, Wendi Deng, Yinuo Guo, Jiaqi Yu, Sicong Leng, Raghuveer Thirukovalluru, Bhuwan Dhingra

机构 * Carnegie Mellon University(卡内基梅隆大学) Individual Researcher(个人研究员) National University Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Duke University(杜克大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出LDDR框架,通过任务条件特征空间中查询感知的DPP帧选择,在有限视觉token预算下提升视频理解,实现3倍速度提升,并通过组DPP重要性度量动态分配分辨率,优于现有基线方法。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11601 2026-05-13 cs.CL cs.AI 62%

DiffScore: Text Evaluation Beyond Autoregressive Likelihood

DiffScore:超越自回归似然的文本评估

Wen Lai, Yingli Shen, Dingnan Jin, Qing Cui, Jun Zhou, Maosong Sun, Alexander Fraser

机构 * Ant Group(蚂蚁集团) Tsinghua University(清华大学) Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 DiffScore通过基于掩码大扩散语言模型的掩码重建方法,消除位置偏差,建立从局部流畅到全局连贯的评估体系,并提供诊断工具提升文本评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11598 2026-05-13 cs.LG cs.AI cs.DB q-bio.QM 62%

EpiCastBench: Datasets and Benchmarks for Multivariate Epidemic Forecasting

EpiCastBench:多变量流行病预测的数据集与基准测试

Madhurima Panja, Danny D'Agostino, Huitao Li, Tanujit Chakraborty, Nan Liu

机构 * Sorbonne University Abu Dhabi(阿布扎赫尔索邦大学) Duke-NUS Medical School, Singapore(新加坡杜克-新加坡国立医学学院)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EpiCastBench,提供40个多变量流行病数据集,用于评估15种多变量预测模型,涵盖统计基线到最新深度学习方法,提升流行病预测的鲁棒性与公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11091 2026-05-13 cs.LG cs.AI 62%

ASD-Bench: A Four-Axis Comprehensive Benchmark of AI Models for Autism Spectrum Disorder

ASD-Bench:面向自闭症谱系障碍的四轴综合AI模型基准

Shubhankit Singh, Hassan Shaikh, Kuldeep Raghuwanshi, Keshav Bulia

机构 * Research Commons AI IIT Bombay(印度理工学院博伊斯) IIT Delhi(印度理工学院德里)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 ASD-Bench通过四轴评估框架,系统评估了不同年龄群体中多种AI模型在预测性能、校准、可解释性和对抗鲁棒性方面的表现,揭示了不同年龄段特征重要性的差异。

Comments 20 pages, 12 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11005 2026-05-13 cs.LG cs.AI cs.DC 62%

DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism

DisagMoE:通过解耦的AF-Pipe并行性实现计算-通信重叠的MoE训练

Zhichen Zeng, Chi-Chih Chang, Jiayi Wang, Zezhou Wang, Ningxin Zheng, Zheng Zhong, Cesar A. Stuardo, Dongyang Wang, Mohamed S. Abdelfattah, Haibin Lin, Banghua Zhu, Ang Li, Ziheng Jiang

机构 * University of Washington(华盛顿大学) Cornell University(康奈尔大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 DisagMoE通过解耦注意力与FFN层,优化模型放置与调度,提升MoE训练效率,实验显示在16节点8xH800集群上实现1.8倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03627 2026-05-13 cs.CL cs.AI 62%

Evaluating the Pre-Consultation Ability of LLMs using Diagnostic Guidelines

利用诊断指南评估大语言模型的预咨询能力

Jean Seo, Gibaeg Kim, Kihun Shin, Seungseop Lim, Hyunkyung Lee, Wooseok Han, Jongwon Lee, Eunho Yang

机构 * AITRICS KAIST(韩国科学技术院) Severance Hospital, Yonsei University(延世大学松云医院) College of Medicine, The Catholic University of Korea(韩国天主大学医学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EPAG基准数据集和框架,通过HPI-诊断指南对比和疾病诊断评估大语言模型的预咨询能力,发现小规模开源模型在预咨询任务中表现优于前沿模型,且预咨询语言影响对话特征。

Comments EACL 2026 Industry

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06371 2026-05-13 cs.CL cs.AI 59%

OASIS: A Multilingual and Multimodal Dataset for Culturally Grounded Spoken Visual QA

OASIS:一个多语言多模态数据集用于文化导向的语音视觉问答

Firoj Alam, Ali Ezzat Shahroor, Md. Arid Hasan, Zien Sheikh Ali, Hunzalah Hassan Bhatti, Mohamed Bayan Kmainasi, Shammur Absar Chowdhury, Basel Mousi, Fahim Dalvi, Nadir Durrani, Natasa Milic-Frayling

机构 * Qatar Computing Research Institute(卡塔尔计算研究 institute)

专题命中 评测与基准 :分类 cs.CL、cs.AI;large language model(comments);language model(comments);foundation model(comments)

AI总结 OASIS是一个多语言多模态数据集,涵盖图像、文本和语音,旨在评估模型在现实场景中的文化导向推理能力,包含0.92M真实图像和14.8M问答对。

Comments Multimodal Foundation Models, Large Language Models, Native, Multilingual, Language Diversity, Contextual Understanding, Culturally Informed

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12299 2026-05-13 cs.CL 57%

GKnow: Measuring the Entanglement of Gender Bias and Factual Gender

GKnow: 测量性别偏见与事实性性别之间的纠缠

Leonor Veloso, Hinrich Schütze

机构 * Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出GKnow基准,用于评估语言模型在不同性别预测类型中的性别知识和偏见,发现性别偏见与事实性性别在电路和神经元层面高度纠缠,表明神经元剪除不可靠。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12286 2026-05-13 q-bio.GN cs.AI 57%

Set-Aggregated Genome Embeddings for Microbiome Abundance Prediction

基于集合聚合基因组嵌入的微生物丰度预测

Younhun Kim, Georg K. Gerber, Travis E. Gibson

机构 * Brigham and Women's Hospital, Boston, MA, USA(布里法伦女性医院,波士顿,马萨诸塞州,美国) Harvard Medical School, Boston, MA, USA(哈佛医学院,波士顿,马萨诸塞州,美国)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出利用集合聚合基因组嵌入(SAGE)预测群落丰度,通过基因组语言模型的少样本学习能力,展示在新型基因组上优于传统生物信息学方法的泛化能力。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12276 2026-05-13 cs.AI 57%

NARA: Anchor-Conditioned Relation-Aware Contextualization of Heterogeneous Geoentities

NARA: 基于锚点的异构地理实体关系感知上下文化

Jina Kim, Gengchen Mai, Lingyi Zhao, Khurram Shafique, Yao-Yi Chiang

机构 * Department of Computer Science and Engineering, University of Minnesota(明尼苏达大学计算机科学与工程系) Department of Geography and the Environment, University of Texas at Austin(德克萨斯大学奥斯汀分校地理与环境系) Novateur Research Solutions(Novateur研究解决方案)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 NARA通过统一框架联合建模语义、几何和空间关系,提升异构地理实体的上下文表示能力,在建筑功能分类、交通速度预测和POI推荐中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12243 2026-05-13 cs.CL 57%

PreScam: A Benchmark for Predicting Scam Progression from Early Conversations

PreScam:一个用于从早期对话预测诈骗进展的基准测试

Weixiang Sun, Shang Ma, Yiyang Li, Tianyi Ma, Zehong Wang, Colby Nelson, Xusheng Xiao, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学) Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出PreScam基准测试,通过分析用户提交的诈骗报告,构建了11573个涵盖20类诈骗的对话实例,评估了语言模型在实时终止预测和诈骗者行为预测任务中的表现,揭示了模型在捕捉诈骗进展方面的能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12200 2026-05-13 cs.LG 57%

Investigating simple target-covariate relationships for Chronos-2 and TabPFN-TS

探究Chronos-2和TabPFN-TS的简单目标-协变量关系

Gaspard Berthelier, Mariia Baranova, Andrei-Tiberiu Pantea, Etienne Le Naour, Adrien Petralia, Tahar Nabil, Themis Palpanas

机构 * EDF R&D(EDF研究院) Inria Sophia-Antipolis(Inria Sophia-Antipolis分部) Université Côte d’Azur(蔚蓝海岸大学) Université Paris Cité(巴黎城市大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文通过设计简单目标-协变量关系的实验,评估了Chronos-2和TabPFN-TS在整合协变量能力上的差异,发现TabPFN-TS在短预测 horizon 中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12090 2026-05-13 cs.RO cs.CL cs.CV 57%

World Action Models: The Next Frontier in Embodied AI

世界动作模型:具身AI的下一个前沿

Siyin Wang, Junhao Shi, Zhaoyang Fu, Xinzhe He, Feihong Liu, Chenchen Yang, Yikang Zhou, Zhaoye Fei, Jingjing Gong, Jinlan Fu, Mike Zheng Shou, Xuanjing Huang, Xipeng Qiu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL

AI总结 本文探讨了具身AI中的世界动作模型(WAMs),通过整合环境动态预测模型,统一预测状态建模与动作生成,提出结构化分类体系并分析数据生态,为该领域提供系统性综述。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11928 2026-05-13 cs.AI 57%

When Simulation Lies: A Sim-to-Real Benchmark and Domain-Randomized RL Recipe for Tool-Use Agents

当模拟欺骗时:一个仿真到现实的基准和领域随机化的强化学习配方用于工具使用智能体

Xiaolin Zhou, Aojie Yuan, Zheng Luo, Zipeng Ling, Xixiao Pan, Yicheng Gao, Haiyue Zhang, Jiate Li, Shuli Jiang, Prince Zizhuang Wang, Zixuan Zhu, Jinbo Liu, Ryan A. Rossi, Hua Wei, Xiyang Hu

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学) Adobe Research(Adobe研究)

专题命中 评测与基准 :language agent(abstract);分类 cs.AI

AI总结 本文研究了工具使用POMDP中的仿真到现实差距,提出了一种领域随机化的强化学习方法,通过扰动增强轨迹提升鲁棒性,缩小了工具使用智能体在现实部署中的性能差距。

Comments Dataset, code, and benchmark leaderboard are available at https://github.com/WillChow66/robustbench-tc-release.git and https://huggingface.co/spaces/willchow66/robustbench-tc-leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13898 2026-05-13 cs.HC cs.AI 57%

Social Human Robot Embodied Conversation (SHREC) Dataset: Benchmarking Foundational Models' Social Reasoning

社交人机具身对话(SHREC)数据集:评估基础模型的社会推理能力

Dong Won Lee, Yubin Kim, Denison Guvenoz, Sooyeon Jeong, Parker Malachowsky, Louis-Philippe Morency, Cynthia Breazeal, Hae Won Park

机构 * Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文提出SHREC数据集,包含400个真实人机交互视频和10000多个标注,用于评估基础模型在社会推理中的能力,揭示社会机器人在情绪理解、意图跟踪等方面的社会挑战。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11756 2026-05-13 cs.CV cs.AI 57%

Focusable Monocular Depth Estimation

可聚焦的单目深度估计

Yuxin Du, Tao Lin, Zile Zhong, Runting Li, Xiyao Chen, Jiting Liu, Chenglin Liu, Ying-Cong Chen, Yuqian Fu, Bo Zhao

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文提出FDE,一种区域感知的单目深度估计方法,通过FocusDepth框架和MSSA模块,提升目标区域的深度精度和全局几何一致性,基于FDE-Bench验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11341 2026-05-13 cs.AI 57%

CPEMH: An Agentic Framework for Prompt-Driven Behavior Evaluation and Assurance in Foundation-Model Systems for Mental Health Screening

CPEMH:一种用于基础模型系统中基于提示的行为评估与保证的代理框架

Giuliano Lorenzoni, Ivens Portugal, Paulo Alencar, Donald Cowan

机构 * University of Waterloo(滑铁卢大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 本文提出CPEMH框架,用于评估基础模型系统在基于转录数据的心理健康筛查中的提示驱动行为,通过模块化代理设计实现行为保证,案例研究展示了其在对话和临床敏感领域稳定性和审计能力。

Comments 4 pages, 2 figures. Accepted at the AGENT 2026 Workshop (ICSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11307 2026-05-13 cs.CV cs.LG 57%

Vision2Code: A Multi-Domain Benchmark for Evaluating Image-to-Code Generation

Vision2Code:一个多领域评估图像到代码生成的基准

Ajay Vikram Periasami, Junlin Wang, Bhuwan Dhingra

机构 * Duke University(杜克大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 Vision2Code提出一个无需参考代码的多领域图像到代码生成评估框架,通过2169个测试示例评估模型生成代码的质量,发现性能依赖于领域,且通过筛选器的模型输出可提升生成能力。

Comments Project page: https://image2code.github.io/vision2code/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12305 2026-05-13 cs.CV 50%

Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation

图像与句子:扩展交错指令以实现统一的视觉生成

Yabo Zhang, Kunchang Li, Dewei Zhou, Xinyu Huang, Xun Wang

机构 * ByteDance Seed(字节跳动种子)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出INSET模型,通过将图像作为文本指令中的原生词汇,解决复杂交错指令下的视觉生成问题,提升多图像一致性和文本对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12282 2026-05-13 cs.CV 50%

Large-Small Model Collaboration for Farmland Semantic Change Detection

大-小模型协作用于耕地语义变化检测

Xinjia Li, Rui Wang, Qiurong Peng, Lingfei Ye, Dengrong Zhang, Haoyu Zhang

机构 * College of Information Science and Technology, Hangzhou Normal University(杭州师范大学信息科学与技术学院)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出大-小协作框架,通过细粒度差分感知Mamba和CLIP文本先验实现耕地变化检测,提升精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12237 2026-05-13 cs.CV 50%

UHR-Micro: Diagnosing and Mitigating the Resolution Illusion in Earth Observation VLMs

UHR-Micro: 诊断和缓解地球观测VLMs中的分辨率错觉

Shuo Ni, Tong Wang, Jing Zhang, He Chen, Haonan Guo, Ning Zhang, Bo Du

机构 * National Key Laboratory of Science and Technology on Space-Born Intelligent Information Processing(国家空间智能信息处理科技重点实验室) Beijing Institute of Technology(北京理工大学) School of Computer Science(计算机学院) Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing(测绘遥感信息工程国家重点实验室) Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :language model(abstract)

AI总结 UHR-Micro通过11253条指令和1212张超高清图像,评估VLM在高分辨率地球观测图像中的空间极限表现,揭示高分辨率输入下空间定位和证据解析的失败,并提出MAP代理以证据为中心提升微尺度感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12107 2026-05-13 eess.AS 50%

Too Good to Be True: A Study on Modern Automatic Speech Recognition for the Evaluation of Speech Enhancement

过于美好而不真实:现代自动语音识别在语音增强评估中的研究

Danilo de Oliveira, Tal Peer, Timo Gerkmann

专题命中 评测与基准 :language model(abstract)

AI总结 本文研究现代ASR模型与人类语音增强识别的关联,发现大规模噪声训练和嵌入语言模型的ASR模型更符合人类WER,但其噪声鲁棒性和上下文使用对声学评估不具信息性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11304 2026-05-13 cs.CV 50%

CheXTemporal: A Dataset for Temporally-Grounded Reasoning in Chest Radiography

CheXTemporal:用于胸部X光影像中时间感知推理的数据集

Eva Prakash, Yunhe Gao, Chong Wang, Justin Xu, Neal Prakash, Arne Michalson, Seena Dehkharghani, Eun Kyoung Hong, Julie Bauml, Roger Boodoo, Jean-Benoit Delbrouck, Sophie Ostmeier, Curtis Langlotz

机构 * Stanford University(斯坦福大学) University of Oxford(牛津大学) University of California, Berkeley(加州大学伯克利分校) HOPPR University Hospital Zurich(苏黎世大学医院)

专题命中 评测与基准 :language model(abstract)

AI总结 该研究提出CheXTemporal数据集,用于胸部X光影像中时间感知推理,包含前后X光片及时间空间标注,评估了多种视觉语言模型在零样本设定下的接地和进展分类任务,发现模型在空间接地和时间推理方面存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏