arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-13 至 2026-04-13 共收录 237 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 47 篇

2604.07779 2026-04-13 cs.CV 78%

Plug-and-Play Logit Fusion for Heterogeneous Pathology Foundation Models

即插即用的逻辑融合用于异构病理基础模型

Gexin Huang, Anqi Li, Yusheng Tan, Beidi Zhao, Gang Wang, Zu-Hua Gao, Xiaoxiao Li

机构 * University of British Columbia(不列颠哥伦比亚大学) Washington University in St. Louis(圣路易斯华盛顿大学) Vector Institute(向量研究所)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出LogitProd方法,通过融合独立训练的病理基础模型预测器,实现高效且无需重新训练的多专家融合,提升异构模型在多种病理任务中的性能。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09212 2026-04-13 cs.CL cs.MA 77%

SPASM: Stable Persona-driven Agent Simulation for Multi-turn Dialogue Generation

SPASM:面向多轮对话生成的稳定人格驱动代理模拟

Han Luo, Guy Laban

机构 * University of Leeds(利兹大学) Southwest Jiaotong University(西南交通大学) Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SPASM框架,通过人格创建、对话生成和终止检测模块,提升多轮对话生成的稳定性,采用ECP方法减少人格漂移和回声现象。

Comments Accepted to Findings of the Association for Computational Linguistics (ACL 2026). Our code and data are available at https://github.com/lhannnn/SPASM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08987 2026-04-13 cs.AI 77%

PilotBench: A Benchmark for General Aviation Agents with Safety Constraints

PilotBench:一个具有安全约束的一般航空智能体基准

Yalun Wu, Haotian Liu, Zhoujun Li, Boyang Wang

机构 * School of Computing National University of Singapore China School of Informatics Xiamen University China CESS Beihang University China

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PilotBench通过对比LLM与传统预报器,评估飞行轨迹和姿态预测,揭示了传统方法在精度上的优势与LLM在指令遵循上的优势,指出LLM在高负荷阶段表现下降,推动混合架构的发展。

Comments Accepted at the 2026 IEEE International Joint Conference on Neural Networks (IJCNN 2026). 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07755 2026-04-13 cs.CL cs.SE 77%

An Empirical Analysis of Static Analysis Methods for Detection and Mitigation of Code Library Hallucinations

对检测和缓解代码库幻觉的静态分析方法的实证分析

Clarissa Miranda-Pena, Andrew Reeson, Cécile Paris, Josiah Poon, Jonathan K. Kummerfeld

机构 * The University of Sydney(悉尼大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过实证分析探讨静态分析方法在检测和缓解代码库幻觉中的效果,发现其能检测部分错误和幻觉,但存在局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09368 2026-04-13 cs.MM cs.CV 75%

Through Their Eyes: Fixation-aligned Tuning for Personalized User Emulation

通过他们的眼睛:基于注视点的个性化用户模拟调谐

Lingfeng Huang, Huizhong Guo, Tianjun Wei, Yingpeng Du, Zhu Sun

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出FixATE方法,通过将视觉语言模型的视觉注意力与用户特定的注视模式对齐,提升推荐系统模拟的准确性,实验表明这种对齐能有效提高点击预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08590 2026-04-13 cs.LG cs.AI 73%

AlphaLab: Autonomous Multi-Agent Research Across Optimization Domains with Frontier LLMs

AlphaLab:利用前沿大语言模型实现跨优化领域的自主多智能体研究

Brendan R. Hogan, Xiwen Chen, James T. Wilson, Kashif Rasul, Adel Boyarsky, Thomas Kamei, Anderson Schneider, Yuriy Nevmyvaka

机构 * Morgan Stanley(摩根士丹利)

专题命中 评测与基准 :LLM(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 AlphaLab通过自主研究系统,利用前沿大语言模型自动完成量化计算密集型领域的完整实验流程,展示了在CUDA内核优化、LLM预训练和交通预测中的显著性能提升。

Comments 43 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09285 2026-04-13 cs.AI 70%

SAGE: A Service Agent Graph-guided Evaluation Benchmark

SAGE:基于服务代理图的评估基准

Ling Shi, Yuqin Dai, Ziyin Wang, Ning Gao, Wei Zhang, Chaozheng Wang, Yujie Wang, Wei He, Jinpeng Wang, Deiyi Xiong

机构 * Tianjin University(天津大学) Tsinghua University(清华大学) Beihang University(北京航空航天大学) Beijing University of Posts and Telecommunications(北京邮电大学) The Chinese University of Hong Kong(香港中文大学) Independent Researcher(独立研究员)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SAGE基准,通过动态对话图验证逻辑合规性,解决现有基准无法评估多维度用户行为和SOP的问题,揭示模型在意图分类与后续动作推导间的执行差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07720 2026-04-13 cs.AI 70%

Towards Knowledgeable Deep Research: Framework and Benchmark

走向知识导向的深度研究:框架与基准

Wenxuan Liu, Zixuan Li, Long Bai, Chunmao Zhang, Fenghui Zhang, Zhuo Chen, Wei Li, Yuxin Zuo, Fei Wang, Bingbing Xu, Xuhui Jiang, Jin Zhang, Xiaolong Jin, Jiafeng Guo, Tat-Seng Chua, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出知识导向深度研究(KDR)任务,设计混合知识分析框架(HKA)并构建KDR-Bench基准,通过结构化与非结构化知识生成多模态报告,实验表明HKA在通用和知识导向指标上优于现有方法,且在视觉增强指标上超越Gemini DR代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08867 2026-04-13 cs.SD cs.AI 70%

AudioGuard: Toward Comprehensive Audio Safety Protection Across Diverse Threat Models

AudioGuard:面向多样化威胁模型的全面音频安全保护

Mintong Kang, Chen Fang, Bo Li

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出AudioGuard,通过SoundGuard和ContentGuard实现音频安全防护,针对音频特有的风险场景建立首个政策导向的音频安全基准,提升安全防护效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08615 2026-04-13 cs.CV cs.AI 70%

MARINER: A 3E-Driven Benchmark for Fine-Grained Perception and Complex Reasoning in Open-Water Environments

MARINER:一种基于3E驱动的基准,用于开放水域环境中的细粒度感知与复杂推理

Xingming Liao, Ning Chen, Muying Shu, Yunpeng Yin, Peijian Zeng, Zhuowei Wang, Nankai Lin, Lianglun Cheng

机构 * Guangdong University of Technology(广东工业大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MARINER基准,通过3E框架评估开放水域环境中的细粒度感知与复杂推理,揭示先进模型在复杂海洋场景中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08597 2026-04-13 cs.DB cs.AI 70%

STIndex: A Context-Aware Multi-Dimensional Spatiotemporal Information Extraction System

STIndex:一种基于上下文的多维时空信息提取系统

Wenxiao Zhang, Yu Liu, Qiang sun, Yihao Ding, Sirui Li, Yanbing Liu, Jin B. Hong, Wei Liu

机构 * The University of Western Australia(西澳大利亚大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) Murdoch University(莫道克大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 STIndex通过多维时空数据仓库提升无结构数据的提取效率,结合大语言模型实现上下文感知提取,提升时空实体识别精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07956 2026-04-13 cs.AI 70%

MONETA: Multimodal Industry Classification through Geographic Information with Multi Agent Systems

MONETA:通过地理信息和多智能体系统进行多模态行业分类

Arda Yüksel, Gabriel Thiem, Susanne Walter, Patrick Felka, Gabriela Alves Werb, Ivan Habernal

机构 * Trustworthy Human Language Technologies(可信人类语言技术实验室) Technical University of Darmstadt, Germany(德国达姆施塔特工业大学) Deutsche Bundesbank(德国联邦银行) Frankfurt University of Applied Sciences, Germany(德国法兰克福应用技术大学) Research Center for Trustworthy Data Science and Security, Ruhr University Bochum, Germany(德国波鸿鲁尔大学可信数据科学与安全研究中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MONETA,首个基于文本和地理空间数据的多模态行业分类基准,利用多智能体系统提升分类精度,实现62.10%和74.10%的分类性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09093 2026-04-13 cs.CR cs.CL 70%

Exploiting Web Search Tools of AI Agents for Data Exfiltration

利用AI代理的网络搜索工具进行数据外泄

Dennis Rall, Bernhard Bauer, Mohit Mittal, Thomas Fraunholz

机构 * Open Hippo GmbH(Open Hippo有限公司) University of Augsburg(奥格斯堡大学) Smart Labs AI GmbH(Smart Labs AI有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究分析了AI代理通过网络搜索工具进行数据外泄的攻击方式,探讨了模型大小、制造商及实现方式对漏洞的影响,并提出加强训练、建立攻击向量数据库和统一测试框架等安全措施。

Comments 9 pages, 6 figures, conference article

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08896 2026-04-13 cs.CV 67%

GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensing

GeoMMBench 和 GeoMMAgent:迈向地质科学和遥感领域的专家级多模态智能

Aoran Xiao, Shihao Cheng, Yonghao Xu, Yexian Ren, Hongruixuan Chen, Naoto Yokoya

机构 * RIKEN AIP(日本理化学研究所革新智能研究中心) Wuhan University(武汉大学) Linköping University(林雪平大学) University of Tokyo(东京大学) Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出 GeoMMBench 和 GeoMMAgent,通过综合多模态问答基准和多智能体框架,解决地质科学和遥感领域知识广、传感器异构、任务碎片化等挑战,提升专家级空间解释能力。

Comments CVPR 2026 Highlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20068 2026-04-13 cs.CV 67%

PRADA: Probability-Ratio-Based Attribution and Detection of Autoregressive-Generated Images

PRADA:基于概率比的自回归生成图像归因与检测

Simon Damm, Jonas Ricker, Henning Petzka, Asja Fischer

机构 * Ruhr University Bochum(波鸿鲁尔大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出PRADA方法,通过分析自回归生成图像的概率比特征,实现对生成图像的可靠检测和归因,适用于多种图像生成模型。

Comments 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition - Findings Track (CVPRF 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03085 2026-04-13 physics.ed-ph 67%

When AI Evaluates Its Own Work: Validating Learner-Initiated, AI-Generated Physics Practice Problems

当AI评估其工作:验证学习者主动生成的物理练习题

Tobias Geisler, Gerd Kortemeyer

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究探讨了在聊天机器人界面中实时生成物理练习题时,哪些自动化检查在技术上可行且在教学上有意义。通过34名学生生成543道题目并进行评估,发现少量关键指标即可有效满足学生偏好。

Journal ref Physical Review PHYSICS EDUCATION RESEARCH 22, 010134 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09155 2026-04-13 cs.LG cs.AI 62%

CORA: Conformal Risk-Controlled Agents for Safeguarded Mobile GUI Automation

CORA: 为保障移动GUI自动化设计的符合性风险控制代理

Yushi Feng, Junye Du, Qifan Wang, Zizhan Ma, Qian Niu, Yutaka Matsuo, Long Feng, Lequan Yu

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) The University of Tokyo(东京大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 CORA通过统计保障减少有害操作,利用Guardian模型评估行动风险并校准执行/中止边界,结合Goal-Lock机制和Phone-Harm基准验证其在自主GUI执行中的安全性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08797 2026-04-13 cs.CL cs.AI 62%

Lessons Without Borders? Evaluating Cultural Alignment of LLMs Using Multilingual Story Moral Generation

国界之外的教训?利用多语言故事道德生成评估语言模型的文化契合度

Sophie Wu, Andrew Piper

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过多语言故事道德生成任务评估语言模型的文化契合度,发现前沿模型在道德生成上与人类响应相似但缺乏跨语言多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08595 2026-04-13 cs.CL cs.AI 62%

Adaptive Rigor in AI System Evaluation using Temperature-Controlled Verdict Aggregation via Generalized Power Mean

基于通用幂均值的温度控制判决聚合中的AI系统评估适应性

Aleksandr Meshkov

机构 * Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TCVA方法,结合五级判决评分系统和通用幂均值聚合,通过温度参数控制评估严格性,实验显示其在忠实度上与RAGAS相当,且优于DeepEval。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08562 2026-04-13 cs.CL cs.AI cs.SD eess.AS 62%

Neural networks for Text-to-Speech evaluation

用于文本到语音评估的神经网络

Ilya Trofimenko, David Kocharyan, Aleksandr Zaitsev, Pavel Repnikov, Mark Levin, Nikita Shevtsov

机构 * HSE University(高等经济学院) Institute for System Programming, Russian Academy of Sciences(俄罗斯科学院系统编程研究所)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出NeuralSBS和改进的MOSNet及WhisperBert,通过神经网络模型在相对和绝对评估中实现高精度,优于人类评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03058 2026-04-13 cs.CL cs.AI cs.CY 62%

Verbalizing LLMs' assumptions to explain and control sycophancy

使LLM的假设 verbal化以解释和控制谄媚行为

Myra Cheng, Isabel Sieh, Humishka Zope, Sunny Yu, Lujain Ibrahim, Aryaman Arora, Jared Moore, Desmond Ong, Dan Jurafsky, Diyi Yang

机构 * Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Verbalized Assumptions框架,通过揭示LLM对用户的错误假设来解释和控制其谄媚行为,发现LLM在面对用户提问时倾向于提供验证而非客观信息,进而提出可解释的细粒度控制方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28013 2026-04-13 cs.CR cs.AI cs.LG 62%

Kill-Chain Canaries: Stage-Level Tracking of Prompt Injection Across Attack Surfaces and Model Safety Tiers

Kill-Chain Canaries: 阶段级跟踪跨攻击表面和模型安全层级的提示注入

Haochuan Kevin Wang, Zechen Zhang

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究通过跟踪加密令牌四个阶段,揭示提示注入是管道-架构问题,发现写节点位置是最高安全决策,所有防御因通道不匹配失效,且隐形白字体PDF负载可匹配或超越可见文本ASR。

Comments 10 pages, 8 figures. Benchmark code and run logs released

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07833 2026-04-13 cs.CV cs.AI cs.LG 62%

Relational Visual Similarity

关系视觉相似性

Thao Nguyen, Sicheng Mo, Krishna Kumar Singh, Yilin Wang, Jing Shi, Nicholas Kolkin, Eli Shechtman, Yong Jae Lee, Yuheng Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Adobe Research(Adobe研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过关系相似性而非视觉属性来衡量图像相似性,构建了首个基于关系逻辑的图像表示空间,揭示了现有视觉模型在捕捉关系相似性方面的不足。

Comments CVPR 2026 camera-ready; Project page, data, and code: https://thaoshibe.github.io/relsim

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05215 2026-04-13 cs.CL cs.LG 62%

BEDTime: A Unified Benchmark for Automatically Describing Time Series

BEDTime:一个统一的基准测试用于自动描述时间序列

Medhasweta Sen, Zachary Gottesman, Jiaxing Qiu, C. Bayan Bruss, Nam Nguyen, Tom Hartvigsen

机构 * University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出BEDTime基准测试,评估模型对时间序列结构属性的描述能力,发现专为时间序列语言设计的模型表现欠佳,而视觉语言模型表现优异,且所有方法在现实鲁棒性测试中均表现脆弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09532 2026-04-13 cs.CV cs.AI 57%

Seeing is Believing: Robust Vision-Guided Cross-Modal Prompt Learning under Label Noise

见仁见智:在标签噪声下鲁棒的视觉引导跨模态提示学习

Zibin Geng, Xuefeng Jiang, Jia Li, Zheng Li, Tian Wen, Lvhua Wu, Sheng Sun, Yuwei Wang, Min Liu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) PCALab, VCIP, College of Computer Science, Nankai University(南开大学计算机学院PCALab, VCIP)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出VisPrompt框架,通过跨模态注意力机制将视觉语义注入提示表示,提升在标签噪声下的鲁棒性,实验表明其在多个数据集上表现优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09369 2026-04-13 q-bio.BM cs.LG q-bio.QM 57%

Biologically-Grounded Multi-Encoder Architectures as Developability Oracles for Antibody Design

基于生物原理的多编码架构作为抗体设计的可开发性预言机

Simon J. Crouzet

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文提出CrossAbSense框架,通过结合冻结的蛋白质语言模型编码器和可配置的注意力解码器,提升抗体可开发性评估的准确性,显著改进了三种评估 assay 的性能。

Comments ICLR 2026 Workshop on Generative and Experimental Perspectives for Biomolecular Design

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08457 2026-04-13 cs.CV cs.AI cs.RO 57%

CrashSight: A Phase-Aware, Infrastructure-Centric Video Benchmark for Traffic Crash Scene Understanding and Reasoning

CrashSight:面向交通事故场景理解与推理的相位感知、基础设施导向视频基准

Rui Gan, Junyi Ma, Pei Li, Xingyou Yang, Kai Chen, Sikai Chen, Bin Ran

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Wyoming(怀俄明大学) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 CrashSight通过真实道路摄像头数据构建大规模视频基准,评估视觉语言模型在交通事故场景中的理解与推理能力,揭示现有模型在时间与因果推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08788 2026-04-13 cs.CL 57%

MedConceal: A Benchmark for Clinical Hidden-Concern Reasoning Under Partial Observability

MedConceal:一个用于在部分可观测性下进行临床隐藏关切推理的基准

Yikun Han, Joey Chan, Jingyuan Chen, Mengting Ai, Simo Du, Yue Guo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NYC Health + Hospitals/Jacobi(纽约市健康与医院管理局/雅可比医疗中心)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 MedConceal通过交互式患者模拟器评估医疗对话中的隐藏关切推理,包含300个案例和600个医生-LLM交互,研究确认和干预能力,发现前沿模型在确认指标上表现优异,而人类医生在干预成功率上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07514 2026-04-13 cs.CV cs.AI 57%

Mitigating Domain Drift in Multi Species Segmentation with DINOv2: A Cross-Domain Evaluation in Herbicide Research Trials

通过DINOv2缓解多物种分割中的领域漂移:在除草剂研究试验中的跨领域评估

Artzai Picon, Itziar Eguskiza, Daniel Mugica, Javier Romero, Carlos Javier Jimenez, Eric White, Gabriel Do-Lago-Junqueira, Christian Klukas, Ramon Navarra-Mestre

机构 * TECNALIA, Basque Research and Technology Alliance (BRTA)(TECNALIA,巴斯克研究与技术联盟(BRTA)) University of the Basque Country(巴斯克大学) BASF Corporation(巴斯夫公司)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文提出利用DINOv2和层级分类推理提升多物种分割在农业环境中的鲁棒性,通过多地区、多设备和多传感器的实验验证了模型在领域漂移下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09478 2026-04-13 cs.CV cs.RO 50%

Incremental Semantics-Aided Meshing from LiDAR-Inertial Odometry and RGB Direct Label Transfer

增量语义辅助的LiDAR-惯性里程计与RGB直接标签转移的网格生成

Muhammad Affan, Ville Lehtola, George Vosselman

机构 * Faculty of Geo-Information Science and Earth Observation (ITC), University of Twente(特温特大学地理信息科学与地球观测学院(ITC))

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出基于RGB和LiDAR的增量语义辅助网格生成方法,通过直接标签转移提升几何重建精度,优于ImMesh和Voxblox,为XR和数字建模提供新路径。

Comments 8 pages, 5 figures, 2 tables. Accepted in ISPRS Archives 2026

详情

展开后加载摘要…

URL PDF HTML 收藏