arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-13 至 2026-04-13 共收录 47 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 47 篇

2604.08559 2026-04-13 cs.CL cs.AI 90%

Medical Reasoning with Large Language Models: A Survey and MR-Bench

基于大语言模型的医学推理:综述与MR-Bench

Xiaohan Ren, Chenxiao Fan, Wenyin Ma, Hongliang He, Chongming Gao, Xiaoyan Zhao, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) The First Affiliated Hospital of USTC(中国科学技术大学附属第一医院) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大语言模型在医学推理中的应用,提出MR-Bench基准测试,揭示了考试级性能与真实临床任务准确性之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03107 2026-04-13 cs.CL 89%

The Mask of Civility: Benchmarking Chinese Mock Politeness Comprehension in Large Language Models

礼貌的面具:在大型语言模型中基准测试中文虚伪礼貌理解

Yitong Zhang, Yuhan Xiang, Mingxuan Liu

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文从语用学角度评估大型语言模型在识别中文礼貌、不礼貌和虚伪礼貌现象中的表现差异,构建了结合真实和模拟中文话语的三类数据集,并通过六种代表性模型在四种提示条件下进行测试。

Comments Preprint

Journal ref International Conference in Applied Language Sciences (ALS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09029 2026-04-13 cs.CL cs.AI 88%

CONDESION-BENCH: Conditional Decision-Making of Large Language Models in Compositional Action Space

CONDESION-BENCH:大语言模型在组合动作空间中的条件决策

Yeonjun Hwang, Sungyong Park, Minju Kim, Dongha Lee, Jinyoung Yeo

机构 * Department of Artificial Intelligence, Yonsei University(延世大学人工智能系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CONDESION-BENCH基准,用于评估大语言模型在组合动作空间中的条件决策能力,通过引入变量、上下文和分配层级的显式条件限制,提升决策质量评估的严谨性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08884 2026-04-13 cs.CV cs.AI 88%

HM-Bench: A Comprehensive Benchmark for Multimodal Large Language Models in Hyperspectral Remote Sensing

HM-Bench:多模态大语言模型在高光谱遥感中的综合基准

Xinyu Zhang, Zurong Mai, Qingmei Li, Zjin Liao, Yibin Wen, Yuhang Chen, Xiaoya Fan, Chan Tsz Ho, Bi Tianyuan, Haoyuan Liang, Ruifeng Su, Zihao Qian, Juepeng Zheng, Jianxi Huang, Yutong Lu, Haohuan Fu

机构 * Sun Yat-sen University(中山大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) China Agricultural University(中国农业大学) Southwest Jiaotong University(西南交通大学) Southwest University(西南大学) National Supercomputing Center in Shenzhen(国家超级计算深圳中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出HM-Bench,首个用于评估多模态大语言模型在高光谱图像理解中的基准,通过构建19337对问题-答案对,探索模型在处理高维高光谱数据中的挑战,揭示视觉输入在空间-光谱推理中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16165 2026-04-13 cs.SE cs.AI cs.HC 88%

Investigating Multimodal Large Language Models to Support Usability Evaluation

探究多模态大语言模型以支持可用性评估

Sebastian Lubos, Alexander Felfernig, Damian Garber, Gerhard Leitner, Julian Schwazer, Manuel Henrich

机构 * Graz University of Technology(格拉茨技术大学) University of Klagenfurt(克拉根福大学) UNiQUARE Software Development GmbH(UNiQUARE软件开发有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文探讨了多模态大语言模型在可用性评估中的应用,通过优先级问题框架识别并排名可用性问题,比较了MLLM与专家评估结果,展示了交互可视化工具,并提出整合MLLM评估到实际开发流程的概念。

Comments To appear in the Proceedings of IEA/AIE 2026, Springer LNAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10277 2026-04-13 physics.comp-ph physics.optics 87%

MCP-Enabled LLM for Meta-optics Inverse Design: Leveraging Differentiable Solver without LLM Expertise

基于MCP的LLM用于元光学逆向设计:无需LLM专业知识即可利用可微求解器

Yi Huang, Bowen Zheng, Yunxi Dong, Hong Tang, Huan Zhao, S. M. Rakibul Hasan Shawon, Sensong An, Hualiang Zhang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出MCP框架,利用LLM生成逆向设计代码,通过动态访问验证代码模板和文档提升设计质量与效率,展示如何使复杂工具对非编程专家可用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09240 2026-04-13 cs.LG 85%

DiffHLS: Differential Learning for High-Level Synthesis QoR Prediction with GNNs and LLM Code Embeddings

DiffHLS: 基于GNN和LLM代码嵌入的高阶综合QoR预测差分学习

Zedong Peng, Zeju Li, Qiang Xu, Jieru Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 DiffHLS通过GNN和LLM代码嵌入预测高阶综合QoR,利用核基线与pragma插入设计变体的差分学习,降低合成成本,实验显示在PolyBench上优于GNN基线,且在ForgeHLS数据集上验证了可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08779 2026-04-13 cs.LG 85%

Adaptive Simulation Experiment for LLM Policy Optimization

面向LLM策略优化的自适应模拟实验

Mingjie Hu, Siyang Gao, Jian-qiang Hu, Enlu Zhou

机构 * School of Management, Fudan University(复旦大学管理学院) H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(佐治亚理工学院H. Milton Stewart工业与系统工程系) Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于配对比较的自适应模拟实验框架,用于从有限候选策略中识别最优策略。通过无结构和有结构策略空间,推导最优采样比例并证明算法在统计保证下达到基本数据要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09163 2026-04-13 cs.DB 85%

Evaluating Data Quality Tools: Measurement Capabilities and LLM Integration

评估数据质量工具:测量能力与LLM集成

Tobias Rehberger, Thomas Hütter, Lisa Ehrlinger, Wolfram Wöß

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文评估了六种数据质量工具,分析其测量能力与LLM集成程度,发现专有工具更全面,但开源工具需更多实施努力。LLM在数据验证中尚未被支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09418 2026-04-13 cs.CL cs.LG 84%

Automated Instruction Revision (AIR): A Structured Comparison of Task Adaptation Strategies for LLM

自动化指令修订(AIR):一种针对大语言模型任务适应策略的结构化比较

Solomiia Bilyk, Volodymyr Getmanskyi, Taras Firman

机构 * Eleks Ltd.(Eleks有限公司) Ukrainian Catholic University(乌克兰天主教大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了基于规则归纳的自动化指令修订(AIR)方法,用于在有限任务特定示例下适应大语言模型。通过比较多种适应策略在不同基准测试中的表现,发现任务依赖性显著,无单一方法在所有情况下占优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08947 2026-04-13 cs.CL cs.AI 82%

MuTSE: A Human-in-the-Loop Multi-use Text Simplification Evaluator

MuTSE:一种人机协同的多用途文本简化评估器

Rares-Alexandru Roscan, Gabriel Petre1, Adrian-Marius Dumitran, Angela-Liliana Dumitran

机构 * University of Bucharest(布加勒斯特大学) Universitatea Creștină "Dimitrie Cantemir"(迪米特里耶·坎泰米尔基督教大学) Cu Drag si Sport SRL(Cu Drag si Sport 有限责任公司) Softbinator Technologies(Softbinator 科技公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对LLM文本简化输出的系统性评估难题,MuTSE提出一种人机协同的交互式评估工具,支持多维度的提示-模型组合分析,通过语义对齐引擎和线性偏差启发式算法实现可视化对比,降低定性分析的认知负荷。

Comments Accepted for ITS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08561 2026-04-13 cs.CL cs.LG 81%

A Representation-Level Assessment of Bias Mitigation in Foundation Models

基础模型中偏见缓解的表示层面评估

Svetoslav Nizhnichenkov, Rahul Nair, Elizabeth Daly, Brian Mac Namee

机构 * IBM Research(IBM研究院) School of Computer Science, University College Dublin(都柏林大学计算机科学学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文通过对比基线与偏见缓解模型,分析了性别与职业术语在嵌入空间中的变化,发现偏见缓解减少了性别-职业差异,提出了WinoDec数据集用于评估解码器模型。

Comments Accepted at ECML-PKDD 2025 (5th Workshop on Bias and Fairness in AI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08553 2026-04-13 cs.LG cs.AI cs.CL 80%

GNN-as-Judge: Unleashing the Power of LLMs for Graph Learning with GNN Feedback

GNN-as-Judge: 通过GNN反馈释放LLM在图学习中的潜力

Ruiyao Xu, Kaize Ding

机构 * Northwestern University(西北大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GNN-as-Judge框架,通过结合GNN的结构归纳偏差,解决LLM在低资源条件下生成可靠伪标签和缓解标签噪声的问题,提升图学习性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27141 2026-04-13 cs.CL 79%

Routing Sensitivity Without Controllability: A Diagnostic Study of Fairness in MoE Language Models

在不可控性之外的路由敏感性:MoE语言模型中公平性的诊断研究

Junhyeok Lee, Kyu Sung Choi

机构 * Interdisciplinary Program in Cancer Biology, Seoul National University College of Medicine(首尔大学医学院癌症生物学跨学科项目) Department of Radiology, Seoul National University Hospital(首尔大学医院放射科) Department of Radiology, Seoul National University College of Medicine(首尔大学医学院放射科) Healthcare AI Research Institute, Seoul National University Hospital(首尔大学医院医疗AI研究所)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 研究探讨了MoE模型在路由层面的敏感性及其对公平性控制的限制,提出FARE框架揭示路由偏好变化的不可行性、非鲁棒性和高代价,指出解码生成中偏好转移的缺失,揭示专家组中偏见与核心知识的交织问题。

Comments 10 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07220 2026-04-13 cs.CL 79%

The Roots of Performance Disparity in Multilingual Language Models: Intrinsic Modeling Difficulty or Design Choices?

多语言语言模型性能差异的根本原因:内在建模难度还是设计选择?

Chen Shani, Yuval Reif, Nathan Roll, Dan Jurafsky, Ekaterina Shutova

机构 * Stanford University(斯坦福大学) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文探讨多语言模型性能差异的根源,分析语言差异是否源于建模选择而非语言固有复杂性,并提出改进设计以实现更平衡的多语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08602 2026-04-13 cs.DL cs.AI cs.LG 79%

TiAb Review Plugin: A Browser-Based Tool for AI-Assisted Title and Abstract Screening

TiAb Review Plugin:一种基于浏览器的AI辅助标题和摘要筛选工具

Yuki Kataoka, Masahiro Banno, Michihito Kyo, Shuri Nakao, Tomoo Sato, Shunsuke Taito, Tomohiro Takayama, Takahiro Tsuge, Yasushi Tsujimoto, Ryuhei So, Toshi A. Furukawa

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于浏览器的无代码、无服务器AI辅助标题和摘要筛选工具,结合大语言模型和机器学习主动学习,实现了高效的系统综述筛选。

Comments 25 pages, 2 figures. Abstract submitted to Cochrane Colloquium 2026. Code: https://github.com/youkiti/tiab-review-plugin

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07779 2026-04-13 cs.CV 78%

Plug-and-Play Logit Fusion for Heterogeneous Pathology Foundation Models

即插即用的逻辑融合用于异构病理基础模型

Gexin Huang, Anqi Li, Yusheng Tan, Beidi Zhao, Gang Wang, Zu-Hua Gao, Xiaoxiao Li

机构 * University of British Columbia(不列颠哥伦比亚大学) Washington University in St. Louis(圣路易斯华盛顿大学) Vector Institute(向量研究所)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出LogitProd方法,通过融合独立训练的病理基础模型预测器,实现高效且无需重新训练的多专家融合,提升异构模型在多种病理任务中的性能。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09212 2026-04-13 cs.CL cs.MA 77%

SPASM: Stable Persona-driven Agent Simulation for Multi-turn Dialogue Generation

SPASM:面向多轮对话生成的稳定人格驱动代理模拟

Han Luo, Guy Laban

机构 * University of Leeds(利兹大学) Southwest Jiaotong University(西南交通大学) Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SPASM框架,通过人格创建、对话生成和终止检测模块,提升多轮对话生成的稳定性,采用ECP方法减少人格漂移和回声现象。

Comments Accepted to Findings of the Association for Computational Linguistics (ACL 2026). Our code and data are available at https://github.com/lhannnn/SPASM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08987 2026-04-13 cs.AI 77%

PilotBench: A Benchmark for General Aviation Agents with Safety Constraints

PilotBench:一个具有安全约束的一般航空智能体基准

Yalun Wu, Haotian Liu, Zhoujun Li, Boyang Wang

机构 * School of Computing National University of Singapore China School of Informatics Xiamen University China CESS Beihang University China

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PilotBench通过对比LLM与传统预报器,评估飞行轨迹和姿态预测,揭示了传统方法在精度上的优势与LLM在指令遵循上的优势,指出LLM在高负荷阶段表现下降,推动混合架构的发展。

Comments Accepted at the 2026 IEEE International Joint Conference on Neural Networks (IJCNN 2026). 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07755 2026-04-13 cs.CL cs.SE 77%

An Empirical Analysis of Static Analysis Methods for Detection and Mitigation of Code Library Hallucinations

对检测和缓解代码库幻觉的静态分析方法的实证分析

Clarissa Miranda-Pena, Andrew Reeson, Cécile Paris, Josiah Poon, Jonathan K. Kummerfeld

机构 * The University of Sydney(悉尼大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过实证分析探讨静态分析方法在检测和缓解代码库幻觉中的效果,发现其能检测部分错误和幻觉,但存在局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09368 2026-04-13 cs.MM cs.CV 75%

Through Their Eyes: Fixation-aligned Tuning for Personalized User Emulation

通过他们的眼睛:基于注视点的个性化用户模拟调谐

Lingfeng Huang, Huizhong Guo, Tianjun Wei, Yingpeng Du, Zhu Sun

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出FixATE方法,通过将视觉语言模型的视觉注意力与用户特定的注视模式对齐,提升推荐系统模拟的准确性,实验表明这种对齐能有效提高点击预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08590 2026-04-13 cs.LG cs.AI 73%

AlphaLab: Autonomous Multi-Agent Research Across Optimization Domains with Frontier LLMs

AlphaLab:利用前沿大语言模型实现跨优化领域的自主多智能体研究

Brendan R. Hogan, Xiwen Chen, James T. Wilson, Kashif Rasul, Adel Boyarsky, Thomas Kamei, Anderson Schneider, Yuriy Nevmyvaka

机构 * Morgan Stanley(摩根士丹利)

专题命中 评测与基准 :LLM(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 AlphaLab通过自主研究系统,利用前沿大语言模型自动完成量化计算密集型领域的完整实验流程,展示了在CUDA内核优化、LLM预训练和交通预测中的显著性能提升。

Comments 43 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09285 2026-04-13 cs.AI 70%

SAGE: A Service Agent Graph-guided Evaluation Benchmark

SAGE:基于服务代理图的评估基准

Ling Shi, Yuqin Dai, Ziyin Wang, Ning Gao, Wei Zhang, Chaozheng Wang, Yujie Wang, Wei He, Jinpeng Wang, Deiyi Xiong

机构 * Tianjin University(天津大学) Tsinghua University(清华大学) Beihang University(北京航空航天大学) Beijing University of Posts and Telecommunications(北京邮电大学) The Chinese University of Hong Kong(香港中文大学) Independent Researcher(独立研究员)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SAGE基准,通过动态对话图验证逻辑合规性,解决现有基准无法评估多维度用户行为和SOP的问题,揭示模型在意图分类与后续动作推导间的执行差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07720 2026-04-13 cs.AI 70%

Towards Knowledgeable Deep Research: Framework and Benchmark

走向知识导向的深度研究:框架与基准

Wenxuan Liu, Zixuan Li, Long Bai, Chunmao Zhang, Fenghui Zhang, Zhuo Chen, Wei Li, Yuxin Zuo, Fei Wang, Bingbing Xu, Xuhui Jiang, Jin Zhang, Xiaolong Jin, Jiafeng Guo, Tat-Seng Chua, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出知识导向深度研究(KDR)任务,设计混合知识分析框架(HKA)并构建KDR-Bench基准,通过结构化与非结构化知识生成多模态报告,实验表明HKA在通用和知识导向指标上优于现有方法,且在视觉增强指标上超越Gemini DR代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08867 2026-04-13 cs.SD cs.AI 70%

AudioGuard: Toward Comprehensive Audio Safety Protection Across Diverse Threat Models

AudioGuard:面向多样化威胁模型的全面音频安全保护

Mintong Kang, Chen Fang, Bo Li

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出AudioGuard,通过SoundGuard和ContentGuard实现音频安全防护,针对音频特有的风险场景建立首个政策导向的音频安全基准,提升安全防护效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08615 2026-04-13 cs.CV cs.AI 70%

MARINER: A 3E-Driven Benchmark for Fine-Grained Perception and Complex Reasoning in Open-Water Environments

MARINER:一种基于3E驱动的基准,用于开放水域环境中的细粒度感知与复杂推理

Xingming Liao, Ning Chen, Muying Shu, Yunpeng Yin, Peijian Zeng, Zhuowei Wang, Nankai Lin, Lianglun Cheng

机构 * Guangdong University of Technology(广东工业大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MARINER基准,通过3E框架评估开放水域环境中的细粒度感知与复杂推理,揭示先进模型在复杂海洋场景中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08597 2026-04-13 cs.DB cs.AI 70%

STIndex: A Context-Aware Multi-Dimensional Spatiotemporal Information Extraction System

STIndex:一种基于上下文的多维时空信息提取系统

Wenxiao Zhang, Yu Liu, Qiang sun, Yihao Ding, Sirui Li, Yanbing Liu, Jin B. Hong, Wei Liu

机构 * The University of Western Australia(西澳大利亚大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) Murdoch University(莫道克大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 STIndex通过多维时空数据仓库提升无结构数据的提取效率,结合大语言模型实现上下文感知提取,提升时空实体识别精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07956 2026-04-13 cs.AI 70%

MONETA: Multimodal Industry Classification through Geographic Information with Multi Agent Systems

MONETA:通过地理信息和多智能体系统进行多模态行业分类

Arda Yüksel, Gabriel Thiem, Susanne Walter, Patrick Felka, Gabriela Alves Werb, Ivan Habernal

机构 * Trustworthy Human Language Technologies(可信人类语言技术实验室) Technical University of Darmstadt, Germany(德国达姆施塔特工业大学) Deutsche Bundesbank(德国联邦银行) Frankfurt University of Applied Sciences, Germany(德国法兰克福应用技术大学) Research Center for Trustworthy Data Science and Security, Ruhr University Bochum, Germany(德国波鸿鲁尔大学可信数据科学与安全研究中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MONETA,首个基于文本和地理空间数据的多模态行业分类基准,利用多智能体系统提升分类精度,实现62.10%和74.10%的分类性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09093 2026-04-13 cs.CR cs.CL 70%

Exploiting Web Search Tools of AI Agents for Data Exfiltration

利用AI代理的网络搜索工具进行数据外泄

Dennis Rall, Bernhard Bauer, Mohit Mittal, Thomas Fraunholz

机构 * Open Hippo GmbH(Open Hippo有限公司) University of Augsburg(奥格斯堡大学) Smart Labs AI GmbH(Smart Labs AI有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究分析了AI代理通过网络搜索工具进行数据外泄的攻击方式,探讨了模型大小、制造商及实现方式对漏洞的影响,并提出加强训练、建立攻击向量数据库和统一测试框架等安全措施。

Comments 9 pages, 6 figures, conference article

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08896 2026-04-13 cs.CV 67%

GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensing

GeoMMBench 和 GeoMMAgent:迈向地质科学和遥感领域的专家级多模态智能

Aoran Xiao, Shihao Cheng, Yonghao Xu, Yexian Ren, Hongruixuan Chen, Naoto Yokoya

机构 * RIKEN AIP(日本理化学研究所革新智能研究中心) Wuhan University(武汉大学) Linköping University(林雪平大学) University of Tokyo(东京大学) Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出 GeoMMBench 和 GeoMMAgent,通过综合多模态问答基准和多智能体框架,解决地质科学和遥感领域知识广、传感器异构、任务碎片化等挑战,提升专家级空间解释能力。

Comments CVPR 2026 Highlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏