arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-25 至 2026-03-25 共收录 246 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 46 篇

2603.22847 2026-03-25 cs.CV 50%

Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought

重新思考多模态链式推理的令牌级策略优化

Yunheng Li, Hangyi Kuang, Hengrui Zhang, Jiangxia Cao, Zhaojie Liu, Qibin Hou, Ming-Ming Cheng

机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出PEPO方法,通过令牌级分析多模态推理轨迹,结合感知先验和熵整合机制,提升多模态推理性能,实验显示在多种基准上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22641 2026-03-25 cs.CV 50%

Q-Tacit: Image Quality Assessment via Latent Visual Reasoning

Q-Tacit: 通过潜在视觉推理进行图像质量评估

Yuxuan Jiang, Yixuan Li, Hanwei Zhu, Siyue Teng, Fan Zhang, David Bull

机构 * Visual Information Lab, University of Bristol(布里斯托大学视觉信息实验室) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出Q-Tacit方法,通过在潜在质量空间中超越自然语言进行视觉推理,提升图像质量评估效果,实验表明其在更少token下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 66 篇

2603.22625 2026-03-25 cs.IR cs.CL 90%

Leveraging Large Language Models to Extract and Translate Medical Information in Doctors' Notes for Health Records and Diagnostic Billing Codes

利用大型语言模型提取和翻译医生笔记中的医疗信息用于健康记录和诊断收费代码

Peter Hartnett, Chung-Chi Huang, Sarah Hartnett, David Hartnett

机构 * Department of Computer Science & Information Technologies, Frostburg State University(弗罗斯堡州立大学计算机科学与信息科技系) Department of Emergency Medicine, FAU Charles E Schmidt College of Medicine(FAU查尔斯·E·施密特医学院急诊医学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文研究利用本地大语言模型提取医生笔记中的临床信息并翻译为ICD-10-CM诊断代码,探讨隐私保护下的医疗信息提取方法,发现需结合人类辅助以提高准确性。

Comments 45 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00026 2026-03-25 cs.LG cs.AI cs.CL cs.CY 90%

RedTopic: Toward Topic-Diverse Red Teaming of Large Language Models

RedTopic:迈向大语言模型的课题多样化红队测试

Jiale Ding, Xiang Zheng, Yutao Wu, Cong Wang, Wei-Bin Lee, Ling Pan, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) City University of Hong Kong(香港城市大学) Deakin University(德克萨斯大学) Hon Hai Research Institute(鸿海研究室) Hong Kong University of Science and Technology(香港理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RedTopic框架,通过上下文生成管道、聚合奖励设计和多目标RL训练循环,生成多样化对抗提示,提升红队测试的适应性和课题多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07396 2026-03-25 quant-ph cs.AI 89%

Automating quantum feature map design via large language models

通过大语言模型自动化量子特征图设计

Kenya Sakka, Kosuke Mitarai, Keisuke Fujii

机构 * Center for Quantum Information and Quantum Biology(量子信息与量子生物学中心) Graduate School of Engineering Science(工程科学研究生院) RIKEN Center for Quantum Computing(理化学研究所量子计算中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型自主生成、评估和优化量子特征图,通过实验在MNIST等数据集上实现超越现有量子特征图的性能,展示了闭环发现方法在量子电路设计中的应用价值。

Comments 39 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22291 2026-03-25 cs.CL 89%

Evaluating Large Language Models' Responses to Sexual and Reproductive Health Queries in Nepali

评估大型语言模型对尼泊尔性与生殖健康问题的回应

Medha Sharma, Supriya Khadka, Udit Chandra Aryal, Bishnu Hari Bhatta, Bijayan Bhattarai, Santosh Dahal, Kamal Gautam, Pushpa Joshi, Saugat Kafle, Shristi Khadka, Shushila Khadka, Binod Lamichhane, Shilpa Lamichhane, Anusha Parajuli, Sabina Pokharel, Suvekshya Sitaula, Neha Verma, Bishesh Khanal

机构 * Nepal Applied Mathematics and Informatics Institute for research(尼泊尔应用数学与信息学研究所) Partnership for Sustainable Development Nepal(尼泊尔可持续发展伙伴关系) Visible Impact(可见影响)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出LEAF框架,评估大型语言模型在尼泊尔性与生殖健康问题上的准确性、语言、可用性及安全性,发现仅35.1%的回应符合标准,揭示了当前模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20670 2026-03-25 cs.AI cs.MA 88%

Towards Intelligent Geospatial Data Discovery: a knowledge graph-driven multi-agent framework powered by large language models

迈向智能地理空间数据发现:一种由大型语言模型驱动的知识图谱多智能体框架

Ruixiang Liu, Zhenlong Li, Ali Khosravi Kazazi

机构 * Geoinformation and Big Data Research Laboratory, Department of Geography, The Pennsylvania State University(地理信息与大数据研究实验室,地理系,宾夕法尼亚州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出基于知识图谱的多智能体框架,利用大型语言模型提升地理空间数据发现的语义性和智能性,通过统一元数据本体和多智能体协作提高检索性能和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22777 2026-03-25 cs.AI 88%

AgriPestDatabase-v1.0: A Structured Insect Dataset for Training Agricultural Large Language Model

AgriPestDatabase-v1.0:用于训练农业大语言模型的结构化昆虫数据集

Yagizhan Bilal Durak, Ahsan Ul Islam, Shahidul Islam, Ashley Morgan-Olvera, Iftekhar Ibne Basith, Syed Hasib Akhter Faruqui

机构 * Sam Houston State University(萨姆豪斯敦州立大学) Kennesaw State University(肯纳威克州立大学)

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.AI

AI总结 本文提出AgriPestDatabase-v1.0,构建了结构化昆虫数据集并采用轻量级LLM进行微调,以提升农业害虫管理的决策支持能力。

Comments Accepted in Artificial Super Intelligence Conference 2026 (Sponsored by KSU PLOT & IEEE CIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05318 2026-03-25 cs.AI 88%

BIRD-INTERACT: Re-imagining Text-to-SQL Evaluation for Large Language Models via Lens of Dynamic Interactions

BIRD-INTERACT:通过动态交互视角重新审视大型语言模型的文本到SQL评估

Nan Huo, Xiaohan Xu, Jinyang Li, Per Jacobsson, Shipei Lin, Bowen Qin, Binyuan Hui, Xiaolong Li, Ge Qu, Shuzheng Si, Linheng Han, Edward Alexander, Xintong Zhu, Rui Qin, Ruihan Yu, Yiyao Jin, Feige Zhou, Weihao Zhong, Yun Chen, Hongyu Liu, Chenhao Ma, Fatma Ozcan, Yannis Papakonstantinou, Reynold Cheng

机构 * The University of Hong Kong(香港大学) Google Cloud(谷歌云) The BIRD Team(BIRD团队)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出BIRD-INTERACT基准,通过动态交互环境和双重评估设置,解决多轮对话中模糊查询和执行错误等问题,验证有效交互对复杂SQL任务的重要性。

Comments ICLR 2026 Oral. Dataset and code available at https://bird-interact.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22763 2026-03-25 cs.CV 88%

ENC-Bench: A Benchmark for Evaluating Multimodal Large Language Models in Electronic Navigational Chart Understanding

ENC-Bench:用于评估多模态大语言模型在电子航海图理解中的基准

Ao Cheng, Xingming Li, Xuanyu Ji, Xixiang He, Qiyao Sun, Chunping Qiu, Runke Huang, Qingyong Hu

机构 * National University of Defense Technology(国防科技大学) Intelligent Game and Decision Lab(智能游戏与决策实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 ENC-Bench是首个专注于专业电子航海图理解的基准,包含20490个经过专家验证的样本,评估了10种先进多模态大语言模型在符号识别、空间推理和航海决策中的表现,揭示了模型在符号 grounding、空间计算和多约束推理方面的系统性挑战。

Comments Accepted to CVPR 2026, Project page: https://qingyonghu.github.io/ENC-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07023 2026-03-25 q-fin.TR cs.AI 87%

Behavioral Consistency Validation for LLM Agents: An Analysis of Trading-Style Switching through Stock-Market Simulation

对LLM代理的行为一致性验证:通过股票市场模拟分析交易风格切换

Zeping Li, Guancheng Wan, Keyang Chen, Yu Chen, Yiwen Zhao, Philip Torr, Guangnan Ye, Zhenfei Yin, Hongfeng Chai

机构 * Fudan University(复旦大学) Wuhan University(武汉大学) BNP Paribas(BNP巴黎银行) Oxford University(牛津大学) Haven

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过股票市场模拟分析交易风格切换,评估LLM代理策略切换与金融理论的一致性,提出四个行为金融驱动因素作为性格特质,并通过Mann-Whitney U检验比较策略切换行为与理论的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08121 2026-03-25 cs.LG cs.AI cs.CL 87%

Balanced Accuracy: The Right Metric for Evaluating LLM Judges -- Explained through Youden's J statistic

平衡准确率:评估大语言模型判官的正确指标——通过Youden的J统计量解释

Stephane Collot, Colin Fraser, Justin Zhao, William F. Shen, Timon Willi, Ilias Leontiadis

机构 * Meta Superintelligence Labs(Meta超智能实验室) Meta University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过Youden的J统计量证明平衡准确率是评估LLM判官的更优指标,通过分析和实验展示其在选择判官时提升分类器鲁棒性的效果。

Comments 10 pages, 5 figures

Journal ref In Proceedings of the 19th Conference of the European Chapter of the Association for Computational Linguistics (Volume 5: Industry Track), pages 927-936, Rabat, Morocco, March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22386 2026-03-25 cs.AI cs.CL 86%

From Static Templates to Dynamic Runtime Graphs: A Survey of Workflow Optimization for LLM Agents

从静态模板到动态运行时图:LLM代理工作流优化的综述

Ling Yue, Kushal Raj Bhandari, Ching-Yun Ko, Dhaval Patel, Shuxin Lin, Nianjun Zhou, Jianxi Gao, Pin-Yu Chen, Shaowu Pan

机构 * Department of Computer Science, Rensselaer Polytechnic Institute(伦斯勒理工学院计算机科学系) IBM Research(IBM研究院) Department of Mechanical, Aerospace, and Nuclear Engineering, Rensselaer Polytechnic Institute(伦斯勒理工学院机械、航空航天与核工程系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了LLM代理工作流优化方法,区分静态与动态方法,探讨结构确定时间、优化部分及评估信号,提出结构感知评估视角以提升可比性和可复现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15994 2026-03-25 cs.CR cs.AI 85%

MCP Security Bench (MSB): Benchmarking Attacks Against Model Context Protocol in LLM Agents

MCP安全基准(MSB):针对LLM代理中模型上下文协议的攻击评估

Dongsen Zhang, Zekun Li, Xu Luo, Xuannan Liu, Peipei Li, Wenjun Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MSB,首个端到端评估套件,系统评估LLM代理在MCP全流程中的抗攻击能力,包含12种攻击类型及性能指标NRP,评估九种主流LLM代理在10个领域405种工具上的表现。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23279 2026-03-25 cs.SI cs.AI 85%

Emergence of Fragility in LLM-based Social Networks: the Case of Moltbook

基于大语言模型的社会网络中脆弱性的涌现:以Moltbook为例

Luca Sodano, Sofia Sciangula, Amulya Galmarini, Francesco Bertolotti

机构 * School of Industrial Engineering Intelligence, Complexity and Technology Lab (ICT Lab)(工业工程智能、复杂性与技术实验室) LIUC - Università Cattaneo Castellanza(LIUC-卡塔内奥卡斯泰尔兰扎大学) Università Cattaneo Castellanza(卡塔内奥卡斯泰尔兰扎大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究分析Moltbook平台中基于大语言模型的智能体交互网络,发现其连接模式高度异质,存在核心外围结构,对随机节点移除较 resilient,但对高连接节点的攻击易受破坏,揭示AI社交系统可能发展出集中化与结构性脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23073 2026-03-25 cs.SE cs.AI 85%

Can an LLM Detect Instances of Microservice Infrastructure Patterns?

LLM能否检测微服务基础设施模式的实例?

Carlos Eduardo Duarte, Neil B. Harrison, Filipe Figueiredo Correia, Ademar Aguiar, Pavlína Gonçalves

机构 * Department of Computer Science, Utah Valley University(计算机科学系,犹他谷大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过MicroPAD工具评估LLM检测建筑模式的能力,发现其在多语言和多类型 artifact 中的表现因模式普及度和独特性而异。

Comments Accepted at ICSA 2026 - International Conference on Software Architecture - Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23050 2026-03-25 cs.DB cs.AI 85%

DBAutoDoc: Automated Discovery and Documentation of Undocumented Database Schemas via Statistical Analysis and Iterative LLM Refinement

DBAutoDoc: 通过统计分析和迭代LLM细化实现未记录数据库模式的自动发现与文档化

Amith Nagarajan, Thomas Altman

机构 * Tasio Labs (a Blue Cypress company)(Tasio实验室(Blue Cypress公司旗下))

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DBAutoDoc通过统计分析与迭代LLM细化技术,自动发现并文档化未记录的关系数据库模式,其核心是通过图结构问题迭代解决,结合神经网络反向传播的结构,实现语义校正,最终在基准数据库上取得96.1%的综合评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22904 2026-03-25 cs.AI 85%

Separating Diagnosis from Control: Auditable Policy Adaptation in Agent-Based Simulations with LLM-Based Diagnostics

区分诊断与控制:基于LLM诊断的代理仿真中可审计的政策适应

Shaoxin Zhong, Yuchen Su, Michael Witbrock

机构 * University of Auckland, Auckland, New Zealand(奥克兰大学,新西兰奥克兰)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出三层框架,通过分离诊断与控制实现政策适应性和可审计性。LLM作为诊断工具评估群体状态并生成风险评估,确定性公式转化为可追溯的参数更新。实验显示显式控制规则在老年护理仿真中比黑盒LLM方法更高效且保持可审计性。

Comments This paper has been accepted at AAMAS 2026 Workshop MABS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22305 2026-03-25 cs.LG cs.AI 84%

CN-Buzz2Portfolio: A Chinese-Market Dataset and Benchmark for LLM-Based Macro and Sector Asset Allocation from Daily Trending Financial News

CN-Buzz2Portfolio: 一个面向中国市场、基于LLM的宏观与行业资产配置基准数据集

Liyuan Chen, Shilong Li, Jiangpeng Yan, Shuoling Liu, Qiang Yang, Xiu Li

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) E Fund Management Co., Ltd.(E基金管理有限公司) Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CN-Buzz2Portfolio数据集,用于评估LLM在动态金融决策中的表现,通过模拟真实市场关注流,测试模型在宏观叙事到资产配置的转换能力,揭示不同模型在资产分配上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22978 2026-03-25 cs.AI 83%

JFTA-Bench: Evaluate LLM's Ability of Tracking and Analyzing Malfunctions Using Fault Trees

JFTA-Bench:评估LLM在跟踪和分析故障中的能力

Yuhui Wang, Zhixiong Yang, Ming Zhang, Shihan Dou, Zhiheng Xi, Enyu Zhou, Senjie Jin, Yujiong Shen, Dingwei Zhu, Yi Dong, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出JFTA-Bench基准,用于评估LLM在复杂环境中的故障跟踪与分析能力,包含3130条记录,每条记录平均40.75轮对话,通过模拟用户错误场景评估模型任务跟踪与错误恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22935 2026-03-25 cs.AI cs.HC 83%

Ran Score: a LLM-based Evaluation Score for Radiology Report Generation

Ran Score:一种基于大语言模型的放射学报告生成评估分数

Ran Zhang, Yucong Lin, Zhaoli Su, Bowen Liu, Danni Ai, Tianyu Fu, Deqiang Xiao, Jingfan Fan, Yuanyuan Wang, Mingwei Gao, Yuwan Hu, Shuya Gao, Jingtao Li, Jian Yang, Hong Song, Hongliang Sun

机构 * School of Optics and Photonics, Beijing Institute of Technology(光学与光子学学院,北京理工大学) School of Medical Technology, Beijing Institute of Technology(医学技术学院,北京理工大学) Department of Radiology, China-Japan Friendship Hospital (Institute of Clinical Medical Sciences), Beijing 100029, China(日本友谊医院放射科(临床医学科学院),北京100029,中国) Chinese Academy of Medical Science & Peking Union Medical College, Beijing 100730, China(中国医学科学院 & 首都医科大学,北京100730,中国) Department of Radiology, Peking University China-Japan Friendship School of Clinical Medicine, Beijing 100029, China(北京大学日本友谊学校临床医学系放射科,北京100029,中国) Department of Gastroenterology, China-Japan Friendship Hospital, Beijing 100029, China(日本友谊医院消化内科,北京100029,中国) NHC Key Laboratory of Clinical Big Data Standardization & Integration, Beijing 100029, China(国家卫生健康委员会临床大数据标准化与整合关键实验室,北京100029,中国)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Ran Score,一种基于大语言模型的放射学报告生成评估指标,通过结合人类专业知识和大型语言模型,改进多标签发现提取,并在多个数据集中验证其有效性。

Comments 4 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22499 2026-03-25 cs.CR cs.LG 83%

OrgForge-IT: A Verifiable Synthetic Benchmark for LLM-Based Insider Threat Detection

OrgForge-IT:一种可验证的合成基准用于基于大语言模型的内部威胁检测

Jeffrey Flynt

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.LG

AI总结 本文提出OrgForge-IT,一种可验证的合成基准,通过确定性模拟引擎和语言模型生成表面文本,确保跨 artifact 一致性。研究发现多模型 leaderboard 显示,三类威胁和八种可注入行为的检测策略存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23142 2026-03-25 cs.SE 82%

Can Language Models Pass Software Testing Certification Exams? a case study

语言模型能否通过软件测试认证考试?一项案例研究

Fitash Ul Haq, Jordi Cabot

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

AI总结 研究评估了60种语言模型在ISTQB认证考试中的表现,探讨LLM在软件测试任务中的能力及考试设计改进建议。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22728 2026-03-25 cs.SD eess.AS 82%

The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models

2026年国际语音处理大会大型音频语言模型音频编码能力挑战

Heinrich Dinkel, Jiahao Zhou, Guanbo Wang, Yadong Niu, Junbo Zhang, Yufeng Hao, Ying Liu, Ke Li, Wenwu Wang, Zhiyong Wu, Jian Luan

机构 * MiLM Plus, Xiaomi Inc., Beijing, China(小米公司,北京) DataoceanAI Inc., USA(DataoceanAI公司,美国) Centre for Vision Speech and Signal Processing, University of Surrey, Guildford, UK(视觉语音与信号处理中心, Surrey大学, Guildford,英国) Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(深圳国际研究生院,清华大学,深圳,中国)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract)

AI总结 本文提出Interspeech 2026音频编码能力挑战,旨在评估和提升预训练音频编码器在大型音频语言模型中的性能,通过统一的生成评估框架XARES-LLM,评估编码器在多种下游任务中的表现。

Comments Interspeech 2026 Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23292 2026-03-25 cs.AI cs.CL 81%

LLM Olympiad: Why Model Evaluation Needs a Sealed Exam

LLM竞赛:为什么模型评估需要密封考试

Jan Christian Blaise Cruz, Alham Fikri Aji

机构 * MBZUAI(人工智能研究所)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过密封考试形式提升LLM评估的公正性与透明度,防止Benchmark追逐和测试内容泄露,确保结果可复现和审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23114 2026-03-25 cs.AI cs.CL cs.CY cs.HC 81%

Between Rules and Reality: On the Context Sensitivity of LLM Moral Judgment

规则与现实之间:关于大语言模型道德判断的上下文敏感性

Adrian Sauter, Mona Schirmer

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨大语言模型在不同上下文中的道德判断敏感性,通过引入上下文道德选择数据集,发现多数模型对上下文变化敏感,且与人类判断存在差异,提出激活引导方法以控制上下文敏感性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22717 2026-03-25 cs.CR cs.SE 80%

Does Teaming-Up LLMs Improve Secure Code Generation? A Comprehensive Evaluation with Multi-LLMSecCodeEval

多模型协同是否能提升安全代码生成?基于多LLMSecCodeEval的全面评估

Bushra Sabir, Shigang Liu, Seung Ick Jang, Sharif Abuadbba, Yansong Gao, Kristen Moore, SangCheol Kim, Hyoungshick Kim, Surya Nepal

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过多LLMSecCodeEval框架评估多模型协同对安全代码生成的影响,发现混合策略在安全性能上表现最佳,而模型规模并非安全保障的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22853 2026-03-25 cs.CR cs.AI 79%

Agent Audit: A Security Analysis System for LLM Agent Applications

代理审计:用于大语言模型代理应用的安全分析系统

Haiyue Zhang, Yi Nian, Yue Zhao

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出Agent Audit系统,用于检测LLM代理应用中的安全漏洞,通过数据流分析、凭证检测等方法,提高召回率并保持快速扫描速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22714 2026-03-25 cs.CY cs.AI 79%

PopResume: Causal Fairness Evaluation of LLM/VLM Resume Screeners with Population-Representative Dataset

PopResume:基于人口代表性数据集的LLM/VLM简历筛选器因果公平性评估

Sumin Yu, Juhyeon Park, Taesup Moon

机构 * ECE, Seoul National University(首尔国立大学电子与计算机工程系) IPAI, Seoul National University(首尔国立大学人工智能研究所) ASRI / INMC / AIIS, Seoul National University(首尔国立大学人工智能研究所)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 PopResume通过人口统计数据和自然属性关系,实现对LLM和VLM简历筛选系统的因果公平性评估,识别出五种传统指标无法捕捉的歧视模式。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26865 2026-03-25 cs.CV cs.AI 79%

Do Vision-Language Models Measure Up? Benchmarking Visual Measurement Reading with MeasureBench

视觉语言模型能否胜任?通过MeasureBench评估视觉测量阅读

Fenfen Lin, Yesheng Liu, Haiyu Xu, Chen Yue, Zheqi He, Mingxuan Zhao, Miguel Hu Chen, Jiakang Liu, JG Yao, Xi Yang

机构 * BAAI FlagEval Team(BAAI FlagEval团队)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出MeasureBench基准测试,评估视觉语言模型在测量阅读任务中的表现,发现即使最强模型也难以处理,通过强化微调提升性能,揭示了当前模型在细粒度空间定位上的局限。

Comments Project page: https://flageval-baai.github.io/MeasureBenchPage/

详情

展开后加载摘要…

URL PDF HTML 收藏