arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-17 至 2026-03-17 共收录 507 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 110 篇

2508.04045 2026-03-17 cs.LG 79%

FeDaL: Federated Dataset Learning for General Time Series Foundation Models

FeDaL:联邦数据学习用于通用时间序列基础模型

Shengchao Chen, Guodong Long, Michael Blumenstein, Jing Jiang

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出FeDaL方法,通过联邦学习 paradigm 解决时间序列异质性问题,通过DBE和GBE机制消除偏差,验证了跨数据集泛化能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13385 2026-03-17 cs.CV cs.AI cs.CR cs.IR 79%

VisualLeakBench: Auditing the Fragility of Large Vision-Language Models against PII Leakage and Social Engineering

VisualLeakBench: 对大型视觉-语言模型在PII泄露和社会工程中的脆弱性进行审计

Youting Wang, Yuan Tang, Yitian Qian, Chen Zhao

机构 * Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学) New York University(纽约大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出VisualLeakBench,通过合成对抗图像评估LVLMs对OCR注入和PII泄露的鲁棒性,揭示了Claude~4在PII识别上的高风险及防御策略的模板依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23410 2026-03-17 cs.AI 79%

Bid2X: Revealing Dynamics of Bidding Environment in Online Advertising from A Foundation Model Lens

Bid2X:从基础模型视角揭示在线广告中拍卖环境的动态

Jiahao Ji, Tianyu Wang, Yeshu Li, Yushen Huo, Zhilin Zhang, Chuan Yu, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出Bid2X基础模型,通过统一函数估计特定拍卖下的效果,结合注意力机制和融合模块,实现跨场景的拍卖策略优化,实验显示其在GMV和ROI上均优于基线模型。

Comments 12 pages, KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15309 2026-03-17 cs.CL cs.AI 79%

CCTU: A Benchmark for Tool Use under Complex Constraints

CCTU:一种复杂约束下的工具使用基准

Junjie Ye, Guoqiang Zhang, Wenjie Fu, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CCTU基准,用于评估大语言模型在复杂约束下的工具使用能力,通过200个精心设计的测试案例,揭示模型在约束遵循和自我完善方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06955 2026-03-17 cs.CL cs.AI 79%

BIS Reasoning 1.0: The First Large-Scale Japanese Benchmark for Belief-Inconsistent Syllogistic Reasoning

BIS推理1.0:首个大规模日语信念不一致三段论基准数据集

Ha-Thanh Nguyen, Hideyuki Tachibana, Chaoran Liu, Qianying Liu, Su Myat Noe, Koichi Takeda, Sadao Kurohashi

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BIS推理1.0,首个针对大语言模型信念不一致推理评估的日语三段论数据集,通过系统引入逻辑有效但信念不一致的三段论,揭示信念偏差问题,并评估多种模型在零样本下的表现。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14525 2026-03-17 cs.CL cs.AI 79%

MALicious INTent Dataset and Inoculating LLMs for Enhanced Disinformation Detection

恶意意图数据集与增强虚假信息检测的LLM接种

Arkadiusz Modzelewski, Witold Sosnowski, Eleni Papadopulos, Elisa Sartori, Tiziano Labruna, Giovanni Da San Martino, Adam Wierzbicki

专题命中 评测与基准 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MALINT数据集,通过专家事实核查员标注,用于评估12种语言模型在意图分类任务中的表现,并提出基于意图的接种方法,通过整合意图分析来缓解虚假信息的说服力。

Comments Paper accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14078 2026-03-17 cs.CL cs.LG 79%

CMHL: Contrastive Multi-Head Learning for Emotionally Consistent Text Classification

CMHL:基于情感一致性的文本情感分类的对比多头学习

Menna Elgabry, Ali Hamdi, Khaled Shaban

专题命中 评测与基准 :large language model(abstract);language model(abstract);SLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出CMHL模型,通过多任务学习、心理基础辅助监督和对比矛盾损失,提升情感一致性,实现优于大模型的F1分数和跨领域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11578 2026-03-17 cs.CL cs.AI 79%

Multi-Agent LLMs for Generating Research Limitations

多智能体大语言模型用于生成研究局限性

Ibrahim Al Azher, Zhishuai Guo, Hamed Alhoori

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出多智能体框架生成研究局限性,结合OpenReview评论和作者声明,利用引用论文捕捉上下文缺陷,通过不同角色智能体系统识别显性、隐性、同行评审和文献相关局限性,提升局限性描述的准确性。

Comments 18 Pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13636 2026-03-17 cs.CL cs.AI cs.CY 79%

Widespread Gender and Pronoun Bias in Moral Judgments Across LLMs

大范围性别和代词偏见在LLM道德判断中的表现

Gustavo Lúcius Fernandes, Jeiverson C. V. M. Santos, Pedro O. S. Vaz-de-Melo

机构 * Universidade Federal de Minas Gerais(巴西米纳斯吉拉斯联邦大学) Instituto Kunumi(昆米研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过分析不同LLM对公平性判断的偏见,发现代词和性别标记显著影响道德分类,非二元性别受青睐,男性受歧视,需改进公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15557 2026-03-17 cs.CV 78%

Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models

Lie的解剖:一种多阶段诊断框架,用于追踪视觉-语言模型中的幻觉

Lexiang Xiong, Qi Li, Jingwen Ye, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Monash University(墨尔本大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出一种多阶段诊断框架,通过动态认知轨迹分析视觉-语言模型中的幻觉问题,结合几何信息双重视角,实现高效且鲁棒的幻觉检测,提升模型透明度和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17130 2026-03-17 cs.CV 78%

Structural Damage Detection Using AI Super Resolution and Visual Language Model

利用人工智能超分辨率和视觉语言模型进行结构损伤检测

Catherine Hoier, Khandaker Mamun Ahmed

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出一种低成本框架,结合无人机视频、AI超分辨率模型和视觉语言模型,用于快速准确评估自然灾害中的结构损伤,实现84.5%的分类准确率。

Journal ref International Conference on Machine Learning and Applications, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21509 2026-03-17 cs.CV 78%

Curing Semantic Drift: A Dynamic Approach to Grounding Generation in Large Vision-Language Models

消除语义漂移:一种动态方法用于在大视觉-语言模型中进行生成基础

Jiahe Chen, Jiaying He, Qiyuan Chen, Qian Shao, Jiahe Ying, Hongxia Xu, Jintai Chen, Jianwei Zheng, Jian Wu

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出DLC方法,通过动态校准logits来减少大视觉-语言模型中的语义漂移,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14633 2026-03-17 cs.CR cs.PF 78%

When Scanners Lie: Evaluator Instability in LLM Red-Teaming

当扫描器撒谎:在LLM红队测试中的评估者不稳定性

Lidor Erez, Omer Hofman, Tamir Nizri, Roman Vainshtein

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文研究了LLM安全评估中评估者不稳定性问题,提出了一种可靠性意识的评估框架,通过量化评估者分歧和验证方法提升评估准确性,发现22个攻击类别存在评估不稳定现象,使评估准确率从72%提升至89%。

Comments Submitted to the EvalEval Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15187 2026-03-17 cs.CL 77%

The Hrunting of AI: Where and How to Improve English Dialectal Fairness

AI的提升:在哪里以及如何改进英语方言公平性

Wei Li, Adrian de Wynter

机构 * Boston College(波士顿学院) Microsoft(微软) The University of York(约克大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了数据质量和可用性对改进LLM在英语方言中的性能的影响,发现人类间的一致性直接影响LLM作为评判者的性能,并指出需谨慎评估数据以确保公平性和包容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15117 2026-03-17 cs.CL 77%

MMKU-Bench: A Multimodal Update Benchmark for Diverse Visual Knowledge

MMKU-Bench:一种多模态更新基准,用于多样化视觉知识

Baochen Fu, Yuntao Du, Cheng Chang, Baihao Jin, Wenzhi Deng, Muhao Xu, Hongmei Yan, Weiye Song, Yi Wan

机构 * Shandong University, Jinan, China(山东大学,济南,中国)

专题命中 评测与基准 :pretraining(abstract);SFT(abstract);RLHF(abstract);分类 cs.CL

AI总结 本文提出MMKU-Bench,用于评估多模态知识更新,包含25k以上知识实例和49k张图像,涵盖更新知识和未知知识两种场景,评估SFT、RLHF和KE等方法,发现SFT和RLHF易遗忘,KE保留能力但更新有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07610 2026-03-17 cs.CV cs.CL cs.HC 77%

SpatialViz-Bench: A Cognitively-Grounded Benchmark for Diagnosing Spatial Visualization in MLLMs

SpatialViz-Bench:一种基于认知的多模态基准,用于诊断大语言模型中的空间可视化能力

Siting Wang, Minnan Pei, Luoyang Sun, Cheng Deng, Yuchen Li, Kun Shao, Zheng Tian, Haifeng Zhang, Jun Wang

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出SpatialViz-Bench,一个包含12个任务和4种子能力的多模态基准,通过1180个程序生成问题评估大语言模型的空间可视化能力,揭示了模型在空间任务中的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14111 2026-03-17 cs.CL 77%

OasisSimp: An Open-source Asian-English Sentence Simplification Dataset

OasisSimp:一个开源的亚洲-英语句子简化数据集

Hannah Liu, Muxin Tian, Iqra Ali, Haonan Gao, Qiaoyiwen Wu, Blair Yang, Uthayasanker Thayasivam, En-Shiun Annie Lee, Pakawat Nakwijit, Surangika Ranathunga, Ravi Shekhar

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出OasisSimp数据集,涵盖五种语言的句子简化任务,揭示了多语言环境下低资源语言的简化挑战,为未来研究提供基准。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18204 2026-03-17 cs.CR cs.LG cs.SE 77%

RESCUE: Retrieval Augmented Secure Code Generation

RESCUE:检索增强型安全代码生成

Jiahao Shi, Tianyi Zhang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 RESCUE通过构建混合知识库和分层多维检索提升安全代码生成,实验显示其在SecurePass@1指标上平均提升4.8点,达到新水平。

Comments Accepted to ICLR'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09295 2026-03-17 cs.CL 77%

MaP: A Unified Framework for Reliable Evaluation of Pre-training Dynamics

MaP:预训练动态可靠评估的统一框架

Jiapeng Wang, Changxin Tian, Kunlong Chen, Ziqi Liu, Jiaxin Mao, Wayne Xin Zhao, Zhiqiang Zhang, Jun Zhou

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MaP框架,通过整合检查点合并与Pass@k指标,解决预训练过程中参数和评估不稳定问题,提升模型训练动态评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13362 2026-03-17 cs.SD cs.AI eess.AS 77%

Patient-Level Multimodal Question Answering from Multi-Site Auscultation Recordings

多站点听诊录音的患者级多模态问答

Fan Wu, Tsai-Ning Wang, Nicolas Zumarraga, Ning Wang, Markus Kreft, Kevin O'Sullivan, Elgar Fleisch, Oliver Aalami, Paul Schmiedmayer, Robert Jakob, Patrick Langer

机构 * Agentic Systems Lab, ETH Zurich(伦理学院系统实验室,苏黎世联邦理工学院) Eindhoven University of Technology(埃因霍温理工大学) Centre for Digital Health Interventions, ETH Zurich(数字健康干预中心,苏黎世联邦理工学院) Centre for Digital Health Interventions, University of St. Gallen(数字健康干预中心,圣加尔登大学) Stanford Mussallem Center for Biodesign, Stanford University(斯坦福穆萨勒姆生物设计中心,斯坦福大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过门控交叉注意力将多站点听诊录音与冻结的大语言模型嵌入空间对齐,实现患者级评估,在CaReSound基准上取得SOTA结果,展示轻量领域特定编码器与多站点聚合的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07427 2026-03-17 cs.AI cs.CR 77%

AutoControl Arena: Synthesizing Executable Test Environments for Frontier AI Risk Evaluation

AutoControl Arena:为前沿AI风险评估合成可执行测试环境

Changyi Li, Pengfei Lu, Xudong Pan, Fazl Barez, Min Yang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AutoControl Arena框架,通过逻辑-叙述解耦原理,结合可执行代码与LLM生成动态,有效缓解逻辑幻觉并提升灵活性,验证了在压力下AI风险显著增加,揭示了不同模型在安全性和对齐性上的差异。

Comments Project page: https://cosmosyi.github.io/AutoControl-Arena/; Code: https://github.com/CosmosYi/AutoControl-Arena/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14328 2026-03-17 cs.SD eess.AS 75%

CodecMOS-Accent: A MOS Benchmark of Resynthesized and TTS Speech from Neural Codecs Across English Accents

CodecMOS-Accent:神经编码器与TTS语音跨英语口音的MOS基准

Wen-Chin Huang, Nicholas Sanders, Erica Cooper

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出CodecMOS-Accent数据集,用于评估神经音频编码器和基于LLM的TTS模型,尤其针对非标准语音如口音。数据集包含24系统生成的4000个样本,涵盖10种口音,通过大规模主观测试收集19600条注解,揭示了说话人与口音相似性之间的紧密关系及客观指标的预测能力。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14326 2026-03-17 cs.LG cs.AI cs.CL 75%

ECG-Reasoning-Benchmark: A Benchmark for Evaluating Clinical Reasoning Capabilities in ECG Interpretation

ECG-Reasoning-Benchmark: 一个用于评估心电图解读中临床推理能力的基准

Jungwoo Oh, Hyunseung Chung, Junhee Lee, Min-Gyu Kim, Hangyul Yoon, Ki Seong Lee, Youngchae Lee, Muhan Yeo, Edward Choi

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ECG-Reasoning-Benchmark,通过6400个样本系统评估17种核心心电图诊断的逐步推理能力,发现现有多模态大语言模型在多步逻辑推理中存在严重缺陷,无法有效将心电图发现与实际信号证据关联。

Comments Preprint. 9 pages for main text, 2 pages for references, 19 pages for supplementary materials (appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03195 2026-03-17 cs.CE 75%

From Text to Alpha: Can LLMs Track Evolving Signals in Corporate Disclosures?

从文本到Alpha:LLMs能否追踪企业披露中演变的信号?

Chanyeol Choi, Yoon Kim, Yu Yu, Young Cha, V. Zach Golkhou, Igor Halperin, Georgios Papaioannou, Minkyu Kim, Zhangyang Wang, Jihoon Kwon, Minjae Kim, Alejandro Lopez-Lira, Yongjae Lee

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文探讨LLMs能否从企业披露中提取出预测超额收益的语义信号,通过提取文本跨度和嵌入相似性量化语义变化,实现风险调整后的超额收益提升。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14822 2026-03-17 cs.IR 75%

A Survey of Model Architectures in Information Retrieval

信息检索中模型架构的综述

Zhichao Xu, Fengran Mo, Zhiqi Huang, Crystina Zhang, Puxuan Yu, Bei Wang, Jimmy Lin, Vivek Srikumar

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文综述了信息检索中模型架构的发展,重点探讨了特征提取的骨干模型和端到端的相关性估计系统,分析了传统术语检索模型向神经网络方法的转变,以及Transformer架构和大语言模型的影响。

Comments TMLR camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13411 2026-03-17 cs.SE cs.HC 75%

Human in the Loop for Fuzz Testing: Literature Review and the Road Ahead

人机协同的模糊测试:文献综述与未来之路

Jiongchi Yu, Xiaolin Wen, Sizhe Cheng, Xiaofei Xie, Qiang Hu, Yong Wang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文综述了人机协同模糊测试的研究现状,提出未来研究方向,强调可视化技术、实时干预和人机协作的重要性,旨在提升模糊测试效率。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13201 2026-03-17 q-bio.GN cs.AI cs.MA 74%

Benchmarking LLM-based agents for single-cell omics analysis

对基于大语言模型的代理在单细胞组学分析中的性能评估

Yang Liu, Lu Zhou, Xiawei Du, Ruikun He, Xuguang Zhang, Rongbo Shen, Yixue Li

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 本文提出一个评估系统,用于严格评估代理在单细胞组学分析中的能力,发现Grok3-beta在测试框架中表现最佳,多代理框架通过角色分工提升协作与执行效率。

Comments please see clear figures in this version. 6 main figures; 13 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14400 2026-03-17 cs.CL cs.AI 73%

Extending Minimal Pairs with Ordinal Surprisal Curves and Entropy Across Applied Domains

扩展最小配对以 ordinal 惊喜曲线和熵在应用领域中

Andrew Katz

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过 ordinal 惊喜曲线和熵评估语言模型在多个应用领域中的分类和评分任务,解决传统二元对比方法的局限性,提供更全面的模型不确定性和响应分析。

Comments 34 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13972 2026-03-17 cs.CL cs.AI 73%

FLUX: Data Worth Training On

FLUX:用于训练的数据价值

Gowtham, Sai Rupesh, Sanjay Kumar, Saravanan, Venkata Chaithanya

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 FLUX提出了一种预处理流程,通过最大化token保留同时确保高质量,使模型在训练数据上取得更高准确率和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09994 2026-03-17 cs.CL cs.AI 73%

Evaluating Adjective-Noun Compositionality in LLMs: Functional vs Representational Perspectives

评估大语言模型中的形容词-名词组合性:功能视角与表征视角

Ruchira Dhar, Qiwei Peng, Anders Søgaard

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨LLM在形容词-名词组合性任务中的表现,发现模型内部状态与任务性能存在差异,强调对比评估的重要性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏