arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-21 至 2026-04-21 共收录 803 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 186 篇

2509.11206 2026-04-21 cs.HC cs.AI cs.CL 90%

Evalet: Evaluating Large Language Models through Functional Fragmentation

Evalet:通过功能碎片化评估大型语言模型

Tae Soo Kim, Heechan Lee, Yoonjoo Lee, Joseph Seering, Juho Kim

机构 * School of Computing, KAIST(韩国庆北大学计算机学院) Computer Science and Engineering, University of Michigan(美国密歇根大学计算机科学与工程学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过功能碎片化方法,分析生成AI输出中的关键片段,揭示其在评估标准下的作用,帮助用户发现更多模型输出中的问题。

Comments The first two authors hold equal contribution. Presented at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17366 2026-04-21 cs.CL cs.AI 90%

ArgBench: Benchmarking LLMs on Computational Argumentation Tasks

ArgBench:对计算论证任务的LLM基准测试

Yamen Ajjour, Carlotta Quensel, Nedim Lipka, Henning Wachsmuth

机构 * Leibniz University Hannover(汉诺威莱布尼茨大学) Adobe Research(Adobe研究)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ArgBench,首个用于评估LLM在计算论证任务中性能的基准,涵盖33个数据集,评估五种LLM家族在46种任务中的泛化能力,分析少样本示例、推理步骤、模型大小和训练技能对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17312 2026-04-21 cs.LG cs.AI 90%

A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions

面向大数据稀缺性的大型语言模型强化学习综述:挑战与解决方案

Zhiyin Yu, Yuchen Mou, Juncheng Yan, Junyu Luo, Chunchun Chen, Xing Wei, Yunhui Liu, Hongru Sun, Yuxing Zhang, Jun Xu, Yatao Bian, Ming Zhang, Wei Ye, Tieke He, Jie Yang, Guanjie Zheng, Zhonghai Wu, Bo Zhang, Lei Bai, Xiao Luo

机构 * Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) Nankai University(南开大学) Tongji University(同济大学) Nanjing University(南京大学) University of Wollongong(沃林根大学) Shanghai Jiao Tong University(上海交通大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了在数据稀缺条件下大型语言模型强化学习的挑战与解决方案,提出三级框架,梳理现有方法并分析其优劣,为高效强化学习提供理论基础。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06201 2026-04-21 cs.CL cs.AI 90%

Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models

超越事实:大型语言模型分布式阅读理解基准测试

Pei-Fu Guo, Ya-An Tsai, Chun-Chia Hsu, Kai-Xin Chen, Yun-Da Tsai, Kai-Wei Chang, Nanyun Peng, Mi-Yen Yeh, Shou-De Lin

机构 * National Taiwan University(国立台湾大学) University of California, Los Angeles(加州大学洛杉矶分校) Academia Sinica, Taiwan(台湾“中央研究院”) NTU AI-CoRE(国立清华大学AI研究中心)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文提出Text2DistBench基准测试,评估LLM从自然语言中推断分布知识的能力,通过真实YouTube评论数据,测试模型在估计评论比例和识别高频主题方面的表现,揭示LLM在分布式阅读理解中的能力和局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16846 2026-04-21 cs.AI cs.CL 90%

BASIL: Bayesian Assessment of Sycophancy in LLMs

BASIL:大型语言模型中趋炎附势行为的贝叶斯评估

Katherine Atwell, Pedram Heydari, Anthony Sicilia, Malihe Alikhani

机构 * Northeastern University(东北大学) Johns Hopkins University(约翰霍普金斯大学) West Virginia University(西弗吉尼亚大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出BASIL框架,通过贝叶斯方法区分LLM中的趋炎附势行为与理性信念更新,评估模型在不确定任务中的理性表现,展示校准和微调策略能有效减少贝叶斯不一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23542 2026-04-21 cs.CL cs.AI cs.LG 89%

On the Shelf Life of Fine-Tuned LLM-Judges: Future-Proofing, Backward-Compatibility, and Question Generalization

大语言模型判官的保质期:未来证明、向后兼容性和问题泛化

Janvijay Singh, Austin Xu, Yilun Zhou, Yefan Zhou, Dilek Hakkani-Tur, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Dartmouth College(达特茅斯学院)

专题命中 评测与基准 :LLM(title,abstract);SFT(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了细调判官模型在现实部署中的挑战,探讨了未来证明、向后兼容性和问题泛化三个核心问题,并通过实验发现持续学习在适应响应分布变化方面表现更优。

Comments Updated after ICLR 2026 Acceptance; 29 pages;

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10687 2026-04-21 cs.AI cs.CY 89%

Safe for Whom? Rethinking How We Evaluate the Safety of LLMs for Real Users

为谁安全?重新思考如何为真实用户评估LLM的安全性

Manon Kempermann, Sai Suresh Macharla Vasu, Mahalakshmi Raveenthiran, Theo Farrell, Ingmar Weber

机构 * Interdisciplinary Institute for Societal Computing(社会计算跨学科研究所)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了评估LLM对真实用户安全性的挑战,指出需考虑用户情境差异,通过测试不同LLM在金融和健康建议上的表现,发现用户背景影响评估结果,且仅依赖用户披露信息不足以提升安全性评估。

Comments Paper accepted at IASEAI'26; please cite that peer-reviewed version instead

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16729 2026-04-21 cs.CV cs.AI 89%

Agentic Large Language Models for Training-Free Neuro-Radiological Image Analysis

基于代理的大型语言模型用于无训练神经放射学图像分析

Ayhan Can Erdur, Daniel Scholz, Jiazhen Pan, Benedikt Wiestler, Daniel Rueckert, Jan C. Peeken

机构 * Department of Radiation Oncology, TUM University Hospital, Munich, Germany(放射肿瘤科,慕尼黑技术大学医院,德国) Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM)(人工智能在医疗和健康领域的主任,慕尼黑技术大学) Chair for AI for Image-Guided Diagnosis and Therapy, Technical University of Munich (TUM)(人工智能在影像引导诊断和治疗领域的主任,慕尼黑技术大学) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),德国慕尼黑) Department of Computing, Imperial College London, London, UK(计算系,伦敦帝国学院,英国伦敦) Deutsches Konsortium für Translationale Krebsforschung (DKTK), Partner Site Munich, Munich, Germany(德国转化癌症研究联盟(DKTK),慕尼黑分部,德国慕尼黑)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 本文提出一种无训练代理框架,利用外部工具实现脑MRI分析,涵盖预处理、病灶分割和体积分析,并通过公开BraTS数据集评估代理AI在神经放射学任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16387 2026-04-21 cs.IR cs.AI cs.DL 89%

Large language models for post-publication research evaluation: Evidence from expert recommendations and citation indicators

基于大语言模型的发表后研究评估:专家推荐与引用指标的证据

Mengjia Wu, Yi Zhang, Robin Haunschild, Lutz Bornmann

机构 * Australian Artificial Intelligence Institute, Faculty of Engineering and Information Technology, University of Technology Sydney(澳大利亚人工智能研究所,工程与信息科技学院,新南威尔士大学) Max Planck Institute for Solid State Research(马克斯·普朗克固体物理研究所) Science Policy and Strategy Department, Administrative Headquarters of the Max Planck Society(马克斯·普朗克学会科学政策与战略部门,行政总部)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文探讨大语言模型在发表后同行评审中的应用,通过专家判断和引用指标对比,发现其在粗粒度评估中表现良好,但在细粒度评分上效果下降,监督微调效果最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04815 2026-04-21 cs.CL cs.AI 89%

LiveFact: A Dynamic, Time-Aware Benchmark for LLM-Driven Fake News Detection

LiveFact:一种动态、时间感知的LLM驱动虚假新闻检测基准

Cheng Xu, Changhong Jin, Yingjie Niu, Nan Yan, Yuke Mei, Shuhao Guan, Liming Chen, M-Tahar Kechadi

机构 * University College Dublin(都柏林大学) Georgia Institute of Technology(佐治亚理工学院) Dalian University of Technology(大连理工大学) Bebxy(贝比)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LiveFact引入动态时间感知基准,评估模型在处理演进不完整信息时的推理能力,发现传统静态基准无法检测的推理差距。

Comments ACL 2026 Main; Homepage at https://livefact.bebxy.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16872 2026-04-21 cs.DL 89%

Do Large Language Models know Which Published Articles have been Retracted?

Mike Thelwall

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17008 2026-04-21 cs.CL 89%

BIASEDTALES-ML: A Multilingual Dataset for Analyzing Narrative Attribute Distributions in LLM-Generated Stories

BIASEDTALES-ML:一个多语言数据集用于分析LLM生成故事中的叙述属性分布

Yuxuan Ouyang, yingfeng luo, JingBo Zhu, Tong Xiao

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,中国沈阳) NiuTrans Research, Shenyang, China(NiuTrans研究院,中国沈阳)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出BiasedTales-ML数据集,通过多语言生成分析叙述属性分布,揭示跨语言生成模式的差异,强调英语中心评估的局限性。

Comments Accepted to ACL 2026 Findings. Data are available at https://huggingface.co/spaces/Linyuana/BIASEDTALES-ML

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17730 2026-04-21 cs.CL cs.AI cs.HC 88%

MHSafeEval: Role-Aware Interaction-Level Evaluation of Mental Health Safety in Large Language Models

MHSafeEval:面向大语言模型中心理健康安全的交互层面角色感知评估

Suhyun Lee, Palakorn Achananuparp, Neemesh Yadav, Ee-Peng Lim, Yang Deng

机构 * Department of Artificial Intelligence, Hanyang University(翰艺大学人工智能系) School of Computing and Information Systems, Singapore Management University(新加坡国立管理学院信息系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MHSafeEval框架,通过角色感知模型评估大语言模型在多轮对话中的心理健康安全问题,揭示角色依赖性和累积性安全故障,提升故障模式覆盖和诊断精度。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18038 2026-04-21 cs.CY cs.AI 88%

First, Do No Harm (With LLMs): Mitigating Racial Bias via Agentic Workflows

首先,不要伤害(与LLM一起):通过代理工作流减轻种族偏见

Sihao Xing, Zaur Gouliev

机构 * School of Enterprise Computing and Digital Transformation(企业计算与数字化转型学院) Technological University Dublin(都柏林技术大学) School of Information and Communication Studies(信息与传播研究学院) University College Dublin(都柏林大学学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过代理工作流评估医疗LLM中的种族偏见,发现DeepSeek V3在诊断任务中表现最佳,嵌入代理工作流后显著降低偏见指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16646 2026-04-21 cs.AI 88%

SMART: Self-Generating and Self-Validating Multi-Dimensional Assessment for LLMs' Mathematical Problem Solving

SMART: 自生成和自验证的多维评估用于LLM的数学问题解决

Yujie Hou, Mei Wang, Yaoyao Zhong, Ting Zhang, Xuetao Ma, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Beijing Key Laboratory of Artificial Intelligence for Education Engineering Research Center of Intelligent Technology and Educational Application, Ministry of Education(北京市教育厅人工智能教育工程研究中心智能技术与教育应用联合实验室)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SMART通过分解数学问题解决为四个维度,评估LLM的数学能力,揭示模型在不同维度上的差异,提出All-Pass Score衡量真实问题解决能力。

Comments Need to address additional data or methodological concerns

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15690 2026-04-21 cs.AI stat.AP 88%

From Passive Metric to Active Signal: The Evolving Role of Uncertainty Quantification in Large Language Models

从被动度量到主动信号:不确定性量化在大语言模型中的演变角色

Jiaxin Zhang, Wendi Cui, Zhuohang Li, Lifu Huang, Bradley Malin, Caiming Xiong, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究院) Intuit(Intuit公司) Vanderbilt University(范德比大学) University of California, Davis(加州大学戴维斯分校) Vanderbilt University Medical Center(范德比大学医学中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文探讨大语言模型中不确定性量化从被动诊断指标到主动控制信号的演变,分析其在高级推理、自主代理和强化学习中的应用及贡献。

Comments This paper has been accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13099 2026-04-21 cs.CL 88%

Alexandria: A Multi-Domain Dialectal Arabic Machine Translation Dataset for Culturally Inclusive and Linguistically Diverse LLMs

Alexandria:一个多领域方言阿拉伯语机器翻译数据集,用于文化包容和语言多样性的LLM

Abdellah El Mekki, Samar M. Magdy, Houdaifa Atou, Ruwa AbuHweidi, Baraah Qawasmeh, Omer Nacar, Thikra Al-hibiri, Razan Saadie, Hamzah Alsayadi, Nadia Ghezaiel Hammouda, Alshima Alkhazimi, Aya Hamod, Al-Yas Al-Ghafri, Wesam El-Sayed, Asila Al sharji, Mohamad Ballout, Anas Belfathi, Karim Ghaddar, Serry Sibaee, Alaa Aoun, Areej Asiri, Lina Abureesh, Ahlam Bashiti, Majdal Yousef, Abdulaziz Hafiz, Yehdih Mohamed, Emira Hamedtou, Brakehe Brahim, Rahaf Alhamouri, Youssef Nafea, Aya El Aatar, Walid Al-Dhabyani, Emhemed Hamed, Sara Shatnawi, Fakhraddin Alwajih, Khalid Elkhidir, Ashwag Alasmari, Abdurrahman Gerrio, Omar Alshahri, AbdelRahim A. Elmadany, Ismail Berrada, Amir Azad Adli Alkathiri, Fadi A Zaraket, Mustafa Jarrar, Yahya Mohamed El Hadj, Hassan Alhuzali, Muhammad Abdul-Mageed

机构 * The University of British Columbia(不列颠哥伦比亚大学) Canada Research Chair in NLP and ML(自然语言处理和机器学习研究主席) Mohammed VI Polytechnic University(穆莱·阿卜杜勒阿齐兹国王理工学院) Birzeit University(比尔泽特大学) Western Michigan University(西部密歇根大学) Tuwaiq Academy(图瓦伊克学院) King Khalid University(国王卡利德大学) American University of Beirut(贝鲁特美国大学) Ibb University(伊卜大学) University of Hail(海勒大学) University of Technology and Applied Sciences(技术与应用科学大学) Arab Open University(阿拉伯开放大学) Minia University(米尼亚大学) Nantes University(南特大学) Prince Sultan University(沙特王子大学) Umm Al-Qura University(乌姆·阿勒·卡拉大学) University of Nouakchott(努尔人大学) Fatabyyano(法塔比亚诺) Independent Researcher(独立研究者) Hadhramout University(哈德拉姆大学) Cairo University(开罗大学) Misurata University(米斯拉塔大学) Al-Balqa Applied University(巴勒斯坦应用大学) University of Khartoum(喀土穆大学) Sultan Qaboos Higher Centre for Culture and Science(穆罕默德·本·拉希德·阿勒马克图姆文化与科学高级中心) Arab Center for Research and Policy Studies(阿拉伯研究中心) Hamad Bin Khalifa University(哈马德·本·哈利法大学) Institut Supérieur du Numérique(数字高级学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Alexandria数据集通过多领域方言阿拉伯语对话数据,提升LLM在不同阿拉伯方言中的翻译能力,揭示现有模型在方言翻译中的挑战。

Comments Accepted to ACL 2026 Main; Project resources will be available here: https://github.com/UBC-NLP/Alexandria

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18272 2026-04-21 cs.CE 88%

MFMDQwen: Multilingual Financial Misinformation Detection Based on Large Language Model

MFMDQwen:基于大语言模型的多语言金融虚假信息检测

Zhiwei Liu, Yuyan Wang, Yuechen Jiang, Yupeng Cao, Tianlei Zhu, Xiaorui Guo, Zhiyang Deng, Zhiyuan Yao, Xiao-Yang Liu, Jimin Huang, Sophia Ananiadou

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn)

AI总结 本文提出MFMDQwen,首个开源多语言金融虚假信息检测模型,构建MFMD4Instruction指令数据集和MFMDBench基准数据集,验证模型在多语言金融信息检测中的优越性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17873 2026-04-21 cs.CV 88%

Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models

时空趋炎附势:基于否定的欺骗性在视频大语言模型中的表现

Ziyao Tang, Pengkun Jiao, Bin Zhu, Huiyan Qi, Jingjing Chen, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University Shanghai Key Laboratory of Multimodal Embodied AI(可信具身人工智能研究所,复旦大学上海多模态具身人工智能重点实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文研究视频大语言模型在面对否定性欺骗时的脆弱性,揭示其在时空推理中的错误修正机制,并提出GasVideo-1000基准测试集以评估模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14804 2026-04-21 cs.SD eess.AS 88%

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages

面向低资源语言多任务理解的语音大语言模型构建

Mingchen Shao, Bingshen Mu, Chengyou Wang, Hai Li, Ying Yan, Zhonghua Fu, Lei Xie

机构 * McShao(麦世超)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出XLSR-Thai和U-Align方法,解决低资源语言语音大语言模型的多任务理解问题,构建首个超过1000小时的泰语spoken language理解数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17329 2026-04-21 cs.SE 88%

A Pilot Study on Detecting Software Design Patterns with Large Language Models: An Empirical Evaluation

基于大语言模型检测软件设计模式的初步研究:实证评估

Oishik Chowdhury, Bastin Tony Roy Savarimuthu, Sherlock A. Licorish

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文评估了四种大语言模型和两种集成方法在检测五种设计模式(单例、适配器、桥接、组合和装饰器)中的性能,发现NextCoder和Gemma 3在准确性上表现更优,集成方法提升了整体效率。

Comments The paper has been accepted for ENASE 2026 and will be published post proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16415 2026-04-21 cs.CY 88%

Using Large Language Models for Emotional Support of Bulgarian Users: A Survey

利用大型语言模型为保加利亚用户提供情感支持:一项调查

Melania Berbatova

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文通过调查100名保加利亚用户,探讨他们对聊天机器人提供情感支持的态度和使用情况,发现约一半用户使用ChatGPT,主要应对人际关系和工作学习压力,但存在数据安全和技术可靠性担忧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18224 2026-04-21 cs.SE cs.AI 87%

WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models

WebCompass:迈向多模态网络编码评估的代码语言模型

Xinping Lei, Xinyu Che, Junqi Xiong, Chenchen Zhang, Yukai Huang, Chenyu Zhou, Haoyang Huang, Minghao Liu, Letian Zhu, Hongyi Ye, Jinhua Hao, Ken Deng, Zizheng Zhan, Han Li, Dailin Li, Yifan Yao, Ming Sun, Zhaoxiang Zhang, Jiaheng Liu

机构 * Nanjing University(南京大学) Kuaishou Technology(快手科技)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI

AI总结 WebCompass提出一个多模态基准测试,用于评估代码语言模型在网络工程中的能力,涵盖生成、编辑和修复三种任务类型,通过多阶段人机协作流程,发现闭源模型在编辑和修复方面表现更优,但美学仍是开放源模型的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17842 2026-04-21 cs.CL 87%

QuickScope: Certifying Hard Questions in Dynamic LLM Benchmarks

QuickScope:动态LLM基准测试中验证难题问题

Taylor Lundy, Narun K. Raman, Kevin Leyton-Brown

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出QuickScope方法,通过改进的COUP算法高效识别动态基准测试中的难题问题,减少误报并提升样本效率。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16120 2026-04-21 cs.CL 87%

Language Models Don't Know What You Want: Evaluating Personalization in Deep Research Needs Real Users

语言模型不知道你想要什么:评估深度研究中个性化需求需要真实用户

Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Eunsol Choi, Jordan Lee Boyd-Graber, Aakanksha Naik

机构 * University of Maryland(马里兰大学) Allen Institute for Artificial Intelligence(人工智能研究院) New York University(纽约大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title);分类 cs.CL

AI总结 本文提出MyScholarQA系统,通过用户兴趣分析、个性化查询响应和报告生成,评估深度研究中个性化需求,发现LLM评估存在不足,需真实用户参与以实现有效个性化。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17191 2026-04-21 cs.LG 87%

Do LLM-derived graph priors improve multi-agent coordination?

基于大语言模型的图先验是否能提升多智能体协调?

Nikunj Gupta, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM ARL Army Research Office(美国陆军研究办公室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨大语言模型能否通过少量自然语言描述推断出多智能体协调的图先验,以提升动态环境中的协调与适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16337 2026-04-21 cs.IR cs.AI cs.CY 87%

HR-Agents: Using Multiple LLM-based Agents to Improve Q&A about Brazilian Labor Legislation

HR-Agents:利用多个基于大语言模型的代理提高关于巴西劳动立法的问题解答

Abriel K. Moraes, Gabriel S. M. Dias, Vitor L. Fabris, Lucas D. Gessoni, Leonardo R. do Nascimento, Charles S. Oliveira, Vitor G. C. B. de Farias, Fabiana C. Q. de O. Marucci, Matheus H. R. Vicente, Gabriel U. Talasso, Erik Soares, Amparo Munoz, Sildolfo Gomes, Maria L. A. de S. Cruvinel, Leonardo T. dos Santos, Renata De Paris, Wandemberg Gibaut

机构 * Eldorado Institute of Research(埃洛多研究 institute)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用多代理系统提升巴西劳动立法问题解答的准确性与效率,通过整合检索增强生成技术,改进HR专业人员的合规性与操作效率。

Comments Paper presented on: July 2025 Conference: XVII Simpósio Brasileiro de Automação Inteligente (SBAI) At: São João del-Rei

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16318 2026-04-21 cs.IR cs.CL 87%

Diagnosing LLM-based Rerankers in Cold-Start Recommender Systems: Coverage, Exposure and Practical Mitigations

诊断基于大语言模型的重排器在冷启动推荐系统中的表现:覆盖、曝光与实际缓解措施

Ekaterina Lemdiasova, Nikita Zmanovskii

机构 * V. A. Trapeznikov ICS RAS Russian Biotechnological University (ROSBIOTECH)(Trapeznikov ICS 俄罗斯科学院俄罗斯生物技术大学) Russian Biotechnological University (ROSBIOTECH)(俄罗斯生物技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过Serendipity-2018数据集研究冷启动电影推荐中交叉编码器重排器的表现,发现检索覆盖不足、曝光偏差和评分区分度低三大问题,并提出混合检索策略、候选池优化和评分校准等缓解措施。

Comments 12 pages, 7 figures. Code and data available at https://github.com/nikita-zmanovskiy/cold-start-algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16304 2026-04-21 cs.SE cs.AI cs.HC 87%

Results-Actionability Gap: Understanding How Practitioners Evaluate LLM Products in the Wild

结果-可行动性差距:理解从业者如何在实际中评估大语言模型产品

Willem van der Maden, Malak Sadek, Ziang Xiao, Aske Mottelson, Q. Vera Liao, Jichen Zhu

机构 * HCI \& Design Section IT University of Copenhagen Copenhagen Denmark Centre for Human-Inspired Artificial Intelligence, Cambridge University Cambridge United Kingdom Computer Science Johns Hopkins University Baltimore Maryland United States Engineering University of Michigan Ann Arbor Michigan United States IT University of Copenhagen Centre for Human-Inspired Artificial Intelligence, Cambridge University Johns Hopkins University University of Michigan

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨从业者如何评估大语言模型产品,发现'结果-可行动性差距'问题,提出策略帮助从业者从非正式评估转向系统化评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17920 2026-04-21 cs.CV cs.AI cs.LG 87%

Prompting Foundation Models for Zero-Shot Ship Instance Segmentation in SAR Imagery

通过提示基础模型实现SAR图像中的零样本船舶实例分割

Islam Mansour, Francescopaolo Sica, Michael Schmitt

机构 * University of the Bundeswehr Munich(联邦国防军 Munich 大学)

专题命中 评测与基准 :foundation model(title,abstract);prompting(title);分类 cs.AI、cs.LG

AI总结 本文提出利用通用视觉基础模型实现SAR图像中零样本船舶实例分割,通过训练YOLOv11检测器并提示SAM2生成实例掩码,有效缓解光学-SAR领域差距,实验表明方法在SSDD基准上达到高IoU和检测率。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏