arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31906 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31906 篇

2602.12430 2026-06-03 cs.MA cs.AI 90%

Agent Skills for Large Language Models: Architecture, Acquisition, Security, and the Path Forward

大型语言模型的智能体技能:架构、获取、安全与未来路径

Renjun Xu, Yang Yan

机构 * ReDiscovery Hangzhou China(杭州ReDiscovery研究院) Westlake University Hangzhou China(西交大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文综述了大型语言模型智能体技能的研究,涵盖架构基础(如SKILL.md规范、渐进式上下文加载)、技能获取(强化学习、自主发现、组合合成)、大规模部署(计算机使用智能体栈、GUI接地)以及安全挑战(26.1%社区技能含漏洞),并提出技能信任与生命周期治理框架。

Comments Accepted by Agent Skills '26 Workshop at ACM Conference on AI and Agentic Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29586 2026-05-29 cs.AI 90%

FinVerBench: Benchmark Validity and Calibration in Large Language Model Financial Statement Verification

FinVerBench: 大型语言模型财务报表验证中的基准有效性与校准

Silu Panda

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 提出FinVerBench基准,通过四类错误分类和SEC 10-K XBRL数据,评估LLM在财务报表数值一致性验证中的性能,发现校准和渲染选择显著影响结果,强调构造有效性而非最终排行榜。

Comments 37 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25536 2026-05-26 cs.SE cs.AI 90%

A Tertiary Review of Large Language Model-Based Code Generating Tasks: Trends, Challenges, and Future Directions

基于大语言模型的代码生成任务的三级综述:趋势、挑战与未来方向

Muslim Chochlov, Michael English, Jim Buckley

机构 * University of Limerick(利默里克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本三级综述综合了30篇二级研究(2017-2025年),分析了基于大语言模型的代码生成任务在出版趋势、效果、场景、集成挑战和未来方向上的证据,发现基准测试准确率高但泛化性弱,鲁棒性脆弱,效率问题普遍,毒性和偏见报告不足,主要挑战涉及经济可行性、评估有效性和社会技术集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23148 2026-05-26 cs.CL cs.CY 90%

When Symptoms Are Not Enough: Evidence-Weighting Patterns in Large Language Model Psychiatric Screening

当症状不足时:大语言模型精神科筛查中的证据加权模式

Jianfeng Zhu, Megan Korhummel, Ruoming Jin, Karin G. Coifman

机构 * Departments of Computer Science1 and Psychological Science2(计算机科学系和心理学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);prompting(abstract)

AI总结 本研究引入SCID锚定基准,评估五个大语言模型在精神科筛查中的表现,发现模型在焦虑症、抑郁症和创伤后应激障碍分类中,当存在功能保留或保护性背景时倾向于低估症状证据,导致假阴性错误。

Comments 25 pages 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24850 2026-05-26 cs.CL cs.IT math.IT stat.AP 90%

Repeated Sequences Reveal Gaps between Large Language Models and Natural Language

重复序列揭示大语言模型与自然语言之间的差距

Kumiko Tanaka-Ishii

机构 * Waseda University(早稻田大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 通过分析重复子序列的分布及其与高阶Rényi熵的关系,提出一种评估大语言模型生成文本长程统计组织的框架,发现GPT生成文本在熵增长模式上与自然语言存在系统性差异。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19219 2026-05-26 cs.CL cs.CR 90%

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework

大型语言模型在评估中作弊了多少?基于一次性密码本的框架下的高估基准测试

Zi Liang, Liantong Yu, Shiyu Zhang, Qingqing Ye, Haibo Hu

机构 * Tech Startups(科技初创公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对大型语言模型在公开基准测试中因数据污染或训练偏差导致评估结果虚高的问题,提出基于一次性密码本加密思想的动态评估框架ArxivRoll,包含自动生成私有测试用例的SCP模块和衡量污染与偏差比例的Rugged Scores指标,实现可重复、透明且高效的评估。

Comments This paper has been accepted by AAAI 2026. We update it for adding new evaluation results for ArxivRollBench-2025a and ArxivRollBench-2026a, with the evaluation of timly models like DeepSeekV4Pro, GPT-5.5, Claude-Opus-4.7, and so on. Source code: https://github.com/liangzid/ArxivRoll/ Online Leaderboard Website: https://arxivroll.moreoverai.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15482 2026-05-25 cs.CL 90%

FINESSE-Bench: A Hierarchical Benchmark Suite for Financial Domain Knowledge and Technical Analysis in Large Language Models

FINESSE-Bench:面向大语言模型金融领域知识与技术分析的分层基准套件

Dmitry Stanishevskii, Nini Kamkia, Alexey Khoroshilov, Dmitry Zmitrovich, Denis Kokosinskii, Zhirayr Hayrapetyan, Andrei Kalmykov

机构 * Lime FinTech(Lime金融科技)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出FINESSE-Bench,包含8个专业基准和3993个问题,通过分层设计(如CFA级别、CMT级别等)系统评估大语言模型从基础到专家级的金融能力,并引入基于LLM评判的自动评分方案。

Comments 21 pages, 10 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00303 2026-05-21 cs.DB cs.AI cs.IR 90%

Access Paths for Efficient Ordering with Large Language Models

利用大型语言模型实现高效的排序访问路径

Fuheng Zhao, Jiayue Chen, Yiming Pan, Tahseen Rabbani, Sohaib, Divyakant Agrawal, Amr El Abbadi, Paritosh Aggarwal, Anupam Datta, Dimitris Tsirogiannis

机构 * Snowflake Inc.(Snowflake公司) University of Chicago(芝加哥大学) UC Los Angeles(洛杉矶大学) UC Santa Barbara(圣巴巴拉大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 本文提出了一种基于大型语言模型的排序语义运算符,并系统研究了其物理实现。通过改进现有语义排序算法并引入语义感知的外部归并排序算法,研究发现没有单一实现能在所有数据集上达到最优。基于此,设计了一个预算感知的优化器,利用启发式规则、LLM作为判断者评估和共识聚合动态选择最优的访问路径。实验结果表明,该优化器在所有基准测试中均能实现与最佳静态方法相当或更优的排名准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19711 2026-05-20 cs.CL 90%

Can Large Language Models Reliably Correct Errors in Low-Resource ASR? A Contamination-Aware Case Study on West Frisian

大型语言模型能否可靠地纠正低资源语音识别中的错误?一项考虑数据污染的西弗里西语案例研究

Yun Hao, Reihaneh Amooie, Wietse de Vries, Rik van Noord, Martijn Wieling

机构 * University of Groningen(Groningen大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究探讨了大型语言模型在低资源语言(如西弗里西语)中通过生成性错误纠正(GER)提升语音识别(ASR)性能的效果,发现GER在大多数设置中提升了ASR性能,并通过详细的错误分析揭示了模型的纠正模式。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17029 2026-05-19 cs.SE cs.AI 90%

Task Abstention for Large Language Models in Code Generation

大型语言模型在代码生成中的任务回避

Yanke Zhou, Yuhao Tan, Senrong Xu, Zenan Li, Yuan Yao, Taolue Chen, Xiaoxing Ma

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究了大型语言模型在代码生成任务中是否应回避生成可能产生幻觉的代码,提出了一种基于多重假设检验原理的校准回避规则,通过代码执行结果评估生成一致性,无需依赖Oracle测试用例或外部数据库,提供了一种可靠的安全且稳健的代码生成机制。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02071 2026-05-19 cs.AI 90%

FormuLLA: A Large Language Model Approach to Generating Novel 3D Printable Formulations

FormuLLA:一种用于生成新型3D打印配方的大型语言模型方法

Adeshola Okubena, Yusuf Ali Mohammed, Moe Elbadawi

机构 * School of Biological and Behavioural Sciences, Queen Mary University of London(伦敦女王玛丽大学生物与行为科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出FormuLLA方法,利用微调后的大型语言模型推荐3D打印配方的辅料并预测丝材机械性能,揭示了模型选择和参数对性能的影响,指出小模型易遗忘及标准指标无法评估配方可加工性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16288 2026-05-19 cs.CY cs.CL 90%

When AI Tells You What You Want to Hear: Sycophantic Behavior of Large Language Models in Dementia Care Settings

当AI说你想听的话:大型语言模型在痴呆症护理环境中的趋炎附势行为

Christian Kolb

机构 * Christian Kolb

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究探讨了大型语言模型在痴呆症护理场景中是否因迎合社会期望而降低专业质量,通过五种提示测试四款模型,发现响应质量随提示框架增强而下降,提示框架显著影响响应质量。

Comments 10 pages, 4 figures. Exploratory study

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16284 2026-05-19 cs.CY cs.AI 90%

Measuring Changes in Instructor Class Design and Student Learning After the Release of Large Language Models (LLMs)

评估大型语言模型发布后教师课程设计和学生学习的变化

Amanda Potasznik, Daniel Haehn

机构 * University of Massachusetts, Boston(马萨诸塞大学波士顿分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 研究通过混合方法分析大学课程中LLM的使用对学生学习和教师教学的影响,结合定量分析和问卷调查数据,探讨学习成果的变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25099 2026-05-18 cs.CE cs.AI 90%

Large Language Models as Optimization Controllers: Adaptive Continuation for SIMP Topology Optimization

大语言模型作为优化控制器:SIMP拓扑优化的自适应延续

Shaoliang Yang, Jun Wang, Yunsheng Wang

机构 * Department of Mechanical Engineering, Santa Clara University(圣克拉拉大学机械工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出利用大语言模型作为SIMP拓扑优化的在线自适应控制器,通过实时状态条件参数决策替代传统固定调度延续方法,提升优化效果。

Comments 32 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14635 2026-05-15 cs.CV cs.AI 90%

MultiEmo-Bench: Multi-label Visual Emotion Analysis for Multi-modal Large Language Models

MultiEmo-Bench:多标签视觉情绪分析用于多模态大语言模型

Tianwei Chen, Takuya Furusawa, Yuki Hirakawa, Ryotaro Shimizu, Mo Fan, Takashi Wada

机构 * ZOZO NEXT Inc.(ZOZO NEXT公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一个多标签视觉情绪分析基准数据集,用于评估多模态大语言模型对图像引发情绪的预测能力。通过改进标注方案,提供更可靠的数据集,并评估了多个模型在情绪预测上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26100 2026-05-15 cs.AI 90%

AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models

AgenticEval: 向大型语言模型的代理和自演化安全评估迈进

Yixu Wang, Xin Wang, Yang Yao, Xinyuan Li, Xibang Yang, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The University of Hong Kong(香港大学) East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.AI

AI总结 本文提出AgenticEval框架,通过自演化评估流程动态检测LLM安全风险,实验显示模型安全评分随评估强化而下降,揭示静态评估的局限性。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08584 2026-05-15 cs.CL 90%

CounselBench: A Large-Scale Expert Evaluation and Adversarial Benchmarking of Large Language Models in Mental Health Question Answering

CounselBench: 一个大规模专家评估和对抗性基准测试,用于评估大型语言模型在心理健康问答中的表现

Yahan Li, Jifan Yao, John Bosco S. Bunyi, Adam C. Frank, Angel Hsing-Chi Hwang, Ruishan Liu

机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) Department of Electrical and Computer Engineering, University of Southern California(南加州大学电气与计算机工程系) Suzanne Dworak-Peck School of Social Work, University of Southern California(南加州大学苏兹安·德沃拉克-佩克社会工作学院) Department of Psychiatry and the Behavioral Sciences, University of Southern California(南加州大学精神病学与行为科学系) Annenberg School for Communication, University of Southern California(南加州大学安纳伯格通信学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 CounselBench通过100名心理健康专家评估GPT-4、LLaMA 3等模型在真实求助场景中的表现,揭示其在临床敏感性和安全风险方面的不足,并通过对抗性数据集深入分析模型失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12332 2026-05-13 cs.AI 90%

Towards Automated Air Traffic Safety Assessment Around Non-Towered Airports Using Large Language Models

基于大语言模型的非塔台机场飞行安全评估自动化方法研究

Torsten Darrell, Mahyar Ghazanfari, Jordan Kam, Alexandre Bayen, Amin Tabrizian, Peng Wei

机构 * Research Intern, Department of Mechanical and Aerospace Engineering, George Washington University(乔治华盛顿大学机械与航空航天工程系研究实习生) Ph.D. Student, Department of Mechanical and Aerospace Engineering, George Washington University(乔治华盛顿大学机械与航空航天工程系博士生) Undergraduate Student, Aerospace Program, University of California, Berkeley(加州大学伯克利分校航空航天项目本科生) Full Professor, Department of Electrical Engineering and Computer Science, University of California, Berkeley(加州大学伯克利分校电气工程与计算机科学系教授) Ph.D. Student, Department of Computer Science, George Washington University(乔治华盛顿大学计算机科学系博士生) Associate Professor, Department of Mechanical and Aerospace Engineering, George Washington University(乔治华盛顿大学机械与航空航天工程系副教授)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出利用视觉语言模型分析非塔台机场CTAF通讯、气象数据和飞行轨迹,通过实证研究和合成数据验证,展示框架在识别飞行冲突中的有效性,表明VLM在非塔台机场安全评估中的潜力。

Comments 25 pages, 17 figures, 5 tables, Accepted to AIAA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01022 2026-05-12 econ.GN cs.AI q-fin.EC 90%

Calibrating Behavioral Parameters with Large Language Models

用大语言模型校准行为参数

Brandon Yee, Pairie Koh

机构 * Management Sciences Lab(管理科学实验室) Yee Collins Research Group(Yee Collins研究组)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文利用大语言模型校准行为参数,发现其存在系统性理性偏差,并通过校准方法提升参数稳定性与理论一致性,验证了校准参数在资产定价模型中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02184 2026-05-12 cs.AI cs.DC cs.PL cs.SE 90%

Leveraging LLMs to Automate Energy-Aware Refactoring of Parallel Scientific Codes

利用LLM自动化能源感知的并行科学代码重构

Matthew T. Dearing, Yiheng Tao, Xingfu Wu, Zhiling Lan, Valerie Taylor

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究LLM能否在经验执行反馈指导下生成能源高效的并行科学代码,提出LASSI-EE框架,通过多阶段迭代方法结合运行时功耗分析、能源感知提示、自纠正反馈循环和LLM作为裁判代理,实现代码重构。

Comments 12 pages, 5 figures, version under review at a peer-reviewed conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06937 2026-05-11 cs.LG 90%

A Reproducible Optimisation Protocol for Calibrating Prompt-Based Large Language Model Workflows in Evidence Synthesis

一种可重复的优化协议用于校准基于提示的大型语言模型在证据综合中的工作流程

Teo Susnjak

机构 * School of Mathematical and Computational Sciences(数学与计算科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出了一种可重复的校准流程,用于基于提示的大型语言模型在结构化证据综合任务中的优化。方法将定义科学任务的规则与可变的提示框架分离,并通过标记或参考示例及显式任务指标优化框架,最终保存校准的工作流程作为可检查的制品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16928 2026-05-11 cs.GT cs.AI cs.MA 90%

Discovering Multiagent Learning Algorithms with Large Language Models

用大型语言模型发现多智能体学习算法

Zun Li, John Schultz, Daniel Hennes, Marc Lanctot

机构 * Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文利用AlphaEvolve框架自动发现CFR和PSRO算法,提出VAD-CFR和SHOR-PSRO,通过简化核心机制获得更高效的WOP-CFR和PM-PSRO,提升泛化能力。

Comments More experiments and analysis on algorithmic distilliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05758 2026-05-08 cs.CL 90%

BioTool: A Comprehensive Tool-Calling Dataset for Enhancing Biomedical Capabilities of Large Language Models

BioTool: 一个全面的工具调用数据集,用于增强大语言模型的生物医学能力

Xin Gao, Ruiyi Zhang, Meixi Du, Peijia Qin, Pengtao Xie

机构 * UC San Diego(圣迭戈大学) MBZUAI(马克斯·普朗克智能系统研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 BioTool通过整合生物医学领域常用工具及高质量查询-API调对,提升大语言模型在生物医学任务中的工具调用能力,实验表明其在生物医学领域表现优于现有商业模型。

Comments Published at ACL 2026; Code and data available at https://github.com/gxx27/BioTool

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01451 2026-05-05 cs.CL 90%

Auditing demographic bias in AI-based emergency police dispatch: a cross-lingual evaluation of eleven large language models

对基于AI的紧急警务调度中的种族偏见进行审计:对十一种大型语言模型的跨语言评估

William Guey, Wei Zhang, Pierrick Bougault, Yi Wang, Bertan Ucar, Vitor D. de Moura, José O. Gomes

机构 * Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) School of Social Sciences, Tsinghua University(清华大学社会科学部) Department of Industrial Engineering, Federal University of Rio de Janeiro(里约热内卢联邦大学工业工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文通过跨语言框架评估11种模型,在19800个输出中发现当事件严重性模糊时种族偏见系统性出现,但当操作优先级由通话内容确定时偏见消失。偏见程度因种族轴而异,宗教外观影响最大,性别次之,种族最小。语言间偏见转移不一致,性别偏见在中文中放大,种族偏见在英文中更明显。

Comments 26 pages, 7 figures. Submitted to Humanities and Social Sciences Communications (Nature) collection on Artificial Intelligence and Emerging Technologies in Public Safety. Code and data: https://github.com/williamguey/llmdispatchbias

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07885 2026-05-05 cs.CR cs.AI cs.SE 90%

False Friends in the Shell: Unveiling the Emoticon Semantic Confusion in Large Language Models

壳中的假朋友:揭示大型语言模型中的表情符号语义混淆

Weipeng Jiang, Xiaoyu Zhang, Juan Zhai, Shiqing Ma, Chao Shen, Yang Liu

机构 * Xi’an Jiaotong University(西安交通大学) Nanyang Technological University(南洋理工大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究揭示大型语言模型对表情符号的语义混淆问题,通过构建数据集发现平均混淆率超38%,且多数混淆响应导致安全风险,呼吁开发有效缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14719 2026-05-01 cs.AI 90%

Policy-Grounded Safety Evaluation of 20 Large Language Models

基于政策的安全性评估:20个大语言模型

Juan Manuel Contreras

机构 * Aymara

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Aymara AI平台,用于生成和管理定制化的政策导向安全性评估。通过评估20个商业大语言模型在10个现实安全领域中的表现,揭示了模型在不同领域中的显著性能差异,强调了构建可扩展、可定制工具的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06198 2026-04-30 cs.CL 90%

LIT-RAGBench: Benchmarking Generator Capabilities of Large Language Models in Retrieval-Augmented Generation

LIT-RAGBench:大型语言模型检索增强生成能力的基准测试

Koki Itai, Shunichi Hasegawa, Yuta Yamamoto, Gouki Minegishi, Masaki Otsuki

机构 * neoAI Inc.(neoAI公司) Tokyo Metropolitan University(东京 Metropolitan 大学) The University of Tokyo(东京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 LIT-RAGBench通过五个类别评估生成器的整合、推理、逻辑、表格和回避能力,提供统一的基准测试框架,用于评估多方面能力并指导模型选择与改进。

Comments Published as a conference paper at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22558 2026-04-30 cond-mat.mtrl-sci cs.AI 90%

aLLoyM: A large language model for alloy phase diagram prediction

aLLoyM:一种用于合金相图预测的大型语言模型

Yuna Oikawa, Guillaume Deffrennes, Taichi Abe, Ryo Tamura, Koji Tsuda

机构 * Graduate School of Frontier Sciences, The University of Tokyo(东京大学前沿科学研究院) University Grenoble Alpes, CNRS, Grenoble INP, SIMaP(格勒诺布尔阿尔卑斯大学、CNRS、格勒诺布尔INP、SIMaP) Research Center for Structural Materials, National Institute for Materials Science(材料研究所结构材料研究中心) Center for Basic Research on Materials, National Institute for Materials Science(材料研究所基础材料研究中心) RIKEN Center for Advanced Intelligence Project(理化学研究所先进人工智能项目中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出aLLoyM,一种针对合金成分和温度训练的大型语言模型,通过微调Mistral模型,提升了相图问题的解答能力,并能生成新的相图,推动材料发现。

Comments 24 pages, 6 figures

Journal ref npj Computational Materials 12, 97 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06337 2026-04-28 cs.AI 90%

Large Language Models as Virtual Survey Respondents: Evaluating Sociodemographic Response Generation

大型语言模型作为虚拟调查受访者:评估社会人口响应生成

Jianpeng Zhao, Chenyu Yuan, Weiming Luo, Haoling Xie, Guangwei Zhang, Steven Jige Quan, Zixuan Yuan, Pengyang Wang, Denghui Zhang

机构 * University of Macau(澳门大学) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Seoul National University(首尔国立大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出两种任务抽象方法,评估大型语言模型在生成社会人口数据中的表现,通过跨不同数据集和模型的系统比较,揭示模型在结构化输出生成中的失败模式。

Comments Revised version, major corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23027 2026-04-28 cs.AI 90%

A Systematic Approach for Large Language Models Debugging

大语言模型调试的系统方法

Basel Shbita, Anna Lisa Gentile, Bing Zhang, Sungeun An, Shailja Thakur, Shubhi Asthana, Yi Zhou, Saptha Surendran, Farhan Ahmed, Rohan Kulkarni, Yuya Jeremy Ong, Chad DeLuca, Hima Patel

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出系统化方法用于大语言模型调试,通过统一评估、可解释性和错误分析,帮助开发者迭代诊断模型弱点,优化提示和参数,并适应数据进行微调或评估,尤其在缺乏标准化基准时仍有效。

详情

展开后加载摘要…

URL PDF HTML 收藏