arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-19 至 2026-05-19 共收录 717 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 160 篇

2605.18430 2026-05-19 cs.LG 85%

Text2CAD-Bench: A Benchmark for LLM-based Text-to-Parametric CAD Generation

Text2CAD-Bench: 一个用于基于LLM的文本到参数化CAD生成的基准

Liang Wang, Heng Meng, Zekai Xiang, Jin Liu, Pingyi Zhou, Litao Chen, Yongqiang Tang

机构 * School of Computer Science, Wuhan University, Wuhan 430000, Hubei, China(武汉大学计算机科学学院) Spatial Design Intelligence Lab, BitInf Ltd., Shanghai 200003, China(BitInf Ltd.空间设计智能实验室) College of Computer and Information Engineering, Nanjing Tech University, Nanjing 211800, Jiangsu, China(南京理工大学计算机与信息工程学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing 100190, China(中国科学院自动化研究所多模态人工智能系统国家重点实验室)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出Text2CAD-Bench,首个系统评估文本到CAD在几何复杂度和应用多样性方面的基准,发现当前模型在基本几何上表现良好,但在复杂拓扑和高级功能上表现下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16358 2026-05-19 cs.LG cs.AI 85%

LEAF: A Living Benchmark for Event-Augmented Forecasting

LEAF:一个用于事件增强预测的活体基准

Mingtian Tan, Mihir Parmar, Palash Goyal, Chun-Liang Li, Nanyun Peng, Thomas Hartvigsen, Jinsung Yoon, Tomas Pfister

机构 * Google(谷歌) University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LEAF,首个用于事件增强预测的活体基准,通过递归检索代理系统和双代理交叉验证,提供全面相关文本辅助预测,评估LLM在复杂真实场景中的预测能力。

Comments 12 tables, 6 figures, 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13415 2026-05-19 cs.CL cs.AI cs.LG 85%

KIT-TIP-NLP at MultiPride: Continual Learning with Multilingual Foundation Model

KIT-TIP-NLP 在 MultiPride 上的持续学习:多语言基础模型

Barathi Ganesh HB, Michal Ptaszynski, Rene Melendez, Juuso Eronen

机构 * Text Information Processing Lab, Kitami Institute of Technology, Kitami, Hokkaido 090-0015, Japan(函授信息处理实验室,Kitami理工学院,日本北海道Kitami,090-0015)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种多阶段框架,用于检测社交媒体中多语言的重新使用侮辱性语言。该框架解决了跨英语、西班牙语和意大利语推文中识别重新使用与非重新使用LGBTQ+相关侮辱性语言的挑战,通过数据驱动的模型选择、语义保留的增强、归纳迁移学习和领域特定知识注入等方法,提高了多语言情感表达的识别能力。

Comments Final Workshop of the 9th evaluation campaign EVALITA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17205 2026-05-19 cs.CL 84%

LLMs for automatic annotation of Mandarin narrative transcripts

基于大型语言模型的汉语叙述转录自动标注

Qingwen Zhao, Hongao Zhu, Yunqi He, Rui Wang, Aijun Huang, Hai Hu

机构 * Shanghai Jiao Tong University(上海交通大学) University of California San Diego(加州大学圣地亚哥分校) The Hong Kong Polytechnic University(香港理工大学) National Research Center for Language and Well-Being(语言与幸福感国家研究中心) City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究探讨了大型语言模型在自动标注汉语叙述转录中的有效性,通过比较四种LLM与训练好的人类标注者,发现最佳模型在标注叙事宏观结构时能与人类标注者达成高一致性,同时显著减少标注时间,但轻量级本地部署模型表现较差,且标注难度因宏观结构元素类型而异,尤其在需要微妙语义区分的类别中存在持续挑战。

Comments 28 pages, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07329 2026-05-19 cs.LG cs.CV 84%

Preparation of Fractal-Inspired Computational Architectures for Advanced Large Language Model Analysis

基于分形的计算架构制备用于高级大语言模型分析

Yash Mittal, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS, University of Würzburg(计算机视觉实验室,CAIDAS,乌尔姆大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.LG

AI总结 本文提出FractalNet框架,通过递归模板模式自动生成并评估卷积神经网络架构,实现高效稳定的网络结构探索,实验显示分形架构在五轮训练后达到80.18%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18032 2026-05-19 cs.CL cs.AI cs.HC cs.SE 84%

PROTEA: Offline Evaluation and Iterative Refinement for Multi-Agent LLM Workflows

PROTEA:多智能体大语言模型工作流的离线评估与迭代优化

Kazuki Kawamura, Satoshi Waki, Kei Tateno

机构 * Sony Group Corporation(索尼集团公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出PROTEA,一种用于多智能体大语言模型工作流的离线评估和迭代优化接口,通过配置评分标准和可视化工作流图中的节点状态,帮助开发者定位瓶颈并改进工作流性能。

Comments 9 pages, 3 figures, 1 table. To appear in Proceedings of ACL 2026 System Demonstrations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17295 2026-05-19 cs.LG cs.CL 84%

DISA: Offline Importance Sampling for Distribution-Matching LLM-RL

DISA: 分布匹配强化学习中的离线重要性采样

Shaobo Wang, Yujie Chen, Yafeng Sun, Wenjie Qiu, Zhihui Xie, Sihang Li, Yucheng Li, Huiqiang Jiang, Xingzhang Ren, Xuming Hu, Dayiheng Liu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Qwen Team, Alibaba Group(阿里集团Qwen团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究提出DISA方法,通过离线重要性采样解决分布匹配强化学习中的校准问题,分离了分区函数估计与策略学习,提高了策略多样性并在多个基准测试中表现出色。

Comments 21 pages, 7 figures, 7 tables. Abstract shortened to respect the arXiv limit of 1920 characters. Please see the PDF for the full abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20981 2026-05-19 cs.CL cs.AI cs.SI 84%

Patients Speak, AI Listens: LLM-based Analysis of Online Reviews Uncovers Key Drivers for Urgent Care Satisfaction

患者发声,AI倾听:基于大语言模型的在线评论分析揭示了紧急护理满意度的关键驱动因素

Xiaoran Xu, Zhaoqian Xue, Chi Zhang, Jhonatan Medri, Junjie Xiong, Jiayan Zhou, Jin Jin, Yongfeng Zhang, Siyuan Ma, Lingyao Li

机构 * Electrical Engineering department, University of South Florida(佛罗里达州立大学电气工程系) Department of Biostatistics, Epidemiology and Bioinformatics, University of Pennsylvania(宾夕法尼亚大学生物统计学、流行病学与生物信息学系) Computer Science and Engineering department, University of South Florida(佛罗里达州立大学计算机科学与工程系) Mathematics & Statistics, University of South Florida(佛罗里达州立大学数学与统计学系) Department of Computer Science and Engineering, University of Missouri Science and Technology(密苏里科技大学计算机科学与工程系) School of Medicine, Stanford University(斯坦福大学医学院) Department of Computer Science, Rutgers University(罗格斯大学计算机科学系) Department of Biostatistics, Vanderbilt University(范德比尔特大学生物统计学系)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文利用大语言模型分析在线评论,揭示紧急护理满意度的关键因素,发现人际因素和运营效率是主要决定因素,其他因素在调整后无显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19667 2026-05-19 cs.CL cs.AI cs.IR cs.LG 83%

SynCABEL: Synthetic Contextualized Augmentation for Biomedical Entity Linking

SynCABEL:面向生物医学实体链接的合成上下文增强

Adam Remaki, Christel Gérardin, Eulàlia Farré-Maduell, Martin Krallinger, Xavier Tannier

机构 * Sorbonne Université, Inserm, Université Sorbonne Paris Nord, Limics(索邦大学、国家医学研究院、巴黎索邦大学、Limics) Service de médecine interne, Hôpital Tenon, Assistance Publique - Hôpitaux de Paris(内科服务部,Tenon医院,巴黎公共医院) Barcelona Supercomputing Center, Barcelona, Spain(巴塞罗那超级计算中心,西班牙巴塞罗那)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SynCABEL通过利用大型语言模型生成丰富的上下文合成训练示例,解决了监督式生物医学实体链接中专家标注数据稀缺的问题,并在三个多语言基准上实现了新的最先进的结果。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10978 2026-05-19 q-bio.QM 83%

VibeProteinBench: An Evaluation Benchmark for Language-interfaced Vibe Protein Design

VibeProteinBench: 一种用于语言接口的蛋白质设计评估基准

Hyunjin Seo, Hongjoon Ahn, Jimin Park, Sungjun Han, Gyubok Lee, Soojung Yang, Joseph S Brown, Leo Chen, Gina El Nesr, Feyisayo Eweje, Sarah Gurev, Hyejin Lee, Cheng-Hao Liu, Junlang Liu, Zhihui Qi, Gyu Rie Lee, Sungsoo Ahn, Jamin Shin, Sangwon Jung

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出VibeProteinBench,一种用于评估语言接口蛋白质设计能力的基准,通过三个互补阶段验证模型在蛋白质设计中的通用能力,揭示当前LLM在蛋白质设计方面的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18941 2026-05-19 cs.CL cs.AI cs.LG 83%

ProfBench: Multi-Domain Rubrics requiring Professional Knowledge to Answer and Judge

ProfBench:需要专业知识回答和评判的多领域评分标准

Zhilin Wang, Jaehun Jung, Ximing Lu, Shizhe Diao, Ellie Evans, Jiaqi Zeng, Pavlo Molchanov, Yejin Choi, Jan Kautz, Yi Dong

机构 * NVIDIA

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ProfBench通过7000多个由专业领域专家评估的响应-评分对,评估大语言模型在处理专业文档、信息整合和生成综合报告方面的能力,揭示了即使顶级模型在专业任务上也面临挑战。

Comments Published at ICLR 2026, 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18632 2026-05-19 cs.AI cs.CL cs.CY cs.LG cs.SE 83%

Automated Knowledge Component Generation for Interpretable Knowledge Tracing in Coding Problems

面向编码问题可解释知识追踪的自动化知识组件生成

Zhangqi Duan, Nigel Fernandez, Arun Balajiee Lekshmi Narayanan, Mohammad Hassany, Rafaella Sampaio de Alencar, Peter Brusilovsky, Bita Akram, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Pittsburgh(匹兹堡大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于LLM的知识组件生成与标注自动化流程,开发KCGen-KT框架,在不同编程语言的实测数据中验证其优于传统方法和人工编写的知识组件。

Comments Findings of ACL 2026: The 64th Annual Meeting of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18380 2026-05-19 cs.AI 83%

QSTRBench: a New Benchmark to Evaluate the Ability of Language Models to Reason with Qualitative Spatial and Temporal Calculi

QSTRBench: 一个评估语言模型进行定性空间和时间推理能力的新基准

Anthony G. Cohn, Robert E. Blackwell

机构 * School of Computer Science, The University of Leeds(利兹大学计算机科学学院) The Alan Turing Institute(阿兰·图灵研究院) Tongji University(同济大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出QSTRBench基准,用于评估大语言模型在定性空间和时间推理方面的能力,通过不同推理算法规则的组合性推理、反向关系和概念邻域等任务,展示了不同模型在处理不同算法规则时的表现差异,发现PA最简单而RCC-22最难。

Comments 74 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06907 2026-05-19 cs.AI cs.CV cs.NE 83%

A Survey on Foundation Models for Personalized Federated Intelligence

面向个性化联邦智能的基础模型综述

Yu Qiao, Huy Q. Le, Avi Deb Raha, Phuong-Nam Tran, Apurba Adhikary, Mengchun Zhang, Loc X. Nguyen, Eui-Nam Huh, Dusit Niyato, Choong Seon Hong

机构 * School of Computing, Kyung Hee University(韩国庆熙大学计算机学院) Noakhali Science and Technology University(诺阿克利科学与技术大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 评测与基准 :foundation model(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文综述了基础模型在个性化联邦智能中的应用,探讨了联邦学习与基础模型的结合,提出了一种新的个性化联邦智能范式,旨在为实现人工智能个性化提供基础支持。

Comments Accepted ACM Computing Survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17691 2026-05-19 cs.CL cs.AI 82%

Validate Your Authority: Benchmarking LLMs on Multi-Label Precedent Treatment Classification

验证你的权威:在多标签先例处理分类上对LLM进行基准测试

M. Mikail Demir, M. Abdullah Canbaz

机构 * Department of Information Science and Technology(信息科学与技术系) College of Emergency Preparedness, Homeland Security, and Cybersecurity(应急准备、国土安全与网络安全学院) University at Albany, SUNY(萨利纳大学)

专题命中 评测与基准 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种新的评估框架,通过专家标注的数据集对现代大语言模型进行基准测试,引入了平均严重性误差指标,以更准确地衡量分类错误的实践影响。

Comments Accepted for publication at the Natural Legal Language Processing Workshop (NLLP) 2025, co-located with EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17503 2026-05-19 cs.AI cs.CL cs.HC 82%

RAG-based EEG-to-Text Translation Using Deep Learning and LLMs

基于深度学习和大语言模型的RAG EEG到文本翻译

Enrico Collautti, Xiaopeng Mao, Luca Tonin, Stefano Tortora, Sadasivan Puthusserypady

机构 * IAS-LAB, Department of Information Engineering, University of Padova(帕多瓦大学信息工程系IAS实验室) Padova Neuroscience Center(帕多瓦神经科学中心) Department of Health Technology, Technical University of Denmark(丹麦技术大学健康技术系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于检索增强生成(RAG)的EEG到文本解码方法,结合EEG编码器、向量检索阶段和大语言模型,以提高句子级解码的准确性,并在ZuCo数据集上验证了其有效性。

Comments 6 pages, 2 figures. Submitted to the 2026 IEEE International Conference on Systems, Man, and Cybernetics

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26384 2026-05-19 cs.AI cs.LG 82%

Scales++: Compute Efficient Evaluation Subset Selection with Cognitive Scales Embeddings

Scales++: 一种计算高效的评估子集选择方法,基于认知尺度嵌入

Andrew M. Bean, Nabeel Seedat, Shengzhuang Chen, Jonathan Richard Schwarz

机构 * Thomson Reuters Foundational Research(汤姆森路透基础研究) University of Oxford(牛津大学) Imperial College London(帝国理工学院伦敦分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于任务项目内在属性的评估子集选择方法Scales++,通过减少预选成本并保持预测保真度,提高了大规模语言模型的评估效率,同时提升了冷启动性能和可解释性。

Comments 9 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17246 2026-05-19 cs.LG cs.AI 82%

Fidelity Probes for Specification--Code Alignment

规范-代码对齐的保真度探针

Ferhat Erata, Hao Zhou, Luke Huan

机构 * AWS Agentic AI(AWS智能AI)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出保真度探针,通过从参考artifact生成的自然语言问题和代码派生的地面真实答案,从候选规范中回答问题。保真度是同意探针的比例,分解为矛盾率和覆盖缺口率,驱动针对性的规范编辑以达到收敛。在15个程序、约12000行COBOL基准(AWS CardDemo)上,通过八次迭代将冻结测试规范的保真度从0.63提升到0.94,其中平台位置由仅需四次速率数据的两状态马尔可夫固定点$F^\dagger$预测。探针来自LLM读取代码或静态分析管道对其控制流、数据流和系统依赖图的处理,具有可调混合比例。一个带有冻结留出集的探针重采样协议提供了Hoeffding有界的过拟合判别;我们测量的训练/测试差距保持在该包络线下一个数量级。三种基于图的混合提升了保真度16到30分;跨分布评估显示LLM和符号通道在经验上互补。在五个独立LLM家族(Anthropic、DeepSeek、Google、Alibaba、OpenAI)上进行的跨家族生成器扫描确认了收敛行为不依赖于任何单一模型家族:五个非Claude生成器中有三个产生了与马尔可夫固定点预测一致的轨迹,而冻结测试协议主动否定了两个探针分布随迭代变化的生成器。该方法适用于任何应描述相同行为的artifact对。

Comments 29 pages, 14 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16892 2026-05-19 cs.CV cs.AI cs.CL 82%

DriveSafe: A Framework for Risk Detection and Safety Suggestions in Driving Scenarios

DriveSafe: 一种用于驾驶场景中风险检测与安全建议的框架

Sainithin Artham, Shankar Gangisetty, Avijit Dasgupta, C. V. Jawahar

机构 * IIIT-Hyderabad(IIIT-海得拉巴)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DriveSafe框架,通过结构化自然语言描述实现风险感知场景理解,结合多模态上下文生成空间 grounded 的描述,用于下游风险评估和安全建议,实验表明其在DRAMA基准上达到最先进的性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12824 2026-05-19 cs.MA cs.AI cs.CL cs.CY 82%

Mechanism Plausibility in Generative Agent-Based Modeling

生成基于代理的建模中的机制合理性

Patrick Zhao, David Huu Pham, Nicholas Vincent

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出机制合理性量表,区分生成充分性与机制合理性,探讨生成式代理模型的生成能力与解释能力。

Comments Accepted at ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11895 2026-05-19 cs.LG cs.AI cs.SE 82%

DevBench: A Realistic, Developer-Informed Benchmark for Code Generation Models

DevBench:一个现实的、面向开发者的代码生成模型基准测试

Adarsh Kumarappan, Pareesa Ameneh Golnari, Wen Wen, Xiaoyu Liu, Gabriel Ryan, Yuting Sun, Shengyu Fu, Elsie Nallipogu

机构 * California Institute of Technology(加州理工学院) Microsoft(微软公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 DevBench通过真实开发者数据和生成模型合成,构建了包含六种编程语言和任务的1800个实例,评估大语言模型在代码补全任务中的表现,揭示模型在语法精度、语义推理和实用价值上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01782 2026-05-19 cs.CL cs.AI 82%

Can LLMs Refuse Questions They Do Not Know? Measuring Knowledge-Aware Refusal in Factual Tasks

大语言模型能否拒绝它们不知道的问题?在事实性任务中测量知识感知的拒绝

Wenbo Pan, Jie Xu, Qiguang Chen, Junhao Dong, Libo Qin, Xinfeng Li, Haining Yu, Xiaohua Jia

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Harbin Institute of Technology(哈尔滨工业大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Refusal Index(RI)作为衡量大语言模型知识感知拒绝能力的新指标,通过评估拒绝概率与错误概率的相关性,揭示模型在事实性任务中的可靠性问题。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16290 2026-05-19 cs.CY cs.AI cs.LG 82%

MCQ Difficulty Prediction via Modeling Learner Heterogeneity Using Data-Driven Cognitive Profiling

通过数据驱动的认知画像建模学习者异质性以预测多项选择题难度

Dhriti Krishnan, Jaromir Savelka

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于学习者异质性的数据驱动认知画像框架,通过隐类分析识别行为画像并模拟响应分布,结合主题上下文和岭回归模型预测IRT难度参数,提升难度预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17887 2026-05-19 cs.AI 81%

When Personalization Legitimizes Risks: Uncovering Safety Vulnerabilities in Personalized Dialogue Agents

当个性化合理化风险:揭示个性化对话代理中的安全漏洞

Jiahe Guo, Xiangran Guo, Yulin Hu, Zimo Long, Xingyu Sui, Xuda Zhi, Yongbo Huang, Hao He, Weixiang Zhao, Yanyan Zhao, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) SERES Group Co., Ltd(SERES集团有限公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了个性化对话代理中的一种安全故障模式——意图合理化,通过引入PS-Bench基准测试,揭示了个性化记忆如何偏移意图推断并导致模型合理化有害查询,提出了一种轻量级的检测-反思方法以减少安全退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21654 2026-05-19 cs.LG 81%

EvilGenie: A Reward Hacking Benchmark

EvilGenie: 一个奖励黑客基准

Jonathan Gabor, Jayson Lynch, Jonathan Rosenfeld

机构 * Cambridge Boston Alignment Initiative(剑桥波士顿对齐倡议) MIT FutureTech(麻省理工 FutureTech)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 本文提出EvilGenie基准,用于评估编程环境中奖励黑客问题,通过测试用例硬编码和测试文件编辑等方法检测奖励黑客行为,并验证了LLM判断在无歧义情况下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17159 2026-05-19 cs.AI cs.MA 81%

MADP: A Multi-Agent Pipeline for Sustainable Document Processing with Human-in-the-Loop

MADP:一种用于可持续文档处理的多智能体系统(带人机协作)

Diego Gosmar, Giovanni Zenezini

机构 * Tesisquare Head of AI(Tesisquare AI首席科学家) Polytechnic University of Turin, Department of Management and Production Engineering(都灵理工学院管理与生产工程系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MADP,一种结合深度学习分类和解析以及大语言模型提取的多智能体架构,通过选择性的人工验证保持准确性,实现了文档处理自动化,显著降低人工需求并减少环境影响。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16821 2026-05-19 cs.AI 81%

Multi-Paradigm Agent Interaction in Practice:A Systematic Analysis of Generator-Evaluator, ReAct Loop,and Adversarial Evaluation in the buddyMe Framework

多范式代理交互实践:buddyMe框架中生成器-评估器、ReAct循环和对抗性评估的系统分析

Xiaohua Wang, Chao Han, Kai Yu, XiaoLiang Xu, Liang Wang

机构 * BuddyMe Research Team(buddyMe研究团队) CHARMMIRAEL Biotech Co., Ltd(CHARMMIRAEL生物技术有限公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过系统分析buddyMe框架中生成器-评估器、ReAct循环和对抗性评估三种代理交互范式,揭示了在实际应用中多范式代理系统的设计挑战与优化策略。

Comments 11 pages, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13877 2026-05-19 cs.NE cs.AI 81%

ARES-LSHADE: Autoresearch-Enhanced LSHADE with Memetic Polish for the GNBG Benchmark

ARES-LSHADE:基于自研增强的LSHADE与膜etic精修的GNBG基准测试

Abdullah Naeem, Md Wasi Ul kabir, Manish Bhatt, Ayon Dey, Anav Katwal, Md Tamjidul Hoque

机构 * University of New Orleans(新奥尔良大学) Amazon(亚马逊)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出ARES-LSHADE,通过自研循环和膜etic精修改进LSHADE,针对GNBG基准测试实现510/744胜率,达到机器精度,揭示LLM研究循环与基准完整性之间的张力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17338 2026-05-19 cs.SE cs.CL 81%

Precise Debugging Benchmark: Is Your Model Debugging or Regenerating?

精确调试基准:你的模型是在调试还是重生成?

Wang Bill Zhu, Miaosen Chai, Shangshang Wang, Yejia Liu, Song Bian, Honghua Dong, Willie Neiswanger, Robin Jia

机构 * University of Southern California(南加州大学) Microsoft(微软) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);post-training(abstract);分类 cs.CL

AI总结 本文提出PDB基准,评估LLM调试能力,发现前沿模型调试精度低,即使受指令引导也难以达到高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12617 2026-05-19 cs.AI cs.HC 81%

Evaluating AI Alignment in LLMs: Output Analysis of Value Priorities Across 75 Models with Human Benchmarking

评估大语言模型中的AI对齐:通过75个模型的人类基准测试分析价值优先级

Gabriel Rongyang Lau, Wei Yan Low, Seow Min Koh, Fiona Fui-Hoon Nah, Andree Hartanto

机构 * School of Social Sciences, Nanyang Technological University(南洋理工大学社会科学学院) Interdisciplinary Graduate Programme, Nanyang Technological University(南洋理工大学跨学科研究生项目) Faculty of Arts and Social Sciences, National University of Singapore(新加坡国立大学人文与社会科学学院) School of Computing and Information Systems, Singapore Management University(新加坡管理学院计算与信息学院) School of Social Sciences, Singapore Management University(新加坡管理学院社会科学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过分析75个大语言模型的输出,评估其价值优先级与人类判断的一致性,发现模型在价值优先级上存在差异,且模型大小、新旧和能力层级与价值一致性无直接关联。

详情

展开后加载摘要…

URL PDF HTML 收藏