arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-13 至 2026-05-13 共收录 92 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 92 篇

2605.06940 2026-05-13 cs.CL cs.AI cs.LG 92%

MultiSoc-4D: A Benchmark for Diagnosing Instruction-Induced Label Collapse in Closed-Set LLM Annotation of Bengali Social Media

MultiSoc-4D:一个用于诊断指令诱导标签崩溃的基准,在封闭集LLM注释印度文社交媒体中的应用

Souvik Pramanik, S. M. Riaz Rahman Antu, Shak Mohammad Abyad, Md. Ibrahim Khalil, Md. Shahriar Hussain

机构 * North South University(北南大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MultiSoc-4D基准,通过LLM注释印度文社交媒体评论,发现指令诱导标签崩溃现象,揭示注释偏见传播问题,提供诊断工具。

Comments 21 pages, 14 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12422 2026-05-13 cs.CL cs.CY 92%

Predicting Disagreement with Human Raters in LLM-as-a-Judge Difficulty Assessment without Using Generation-Time Probability Signals

预测在LLM-as-a-Judge难度评估中与人类评分者的分歧

Yo Ehara

机构 * Yo Ehara

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种无需生成时间概率信号的方法,通过构建嵌入空间预测LLM生成的难度评分与人类评分者的分歧,实验表明其在预测分歧上的AUC优于基于概率的基线方法。

Comments Accepted to Educational Data Mining (EDM) 2026 (Poster/Demo Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12147 2026-05-13 cs.CR cs.LG 92%

PrivacySIM: Evaluating LLM Simulation of User Privacy Behavior

PrivacySIM: 评估LLM对用户隐私行为的模拟

James Flemings, Murali Annavaram

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出PrivacySIM评估框架,通过对比1000名用户的真实响应,评估LLM在模拟用户隐私行为方面的表现,发现隐私人格特征对模拟质量有提升作用,但最佳模型仅达到40.4%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04056 2026-05-13 cs.CR 91%

QuiLL: An LLM-Based Vulnerability Assessment Framework for the Wild

QuiLL:一种基于LLM的漏洞评估框架

Rijha Safdar, Danyail Mateen, Syed Taha Ali, Wajahat Hussain

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出QuiLL,首个针对真实世界漏洞检测的综合评估框架,通过端到端流程结合先进LLM优化技术,提供动态上下文学习和新颖评分指标,用于系统评估不同LLM的漏洞检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11772 2026-05-13 cs.SE 91%

Breaking the Dependency Chaos: A Constraint-Driven Python Dependency Resolution Strategy with Selective LLM Imputation

打破依赖混沌:一种基于约束的Python依赖解析策略与选择性LLM填补

Kowshik Chowdhury, Dipayan Banik, Shazibul Islam Shamim

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出SMT-LLM,通过形式化约束求解替代LLM猜测,利用AST分析和vermin工具确定Python版本,并在PyPI查询前构建约束图以解决版本一致性问题,提升解析效率。

Comments 34th ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11348 2026-05-13 cs.CL cs.AI cs.IR cs.SI 91%

Large Language Models for Causal Relations Extraction in Social Media: A Validation Framework for Disaster Intelligence

用于社交媒体因果关系提取的大型语言模型:灾害情报的验证框架

Ujun Jeong, Saketh Vishnubhatla, Bohan Jiang, Andre Harrison, Adrienne Raglin, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文研究大型语言模型在灾害社交媒体中提取因果关系的有效性,提出专家导向的评估框架并评估提取关系是否由事后证据支持。

Comments Submitted to EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12332 2026-05-13 cs.AI 90%

Towards Automated Air Traffic Safety Assessment Around Non-Towered Airports Using Large Language Models

基于大语言模型的非塔台机场飞行安全评估自动化方法研究

Torsten Darrell, Mahyar Ghazanfari, Jordan Kam, Alexandre Bayen, Amin Tabrizian, Peng Wei

机构 * Research Intern, Department of Mechanical and Aerospace Engineering, George Washington University(乔治华盛顿大学机械与航空航天工程系研究实习生) Ph.D. Student, Department of Mechanical and Aerospace Engineering, George Washington University(乔治华盛顿大学机械与航空航天工程系博士生) Undergraduate Student, Aerospace Program, University of California, Berkeley(加州大学伯克利分校航空航天项目本科生) Full Professor, Department of Electrical Engineering and Computer Science, University of California, Berkeley(加州大学伯克利分校电气工程与计算机科学系教授) Ph.D. Student, Department of Computer Science, George Washington University(乔治华盛顿大学计算机科学系博士生) Associate Professor, Department of Mechanical and Aerospace Engineering, George Washington University(乔治华盛顿大学机械与航空航天工程系副教授)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出利用视觉语言模型分析非塔台机场CTAF通讯、气象数据和飞行轨迹,通过实证研究和合成数据验证,展示框架在识别飞行冲突中的有效性,表明VLM在非塔台机场安全评估中的潜力。

Comments 25 pages, 17 figures, 5 tables, Accepted to AIAA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12022 2026-05-13 cs.CL 90%

SAGE: Scalable Automated Robustness Augmentation for LLM Knowledge Evaluation

SAGE:可扩展的自动鲁棒性增强用于LLM知识评估

Xiaoyuan Li, Yuzhe Wang, Moxin Li, Keqin Bao, Rui Men, Yichang Zhang, Dayiheng Liu, Wenjie Wang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SAGE通过细调小型模型构建大规模鲁棒性增强的知识评估基准,成本显著低于人工标注的HellaSwag-Pro,且细调模型可泛化至MMLU。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11376 2026-05-13 cs.AI 90%

LLM-X: A Scalable Negotiation-Oriented Exchange for Communication Among Personal LLM Agents

LLM-X:一种可扩展的面向协商的交换机制用于个人LLM代理间的通信

Giuliano Lorenzoni, Paulo Alencar, Donald Cowan

机构 * University of Waterloo(滑铁卢大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出LLM-X,一种可扩展的面向协商的交换机制,支持个人代理间的结构化通信。该机制引入了消息总线和路由子层,支持LLM间的协调,并保证了模式有效性和政策执行。贡献包括LLM-X的架构、类型化消息协议以及首次大规模LLM多代理协商的实证评估。

Comments 8 pages, 7 figures, accepted at AGENT 2026 Workshop, co-located with ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11269 2026-05-13 gr-qc astro-ph.HE astro-ph.IM cs.AI 90%

gwBenchmarks: Stress-Testing LLM Agents on High-Precision Gravitational Wave Astronomy

gwBenchmarks: 对高精度引力波天文学中LLM代理的应力测试

Tousif Islam, Digvijay Wadekar, Zihan Zhou

机构 * Kavli Institute for Theoretical Physics, University of California Santa Barbara, Kohn Hall, Lagoon Rd, Santa Barbara, CA 93106(加州大学圣芭芭拉分校凯弗利理论物理研究所) Center for Gravitational Physics, University of Texas at Austin, Austin, TX 78712, USA(德克萨斯大学奥斯汀分校引力物理中心) Department of Physics, Princeton University, Princeton, NJ 08540, USA(普林斯顿大学物理系)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究了最先进的LLM编码代理能否完成端到端的科学建模任务,通过八个任务测试其精度和物理系统推理能力,发现代理在复杂任务上表现不佳,无法达到领域要求。

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10990 2026-05-13 cs.SE cs.AI 90%

Skill Drift Is Contract Violation: Proactive Maintenance for LLM Agent Skill Libraries

技能漂移是合同违约:为LLM代理技能库的主动维护

Linfeng Fan, Yuan Tian, Ziwei Li, Zhiwu Lu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院) King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出通过提取可执行环境合同来检测LLM代理技能库中的技能漂移,通过区分噪声监控与精准维护信号,提升检测精度和修复效果,同时发布了一个技能退化基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11482 2026-05-13 cs.SE 89%

NeuroFlake: A Neuro-Symbolic LLM Framework for Flaky Test Classification

NeuroFlake:一种用于故障测试分类的神经符号LLM框架

Khondaker Tasnia Hoque, Toukir Ahammed

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出NeuroFlake框架,通过结合神经网络与符号方法,提升故障测试分类的鲁棒性与泛化能力,实验表明其在F1-score上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10036 2026-05-13 cs.CL cs.AI cs.IR cs.LG 89%

Reflect then Learn: Active Prompting for Information Extraction Guided by Introspective Confusion

先反思再学习:基于反思困惑的主动提示信息提取

Dong Zhao, Yadong Wang, Xiang Chen, Chenxi Wang, Hongliang Dai, Chuanxing Geng, Shengzhong Zhang, Shaoyuan Li, Sheng-Jun Huang

机构 * NUAA-MMMI(南京航空航天大学- MMMI)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出APIE框架,通过反思困惑度评估,主动选择具有挑战性和信息量的样本,提升信息提取的准确性和鲁棒性。

Comments Published at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13050 2026-05-13 cs.LG cs.AI cs.CL cs.CV cs.SD eess.AS 89%

Modality-Inconsistent Continual Learning of Multimodal Large Language Models

多模态大语言模型的模态不一致持续学习

Weiguo Pian, Shijian Deng, Shentong Mo, Mingrui Liu, Yunhui Guo, Yapeng Tian

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Carnegie Mellon University(卡内基梅隆大学) George Mason University(乔治·梅森大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MICL,一种针对多模态大语言模型的持续学习场景,涉及不一致的模态和变化的任务类型。通过伪目标生成模块和基于指令的知识蒸馏,解决任务类型转移导致的遗忘问题,实验验证了方法的有效性。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04265 2026-05-13 cs.AI cs.CL math.ST stat.ML stat.TH 88%

Don't Pass@k: A Bayesian Framework for Large Language Model Evaluation

不要Pass@k:大规模语言模型评估的贝叶斯框架

Mohsen Hariri, Amirhossein Samandar, Michael Hinczewski, Vipin Chaudhary

机构 * Department of Computer and Data Sciences, Case Western Reserve University(计算机与数据科学系,凯斯西储大学) Department of Physics, Case Western Reserve University(物理系,凯斯西储大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出基于贝叶斯的评估框架,用后验估计替代Pass@k和avg@N,提升排名稳定性与透明度,适用于二元和非二元评估。

Comments OpenReview (ICLR 2026): https://openreview.net/forum?id=PTXi3Ef4sT

Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12361 2026-05-13 cs.CL cs.AI cs.IR 88%

MedHopQA: A Disease-Centered Multi-Hop Reasoning Benchmark and Evaluation Framework for LLM-Based Biomedical Question Answering

MedHopQA: 一种以疾病为中心的多跳推理基准和评估框架,用于基于大语言模型的生物医学问答

Rezarta Islamaj, Robert Leaman, Joey Chan, Nicholas Wan, Qiao Jin, Natalie Xie, John Wilbur, Shubo Tian, Lana Yeganova, Po-Ting Lai, Chih-Hsuan Wei, Yifan Yang, Yao Ge, Qingqing Zhu, Zhizheng Wang, Zhiyong Lu

机构 * National Library of Medicine, Division of Intramural Research(国家医学图书馆,院内研究部) University of Illinois at Urbana-Champaign, Department of Computer Science(伊利诺伊大学厄巴纳-香槟分校计算机科学系) University of Michigan Medical School(密歇根大学医学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MedHopQA旨在通过多跳推理评估大语言模型在生物医学领域的表现,提供了一个以疾病为中心的基准和框架,强调组合推理、抗饱和性和抗污染性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09904 2026-05-13 cs.CV 88%

TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models

TOC-Bench:一个用于视频大语言模型的时序物体一致性基准

Junzhe Chen, Siyuan Meng, Yuxi Chen, Man Zhao, Wenyao Gui, Xiaojie Guo

机构 * Tianjin University(天津大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 TOC-Bench旨在评估视频大语言模型的时序物体一致性,通过设计三层时序必要性过滤协议,筛选出17900个时间依赖项,构建了包含2323个高质量问答对的基准,揭示了模型在事件计数、事件排序等任务上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11738 2026-05-13 cs.AI 87%

OptArgus: A Multi-Agent System to Detect Hallucinations in LLM-based Optimization Modeling

OptArgus:一种多智能体系统用于检测基于大语言模型的优化建模中的幻觉

Zhong Li, Zihan Guo, Xiaohan Lu, Juntao Wang, Jie Song, Chao Shen, Jiageng Wu, Mingyang Sun

机构 * Great Bay University(大湾大学) Peking University(北京大学) Jilin University(吉林大学) Zhejiang University(浙江大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出OptArgus多智能体系统,通过细粒度幻觉分类法检测优化建模中的错误,通过三部分基准测试验证其在清洁、控制和自然生成 artifact 上的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11330 2026-05-13 cs.AI 87%

Rethinking Evaluation for LLM Hallucination Detection: A Desiderata, A New RAG-based Benchmark, New Insights

重新思考LLM幻觉检测的评估:一种需求清单,一个新的基于RAG的基准,新的见解

Wenbo Chen, Veena Padmanabhan, Tootiya Giyahchi, Elaine Wong, Leman Akoglu

机构 * Amazon(亚马逊公司) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出了一种基于RAG的新型基准T RIVIA+,填补了现有基准在长上下文和噪声标签方面的空白,并通过实验揭示了当前检测器在RAG基准上的改进空间。

Comments ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11026 2026-05-13 cs.CR cs.CL 87%

AgentShield: Deception-based Compromise Detection for Tool-using LLM Agents

AgentShield:基于欺骗的工具使用LLM代理 compromise 检测

Yassin H. Rassul, Tarik A. Rashid

机构 * Computer Science and Engineering Department, School of Science and Engineering, University of Kurdistan Hewl\^{e}r, Erbil, Iraq(科罗曼嫩大学科学与工程学院计算机科学与工程系) Engineering Department, School of Science(科学学院工程系) Engineering, University of Kurdistan Hewl\ e r, Erbil, Iraq(科罗曼嫩大学工程学院) Innovation Centre, University of Kurdistan Hewl\ e r, Erbil, Iraq(科罗曼嫩大学创新中心)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 AgentShield 通过在代理工具接口中设置三层陷阱(假工具、假凭证、允许参数)来检测间接提示注入攻击,利用高精度标签训练自监督分类器,实现高准确率的实时检测与无误报的下游检测训练。

Comments 20 pages, 5 figures. Code: https://github.com/Yassin-H-Rassul/AgentShield

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05269 2026-05-13 cs.CV 87%

B4DL: A Benchmark for 4D LiDAR LLM in Spatio-Temporal Understanding

B4DL:用于空间时间理解的4D激光雷达LLM基准

Changho Choi, Youngwoo Shin, Gyojin Han, Dong-Jae Lee, Junmo Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出B4DL基准,用于训练和评估多模态大语言模型对4D激光雷达数据的理解,结合可扩展的数据生成管道和新模型,实现动态户外环境的空间时间推理。

Comments Accepted at ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11006 2026-05-13 cs.SE cs.AI 86%

An Execution-Verified Multi-Language Benchmark for Code Semantic Reasoning

一个经过执行验证的多语言基准用于代码语义推理

Yikun Li, Jinfeng Jiang, Ting Zhang, Chengran Yang, Chenxing Zhong, Yin Yide, Leow Wen Bin, Eng Lieh Ouh, Lwin Khin Shar, David Lo

机构 * Singapore Management University(新加坡管理大学) Monash University(墨尔本大学) Nanjing University of Science and Technology(南京理工大学) GovTech Singapore(新加坡政府科技局)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出TraceEval,首个经过执行验证的多语言代码语义推理基准,通过验证执行消除标注偏差,评估10个LLM在零样本下的表现,展示了其在代码语义推理中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11727 2026-05-13 cs.AI cs.CL cs.CV 85%

Allegory of the Cave: Measurement-Grounded Vision-Language Learning

洞穴的寓言:基于测量的视觉-语言学习

Kepeng Xu, Li Xu, Gang He, Wenxin Yu

机构 * Xidian University(西电大学) Southwest University of Science and Technology(西南科技大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了视觉-语言模型在更接近底层相机测量的视觉接口下,基于测量的视觉-语言学习是否能提升性能。PRISM-VL模型结合RAW数据、相机条件接地和曝光括号监督聚合,通过高质量数据集和基准测试,提升了BLEU、ROUGE-L和LLM-Judge的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11769 2026-05-13 cs.CL 84%

Safety-Oriented Evaluation of Language Understanding Systems for Air Traffic Control

面向安全的语言理解系统在空交通管制中的评估

Yujing Chang, Yash Guleria, Duc-Thinh Pham, Nhut-Huy Pham, Ningli Wang, Vu N. Duong, Sameer Alam

机构 * ATMRI, Nanyang Technological University (NTU), Singapore(航空交通管理研究所,南洋理工大学(NTU),新加坡) School of Management, Indian Institute of Technology Mandi, India(管理学院,印度理工学院曼迪分校,印度) Centre of AI Research, VinUniversity, Vietnam(人工智能研究中心,文大学,越南)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出面向安全的评估框架,揭示现有LLM在空交通管制中的可靠性不足,指出需建立后果意识的评估协议以确保AI辅助系统的安全部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12036 2026-05-13 eess.AS 83%

Towards Fine-Grained Multi-Dimensional Speech Understanding: Data Pipeline, Benchmark, and Model

迈向细粒度多维语音理解:数据管道、基准和模型

Guojian Li, Zhixian Zhao, Zhennan Lin, Jingbin Hu, Qirui Zhan, Yuang Cao, Pengyuan Xie, Chuan Xie, Jie Liu, Qiang Zhang, Zhonghua Fu, Lei Xie

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出FMSU-Bench基准和FM-Speech模型,通过数据管道优化、细粒度建模和渐进式课程训练,提升语音多维感知能力,验证现有语音LLM在细粒度多维理解上仍需改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12181 2026-05-13 cs.AI 83%

MolDeTox: Evaluating Language Model's Stepwise Fragment Editing for Molecular Detoxification

MolDeTox:评估语言模型的逐步片段编辑用于分子去毒化

Jueon Park, Wonjune Jang, Jiwoo Lee, Yein Park, Jaewoo Kang

机构 * Korea University(韩国大学) Myongji University(明知大学) AIGEN Sciences(AIGEN科技公司)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出MolDeTox基准,用于评估语言模型在分子去毒化中的逐步片段编辑能力,通过细粒度评估提升分子结构有效性与生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06139 2026-05-13 cs.CL 83%

GRP: Goal-Reversed Prompting for Zero-Shot Evaluation with LLMs

GRP:基于大语言模型的零样本评估中的目标反转提示

Mingyang Song, Mao Zheng, Xuan Luo

机构 * Tencent(腾讯)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出GRP方法,通过要求模型选择更差的答案来反转传统评估目标,从而提升判断准确性,实验表明其在多个基准测试中表现优异。

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12375 2026-05-13 cs.LG cs.AI 82%

Agent-Based Post-Hoc Correction of Agricultural Yield Forecasts

基于代理的农业产量预测事后修正

Matthew Beddows, Aiden Durrant, Georgios Leontidis

机构 * School of Natural and Computing Sciences(自然与计算科学学院) University of Aberdeen(阿伯丁大学) School of Computing Sciences(计算科学学院) University of East Anglia(东安格利亚大学) Department of Physics and Technology(物理与技术系) UiT The Arctic University of Norway(北欧大学(UiT))

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种结构化的LLM代理框架,用于事后修正现有模型预测,通过编码农业领域知识提升预测准确性,在草莓和玉米数据集上显著降低MAE和MASE。

Comments 21 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10442 2026-05-13 cs.CY cs.AI cs.CL 82%

StereoTales: A Multilingual Framework for Open-Ended Stereotype Discovery in LLMs

StereoTales:一个多语言框架,用于LLMs中的开放性刻板印象发现

Pierre Le Jeune, Étienne Duchesne, Weixuan Xiao, Stefano Palminteri, Bazire Houssin, Benoît Malézieux, Matteo Dora

机构 * Giskard AI École Normale Supérieure, INSERM, Paris(巴黎高等师范学院、INSERM、巴黎)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出StereoTales,一个多语言数据集和评估流程,用于系统研究开放性LLM生成中的社会偏见。研究发现所有模型在开放生成中都会产生有害刻板印象,提示语言显著影响刻板印象表现,且人类和LLM对有害性的判断基本一致。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02955 2026-05-13 cs.CV 82%

MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models

MotionBench: 视觉语言模型视频细粒度运动理解的基准测试与改进

Wenyi Hong, Yean Cheng, Zhuoyi Yang, Weihan Wang, Lefan Wang, Xiaotao Gu, Shiyu Huang, Yuxiao Dong, Jie Tang

机构 * Tsinghua University(清华大学) Zhipu AI(智谱AI)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract)

AI总结 MotionBench针对视觉语言模型在细粒度视频运动理解方面的不足,提出综合评估基准,通过六类运动导向问题类型评估模型运动层面感知能力,并提出Through-Encoder融合方法提升模型对有限序列长度内细粒度运动的感知。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏