arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2611 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2611 篇

2606.14817 2026-06-16 cs.IR cs.AI 新提交 84%

Combining Retrieval-Augmented Text Generation with LLMs for Reading Content Recommendations

结合检索增强文本生成与大型语言模型的阅读内容推荐

Sooyeon Kim, Piotr S. Maciąg

机构 * Institute of Computer Science, Warsaw University of Technology(计算机科学学院,华沙技术大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出结合检索增强生成(RAG)与大型语言模型的系统,通过四个模块实现个性化阅读内容生成,实验表明RAG将相关性和接地性提升26-35个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06563 2026-06-16 cs.SE cs.AI 新提交 84%

AI-Driven Test Case Generation from Natural Language Requirements: A Survey of Techniques and Research Gaps

AI驱动的自然语言需求测试用例生成:技术与研究空白综述

Orimoloye Folorunsho, Hassan Reza

机构 * School of Electrical Engineering and Computer Science(电气工程与计算机科学学院)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 综述AI、NLP和LLM从自然语言需求生成测试用例的技术,指出当前方法无法同时满足自动化、歧义处理等六个质量维度,提出四个研究方向。

Comments 22 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14600 2026-06-15 cs.CL 新提交 84%

LoSoNA: A Benchmark for Local Social Norm Adaptation in Group Conversations

LoSoNA:群组对话中局部社交规范适应的基准

Mateusz Winiarek, Maksymilian Bilski, Mateusz Jacniacki

机构 * Humalike Research

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL

AI总结 提出LoSoNA基准,通过群聊场景测试LLM从对话历史推断并适应未明示的局部社交规范的能力,评估多种模型在不同提示条件下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12864 2026-06-12 cs.SE cs.AI 新提交 84%

Beyond Problem Solving: UOJ-Bench for Evaluating Code Generation, Hacking, and Repair in Competitive Programming

超越问题求解:用于评估竞赛编程中代码生成、攻击和修复的UOJ-Bench基准

Tingqiang Xu, Hangrui Zhou, Tianle Cai, Alex Gu, Kaifeng Lyu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出UOJ-Bench基准,通过代码生成、攻击和修复三项任务评估LLM在竞赛编程中的问题求解与人类代码错误识别能力,发现最强模型在一次性评估中无法识别超过50%的错误提交,但测试时扩展可提升至90%以上,且能发现约5%的满分提交中的错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09389 2026-06-09 cs.CL 新提交 84%

LexRubric: A Rubric-Guided Diagnostic Benchmark for Open-Ended Legal Tasks

LexRubric:面向开放式法律任务的基于评分指南的诊断基准

Yifan Chen, Haitao Li, Yiran Hu, Kaisong Song, Jun Lin, Yueyue Wu, Qingyao Ai, Min Zhang, Yiqun Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) University of Waterloo(滑铁卢大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出LexRubric基准,包含649个中国法律咨询与司法考试实例及12,337条原子评分标准,通过六维框架评估LLM在开放式法律任务中的可靠性,发现当前模型仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13624 2026-08-17 cs.CL cs.AI cs.SD 新提交 84%

Measuring Fairness in Large Audio Language Models via Semantic-Aware Bias Estimation

基于语义感知偏差估计的大音频语言模型公平性测量

Zhe Liu

机构 * Meta Platforms, Inc.(元平台公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大音频语言模型公平性评估中语义与说话人混淆因素的问题,提出语义感知混合效应回归框架,经实验验证可减少虚假结论,得到更稳健的子群体性能差异估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12150 2026-08-13 cs.AI cs.CL 新提交 84%

Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation

哪种模型表现最佳取决于你给的时间:大语言模型评估中依赖预算的排名

Rodrigo Guedes de Souza, Alison R. Panisson

机构 * Federal University of Santa Catarina (UFSC)(圣卡塔琳娜联邦大学(UFSC))

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过调整 token 生成预算评估 4 个大语言模型在 3 个推理基准的表现,发现模型排名随预算变化反转,提出需采用预算条件化的评估协议。

Comments 19 pages, 11 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10315 2026-08-12 cs.CL cs.AI 新提交 84%

Is This Your Final Answer? Cross-Contextual Consistency as a Measure of LLM Credibility

这是你的最终答案吗?跨上下文一致性作为大语言模型可信度的度量

Siyang Wu, Yibo Jiang, Bryon Aragam

机构 * University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出用跨上下文一致性(C3)度量大语言模型可信度,通过对比26个模型在6个基准上的原始与扰动提示生成结果,发现C3可作为互补评估维度与基准有用性诊断工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08722 2026-08-11 cs.LG cs.AI 新提交 84%

Gaming Without an Attacker: Benchmark Fingerprinting in LLM-Driven Search Under Selection Pressure

无攻击者的博弈:选择压力下大语言模型驱动搜索中的基准指纹识别

Víctor Gallego

机构 * Komorebi AI Technologies(Komorebi人工智能技术公司)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 本文研究发现,在带反馈的进化循环中,前沿LLM提出的GPU内核会对评估配置进行指纹识别,导致30%的分布内胜出案例无法迁移,进而给出失败分类与测量设计指导。

Comments Published as a conference paper at AI Measurement Science Workshop @ COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04670 2026-08-06 cs.CL cs.AI 新提交 84%

Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark

易完成,难选择:探究大型语言模型在ProverbIT基准上的性能

Enrico Mensa, Lorenzo Zane, Calogero Jerik Scozzaro, Matteo Delsanto, Tommaso Milani, Daniele Paolo Radicioni

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究构建了意大利谚语基准ProverbIT,评估13个前沿LLMs的谚语处理能力,发现LLMs虽能完成谚语任务,但在无正确答案的选择题中性能骤降,暴露其依赖记忆而非深层语义理解的局限。

Journal ref Proceedings of the Eleventh Italian Conference on Computational Linguistics (CLiC-it 2025), pages 722-734

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03044 2026-08-05 cs.CL cs.AI 新提交 84%

Emulate or Estimate? The Divergent Strengths of Base and Post-Trained Language Models for Opinion Simulation

模拟还是估计?基础语言模型与后训练语言模型在观点模拟中的差异化优势

Seth Grief-Albert, Jessica Bo, Difan Jiao, Ashton Anderson

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大型语言模型用于观点模拟的矛盾结果,区分了模拟与估计任务,发现基础模型更适合模拟、后训练模型更适合估计,为相关模型选择提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02689 2026-08-05 cs.CL cs.LG 新提交 84%

Stuck on "A": Diagnosing and Repairing Interface Injury in Attention-to-KDA Linearization of a 0.6B Language Model

困在“A”上:诊断与修复0.6B语言模型的KDA线性化注意力中的接口损伤

Ronglong Bao

专题命中 评测与基准 :language model(title);SFT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本研究将Qwen3-0.6B-Base的21层注意力转为KDA线性注意力,发现模型存在标签执着的接口损伤,经格式针对性KL阶段修复后,C-Eval分数提升12.48分,相关成果已开源。

Comments Code and models: https://github.com/Sisyphbaous-DT-Project/open-qingyi ; https://huggingface.co/shiershuihesaixiliya/qingyi-kda-0.6b . A version of this preprint is archived on Zenodo (DOI: 10.5281/zenodo.21722356)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02618 2026-08-05 cs.AI cs.CL 新提交 84%

Beyond the Hivemind: Escaping LLM Homogeneity via Meta-Persona Anchoring and Sequential Temperature Scaling

超越群体思维:通过元角色锚定与顺序温度缩放规避大语言模型同质化

Tairan Fu, Javier Conde, Carlos Arriaga, Gonzalo Martínez, Pedro Reviriego, Javier Coronado-Blázquez

机构 * Politecnico di Milano(米兰理工大学) Information Processing and Telecommunications Center(信息处理与电信中心) Universidad Politécnica de Madrid(马德里理工大学) Banco de España(西班牙银行)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大语言模型的同质化问题,提出元角色锚定结合过滤式温度缩放的框架,在INFINITY-CHAT数据集的约200亿参数模型上,将平均成对余弦相似度从0.85降至0.65,缩小了人工模式坍缩与人类多样性的差距并开源了框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00991 2026-08-04 cs.AI cs.CL 新提交 84%

SCHEDBench: A Benchmark for Evaluating LLM Constraint Faithfulness in Natural-Language Combinatorial Scheduling

SCHEDBench:评估大语言模型在自然语言组合调度中约束忠实度的基准

Shrenil Shaun Sharma, Avi Sharma

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SCHEDBench基准针对13个LLMs的测试表明,模型对同一调度问题的语义等价表述缺乏不变性,约束重排序引发的敏感性最为突出。

Comments 19 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00561 2026-08-04 cs.AI cs.CL cs.CV 新提交 84%

Through the LENS: Local Geometric Decomposition of Vision-Language Model Representations

通过LENS:视觉语言模型表示的局部几何分解

Shalom Kachko, Raz Lapid, Margarita Vald, Almog Dubin, Moshe Sipper

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出LENS方法,将VLM激活分解为局部低秩高斯邻域,揭示LLaVA与Qwen3-VL的不同模态融合轨迹,该方法可实现因果生成干预并提升多模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25308 2026-07-29 cs.CL cs.AI 新提交 84%

CAST: Game Solvers as Turn-Level Teachers for LLM Agents

CAST:将游戏求解器作为大语言模型智能体的回合级教师

Yu Wang, Yi-Kai Zhang, Wentao Shi, Ziang Ye, Yuchun Miao, Yueqing Sun, Qi Gu, Xunliang Cai, Lan-Zhe Guo, Han-Jia Ye, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) Wuhan University(武汉大学) Meituan(美团)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究如何训练大语言模型在长期游戏中决策,提出CAST方法,利用游戏求解器状态值变化转化为求解器优势并注入RLVR,在多个游戏中优于基线,实现高平均零样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23976 2026-07-28 cs.CL cs.AI 新提交 84%

Tag Questions and the Generational Reversal of Sycophancy Across 45 Language Models

标签问题与45种语言模型中谄媚现象的代际反转

Tapan Parikh

机构 * Cornell Tech(康奈尔科技)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究在语言模型决策问题中附加标签的效应,通过特定实验设置在45个模型上测量,发现效应范围广且随代际反转,定位了抗性来源,表明标签极性更关键,工具能从模型行为读出反谄媚训练情况。

Comments 18 pages, 4 figures. Data, code, and raw model replies: https://github.com/tap2k/modelun. Interactive explorer: https://tap2k.github.io/modelun/suggestibility/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18983 2026-07-22 cs.CL cs.AI cs.HC 新提交 84%

AutoJourn: Multi-Perspective Summarisation, Bias Detection and Bias Neutralisation for LLM-Generated News in Automated Journalism

AutoJourn:自动新闻中基于大语言模型生成的新闻的多视角摘要、偏差检测与偏差中和

Himel Ghosh, Ahmed Mosharafa, Georg Groh

机构 * Technical University of Munich(慕尼黑工业大学) Sapienza University of Rome(罗马第一大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AutoJourn系统旨在应对自动新闻中多视角新闻生成及偏差问题,通过整合提示工程与检索增强等,产生多样视角集,经多视角摘要模块和偏差分析套件,实现不同视角提取、平衡摘要生成及偏差检测与中和,评估显示其优于基线且保持内容保真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17765 2026-07-21 cs.LG cs.AI cs.DB 新提交 84%

FIFA World Cup 2026 as a Contamination-Free Benchmark for LLM Forecasting Agents: Four Models, a Bookmaker, and 104 Matches

2026年国际足联世界杯作为语言模型预测代理的无污染基准:四个模型、一个博彩公司和104场比赛

Jiacheng Ding, Cong Guo, Jason Xu

机构 * University of Memphis(孟菲斯大学) QuantaInsight(量子洞察)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 介绍WC2026-Agents基准和数据集,用于评估大语言模型作为世界杯预测代理。四个前沿模型对104场比赛运行相同循环,与博彩市场数据配对。揭示模型预测虽有相同首选,但在决策质量等方面差异大,可衡量校准等方面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07219 2026-07-09 cs.CV cs.AI cs.LG 新提交 84%

Vision Foundation Models in Radiology: A Scoping Review of Data, Methodology, Evaluation and Clinical Translation

放射学中的视觉基础模型:数据、方法、评估和临床转化的范围综述

Alejandro Vergara-Richart, Xavier Rafael-Palou, Almudena Fuster-Matanzo, Ignacio Iborra Roncales, Ángel Alberich-Bayarri, Ana Jiménez-Pastor

机构 * Universitat Politècnica de València(瓦伦西亚理工大学)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 对2017年1月至2026年3月关于放射成像数据训练基础模型的研究综述,涵盖数据、架构、评估等方面。Transformer架构和自监督预训练为主,评估集中在分割和分类。虽有可迁移性,但临床转化因多种问题受限。

Comments 33 pages, 8 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04686 2026-07-07 cs.CL cs.AI cs.SE 新提交 84%

ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents

ToolFailBench:诊断大语言模型智能体中的工具使用失败

Harsh Soni

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 介绍ToolFailBench诊断基准,用于衡量金融、医学等领域1000个任务中的工具使用失败情况。通过规则分类器和大语言模型裁判标注失败类型,发现模型工具使用存在差异,强调评估应考量多方面。

Comments 18 pages, 3 figures. Published at the Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) and the Workshop on Failure Modes of Agentic AI (FAGEN) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27288 2026-06-26 cs.AI cs.LG 新提交 84%

When Does Combining Language Models Help? A Co-Failure Ceiling on Routing, Voting, and Mixture-of-Agents Across 67 Frontier Models

语言模型组合何时有效?基于67个前沿模型的协同失败上限:路由、投票与多智能体混合

Josef Chen

机构 * KAIKAKU

专题命中 评测与基准 :language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究多模型系统(路由、投票、级联等)的准确率上限,发现其增益受限于所有模型同时出错的比率β,而非常用的平均成对误差相关性ρ,并通过67个模型实验验证了β的显著低估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24589 2026-06-24 cs.AI cs.CL 新提交 84%

AdversaBench: Automated LLM Red-Teaming with Multi-Judge Confirmation and Cross-Model Transferability

AdversaBench: 基于多裁判确认与跨模型迁移性的自动化大语言模型红队测试

Khanak Khandelwal

机构 * Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出AdversaBench端到端红队测试流水线,使用五种结构化算子变异种子提示,通过三裁判加元裁判机制确认失败,实验发现算子效果因类别而异、二元失败率掩盖难度、裁判一致性受标签偏斜影响、对抗提示可跨模型迁移。

Comments 10 pages, 4 figures, 5 tables. Code and data at https://github.com/khanak0509/AdversaBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20074 2026-06-19 eess.SP cs.AI cs.LG 新提交 84%

Evaluation of EEG Foundation Models for Event-Based Burst-Suppression Detection in ICU

用于ICU中基于事件的爆发-抑制检测的EEG基础模型评估

Elisa Vasta, Thorir Mar Ingolfsson, Andrea Cossettini, Luca Benini, Tilman Beck, Emanuela Keller, Una Pale

机构 * DEI, University of Bologna, Bologna, Italy(DEI,博洛尼亚大学,博洛尼亚,意大利)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究首次评估EEG基础模型在ICU中无需患者校准的爆发检测性能,REVE-base模型在事件级F1分数上达到0.868,并将每分钟爆发错误率分别降低52.1%和36.2%。

Comments 4 pages, 1 figure. Code available upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18557 2026-06-18 cs.AI cs.LG cs.LO 新提交 84%

DeFAb: A Verifiable Benchmark for Defeasible Abduction in Foundation Models

DeFAb:基础模型中可废止溯因的可验证基准

Patrick Cooper, Alvaro Velasquez

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 评测与基准 :foundation model(title);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 提出DeFAb基准,通过将知识库转换为可验证的溯因实例,评估基础模型在可废止推理中的创造力与理论推理能力,发现前沿模型准确率远低于符号求解器。

Comments 33 pages, 14 figures, 23 tables. Dataset: https://huggingface.co/datasets/PatrickAllenCooper/DeFAb ; code and evaluation harness: https://github.com/PatrickAllenCooper/blanc

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15436 2026-06-16 cs.LG cs.AI eess.AS 新提交 84%

Beyond Classification: A Cough Regression Benchmark for Respiratory Acoustic Foundation Models

超越分类:呼吸声学基础模型的咳嗽回归基准

Mayur Sanap, Prasanna Desikan, Edgar Lobaton

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出多模型多目标咳嗽回归基准,评估五个基础模型在六个目标上的表现,发现MLP-small优于线性探测,揭示数据集大小与头部容量的权衡,并展示跨数据集迁移的不对称性。

Comments Accepted at the ICML 2026 Workshop on Structured Data for Health

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11409 2026-06-11 cs.LG cs.AI cs.CR 新提交 84%

Risk Under Pressure: Compute-Aware Evaluation of Adversarial Robustness in Language Models

压力下的风险:语言模型对抗鲁棒性的计算感知评估

Malikeh Ehghaghi, Boglárka Ecsedi, Marsha Chechik, Colin Raffel

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Hugging Face

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 提出基于计算压力(累积FLOPs)的对抗鲁棒性评估框架,通过风险-计算曲线和两个新指标,揭示不同攻击策略的计算成本差异,并在10个模型上验证了对齐训练、模型规模等因素对计算空间鲁棒性的非单调影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09046 2026-06-09 cs.LG cs.CL cs.IR 新提交 84%

Decoy-Calibrated Failure Audits for Language Models

语言模型的诱饵校准失败审计

Vyzantinos Repantis, Ameya Gawde, Harshvardhan Singh

机构 * Meta Platforms(Meta平台)

专题命中 评测与基准 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出Janus程序,通过诱饵校准和留出数据验证,判断语言模型错误解释的可信度,避免选择偏差。

Comments 14 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12547 2026-08-14 cs.MA cs.RO 新提交 83%

Do LLMs Beat Nash? Testing Decentralized Coordination in Self-Play Multi-Agent Games

大型语言模型智能体能胜过纳什(均衡)吗?测试自玩多智能体游戏中的去中心化协调

Deborah Sinishaw, Qile Zhu, Edwin Meriaux, Gregory Dudek

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究测试无通信时LLM智能体能否超越纳什均衡,构建无通信博弈基准发现部分前沿托管模型可超越纳什,开放权重模型收益有限且无法迁移至多智能体团队。

Comments 5 pages, 5 figures. Submitted to the 2026 IEEE MIT Undergraduate Research Technology Conference (URTC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06301 2026-08-07 cs.AI cs.CL cs.LG 新提交 83%

HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

HarnessOpt-Bench:评估大型语言模型的 harness 优化能力

Varun Ursekar, Apaar Shanker, Yash Maurya, Shehab Yasser, Vijay S. Kalmath, Veronica Chatrath, Yuan Xue

机构 * Scale AI

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出HarnessOpt-Bench基准,评估前沿LLM在高成本随机评估下的端到端harness优化能力,发现优化器模型差异大于编码harness、原生harness非始终更优,该能力具可测性与提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏