arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2611 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2611 篇

2607.10103 2026-07-14 cs.CR cs.CL 新提交 90%

A Survey on LLM Watermarking: Theory and Deployment

大语言模型水印:理论与部署综述

Huy Phan, Kieu Dang, Ojaswi Dulal, Aiham AL Shukairi, Abby Shine, Chase Garner, Phung Lai

机构 * Truman State University(特伦特州立大学) University at Albany, State University of New York(纽约州立大学阿尔巴尼分校)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 综述大语言模型水印技术,通过从业者核心问题组织内容,综合技术家族并分析安全效用权衡,回顾攻击策略、评估协议等,为LLM水印设计提供实际指导,明确可靠部署的研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17041 2026-07-02 cs.CL cs.IR 新提交 90%

MetaSyn: A Benchmark for LLM Agents on Meta-Analysis Articles from Nature Portfolio

对Nature Portfolio元分析文章进行LLM代理基准测试

Anzhe Xie, Weihang Su, Yujia Zhou, Yiqun Liu, Min Zhang, Qingyao Ai

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出MetaSyn数据集,包含442篇专家策划的元分析,用于评估LLM代理在检索-筛选-综合全流程中的表现,发现当前系统在筛选阶段存在严重瓶颈。

Comments 17 pages, 8 figures, 11 tables. Code and evaluation: https://github.com/THUIR/MetaSyn Dataset: https://huggingface.co/datasets/THUIR/MetaSyn Model: https://huggingface.co/BFTree/MA-Retriever

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31039 2026-07-01 cs.CL 新提交 90%

Truth or Sophistry? LoFa: A Benchmark for LLM Robustness Against Logical Fallacies

真相还是诡辩?LoFa:大语言模型对逻辑谬误鲁棒性的基准测试

Xudong Shen, Li Yuan, Ye Chen, Xin Wu, Yi Cai, Zhiyong Wu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) South China University of Technology(华南理工大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出LoFa基准,通过多智能体管道生成事实与谬误配对,结合多轮辩论框架评估LLM对逻辑谬误的鲁棒性,并设计LFR@k指标量化抵抗能力。

Comments Accepted to ACL 2026 Main. 33 pages (9 pages main text)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27314 2026-06-26 cs.CL 新提交 90%

Beyond Surface Forms: A Comprehensive, Mechanism-Oriented Taxonomy of Indirect Linguistic Encoding for LLM-Based Coded Language Detection

超越表面形式:面向LLM的编码语言检测的全面、机制导向的间接语言编码分类法

Hamid Reza Firoozfar, Mohammadsadegh Abolhasani, Reza Mousavi, Paul Jen-Hwa Hu

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出一种机制导向的间接语言表达分类法,通过抽象编码操作而非沟通目标,在LLM提示中集成后,在TikTok和Bluesky数据集上检测准确率提升4.7%,F1提升5.4%。

Comments Submitted for review in ARR for EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26185 2026-06-26 cs.LG 新提交 90%

Necessary but Not Sufficient: Temperature Control and Reproducibility in LLM-as-Judge Safety Evaluations

必要但不充分:LLM作为评判者的安全评估中的温度控制与可重复性

Hiroki Tamba

机构 * Tamba Research Academy(Tamba研究学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 研究LLM评判者在安全评估中温度设置对结果可重复性的影响,发现温度未设置或设为0仍无法完全消除判决翻转,建议将评判者分歧作为首要健康指标。

Comments 7 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25608 2026-06-25 cs.CR cs.AI 新提交 90%

An Approach for a Supporting Multi-LLM System for Automated Certification Based on the German IT-Grundschutz

基于德国IT-Grundschutz的自动化认证的多LLM支持系统方法

Lea Roxanne Muth, Marian Margraf

机构 * Department of Mathematics and Computer Science(数学与计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种多LLM系统结合混合RAG的方法,用于半自动化BSI IT-Grundschutz认证,以提高效率、降低成本并应对NIS2指令带来的认证需求增长。

Comments Accepted for publication at the 2025 IEEE International Conference on Cyber Security and Resilience (IEEE CSR), Chania, Crete, Greece, August 4-6, 2025. 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24834 2026-06-24 cs.AI 新提交 90%

Accuracy and Satisfaction in Multi-Turn LLM Dialogues for NFR Assessment

多轮LLM对话中NFR评估的准确性与满意度

Ali Pourghasemi Fatideh, Wilder Baldwin, Maria Dhakal, Collin McMillan, Sepideh Ghanavati

机构 * University of Maine(缅因大学) University of Notre Dame(圣母大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 研究开发者在与LLM对话助手评估非功能需求(NFR)时的准确性和满意度,发现开发者倾向于同意LLM评估但准确性低,且长回复和过多信息提供轮次降低满意度,而主动交互提升满意度。

Comments 9 pages, 5 figures. Accepted to SIGDIAL 2026 (27th Annual Meeting of the Special Interest Group on Discourse and Dialogue)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22706 2026-06-23 cs.AI 新提交 90%

Safety-Aware Evaluation of LLM-Generated Driver Intervention Messages through Multi-Task Risk Fusion

通过多任务风险融合的LLM生成驾驶员干预信息的安全感知评估

Keito Inoshita

机构 * Faculty of Business and Commerce, Kansai University(关西大学商学部) Data Science and AI Innovation Research Promotion Center, Shiga University(滋贺大学数据科学与人工智能创新研究推进中心)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出DSAIS指标,结合规则与LLM评估五个维度,通过多任务风险融合框架提升干预信息质量,实验表明多任务集成使上下文相关性提升9.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21071 2026-06-23 cs.CR cs.AI 新提交 90%

Local LLM Agents as Vulnerable Runtimes:A Source-Code Audit of the Agent Runtime Layer

本地LLM智能体作为易受攻击的运行时:智能体运行时层的源代码审计

Zhengsong Zhang, Zongze Li, Jiawei Guo, Haipeng Cai

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University at Buffalo, SUNY(布法罗大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出CLAWAUDIT静态审计框架,通过STRIDE导出的五类漏洞分类法和自定义静态分析规则,评估本地LLM智能体运行时的安全弱点,在OpenClaw基准上显著提升召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20695 2026-06-23 cs.MA cs.AI 新提交 90%

How Much Coordination Gain Is Real? A Paired Noise-Floor Protocol for Multi-Agent LLM Benchmarks

真正的协调增益有多大?多智能体LLM基准测试的配对噪声底线协议

Alibek T Kaliyev, Artem Maryanskyy

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对多智能体LLM协调基准测试中微小增量不可靠的问题,提出配对噪声底线协议,通过配置等价对比发现典型效应量低于观测噪声包络,并定义协调活跃pass^k作为最低报告标准。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18774 2026-06-23 cs.LG 新提交 90%

RouteJudge: An Open Platform for Reproducible and Preference-Aware LLM Routing

RouteJudge: 一个可复现且偏好感知的LLM路由开放平台

Guannan Lai, Haoran Hu, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) SinapisAI

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 提出RouteJudge平台,通过匿名成对比较评估LLM路由策略的决策质量,并发布ORBIT工具箱标准化路由工作流,支持可复现和偏好感知的路由评估。

Comments Accepted by Pluralistic Alignment Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19787 2026-06-19 cs.AI 新提交 90%

ORAgentBench: Can LLM Agents Solve Challenging Operations Research Tasks End to End?

ORAgentBench: LLM代理能否解决具有挑战性的端到端运筹学任务?

Jiajun Li, Mingshu Cai, Yixuan Li, Yu Ding, Ran Hou, Guanyu Nie, Xiongwei Han, Wanyuan Wang

机构 * Southeast University(东南大学) Waseda University(早稻田大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ORAgentBench基准,评估LLM代理在端到端运筹学任务中的表现,发现当前代理通过率仅35.51%,主要受策略性弱点限制。

Comments 31 pages, preprint, v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18596 2026-06-18 cs.HC cs.AI 新提交 90%

Better Adherence, Richer Context: A Field Evaluation of LLM-Powered Conversational Voice Diaries for Sleep

更好的依从性,更丰富的上下文:基于LLM的对话式语音睡眠日记的现场评估

Amama Mahmood, Bokyung Kim, Honghao Zhao, Molly E. Atwood, Luis F. Buenaver, Michael T. Smith, Chien-Ming Huang

机构 * The Johns Hopkins University(约翰霍普金斯大学) Department of Psychiatry and Behavioral Sciences, The Johns Hopkins University School of Medicine(精神病学与行为科学系,约翰霍普金斯大学医学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 通过现场实验评估基于LLM的对话式语音睡眠日记,发现相比文本日记,语音日记提高了依从性并收集了更详细的上下文信息,但结构化字段完整性较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18129 2026-06-17 cs.HC cs.AI 新提交 90%

Towards Understanding and Measuring COGNITIVE ATROPHY in LLM Behaviour

理解和测量LLM行为中的认知萎缩

Abeer Badawi, Moyosoreoluwa Olatosi, Negin Baghbanzadeh, Laleh Seyyed-Kalantari, Frank Rudzicz, R. Shayna Rosenbaum, Sara Pishdadian, Elham Dolatabadi

机构 * York University(约克大学) Vector Institute(向量研究所) Rotman Research Institute(罗特曼研究学院) Dalhousie University(达尔豪斯大学) Centre for Addiction & Mental Health(成瘾与心理健康中心) KITE Research Institute(KITE研究机构)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM在心理健康支持中缺乏过程行为评估的问题,提出认知萎缩概念及基准,通过临床标注和专家评估揭示模型普遍存在中度至高度萎缩行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17213 2026-06-17 cs.CL cs.CV 新提交 90%

Revisiting LLM Adaptation for 3D CT Report Generation: A Study of Scaling and Diagnostic Priors

重新审视用于3D CT报告生成的LLM适应:缩放与诊断先验研究

Vanshali Sharma, Andrea M. Bejar, Halil Ertugrul Aktas, Quoc-Huy Trinh, Debesh Jha, Gorkem Durak, Ulas Bagci

机构 * Northwestern University(西北大学) University of South Dakota(南达科他大学) Aalto University(阿尔托大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出RAD3D-Prefix轻量级诊断先验框架,通过冻结大语言模型并融合多标签分类逻辑,在少量可训练参数下实现3D CT报告生成,优于全微调基线并展现强泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09004 2026-06-17 cs.AI 新提交 90%

LATTEArena: An Evaluation Framework for LLM-powered Tabular Feature Engineering (Extended Version)

LATTEArena: 基于LLM的表格特征工程评估框架(扩展版)

Ankai Hao, Ke Chen, Huan Li, Lidan Shou

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出LATTEArena,首个标准化评估框架,通过六维分类法分解15种方法、模块化竞技场和组件消融实验,揭示Tree-of-Thought与MCTS成本效益最优等16项关键发现。

Comments 31 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16613 2026-06-16 cs.AI 新提交 90%

CoffeeBench: Benchmarking Long-Horizon LLM Agents in Heterogeneous Multi-Agent Economies

CoffeeBench:异构多智能体经济中的长周期LLM智能体基准测试

Issa Sugiura, Daichi Hattori, Kazuo Araragi, Keita Ogawa, Shota Onose, Taro Makino, Teppei Usuki, Takashi Ishida

机构 * Sakana AI KPMG AZSA LLC

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出CoffeeBench基准,在90天模拟中评估LLM智能体在异构多智能体经济中的长周期任务表现,发现高性能模型更积极沟通,而Claude Haiku 4.5存在空闲漂移失败模式。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16364 2026-06-16 cs.AI cs.CR cs.SE 新提交 90%

Looking Is Not Picking: An Attention-Segment Account of Tool-Selection Failures in LLM Agents

看而非选:LLM智能体工具选择失败的注意力-片段解释

Shiyang Chen

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文通过分析LLM智能体对工具定义片段的注意力,发现工具选择失败源于决策读出阶段而非工具可见性,并提出了基于注意力的无训练选择器来修复。

Comments 13 pages, 1 figure, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16262 2026-06-16 cs.SE cs.AI 新提交 90%

UXBench: Measuring the Actionability of LLM-Generated UX Critiques

UXBench: 衡量LLM生成的UX评论的可操作性

Wenjie Wang, Yue Huang, Zipeng Ling, Han Bao, Hang hua, Xiaonan Luo, Yu Jiang, Shiyi Du, Yuexing Hao, Xiaomin Li, Yuchen Ma, Dianzhuo Wang, Yanfang Ye, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) University of Pennsylvania(宾夕法尼亚大学) University of Rochester(罗切斯特大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学) LMU Munich(慕尼黑路德维希-马克西米利安大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出UXBench基准,通过下游修复代理能否基于评论改进界面来评估LLM作为UX评判者的可操作性,发现不同模型在报告可操作性、修复特征和可靠性上存在显著差异。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15500 2026-06-16 cs.AR cs.AI cs.SY eess.SY 新提交 90%

LLM4RTL: Tool-Assisted LLM for RTL Generation

LLM4RTL: 工具辅助的大语言模型用于RTL生成

Jing Jin, Robert Chu, Ning Yan, Masood S. Mortazavi

机构 * UC Riverside(加州大学河滨分校) Futurewei(未来科技)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出JRCRC流水线,利用商业LLM层次结构过滤和优化RTL代码生成数据集,并设计工具辅助架构提升逻辑推理能力,在VerilogEval上超越多数方法,用更小模型达到GPT-4O性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15474 2026-06-16 cs.AI stat.AP 新提交 90%

Who Drifted: the System or the Judge? Anytime-Valid Attribution in LLM Evaluation Pipelines

谁漂移了:系统还是裁判?LLM评估流水线中的随时有效归因

Yitao Li

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种基于固定锚点集和赌检验的方法,区分LLM评估中产品性能下降与裁判模型变化导致的分数漂移,并证明其随时有效性和归因准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15029 2026-06-16 cs.AI 新提交 90%

Metric Match: A Subset Selection Approach to Evaluating LLM Judge Reliability

Metric Match:一种评估LLM评判可靠性的子集选择方法

Alyssa Unell, Natalie Dullerud, Naomi Boneh, Meena Jagadeesan, Tatsu Hashimoto, Nigam Shah, Sanmi Koyejo

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出Metric Match方法,通过选择少量样本进行人工标注,以子集匹配总体可靠性指标,从而高效估计LLM评判的可靠性,实验表明在15个数据集上平均估计误差降低18.7%,标注需求减少32.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14762 2026-06-16 cs.CV cs.AI 新提交 90%

Scribby: A Multi-Level LLM Framework for Semantic Video Analysis

Scribby: 一种用于语义视频分析的多级LLM框架

Julian Abelarde, Hugo Garrido-Lestache Belinchon

机构 * Department of Computer Science and Software Engineering, Milwaukee School of Engineering(密尔沃基工程学院计算机科学与软件工程系)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种基于LLM的视频摘要框架,通过微观索引(分析完整转录、句子及语义分组)平衡宏观理解与微观语义分析,并利用相关性热图实现语义分块和匹配的可视化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13706 2026-06-15 cs.AR cs.AI 新提交 90%

HierSVA: A Data Synthesis Pipeline, Dataset, and Benchmark for LLM-Driven Hierarchical Hardware Formal Verification

HierSVA:面向LLM驱动的层次化硬件形式化验证的数据合成流水线、数据集与基准

Maohua Nie, Jiang Zhu, Jingqun Zhang, Zhichen Zeng, Jiayi Wang, Sibo Zhang, Jialin Wang, C. -J. Richard Shi

机构 * University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出HierSVA套件,包含数据合成流水线、数据集和基准,用于LLM驱动的层次化硬件形式化验证;通过RTL预处理与LLM在环流程生成SystemVerilog断言,并构建342模块数据集;设计六轴指标评估断言质量,揭示LLM在层次化验证中的性能与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13111 2026-06-12 cs.CL 新提交 90%

MÖVE: A Holistic LLM Benchmark for the German Public Sector

MÖVE:德国公共部门的大语言模型整体基准

Camilla Dalerci, Thilo Michael, Robin Schaefer, Daniel Weinland

机构 * Innovations Department, Bundesdruckerei GmbH(德国联邦印钞公司创新部)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出MÖVE基准,从性能和治理两个维度评估39个LLM在德国公共部门的应用,发现无单一模型全面领先,模型大小非质量可靠指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12071 2026-06-11 cs.DL cs.AI 新提交 90%

On the Limits of LLM-as-Judge for Scientific Novelty Assessment

论LLM作为评审在科学新颖性评估中的局限性

Soumitra Sinhahajari, Navonil Majumder, Soujanya Poria

机构 * DeCLaRe Lab, Nanyang Technological University(德克莱实验室,南洋理工大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文通过构建RQ-Bench基准,发现LLM评审对模型生成的研究问题产生新颖性幻觉,而人类专家则持相反意见,揭示了LLM在评估科学新颖性时的可靠性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11316 2026-06-11 cs.CL 新提交 90%

Schützen: Evaluating LLM Safety in Bulgarian and German Contexts

Schützen: 在保加利亚语和德语语境中评估LLM安全性

Kiril Georgiev, Yuxia Wang, Dimitar Iliyanov Dimitrov, Preslav Nakov, Ivan Koychev

机构 * Sofia University "St. Kliment Ohridski" MBZUAI(索菲亚大学"圣克莱门特·奥赫里德斯基" MBZUAI)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有安全评估数据集以英语和中文为主的问题,构建了覆盖低资源语言保加利亚语和高资源语言德语的Schützen安全数据集,实验揭示多语言LLM在安全行为上的显著跨语言差异,强调了区域特定评估资源的必要性。

Comments 19 pages, 13 tables, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11016 2026-06-10 cs.AI 新提交 90%

Superficial Beliefs in LLM Decision-Making

LLM决策中的表面信念

Gabriel Freedman, Francesca Toni

机构 * Department of Computing, Imperial College London(帝国理工学院计算系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大型语言模型在二元选择中是否仅模仿理由,通过合成决策实验发现模型行为有系统性但自我报告与行为推断的驱动因素不完全一致,表明存在“表面信念”。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10389 2026-06-10 cs.AI 新提交 90%

Beyond Static Evaluation: Co-Evolutionary Mechanisms for LLM-Driven Strategy Evolution in Adversarial Games

超越静态评估:对抗性游戏中LLM驱动策略演化的协同进化机制

Haoran Li, Zengle Ge, Ziyang Zhang, Xiaomin Yuan, Yui Lo, Qianhui Liu, Bocheng An, Dongke Rong, Jiaqun Liu, Annan Li, Jianmin Wu, Dawei Yin, Dou Shen

机构 * Baidu Inc.(百度公司) University of Chinese Academy of Sciences(中国科学院大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) University of Technology Sydney(悉尼科技大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM驱动代码进化在对抗性多智能体游戏中因评估景观变化导致停滞的问题,提出评估器协同进化、层次深度评估和弱点压力三种机制,在MCTF任务中实现最优性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09863 2026-06-10 cs.LG 新提交 90%

From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents

从自信收尾到无声失败:LLM智能体中的虚假成功特征分析

Laksh Advani

机构 * Laksh Advani

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 研究LLM智能体在环境状态未完成时声称任务完成的虚假成功模式,发现其普遍存在但检测困难,轻量级TF-IDF检测器优于LLM评判器。

Comments Accepted to FAGEN@ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏