arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2611 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2611 篇

2608.07544 2026-08-11 cs.NE cs.AI 新提交 90%

MOSAIC: Adversarial Co-evolution of Specialist Heuristics and Problem Instances for LLM-based Automated Heuristic Design

MOSAIC:针对基于大语言模型的自动启发式设计的专用启发式算法与问题实例的对抗性协同进化

Oguzhan Gungordu, Siheng Xiong, Faramarz Fekri

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出MOSAIC框架,通过对抗性协同进化组合优化问题的专用启发式算法与问题实例,构建区域专用启发式算法池,所提取的组合在各类基准测试中均优于现有最先进的基于LLM的自动启发式设计方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07437 2026-08-10 cs.AI 新提交 90%

Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing

Fisher-R1:训练用于可靠假设检验的大语言模型智能体

Jiacheng Miao, Jin Mu, Guanhua Chen, James Zou

机构 * Stanford University(斯坦福大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究构建了含425项多领域假设检验任务的P-Bench基准,训练出Fisher-R1智能体,其在P-Bench上较DeepSeek-V4-Pro单试验成功率平均提升21%,证明强化学习可提升LLM的统计推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06949 2026-08-10 cs.AI 新提交 90%

Does Splitting a Triage Decision Across Agents Hide Bias or Help Catch It? A Multi-Agent Simulation Study of LLM-Based Resource Allocation Under Audit Capacity Constraints

在智能体间拆分分诊决策是隐藏偏差还是有助于发现偏差?审计能力约束下基于大语言模型的资源分配多智能体模拟研究

Paul-Peter Arslan

机构 * Institute for Future Technologies(未来技术研究所)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究通过多智能体模拟发现,在LLM资源分配中拆分决策为多智能体流程未显著改变偏差发生率,但审计能力影响偏差发现率,风险排序审核可提升覆盖范围。

Comments 6 pages, 2 figures, 3 tables. Code and data available at https://github.com/Polpii/policy-town

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07439 2026-08-10 cs.CL quant-ph 新提交 90%

An Exploratory Evaluation of LLM-Assisted Rewriting of Moderate-Complexity Financial Sentences for DisCoCat-Based Sentiment Analysis

基于DisCoCat的情感分析中,大语言模型辅助改写中等复杂度金融句子的探索性评估

Brian Llinas, Nikos Chrisochoides

专题命中 评测与基准 :LLM(title,summary_cn);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本研究提出LLM辅助的预处理工作流,通过改写优化中等复杂度金融句子以适配DisCoCat情感分析,经对比实验验证其可降低电路资源消耗并提升准确率,为可扩展QNLP金融情感分析提供探索性依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06085 2026-08-07 cs.AI 新提交 90%

Signal or Spurious Cue? A Randomized Audit of Survey-Country Metadata in LLM Social Inference

信号还是虚假线索?对LLM社会推理中调查国元数据的随机审计

Yifan Lyu, Xinran Li, Jiaqi Qiao, Xiujuan Xu

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究通过对5个API模型、6国7目标的审计,发现LLM社会推理中调查国元数据可降低预测损失,但随机披露该线索无法可靠减弱其误导性,PROV-FORECAST数据集含14400组概率分布。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04333 2026-08-06 cs.LG 新提交 90%

Cost-Aware Multi-Objective Bandits: Theory and Application to Budgeted LLM Configuration Evaluation

成本感知多目标老虎机:理论及在预算约束下的大语言模型配置评估中的应用

Bo Xue, Zhi Hong, Jiayi Li, Yuanyu Wan, Ji Cheng, Shuang Qiu

机构 * City University of Hong Kong(香港城市大学) South China University of Technology(华南理工大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文将LLM配置评估建模为成本感知多目标老虎机问题,提出基于超体积的UCB算法与成本感知经验差距消除算法,在有限预算下实现高效在线决策和准确的帕累托识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04041 2026-08-06 cs.LG 新提交 90%

An Explainable LLM Agent Layer for Open-World Anomaly Detection in Oil Wells

用于油井开放世界异常检测的可解释大语言模型智能体层

Lucas Gouveia Omena Lopes, Thales Miranda de Almeida Vieira, Eduardo Toledo de Lima Junior, William Wagner Matos Lira

机构 * Laboratory of Scientific Computing and Visualization, Federal University of Alagoas(阿拉戈斯联邦大学科学计算与可视化实验室) Computing Institute, Federal University of Alagoas(阿拉戈斯联邦大学计算学院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种部署在油井开放世界异常检测OWL流程下游的LLM智能体层,借助Qwen3.5-397B-A17B模型,可解释上游决策、标记分歧、命名新异常,缩小OWL流程的可解释性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03636 2026-08-05 cs.NE cs.AI 新提交 90%

MuEvo: LLM-Driven Evolution of Multi-Heuristic Ensemble

MuEvo:大语言模型驱动的多启发式集成演化

Haoze Lv, Ning Lu, Shengcai Liu, Shaofeng Zhang, Ke Tang

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MuEvo框架,结合动态组件管理与LLM驱动协同演化,在四类组合优化领域的实验显示其优于现有LLM-AHD方法,可改进人工设计的优化框架。

Comments 30 pages, 4 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03627 2026-08-05 cs.AI 新提交 90%

Unequal Verdicts: Investigating Gender Bias in LLM-Based Fake News Detection

不等的裁决:研究基于大语言模型的假新闻检测中的性别偏见

Razieh Chalehchaleh, Reza Farahbakhsh, Noel Crespi

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过扩展LIAR基准数据集,评估六个LLM的假新闻检测性能,发现存在性别偏见,影响检测的可靠性与公平性,且数据集已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03591 2026-08-05 cs.CR cs.AI 新提交 90%

DiagChain: A Diagnostic Benchmark for Evaluating LLM Agents on Evidence-Grounded Attack Chain Reconstruction

DiagChain:用于评估大语言模型智能体基于证据的攻击链重构的诊断基准

Xuyang Liu, Yibin Han, Zhenwei Zhang, Kai Chang, Zhiwei Xu, Tian Qiu, Weixian Deng, Jiabao Gao, Xiaolin Peng, Hai Wan, Xibin Zhao

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对LLM智能体攻击链重构基准的不足,提出DiagChain基准与ECRAG方法,经6种LLM评估发现模型在证据整合与排序环节存在瓶颈,为网络安全智能体改进提供了诊断依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03501 2026-08-05 cs.AI 新提交 90%

Can LLM design high-quality experiments? A Comprehensive and Systematic Benchmark on Autonomous Experimental Design

大语言模型(LLM)能否设计高质量实验?一项针对自主实验设计的全面系统基准测试

Zejun Liu, Jian Wu, Ru Peng, Yuliang Ji, Dongyuan Li, Renhe Jiang, Yue Zhang

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究构建SCOPE基准评估LLM的自主实验设计能力,发现多数LLM无法直接设计高质量实验,低层配置存在瓶颈,进而提出OptED工作流缓解该瓶颈。

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03239 2026-08-05 cs.CL 新提交 90%

Relational Priors as Convergence Pressure in LLM-Based Multi-Agent Systems

关系先验作为基于大语言模型的多智能体系统中的收敛压力

Ming Shen, Chao Shang, Sadat Shahriar, Devang Kulshreshtha, Yi Zhang, Sandesh Swamy, Yanjun Qi

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究将关系先验注入LLM-MAS提示中,发现其主要起收敛压力作用,正向性提升可促进智能体协调但未必提高准确性,建议按需使用而非默认添加。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02677 2026-08-05 cs.SE cs.AI cs.MA 新提交 90%

When Policies Change Probabilities: Modular Decision-Making for LLM Code Review

当策略改变概率时:用于LLM代码审查的模块化决策

Rasvik Kudum, Max Corbett, Hitansh Paliwal, Romaisa Fatima, Thomas Jiralerspong, Sneheel Sarangi

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究针对LLM代码审查,测试4种审查界面的策略与概率分离情况,提出模块化流水线可提升概率准确性、降低损失,验证了风险与行动分离评估的必要性。

Comments 20 pages, 6 figures; includes technical appendices. Code and data: https://github.com/rasvik/when-policies-change-probabilities

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02024 2026-08-04 cs.AI cs.CY 新提交 90%

EduZone: A Framework for Evaluating LLM Safety for K-12 Students and Teachers

EduZone:面向K-12学生与教师的大语言模型安全评估框架

Junyeong Park, Jieun Han, Haneul Yoo, So-Yeon Ahn, Jinsung Yoon, Alice Oh

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EduZone是针对K-12教育场景的LLM安全评估框架,整合多维度要素生成对抗交互,评估10个LLMs后发现其对教育特定风险更脆弱,现有防护措施不足,该框架可助力开发更安全的教育类LLMs。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01810 2026-08-04 cs.CL 新提交 90%

RADAR: Rubric-Aware Dependency and Redundancy Analysis for LLM-as-Judge Evaluation

RADAR:用于LLM作为评判者评估的基于 Rubric 的依赖与冗余分析

Divyansh Singh, Reza Davari, Afra Mashhadi

机构 * Microsoft(微软公司) University of Florida(佛罗里达大学) University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出 RADAR 框架,用于在 LLM 作为评判者的大规模评估前,通过少量探针估计评估标准间的耦合,验证显示其可恢复人类标准间高相关性,提供审计信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01684 2026-08-04 cs.AI 新提交 90%

GABench: A Comprehensive Benchmark for Evaluating LLM Agents on Graph Analysis Tasks

GABench:用于评估大语言模型智能体图分析任务的综合基准

Jiarui Tan, Zhongjian Zhang, YaBo Guo, Jiawei Liu, Yujie Xing, Muhan Zhang, Cheng Yang, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出GABench这一综合基准,涵盖多类图类型与任务及84个可执行工具,构建10400个带可验证答案的任务,评估前沿LLM及智能体框架,发现现有智能体应对复杂图任务仍存局限等结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01633 2026-08-04 cs.LG 新提交 90%

GraphIR: Architecture-Level Search States for LLM-Guided Neural Architecture Evolution

GraphIR:面向大语言模型引导的神经架构演化的架构级搜索状态

Zhen Liu, Wanqi Zhou, Shuanghao Bai, Yuhan Liu, Jinjun Wang, Jingwen Fu

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对LLM引导NAS中代码级表示无法满足架构变异需求的问题,提出架构感知中间表示GraphIR,在六个下游基准中集成到OpenEvolve后实现最佳搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00685 2026-08-04 cs.AI 新提交 90%

When Does LLM Orchestration Pay Off? A Controlled Evaluation of Accuracy, Cost, and Task Difficulty

LLM编排何时划算?关于准确率、成本与任务难度的对照评估

Nicolas Leins, Nico Pelleriti, Jana Gonnermann-Müller, Sebastian Pokutta

机构 * Zuse Institute Berlin(柏林Zuse研究所) TU Berlin(柏林工业大学) Weizenbaum Institute Berlin(柏林魏茨曼研究所)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究对照评估了Self-Refine等三种LLM编排方法与基线方法在5种骨干模型、3个领域的表现,发现编排收益依赖模型,需权衡准确率提升与额外推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28840 2026-08-03 cs.CL cs.SE 新提交 90%

Benchmarks Are Not Validation: A System-Level View of Financial LLM Applications

基准测试并非验证:金融大语言模型应用的系统级视角

Burak Payzun, İrem Demirtaş, Simona Scala, Elena Ferretti, Seçil Arslan

机构 * Prometeia S.p.A.(普罗米特亚公司)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究指出金融大语言模型不能仅靠基准测试验证,提出需从系统全栈进行多层验证,还讨论了LLM-as-a-judge的应用与控制措施,强调要研究系统感知基准等相关方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28643 2026-08-03 cs.HC cs.CL 新提交 90%

To Facilitate or not to Facilitate: Human and LLM Facilitator Tendencies in Online Discussions

是否促进:在线讨论中的人类与大语言模型(LLM)促进者倾向

Dimitris Tsirmpas, Katerina Korre, John Pavlopoulos

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本研究创建PEFK语料库,对比人类与LLM的在线讨论促进倾向,发现LLM过度急于促进,训练ModernBert分类器修正效果优于LLM替代设置。

Comments For the moderators: The acronym package may complain that some "acro" references are undefined. These references are, in fact, defined and the readability of the article remains the same

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28006 2026-07-31 cs.AI 新提交 90%

MMLDSum-LLM: Multimodal Long-Document Summarization with Visual-Alignment and Keyword-Aware

MMLDSum-LLM:结合视觉对齐与关键词感知的多模态长文档摘要方法

Xianpeng Zhang, Jiahua Yang, Dongyu Chen, Lei zhang, Jian Ma, Xu guohuan, Haonan Lu, Tianhuang Su, Chuangchuang Wang, Kai Tang

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对多模态长文档摘要的关键信息遗漏与跨模态幻觉问题,提出结合视觉对齐与关键词感知的两阶段训练框架MMLDSum-LLM,在自研基准MMLDSum-Bench上验证了其性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26849 2026-07-30 cs.CR cs.LG 新提交 90%

ToxScreen: Detecting Whether an LLM Has Been Poisoned

ToxScreen:检测大语言模型是否被植入后门

Anthony Hughes, Nicole Xing, Collin Francel, Andy Kim, Andrew Draganov

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出ToxScreen基准,研究现实条件下防御者能否恢复LLM的后门触发器,发现令牌查找方法可有效恢复触发器,且易越狱模型是有用信号,相关模型与代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26724 2026-07-30 cs.AI 新提交 90%

UrbanDS: A Graph-Guided LLM Multi-Agent System for Data-Intensive Urban Tasks

UrbanDS:一种用于数据密集型城市任务的图引导大语言模型多智能体系统

Zhilun Zhou, Jianghao Yu, Yuming Lin, yongjun yang, Sun Yongquan, Depeng Jin, Yong Li

机构 * Tsinghua University(清华大学) Jiangmen Municipal Smart Social Governance Technology Innovation Center(江门市智慧社会治理技术创新中心)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对数据密集型城市任务中现有LLM智能体依赖有限数据集的问题,提出图引导多智能体系统UrbanDS,构建基准UrbanDS-Bench验证其性能,该系统已在武汉东西湖城市平台落地应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25297 2026-07-29 cs.CR cs.AI 新提交 90%

Hybrid Analysis for Secure MCP Tool Use in LLM Agents

用于大语言模型智能体中安全MCP工具使用的混合分析

Ping He, Yuexiang Xie, Yaliang Li, Shouling Ji

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究LLM智能体中MCP工具使用的安全问题,提出基于混合分析的MTGuard框架,利用生命周期感知的静态 - 动态协同分析,有效减轻有害工具使用,保持良性任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21614 2026-07-27 cs.AI 新提交 90%

Household Movement Detection in Mixed-Format Occupancy Data Using LLM-Based Entity Resolution

使用基于大语言模型的实体解析在混合格式居住数据中进行家庭移动检测

Sasirekha Oguri, John R. Talburt, Mert Can Cakmak

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究在混合格式居住数据中检测家庭移动相关间接实体链接的问题,核心方法是集成基于提示的LLM命名实体识别、语义文本嵌入和基于图的推理,主要贡献是提高召回率和F1分数。

Comments Computer Science & Information Technology (CS & IT) ISSN : 2231 - 5403, Volume 16, Number 10, May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21010 2026-07-24 cs.AI 新提交 90%

Reexamining zero-shot summarization: Empirical investigation of trustworthiness of LLM-summarizers

重新审视零样本摘要:对大语言模型摘要器可信度的实证研究

Vasudha Bhatnagar, Purnima Bindal, Vikas Kumar, Raj Kumari Bahl

机构 * Department of Computer Science, University of Delhi(德里大学计算机科学系) Department of Statistics, Ramjas College, University of Delhi(德里大学拉姆贾斯学院统计系)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型零样本摘要的稳定性与可信度问题,提出两级诊断协议,通过文档级稳定性分析及分层样本观察估计稳定性指数,经对三种文档类型的三个LLM摘要器实证研究,揭示差异,推动相关研究发展。

Comments 28 pages, Under review in a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20531 2026-07-24 cs.AI 新提交 90%

DynamicMCPBench: A Trace-Grounded, Effect-Scored Benchmark for LLM Agents over Live MCP Servers

DynamicMCPBench:用于实时MCP服务器上的大语言模型智能体的基于轨迹的效果评分基准测试

Jerzy Kamiński, Ilya Galyukshev, Artem Kuznetsov, Sergey Chuprin, Kirill Redko, Aidar Shumbalov, Anna Kalyuzhnaya

机构 * ITMO University(俄罗斯圣彼得堡国立信息技术机械与光学大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对LLM智能体在MCP服务器上的评估基准问题,提出DynamicMCPBench框架,能生成目标、追踪轨迹并按效果评分。大规模测试发现智能体处理长多步任务能力不足,且该框架可重复运行,人工验证其自动评分可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17615 2026-07-21 cs.SD cs.AI 新提交 90%

Re-Sonance: A Dysarthric Asynchronous Real-Time Speech Conversion System Based on a Three-Stage Cascaded ASR-LLM-TTS Architecture

共振:基于三级级联ASR-LLM-TTS架构的构音障碍异步实时语音转换系统

Yuxuan Wu, Yifan Xu, Junkun Wang, Jiayong Jiang, Xin Zhao, Zhaojie Luo

机构 * Southeast University(东南大学) School of Biological Science & Medical Engineering, Southeast University(东南大学生物科学与医学工程学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对构音障碍患者在专业演讲场景的沟通问题,提出基于三级级联ASR-LLM-TTS架构的Re-Sonance系统,集成多种技术,经评估其能提高轻度至中度构音障碍患者语音清晰度与自然度,验证了基于LLM方法增强语音驱动AAC系统的潜力。

Comments Accepted by NCMMSC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15899 2026-07-20 cs.LG 新提交 90%

ContinuityBench: A Benchmark and Systems Study of Stateful Failover in Multi-Provider LLM Routing

ContinuityBench:多提供商大语言模型路由中有状态故障转移的基准测试与系统研究

Vishal Pandey, Gopal Singh

机构 * Metriqual(梅特里夸尔)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究多提供商LLM路由中状态故障转移问题,提出有状态代理架构及历史转发策略,引入新指标,通过continuity - bench评估,实证表明该架构CPR达99.20%,刻画延迟分布,为构建多模型推理系统提供基础。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14118 2026-07-17 cs.CL cs.SE 新提交 90%

Budgeted Subset Refinement for Execution-Aware LLM Research Ideation

用于执行感知大语言模型研究构思的预算子集优化

Micah Zhang

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对LLMs生成研究想法存在的问题,引入预算子集优化策略,在统一共享候选池评估中对比不同策略效果,发现随机k优化是低成本基线,多样性感知的MMR - k优化权衡最佳,表明LLM研究构思系统应作为预算支持分配系统评估。

Comments 18 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏