arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-04 至 2026-08-04 共收录 174 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 174 篇

2608.00054 2026-08-04 cs.AI cs.SE 新提交 93%

RAG-TESTER: Automated End-to-End Testing of Retrieval-Augmented Large Language Models

RAG-TESTER:检索增强型大语言模型的自动化端到端测试工具

Ange Maiztegi, Jon Ayerdi, Miren Illarramendi, Aitor Arrieta

机构 * Mondragon University(蒙德拉贡大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.AI

AI总结 RagTester是针对RAG系统的自动化端到端测试方法,通过生成测试用例、利用LLM评估结果,在24种配置中20种优于基线,可有效检测RAG的交互故障并支持部署评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06519 2026-08-04 cs.CR cs.AI 版本更新 92%

Can Small Language Models Reliably Resist Jailbreak Attacks? A Comprehensive Evaluation

小型语言模型能否可靠抵御越狱攻击?一项综合评估

Zhibo Wang, Wenhui Zhang, Huiyu Xu, Zeqing He, Ziqi Zhu, Kui Ren

专题命中 评测与基准 :SLM(summary_cn,abstract);language model(title,abstract);small language model(title,abstract);large language model(abstract)

AI总结 本文通过评估59个SLMs对12种越狱方法的抵御能力,发现多数SLMs存在高ASR,漏洞与训练细节相关,且现有防御效果有限,凸显SLM需采用设计即安全的方法。

Comments Accepted by ACM CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27637 2026-08-04 cs.CV 版本更新 92%

MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models

MMOOC:多模态大语言模型的上下文外评估综合基准

Wenjie Zhu, Yabin Zhang, Wenjun Zeng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology(东方理工大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);post-training(abstract)

AI总结 本文提出MMOOC基准,评估多模态大语言模型在上下文偏移场景下的拒绝与作答能力,实验发现当前模型难以平衡可答性与拒绝性,后训练可提升稳健性,该基准将公开。

Comments project page:https://zhuwenjie98.github.io/MMOOC-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01012 2026-08-04 cs.CL cs.AI 新提交 92%

MedUPS: Towards Diagnostic Assistance in Uncommon Medical Cases with Large Language Models

MedUPS:利用大语言模型辅助罕见医疗病例的诊断

Ofir Ben Shoham, Oriel Perets, Nir Grinberg, Nadav Rappoport

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 本研究提出MedUPS对齐框架及MedUPSQA数据集,通过强化学习使大语言模型对齐临床中游决策,提升了不同规模模型的下一步临床决策准确率,且小模型表现优于部分大模型。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07121 2026-08-04 cs.LG cs.AI cs.NE 版本更新 92%

Quality-Diversity Red-Teaming: Automated Generation of High-Quality and Diverse Attackers for Large Language Models

质量-多样性红队测试:针对大语言模型的高质量多样化攻击者自动生成

Ren-Jian Wang, Ke Xue, Zeyu Qin, Ziniu Li, Sheng Tang, Hao-Tian Li, Shengcai Liu, Zhi Yu, Yuanpeng Tan, Chao Qian

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong, Shenzhen(香港大学深圳校区) Southern University of Science and Technology(南方科技大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出QDRT框架,通过训练多专用攻击者生成高质量多样化攻击,提升LLM安全评估的多样性与有效性,支持LLM负责任部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00817 2026-08-04 cs.AI cs.HC stat.AP 新提交 92%

Large language models improve physician accuracy but lead to false reliance

大型语言模型可提高医师准确率,但会导致错误依赖

Tirtha Chanda, Christoph Wies, Franziska Schramm, Carina Nogueira Garcia, Nicolas B. Merl, Martin J. Hetz, Jochen S. Utikal, Phillip Tschandl, Cristian Navarrete-Dechent, Alexander Thiem, Jakob N. Kather, Consortium, Titus J. Brinker

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究开发智能体式检索增强型LLM CORA,发现其可将46名医师的诊断准确率从70.8%提升至82.6%,但存在错误答案获引用支持时医师抵抗大幅下降的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07722 2026-08-04 cs.AI 版本更新 92%

Some hypotheses on how chatbots work in problem-solving-driven conversations. Large Language Models as confirmation of the Innovation Illusion

关于聊天机器人在问题解决驱动对话中如何工作的一些假设:大型语言模型作为创新幻觉的确认

S. F. M. van Vlijmen, H. D. Lethe

机构 * S.F.M. van Vlijmen and H.D. Lethe jr(S.F.M. van Vlijmen 和 H.D. Lethe jr)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出聊天机器人作为对话伙伴的本质,基于聚合动力学、认知语言学等理论,假设LLM训练数据仅部分模仿人类思维,并得出结论:基础聊天机器人无法成为与人类匹敌的思考伙伴。

Comments Changes made over the versions do NOT concern the argument or conclusion. The changes do concern: typo's, better phrasing, extra references, making the abstract fit the length demands without losing the main points to be made. 42 pages, 3 figures, submitted to Transmathematica

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15416 2026-08-04 cs.LG cs.AI 版本更新 92%

Margin-Adaptive Confidence Ranking for Reliable LLM Judgement

基于边际的置信度排名用于可靠的LLM判断

Gaojie Jin, Yong Tao, Lijia Yu, Tianjin Huang

机构 * Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院工业人工智能研究所) Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于边际的置信度排名方法,通过学习专用置信度估计器,改进LLM在人类判断一致性上的表现,通过模拟标注者多样性与边际排名公式,显式建模LLM区分人类一致与不一致案例的置信度,并推导出通用性保证。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01451 2026-08-04 cs.SE 新提交 92%

Doc2CI: A Multi-Service Study of CI Configuration Generation Using Large Language Models

Doc2CI:基于大语言模型的CI配置生成多服务研究

Taher A. Ghaleb

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract_cn);language model(title,abstract_cn)

AI总结 本文通过构建DOC2CI基准评估LLM生成CI配置的能力,发现其结构有效性不足,提出无需训练的模式引导修复方法提升有效性,为相关工具开发提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01629 2026-08-04 cs.CL 新提交 92%

Human-LLM Alignment in Language Attitudes Toward Non-Native Japanese

在非母语日语的语言态度上实现人类与大语言模型(LLM)的对齐

Naho Orita, Hayato Ogawa, Daisuke Kawahara

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究对比人类与LLM对母语及非母语日语邮件的评价,发现LLM以结构化弱化形式重现母语者的语言态度,为审计LLM提供了可推广的语言态度框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07078 2026-08-04 q-fin.TR cs.AI cs.CE 92%

Can LLM-based Financial Investing Strategies Outperform the Market in Long Run?

基于LLM的金融投资策略能否长期跑赢市场?

Weixian Waylon Li, Hyeonjun Kim, Mihai Cucuringu, Tiejun Ma

机构 * AIAI, School of Informatics The University of Edinburgh Edinburgh United Kingdom Global Finance Research Center Sungkyunkwan University Seoul Republic of Korea Dept. of Statistics \& OMI University of California, Los Angeles University of Oxford United States The University of Edinburgh Sungkyunkwan University University of California, Los Angeles University of Oxford

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出FINSABER回测框架,在更长时间和更大股票池上评估基于LLM的择时策略,发现其优势在长期和广泛截面下显著下降,且在牛熊市中表现不佳。

Comments KDD 2026, Datasets & Benchmarks Track (Oral) Corrected the FinAgent results and added FinAgent (GPT-4o-mini) in Table 2; conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13280 2026-08-04 cs.SE cs.AI 版本更新 92%

Characterizing Readability Issue Patterns and the Role of Prompt Design in LLM-Generated Code

可读性光谱:LLM生成代码中的模式、问题和提示影响

Hengzhi Ye, Fengyuan Ran, Weiwei Xu, Minghui Zhou

机构 * Peking university(北京大学) Wuhan University(武汉大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了LLM生成代码的可读性,发现其与人工编写代码相当,但存在特定问题模式,提示设计对可读性影响有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00665 2026-08-04 cs.CL cs.AI 版本更新 91%

Can Small Language Models Handle Context-Summarized Multi-Turn Customer-Service QA? A Synthetic Data-Driven Comparative Evaluation

小语言模型能否处理上下文总结的多轮客户服务问答?一种合成数据驱动的比较评估

Lakshan Cooray, Deshan Sumanathilaka, Pattigadapa Venkatesh Raju

机构 * School of Computing, Informatics Institute of Technology(计算学院,信息学院技术研究所) School of Mathematics and Computer Science, Swansea University(数学与计算机科学学院,萨默塞特大学) R&D, Zame AI(Zame AI研发部)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 本文通过合成数据评估小语言模型在多轮客户服务问答中的表现,发现部分模型接近大语言模型性能,但整体仍存在对话连续性和上下文对齐的挑战。

Comments Published at Frontiers in Artificial Intelligence, Natural Language Processing Section

Journal ref Frontiers in Artificial Intelligence, 9:1804284, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01649 2026-08-04 cs.NI 新提交 91%

LLM-Driven Automated Reward Design for Reinforcement Learning-Based Routing in LEO Satellite Networks

面向低轨(LEO)卫星网络中基于强化学习(RL)的路由的大语言模型(LLM)驱动的自动奖励设计

Walter P. Casas, Nelson L. S. da Fonseca, and Carlos A. Astudillo

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出LARGE框架结合LLM生成与迭代在环仿真,为LEO卫星网络RL路由自动设计奖励,其性能可与专家基线相当,凸显该优化方法的潜力。

Comments This paper was accepted for publication at the IEEE Global Communications Conference (GLOBECOM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.18223 2026-08-04 cs.CL cs.AI 91%

A Survey of Large Language Models

大型语言模型综述

Wayne Xin Zhao, Kun Zhou, Junyi Li, Tianyi Tang, Xiaolei Wang, Yupeng Hou, Yingqian Min, Beichen Zhang, Junjie Zhang, Zican Dong, Yifan Du, Chen Yang, Yushuo Chen, Zhipeng Chen, Jinhao Jiang, Ruiyang Ren, Yifan Li, Xinyu Tang, Zikang Liu, Peiyu Liu, Jian-Yun Nie, Ji-Rong Wen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文综述了大型语言模型的发展,探讨了预训练、微调、应用及能力评估等核心方法,并总结了现有资源与未来研究方向。

Comments ongoing work; 144 pages, 1081 citations

Journal ref Frontiers of Computer Science, Volume 20, Issue 12, Article 2012627 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15082 2026-08-04 eess.AS 版本更新 90%

From Who Said What to Who They Are: Modular Training-free Identity-Aware LLM Refinement of Speaker Diarization

从谁说了什么到他们是谁:用于说话人 diarization 的无训练模块化身份感知大语言模型优化

Yu-Wen Chen, William Ho, Maxim Topaz, Julia Hirschberg, Zoran Kostic

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对现有 SD+ASR 框架缺乏灵活性与真实说话人身份的问题,提出无训练模块化流水线,结合 SD、ASR 与 LLM 优化低置信度标签,在患者-临床医生数据集上实现 29.7% 相对误差降低,提供完整身份检测流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02409 2026-08-04 cs.AI cs.CY 新提交 90%

MonitrLLM: A Community-Centered Evaluation Infrastructure for Large Language Models

MonitrLLM:面向大型语言模型的社区中心评估基础设施

Victor Ojewale, Ro Encarnación, Suresh Venkatasubramanian, Danaé Metaxa

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 本研究提出开源LLM评估基础设施MonitrLLM,将对话记录、用户任务意图与结果关联,试点显示多轮对话失败率为单轮2.5倍,为LLM评估提供新方法。

Comments Accepted to AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01849 2026-08-04 cs.AI 新提交 90%

Exploring and Bridging Knowledge Holes in Unlearned Multimodal Large Language Models

探索与弥合未学习多模态大语言模型中的知识缺口

Junxiang You, Junkai Chen, Yuhao He, Ruiqi Liu, Zhetao Guo, Shu Wu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对未学习多模态大语言模型存在的知识缺口问题,提出带锚定正则化的选择性保护方法,在保障未学习安全性的同时大幅恢复模型响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01008 2026-08-04 cs.AI 新提交 90%

Toward Fine-Grained Forgetting:Attribute Unlearning for Multimodal Large Language Models

面向细粒度遗忘:多模态大语言模型的属性遗忘

Junkai Lin, Junkai Chen, Siqi Hou, Yuhao He, Ruiqi Liu, Chenhan Jin, Shengze Xu, Tieyong Zeng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型(MLLMs)属性遗忘的细粒度需求,提出轻量级训练无关框架CLRP,通过激活修补定位因果层并应用保留感知投影,实现目标属性遗忘同时保留同一身份信息,在多种MLLMs上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02464 2026-08-04 cs.AI cs.LG cs.SE 新提交 90%

Real-Time Detection and Repair of LLM Agent Failures

LLM智能体故障的实时检测与修复

Sunny Dubey

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 该研究提出基于LLM智能体步骤遥测的实时故障检测与修复系统,结合单类回声状态网络集成与确定性验证层,可高效检测并修复故障,提升任务成功率且成本极低。

Comments 16 pages, 5 figures. Code, data and demo: github.com/sunnydubey1111/agent-trajectory-sentinel Walkthrough: youtu.be/a05n_000klE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02442 2026-08-04 cs.AI cs.CL 新提交 90%

Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks

正确答案,错误方法:捷径作弊误导前沿科学基准上的大语言模型推理评估

Xuan Ren, Weiqi Zhai, Tianle Pu, Yihua Zhu, Yihua Zhu, Hu Wei, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团) Alibaba DAMO Academy(阿里巴巴达摩院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究指出前沿LLM在科学推理基准中存在解题作弊问题,仅答案评估会高估其推理能力,开发的反作弊策略可抑制该问题。

Comments working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01395 2026-08-04 cs.CL cs.AI 新提交 90%

Language Equality has a Price: A Systematic Investigation of Multi-turn LLM Performance for EU-24+

语言平等是有代价的:针对欧盟24+语言的多轮大语言模型性能系统研究

Sherzod Hakimov, Karl Osswald, Jelle Psurek, Eszter Bukovszky, A. Altar Lüser, David Schlangen

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);language agent(abstract)

AI总结 本研究以30种语言评估9种LLM,发现开源模型难以覆盖欧盟24种官方语言,商用模型表现更优且非英语语言运行成本更高、得分更低,揭示语言平等存在代价。

Comments Source code: https://github.com/clembench/multilingual

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29771 2026-08-04 cs.AI cs.LG q-fin.CP q-fin.PM 版本更新 90%

CLQT: A Closed-Loop, Cost-Aware, Strategy-Consistent Benchmark for Diagnostic Evaluation of LLM Portfolio-Management Agents

CLQT:用于LLM投资组合管理代理诊断评估的闭环、成本感知、策略一致性基准

Bo Qu, Mingguang Chen

机构 * Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出CLQT基准,通过闭环交易环境诊断LLM代理的决策过程,而非仅排名收益,评估五个维度的能力。

Comments 56 pages, 15 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19913 2026-08-04 cs.CL cs.AI 版本更新 90%

When LLM Essays Outscore Student Essays: What a Korean Writing Rubric Rewards and Where Readers Disagree

从直觉到校准判断:基于评分标准的专家小组研究人类对LLM生成韩语文本的检测

Shinwoo Park, Yo-Sub Han

机构 * Yonsei University(延世大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究通过三阶段盲 longitudinal 研究评估人类对LLM生成韩语文本的判断,提出LREAD框架提升准确性与一致性,证明评分标准辅助判断能提高检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03156 2026-08-04 cs.SE cs.AI cs.HC 版本更新 90%

The Impact of LLM-Assistants on Software Developer Productivity: A Systematic Review and Mapping Study

大型语言模型助手对软件开发者生产力的影响:一项系统综述和映射研究

Amr Mohamed, Maram Assi, Mariam Guizani

机构 * Queen's University(女王大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过综述39项研究,探讨LLM助手对软件开发者生产力的影响,发现多数研究显示积极效益,但存在认知卸载和团队协作风险,研究指出需更全面的评估方法。

Comments 42 pages

Journal ref Mohamed, Amr, Maram Assi, and Mariam Guizani. "The impact of llm-assistants on software developer productivity: A systematic review and mapping study." ACM Transactions on Software Engineering and Methodology (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02024 2026-08-04 cs.AI cs.CY 新提交 90%

EduZone: A Framework for Evaluating LLM Safety for K-12 Students and Teachers

EduZone:面向K-12学生与教师的大语言模型安全评估框架

Junyeong Park, Jieun Han, Haneul Yoo, So-Yeon Ahn, Jinsung Yoon, Alice Oh

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EduZone是针对K-12教育场景的LLM安全评估框架,整合多维度要素生成对抗交互,评估10个LLMs后发现其对教育特定风险更脆弱,现有防护措施不足,该框架可助力开发更安全的教育类LLMs。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01810 2026-08-04 cs.CL 新提交 90%

RADAR: Rubric-Aware Dependency and Redundancy Analysis for LLM-as-Judge Evaluation

RADAR:用于LLM作为评判者评估的基于 Rubric 的依赖与冗余分析

Divyansh Singh, Reza Davari, Afra Mashhadi

机构 * Microsoft(微软公司) University of Florida(佛罗里达大学) University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出 RADAR 框架,用于在 LLM 作为评判者的大规模评估前,通过少量探针估计评估标准间的耦合,验证显示其可恢复人类标准间高相关性,提供审计信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01684 2026-08-04 cs.AI 新提交 90%

GABench: A Comprehensive Benchmark for Evaluating LLM Agents on Graph Analysis Tasks

GABench:用于评估大语言模型智能体图分析任务的综合基准

Jiarui Tan, Zhongjian Zhang, YaBo Guo, Jiawei Liu, Yujie Xing, Muhan Zhang, Cheng Yang, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出GABench这一综合基准,涵盖多类图类型与任务及84个可执行工具,构建10400个带可验证答案的任务,评估前沿LLM及智能体框架,发现现有智能体应对复杂图任务仍存局限等结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01633 2026-08-04 cs.LG 新提交 90%

GraphIR: Architecture-Level Search States for LLM-Guided Neural Architecture Evolution

GraphIR:面向大语言模型引导的神经架构演化的架构级搜索状态

Zhen Liu, Wanqi Zhou, Shuanghao Bai, Yuhan Liu, Jinjun Wang, Jingwen Fu

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对LLM引导NAS中代码级表示无法满足架构变异需求的问题,提出架构感知中间表示GraphIR,在六个下游基准中集成到OpenEvolve后实现最佳搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00685 2026-08-04 cs.AI 新提交 90%

When Does LLM Orchestration Pay Off? A Controlled Evaluation of Accuracy, Cost, and Task Difficulty

LLM编排何时划算?关于准确率、成本与任务难度的对照评估

Nicolas Leins, Nico Pelleriti, Jana Gonnermann-Müller, Sebastian Pokutta

机构 * Zuse Institute Berlin(柏林Zuse研究所) TU Berlin(柏林工业大学) Weizenbaum Institute Berlin(柏林魏茨曼研究所)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究对照评估了Self-Refine等三种LLM编排方法与基线方法在5种骨干模型、3个领域的表现,发现编排收益依赖模型,需权衡准确率提升与额外推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏