arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11618 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2798 篇

2606.15577 2026-06-16 cs.AI 新提交 92%

Large Language Models as Optimizers: A Survey of Direct vs. Tool-Augmented Approaches and Their Performance Frontiers

大型语言模型作为优化器:直接方法与工具增强方法的调查及其性能前沿

Roko Peran, Luka Hobor, Mihael Kovac, Mario Brcic

机构 * University of Zagreb, Faculty of Electrical Engineering and Computing(萨格勒布大学电气工程与计算学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 综述LLM作为优化器的三种范式(直接优化、工具增强优化、工具创造优化),分析性能前沿与推理差距,探讨直接优化的未来潜力与工具增强优化的可审计性之间的权衡。

Comments 6 pages, 1 figure, 2 tables, accepted at 49th ICT and Electronics Convention, MIPRO - https://mipro.hr; Paper ID: #23463

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26348 2026-07-30 cs.CL cs.AI cs.CY cs.HC 新提交 92%

When Synthetic Users Fail: A Cross-Domain Benchmark of LLM-Simulated Human Survey Responses

当合成用户失效时:LLM模拟人类调查回复的跨领域基准测试

Zihan Chen, Di Zhu, Lei Nico Zheng

机构 * Stevens Institute of Technology(史蒂文斯理工学院) University of Massachusetts Boston(马萨诸塞大学波士顿分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究构建跨领域基准与评估框架,发现LLM模拟人类调查回复存在个体表现逊于基线、过度确定人口统计特征等失效问题,且无法通过更大模型纠正,会误导细分目标决策。

Comments 19 pages, 5 figures, 4 tables. Preprint; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26130 2026-06-26 cs.CL cs.AI cs.DL 新提交 92%

Thinking Like a Scientist? A Structural Study of LLM-Generated Research Methods

像科学家一样思考?LLM生成研究方法的结构性研究

Francesca Carlon, Brecht Verbeken, Vincent Ginis, Andres Algaba

机构 * Data Analytics Lab, Vrije Universiteit Brussel(布鲁塞尔自由大学数据分析实验室) imec-SMIT, Vrije Universiteit Brussel(布鲁塞尔自由大学imec-SMIT) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过对比LLM在最小提示下生成的方法建议与论文实际方法,发现LLM在模型选择上存在显著偏差,且方法多样性大幅缩减。

Comments 46 pages, 13 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25782 2026-06-25 cs.CL cs.AI 新提交 92%

Do Encoders Suffice? A Systematic Comparison of Encoder and Decoder Safety Judges for LLM Adversarial Evaluation

编码器足够吗?用于LLM对抗性评估的编码器与解码器安全评判器的系统比较

Han Jeon, Shiv Medler, Joseph Voyles, Matt Wood

机构 * PricewaterhouseCoopers(普华永道)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 系统比较ModernBERT系列编码器分类器与基于LLM的解码器评判器在识别有害LLM输出上的性能,发现编码器可在保持低延迟和低成本的同时接近LLM评判器的效果。

Comments 13 pages, 5 figures, Accepted into ICANN2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08247 2026-06-09 eess.AS cs.AI cs.LG eess.SP 新提交 92%

AeroSpectra Sentinel: An Auditable LLM Prompt-Chaining Decision-Support Workflow for Acute Asthma Risk Assessment from Respiratory Sounds and Clinical Signals

AeroSpectra Sentinel:一种用于从呼吸音和临床信号进行急性哮喘风险评估的可审计LLM提示链决策支持工作流

Aueaphum Aueawatthanaphisut

机构 * School of Information, Computer, and Communication Technology(信息、计算机与通信技术学院) Sirindhorn International Institute of Technology, Thammasat University(泰国朱拉隆梭国际技术学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出AeroSpectra Sentinel,结合STFT呼吸音分析、轻量ML筛查、临床特征融合和五阶段LLM提示链,实现可审计的急性哮喘风险评估,在公开数据集上验证了音频筛查和LLM工作流的有效性。

Comments 10 pages, 8 figures, 5 tables, 14 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12391 2026-08-14 cs.CL cs.AI cs.LG 新提交 92%

Unified Multi-Dimensional Benchmark for Complex Graph Reasoning in Large Language Models

面向大语言模型复杂图推理的统一多维度基准

Fali Wang, Ali Al-Lawati, Iliyas Bektas, Jinxuan Fang, Alek Melenski, Tianxiang Zhao, Yao Ma, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有图推理基准的局限,提出半自动框架构建含202个任务的统一多维度基准,评估LLM在不同推理模式下的表现,揭示模型局限并提供实证指导。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25561 2026-06-25 cs.CR 新提交 92%

CrypFormBench: Benchmarking Formal Analysis Capability of Large Language Models for Cryptographic Schemes

CrypFormBench:评估大型语言模型在密码方案形式化分析中的能力基准

Zhaoxuan Li, Qionglu Zhang, Hengyuan Liu, Xiaoyan Gu, Xianhui Lu, Hongbo Liu, Bingzheng Wang, Haihui Fan, Ziming Zhao, Rui Zhang, Li Zhou

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 提出CrypFormBench基准,涵盖符号与计算安全,评估LLM在密码方案形式化分析中的五项核心能力,发现模型在生成、转换和修正方面表现有限。

Comments 23 pages, 17 figures, FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17582 2026-06-17 cs.DB 新提交 92%

Collaborative Large and Small Language Models for Accurate and Scalable Data Repair

协作式大小语言模型实现准确且可扩展的数据修复

Qian Chen, Jianwei Wang, Wenjie Zhang

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract,abstract_cn);SLM(abstract,abstract_cn)

AI总结 提出LasRepair框架,利用大语言模型作为指导者选择全局修复上下文,小语言模型作为校正者高效修复错误数据,并通过EM过程和置信度加权进一步提升修复质量。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24573 2026-07-28 cs.AI 新提交 92%

LLM-SoccerArena: Benchmarking LLMs on Real-World Predictions in Sports

LLM - 足球竞技场:在体育领域的现实世界预测中对大语言模型进行基准测试

Jonas Schröder, Jonas Schweisthal, Oliver Müller, Markus Weinmann, Stefan Feuerriegel

机构 * MCML & LMU Munich(慕尼黑机器学习中心及慕尼黑大学) Paderborn University(帕德博恩大学) University of Cologne(科隆大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究旨在评估大语言模型预测现实世界体育赛事的能力,核心方法是引入LLM - 足球竞技场这一前瞻性实时基准,通过对2026年世界杯的评估,详细分析模型性能各维度表现,为LLMs预测性能提供新证据及开源平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20436 2026-06-19 cs.CR cs.AI 新提交 92%

Multi-View Decompilation for LLM-Based Malware Classification

基于LLM的恶意软件分类的多视角反编译

Bercan Turkmen, Vyas Raina

机构 * Independent Researcher(独立研究员) SPARK

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出多反编译器视角提升LLM恶意软件分类性能,通过Ghidra和RetDec的互补伪C代码提高召回率和F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11493 2026-08-13 cs.AI cs.LG 新提交 92%

From Prompting to Behavioral Alignment: Personalized LLM Judges for Recommendation Evaluation

从提示工程到行为对齐:用于推荐评估的个性化大语言模型评判者

Alireza S. Ziabari, Kat Ellis, Colleen Chan, Ding Tong

机构 * Netflix(网飞公司)

专题命中 评测与基准 :LLM(title,summary_cn);prompting(title);large language model(abstract);language model(abstract)

AI总结 该研究针对离线推荐评估中LLM存在的双向合理化问题,提出序列行为对齐框架,经真实日志验证,其Macro-F1较零样本基线提升32.19%,可缓解失效模式且无需人工管道开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09925 2026-08-11 cs.CL cs.AI 新提交 92%

From Values to Benchmarks: Evaluating Large Language Models for Governmental Use in Dutch

从价值到基准:评估用于荷兰政府场景的大型语言模型

Laurens Samson, Iva Gornishka, Gossa Lô, Yuki M. Asano, Sennay Ghebreab

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究推出面向荷兰政府场景的“Grip on LLMs”评估框架,确定六大评估维度,发现模型在质量、成本、能耗等维度存在权衡,发布模型概览供政府LLM选择使用。

Comments Accepted at AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01012 2026-08-04 cs.CL cs.AI 新提交 92%

MedUPS: Towards Diagnostic Assistance in Uncommon Medical Cases with Large Language Models

MedUPS:利用大语言模型辅助罕见医疗病例的诊断

Ofir Ben Shoham, Oriel Perets, Nir Grinberg, Nadav Rappoport

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 本研究提出MedUPS对齐框架及MedUPSQA数据集,通过强化学习使大语言模型对齐临床中游决策,提升了不同规模模型的下一步临床决策准确率,且小模型表现优于部分大模型。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29064 2026-08-03 cs.LG cs.AI 新提交 92%

Benchmarking Frontier Large Language Models Against Official Crash Database Coding Using Police Crash Narratives

基于警方事故叙述文本,对比前沿大语言模型与官方事故数据库编码的基准测试

Sudhir Bharati, Rajendra K C Khatri, Sudip Bharati

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究以阿肯色州2015-2025年的致命事故数据为对象,对比6种前沿大语言模型与官方事故数据库的编码效果,为事故编码领域的LLM应用提供了基准评估依据。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28282 2026-07-31 cs.CL cs.LG 新提交 92%

(Towards) Scalable Reliable Automated Evaluation with Large Language Models

面向可扩展的可靠自动化评估:基于大语言模型

Bertil Braun, Martin Forell

机构 * KIT(卡尔斯鲁厄理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究提出一种基于多LLM两两比较与Elo评分的自动化评估框架,可近似专家评估,减少人工干预,实现对LLM输出的高效可靠评估。

Comments 17 pages. Published in the Proceedings of the Fourth Workshop on Generation, Evaluation and Metrics (GEM2) at ACL 2025

Journal ref Proceedings of the Fourth Workshop on Generation, Evaluation and Metrics (GEM2), pages 320-336, Association for Computational Linguistics, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26382 2026-06-26 cs.CL cs.AI cs.DL cs.HC cs.RO 新提交 92%

Charting the Growth of Social-Physical HRI (spHRI): A Systematic Review Pipeline Augmented by Small Language Models

绘制社会-物理人机交互(spHRI)的增长:由小型语言模型增强的系统综述流程

Mayumi Mohan, Ju-Hung Chen, Alexis E. Block

机构 * MPI for Intelligent Systems(马克斯·普朗克智能系统研究所) Case Western Reserve University(凯斯西储大学)

专题命中 评测与基准 :SLM(summary_cn,abstract);language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对社会-物理人机交互领域术语碎片化和方法不一致的问题,本文评估了小型语言模型(<1.5B参数)在标题和摘要筛选中的辅助能力,发现其虽未达到人类水平,但能快速筛选并发现人类遗漏的论文,表明SLM可增强而非取代专家评审。

Comments 5 pages, 3 figures, 2 tables, Companion Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21460 2026-06-23 cs.CL cs.AI 新提交 92%

Evaluation of Small Language Models for Arabic Language Processing

小型语言模型在阿拉伯语处理中的评估

Jumana Alsubhi, Ahmed Alhusayni, Abdulrahman Gharawi, Israa Hamdine, Alshaymaa Allahim, Lamees Alhumaid, Ahmad Shabana, Rafik Madani

机构 * Naseej Innovation Lab(纳赛伊创新实验室) Naseej for Technology(纳赛伊技术)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract,abstract_cn);SLM(abstract,abstract_cn)

AI总结 本文评估了12种小型语言模型在阿拉伯语自然语言处理任务上的表现,构建了涵盖8个领域和10种语言技能的240项测试基准,发现模型大小并非决定因素,阿拉伯语对齐和指令遵循能力更关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31371 2026-07-01 cs.LG cs.AI cs.CL 新提交 92%

Calibrating the Evaluator: Does Probability Calibration Mitigate Preference Coupling in LLM Agent Feedback Loops?

校准评估器:概率校准能否缓解LLM智能体反馈回路中的偏好耦合?

Zewen Liu

机构 * Qilu Institute of Technology, School of Software Engineering(齐鲁理工学院软件工程学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过概率校准评估器的成对判断来缓解LLM智能体反馈回路中的偏好耦合,实验表明校准将耦合系数降低20-49%,JS散度降低45-67%。

Comments 7 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18422 2026-06-18 quant-ph 新提交 92%

Gatekeepers and Hallucinations: A Layered Evaluation Framework for LLM-Driven Quantum Circuit Generation

守门人与幻觉:LLM驱动的量子电路生成的分层评估框架

Christopher Coleman, Sharon Marfatia

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 提出分层评估框架,通过守门人筛选、电路保真度分析和设计熵指标,识别LLM在量子电路生成中的五种失败模式,并揭示评估基础设施本身可能引入错误。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12369 2026-06-11 cs.CY 新提交 92%

Should LLM Agents Decide in Social Simulations? Comparing Finite-State and LLM-Based Decision Policies

LLM智能体应在社会模拟中做决策吗?比较有限状态与基于LLM的决策策略

Alejandro Buitrago López, Javier Pastor-Galindo, José A. Ruipérez-Valiente

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究评估LLM作为在线社交网络模拟中动作选择器时,是否保持可解释的参考策略,发现LLM在某些配置下可近似但不可靠地保持策略,且速度远慢于马尔可夫链采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09852 2026-06-10 cs.HC cs.AI cs.CL cs.LG cs.MA cs.SE 新提交 92%

LLM-Based Code Documentation Generation and Multi-Judge Evaluation

基于LLM的代码文档生成与多裁判评估

Ikbel Ghrab, Mohamed Dhieb, Ismail Khenissi, Ines Abdeljaoued-Tej

机构 * University of Tunis El Manar(突尼斯国家理工大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出利用八种大语言模型自动生成代码文档,并通过多裁判评估框架(四个LLM从九个维度评分)提升文档质量,在医学物理库上实验显示最佳与最差模型性能差距达42%。

Comments ICAHS, \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

Journal ref Conference ICAHS IEEE, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02049 2026-07-03 cs.CL cs.AI cs.CY 新提交 92%

SPLIT: Cross-Lingual Empathy and Cultural Grounding in English and Ukrainian LLM Responses

SPLIT:英语和乌克兰语LLM回应中的跨语言共情与文化根基

Anna Chorna

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SPLIT基准测试,评估LLM在英语和乌克兰语危机情境下的共情准确性、语言自然性和文化根基,发现模型在乌克兰语中表现下降,且人类与AI评估者一致性弱。

Comments 19 pages, 5 figures, 3 tables. Benchmark paper introducing SPLIT for evaluating empathy, linguistic naturalness, and cultural grounding in English and Ukrainian LLM responses

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19299 2026-08-21 cs.AI 新提交 92%

Air Traffic Control Using Large Language Models: Prompt Engineering, Architecture, and Evaluation

使用大语言模型的空中交通管制:提示工程、架构与评估

Mahyar Ghazanfari, Matthias Casanova, Jordan Kam, Alex Zongo, Peng Wei, Torsten Darrell, Alexandre Bayen

机构 * The George Washington University(乔治华盛顿大学) California Institute of Technology(加州理工学院) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究针对ATC仍以人工为主的问题,设计5种提示结构并在9种LLMs上实验,发现简洁提示表现最佳,注入正确历史可修复脚本严格提示的错误,明确了LLM辅助ATC的路径与局限。

Comments 39 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17715 2026-08-19 q-fin.RM cs.AI 新提交 92%

Communicating Credit Risk with Large Language Models: Evaluation of Explanations from Standard and Alternative Data-Based Models

利用大语言模型传达信用风险:基于标准数据与替代数据模型的解释评估

Sahab Zandi, Noah Kostesku, Christophe Mues, María Óskarsdóttir, Cristián Bravo

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究探究大语言模型能否作为解释层转化信用风险模型的事后解释,构建三类流程并采用三类LLM,发现证据表征是解释质量的关键制约,专业人士对证据标准要求更严格。

Comments 49 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17516 2026-08-19 cs.CL 新提交 92%

Effects of Answer Format Variation on Gender Bias in Large Language Models

答案格式变化对大型语言模型中性别偏见的影响

Ksenia Merzlyakova, Sebastian Padó, Franziska Weeber

机构 * Institute for Natural Language Processing, University of Stuttgart(斯图加特大学自然语言处理研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究探讨答案格式变化对LLMs性别偏见测量的影响,通过评估三种指令微调模型在不同格式下的表现,发现格式会显著改变测量结果,强调需将答案格式纳入LLM评估。

Comments 6th Workshop on Computational Linguistics for the Political and Social Sciences (CPSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16594 2026-08-18 cs.AI 新提交 92%

CACSurv: Concordance-Aligned Comparative Learning with Large Language Models for Cancer Survival Prediction

CACSurv:基于大型语言模型的一致性对齐比较学习用于癌症生存预测

Tianqi Xiang, Qixiang Zhang, Xinpeng Ding, Yi Li, Xiaomeng Li

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究针对癌症生存预测中LLM时间回归的公式与监督不匹配问题,提出CACSurv框架,构建TCGA-SurvReport基准,在6个TCGA癌症队列上的平均C指数达0.722,显著优于现有模型与基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08061 2026-08-11 cs.AI 新提交 92%

CORDA: A Benchmark for Hierarchical Harm-Centric Moral Reasoning in Large Language Models

CORDA:面向大语言模型的以伤害为核心的分层道德推理基准

Siddarth Singh, Victoria Williams, Simon Rosen, Ebenezer Gelo, Helen Sarah Robertson, Ibrahim Suder, Benjamin Rosman, Geraud Nangue Tasse, Steven James

机构 * University of the Witwatersrand(威特沃特斯兰德大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究提出CORDA基准,评估大语言模型的以伤害为核心的分层道德推理,发现多数模型优先避免直接个人伤害,部分模型无法遵循指定优先级,该基准填补了LLM道德评估的核心空白。

Comments 8 pages, 6 figures. Accepted at the Fourth International Workshop on Value Engineering in AI (VALE 2026), affiliated with IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07978 2026-08-11 cs.SE cs.AI 新提交 92%

Verication-driven closed-loop multi-agent large language modelframework for code-compliant structural design

验证驱动的闭环多智能体大语言模型框架:面向符合代码规范的结构设计

Jianbin Luo, Weibin Lin, Yiran Lin, Qing Wei, Wei Guo

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究提出验证驱动的闭环多智能体LLM框架,通过耦合有限元验证系统与双节点结构提升结构设计的代码合规性,开源基准与脚本,性能提升显著且具可复现性。

Comments 20 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07651 2026-08-11 cs.AI cs.CV 新提交 92%

An Agentic AI Framework Overcomes Fundamental Limitations of Large Language Models for Glaucoma Detection from Fundus Photography

一种智能体AI框架克服了大型语言模型在眼底照相青光眼检测中的基本局限

Jalil Jalili, Hossein Taghizad, Anuwat Jiravarnsirikul, Christopher Bowd, Akram Belghith, Raheleh Kafieh, Christopher A. Girkin, Sally L. Baxter, Robert N. Weinreb, Linda M. Zangwill, Mark Christopher

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究开发的智能体AI框架整合LLM与专用深度学习工具,提升了眼底照相青光眼检测的准确率、一致性,纠正了仅用LLM的缺陷,具有通用性,或推动医学AI向多智能体系统转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00817 2026-08-04 cs.AI cs.HC stat.AP 新提交 92%

Large language models improve physician accuracy but lead to false reliance

大型语言模型可提高医师准确率,但会导致错误依赖

Tirtha Chanda, Christoph Wies, Franziska Schramm, Carina Nogueira Garcia, Nicolas B. Merl, Martin J. Hetz, Jochen S. Utikal, Phillip Tschandl, Cristian Navarrete-Dechent, Alexander Thiem, Jakob N. Kather, Consortium, Titus J. Brinker

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究开发智能体式检索增强型LLM CORA,发现其可将46名医师的诊断准确率从70.8%提升至82.6%,但存在错误答案获引用支持时医师抵抗大幅下降的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏