arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-31 至 2026-07-31 共收录 81 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 81 篇

2607.27674 2026-07-31 cs.SE 新提交 94%

Can Large Language Models Resolve Real Java Merge Conflicts? An Evaluation with a Calibrated LLM-as-Judge

大语言模型能否解决真实的Java合并冲突?一项使用校准后的LLM作为评判者的评估

Bowen Shen

专题命中 评测与基准 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract)

AI总结 该研究针对真实Java合并冲突,构建仅用推理信号的LLM求解器,经校准的LLM评判者评估发现,其解决冲突的覆盖和匹配开发者方案的表现优于传统工具AutoMerge,但结构正确性仍需确定性检查保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28282 2026-07-31 cs.CL cs.LG 新提交 92%

(Towards) Scalable Reliable Automated Evaluation with Large Language Models

面向可扩展的可靠自动化评估:基于大语言模型

Bertil Braun, Martin Forell

机构 * KIT(卡尔斯鲁厄理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究提出一种基于多LLM两两比较与Elo评分的自动化评估框架,可近似专家评估,减少人工干预,实现对LLM输出的高效可靠评估。

Comments 17 pages. Published in the Proceedings of the Fourth Workshop on Generation, Evaluation and Metrics (GEM2) at ACL 2025

Journal ref Proceedings of the Fourth Workshop on Generation, Evaluation and Metrics (GEM2), pages 320-336, Association for Computational Linguistics, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04510 2026-07-31 cs.CE 版本更新 91%

OSCAgent: Accelerating the Discovery of Organic Solar Cells with LLM Agents

OSCAgent:利用LLM代理加速有机太阳能电池的发现

Zhaolin Hu, Zhiliang Wu, Kun Li, Hehe Fan, Yi Yang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 OSCAgent通过多代理框架整合检索增强设计、分子生成和系统评估,提升有机太阳能电池材料发现效率,实现预测性能超越传统和LLM基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27654 2026-07-31 cs.CL cs.AI 新提交 91%

From Single- to Cross-Document: Benchmarking Multi-Granularity Event Analysis of Large Language Models

从单文档到跨文档:大语言模型多粒度事件分析的基准测试

Tao Wen, Shuai Shao, Pei Ke, Xu Han, Jie Zou, Guannan Li, Tao Tian, Jinjie Qiu, Lan Wang, Ke Qin

机构 * University of Electronic Science and Technology of China(电子科技大学) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文推出MiGUE-Bench基准及MiGUE-Pipeline框架,通过四项核心任务评估LLMs多粒度事件分析能力,明确其能力边界与缺陷,为该领域改进提供方向。

Comments 9 pages. Published in the Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), pp. 3464-3472, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19786 2026-07-31 cs.CL 版本更新 90%

HumorRank: A Tournament-Based Leaderboard for Evaluating Humor Generation in Large Language Models

HumorRank: 基于锦标赛的大语言模型幽默生成评估排行榜

Edward Ajayi, Prasenjit Mitra

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出HumorRank,一种基于锦标赛的框架,通过理论指导的成对偏好判断对文本幽默生成进行排名,并利用Bradley-Terry估计生成全局排行榜。

Comments Leaderboard: https://humorrank-leaderboard.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27231 2026-07-31 cs.AI cs.LG 新提交 90%

KernelGenBench: A Multi-Source and Multi-Chip Benchmark for LLM-based Kernel Generation

KernelGenBench:面向基于大语言模型的内核生成的多源多芯片基准测试

Peiyu Zang, Jian Tao, Jialing Zhang, Yichen Yuan, Wentao Zhang, Guang Liu, Yonghua Lin

机构 * Beijing Normal University(北京师范大学) Beijing Jiaotong University(北京交通大学) Institute of Automation, CAS(中国科学院自动化研究所) Peking University(北京大学) BAAI(北京智源人工智能研究院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出KernelGenBench基准,评估LLM与智能体生成的Triton内核,发现智能体方法优于纯LLM采样,cuBLAS算子最具挑战,跨平台性能退化严重,自主生成成本远高于简单采样。

Comments 10 pages, 4 figures. Code and data are publicly available at https://github.com/flagos-ai/KernelGenBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28006 2026-07-31 cs.AI 新提交 90%

MMLDSum-LLM: Multimodal Long-Document Summarization with Visual-Alignment and Keyword-Aware

MMLDSum-LLM:结合视觉对齐与关键词感知的多模态长文档摘要方法

Xianpeng Zhang, Jiahua Yang, Dongyu Chen, Lei zhang, Jian Ma, Xu guohuan, Haonan Lu, Tianhuang Su, Chuangchuang Wang, Kai Tang

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对多模态长文档摘要的关键信息遗漏与跨模态幻觉问题,提出结合视觉对齐与关键词感知的两阶段训练框架MMLDSum-LLM,在自研基准MMLDSum-Bench上验证了其性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17219 2026-07-31 cs.CL cs.AI quant-ph stat.ME 版本更新 90%

Auditing Question-Order Effects in Large Language Models with the QQ Equality: Mechanism Characterization and a Saturation Caveat

用QQ等式审计大语言模型中的问题顺序效应:机制表征与饱和警告

Pilsung Kang

机构 * Dankook University(韩国檀国大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型中问题顺序效应,将QQ等式发展为审计标准,理论上表征满足该等式的机制类别,方法上开发审计管道,实验发现强制二元下一个token对数概率不适用于分布级QQ审计,建议进行饱和诊断。

Comments v2: major revision. Five restructured findings separating order sensitivity, QQ imbalance, and residual contextuality; two-layer discriminant table; pipeline figure and per-item joint table; envelope pooling and certified Gamma bounds specified; retrospective batch-1 G3 re-validation (all verdicts preserved). No new pilot measurements

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11270 2026-07-31 cs.SE 版本更新 89%

Evaluating LLM Agents on Automated Software Analysis Tasks

评估LLM代理在自动化软件分析任务中的性能

Islem Bouzenia, Cristian Cadar, Michael Pradel

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文通过AnalysisBench评估四种LLM架构在自动化软件分析任务中的表现,发现AnalysisAgent在手动验证的成功率高达94%,而现有代理存在阶段混用、错误定位差等问题,且整程序分析和符号执行是最具挑战性的任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28137 2026-07-31 cs.CY cs.AI 新提交 89%

Asymmetric Communication: Large Language Models and Language Games

非对称通信:大语言模型与语言游戏

Enzo Fenoglio

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过提出非对称通信框架,纠正了AI讨论对大语言模型的错误属性投射,将相关现象重新归类为接收方一侧的现象,为AI治理提供了启示,明确对齐是制度约束工程,责任归人类机构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03328 2026-07-31 cs.LG cs.AI 版本更新 89%

Averaged Evaluation Masks Capability Trade-Offs: Multi-Source Calibration for High-Sparsity LLM Pruning

校准数据在能力维度上的权衡:为什么多源混合对高稀疏LLM剪枝至关重要

Hu Xu, Zhaolong Xing, Congcong Liu, Jiaxing Wang, Zhida Jiang, Junshi Huang, Zhen Chen, Jianfeng Xu

机构 * Shanghai Jiao Tong University(上海交通大学) JD.com(京东公司)

专题命中 评测与基准 :LLM(title,title_cn);pretraining(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 通过分解后剪枝能力维度并分析15个校准源,发现校准困惑度与通用能力保留正相关但与数学和代码能力保留负相关,提出多源混合校准方法IGSP以平衡各维度性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28307 2026-07-31 cs.SE cs.AI 新提交 89%

From Textual Requirements to Microservice Architectures - A Comprehensive Evaluation of LLM-Based Design Synthesis

从文本需求到微服务架构 —— 基于大语言模型的设计合成综合评估

Danyllo Albuquerque, José Renan, Guillermo Rodríguez, Guillermo Rodríguez, Emanuel Dantas, Ademar França, Mirko Perkusich, Kyller Gorgônio, Angelo Perkusich

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究探讨OpenAI o3能否仅从文本需求生成微服务架构,经实验发现少样本提示下其服务识别与通信恢复的一致性优于零样本,为需求驱动的架构合成提供了潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06458 2026-07-31 cs.CL cs.AI cs.LG 版本更新 88%

LLM Self-Correction with DeCRIM: Decompose, Critique, and Refine for Enhanced Following of Instructions with Multiple Constraints

基于DeCRIM的大语言模型自校正:分解、批判与优化,提升多约束指令遵循能力

Thomas Palmeira Ferraz, Kartik Mehta, Yu-Hsiang Lin, Haw-Shiuan Chang, Shereen Oraby, Sijia Liu, Vivek Subramanian, Tagyoung Chung, Mohit Bansal, Nanyun Peng

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM处理多约束指令的不足,研究推出RealInstruct基准,提出DeCRIM自校正流程,可提升开源模型性能,结合强反馈时其表现能超越GPT-4。

Comments EMNLP 2024, see https://aclanthology.org/2024.findings-emnlp.458/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28318 2026-07-31 cs.AI 新提交 88%

PathView-Bench: Can Multimodal Large Language Models Achieve Fine-grained Multiscale Understanding of Pathology Images?

PathView-Bench:多模态大语言模型能否实现病理图像的细粒度多尺度理解?

Zongyi Chen, Yu Liang, Jie Lin, Liansheng Wang

机构 * National Institute for Data Science in Health and Medicine, Xiamen University(厦门大学健康与医学数据科学国家研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究针对现有病理多模态基准的不足,推出PathVU基准,评估发现主流MLLMs在多尺度病理图像细粒度视觉任务上存在显著局限,为相关模型的开发评估提供了可复现基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28086 2026-07-31 cs.AI 新提交 88%

Distilling Answer Set Programming Theories from Large Language Models

从大型语言模型中提炼答案集编程理论

Nelson Higuera Ruiz, Markus Hofmarcher, Claudiu Leoveanu-Condrei

机构 * ExtensityAI

专题命中 评测与基准 :large language model(title);language model(title);LLM(summary_cn);分类 cs.AI

AI总结 该研究针对从头编写ASP理论困难的问题,采用神经符号方法测试9种模型从LLM提炼ASP理论的能力,在VQA基准上验证了前沿模型的性能,并发布了相关资源。

Comments Accepted at NeSy 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27595 2026-07-31 cs.CL cs.AI cs.DL 新提交 87%

Beyond Similarity: Grounded Agentic Extraction and Expert-Adjudicated Evaluation of Intertextuality in Classical Chinese Histories

超越相似性:中国古典史书互文性的智能体式提取与专家裁决评估

Zhaoji Wang, Wanyu Si, Jun Wang

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究将细粒度互文性提取设为LLM智能体任务,构建专家裁决的古典史书互文基准,验证12种LLM性能,扩展至二十四史揭示引文的总体稳定与个案漂移规律并发布相关资源。

Comments 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27942 2026-07-31 cs.MA 新提交 87%

Scaling LLM-Driven Multi-Agent Systems: Design Principles and Architectural Scalability Analysis

扩展大语言模型驱动的多智能体系统:设计原则与架构可扩展性分析

Linus Sander, Fengjunjie Pan, Vahid Zolfaghari, Andre Schamschurko, Nenad Petrovic, Alois Knoll

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 该研究提炼出可扩展多智能体系统的四项设计原则,构建参考架构并在基准任务上评估,发现LLM超能力阈值时扩展可提升准确率但成本近似线性增长,性能在中等复杂度达峰,一致性是核心挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27294 2026-07-31 cs.SE 新提交 87%

AgentS4D: Benchmarking Runtime Risks across the Execution Lifecycle of LLM-Based Workspace Agents

AgentS4D:基于大语言模型的工作空间智能体执行生命周期内运行时风险基准

Jiajun Zhou, Zhaoxuan Ke, Jihang Ye, Xuanze Chen, Shanqing Yu, Qi Xuan

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究推出AgentS4D基准,评估20种智能体配置在328个风险案例中的表现,发现任务完成不代表安全,需跨风险条件完整评估智能体配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27267 2026-07-31 cs.CR cs.AI 新提交 86%

FAVA: Formal Authorization for Verified Agents with Evidence-Backed Permission Graphs

FAVA:基于证据支持的权限图的经验证智能体的形式化授权

Yifan Zhang, Xinkui Zhao, Sai Liu, Hengxuan Lou, Guanjie Cheng, Chang Liu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FAVA是一种用于智能体执行的带权限授权框架,通过LLM引导的权限IR、证据支持的权限图和SMT授权器保障安全,在多场景评估中达90.5%决策合规率,可拦截动态违规迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26172 2026-07-31 cs.HC cs.AI cs.SI 版本更新 86%

Linking Heterogeneous Data with Coordinated Agent Flows for Social Media Analysis

通过协调智能体流关联异构数据以开展社交媒体分析

Shifu Chen, Dazhen Deng, Zhihong Xu, Sijia Xu, Linyu Qin, Tai-Quan Peng, Yingcai Wu

机构 * Zhejiang University(浙江大学) Department of Communication, Michigan State University(密歇根州立大学通讯系)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出LLM智能体系统SIA,通过协调智能体流关联社交媒体异构多模态数据,采用阶段同步策略挖掘洞见,经评估可发现多样有意义的洞见,为社交媒体分析提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27421 2026-07-31 cs.CL cs.AI cs.LG 新提交 85%

Selecting Open-Weight Language Models for Zero-Shot Intent Classification: A Systematic Evaluation of 41 Models

选择用于零样本意图分类的开放权重语言模型:41种模型的系统评估

Parishruthi Ganesh, Gerry Dozier, Cheryl Seals

专题命中 评测与基准 :language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究通过系统评估41种开放权重语言模型,为意图分类场景下选择符合计算、延迟等约束的模型提供了实用指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28094 2026-07-31 cs.AI 新提交 84%

An Instrument to Evaluate Governance Proposals: AI Policy Analysis at Scale

一种用于评估治理提案的工具:规模化AI政策分析

Paulo Carvao, Claudio Mayrink Verdun, Isabel Adler, Jeffrey Zhou

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种AI政策分析框架,结合专家见解与计算分析,以领域校准模型为基准评估商业LLM,助力用户评估AI治理提案的属性一致性,支持政策制定等人员应对复杂环境。

Comments 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00215 2026-07-31 cs.SE 版本更新 83%

DocPrism: Multi-lingual Detection of Incorrectness Inconsistencies between Code and Documentation

DocPrism:代码与文档间错误不一致性的多语言检测

Xiaomeng Xu, Zahin Wahab, Reid Holmes, Caroline Lemieux

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出轻量级多语言代码-文档不一致性检测工具DocPrism,通过LCEF方法降低标记率、提升F1分数,在多语言真实场景中表现优于现有技术。

Comments 22 pages. To appear in Proceedings of the ACM on Software Engineering, Volume 3, ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26993 2026-07-31 cs.LG 版本更新 83%

Foundation Models for Face Presentation Attack Detection: A Unified Linear-Probing Benchmark

用于人脸呈现攻击检测的基础模型:统一的线性探测基准

Peter Lorenz, Anjith George, Sébastien Marcel

机构 * Idiap Research Institute(Idiap研究所) University of Lausanne (UNIL)(洛桑大学)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本研究在MCIO基准上评估24种冻结基础模型编码器的线性探测性能,发现其仅通过线性分类器可实现强劲的数据集内PAD性能,但跨数据集迁移能力有限,需明确适配以解决域偏移问题。

Comments accepted at IJCB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25199 2026-07-31 q-fin.CP cs.AI 版本更新 83%

RIDGE: An Autonomous Framework for Validation and Method Discovery in LLM-Generated Option Pricing

RIDGE:一个用于验证和发现大语言模型生成的期权定价方法的自主框架

Liexin Cheng, Xue Cheng, Shuaiqiang Liu, Cornelis W. Oosterlee

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型生成的期权定价实现,介绍自主验证框架RIDGE,通过多种测试和检查优化定价实现与验证方法,应用于五个随机波动率模型,消除缺陷并带来新定价方法。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28190 2026-07-31 cs.CL cs.AI 新提交 82%

The MADRS Pipeline: Supporting Depression Assessment in Clinical Trials

MADRS 流程:支持临床试验中的抑郁评估

Mila Fodor, Katalin Ócsai, Francesco Periti, Rien Sonck, Alex Boudreau

机构 * Clario, part of Thermo Fisher Scientific(赛默飞世尔科技旗下Clario)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究开发了一种 LLM 流程,可将临床试验的结构化音频访谈转换为文本,映射至 MADRS 10 项症状条目并评估严重程度,与专家评级整体相关性达 0.867,为抑郁评估提供可解释支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27268 2026-07-31 cs.SD 新提交 82%

Does EEG Foundation Models Transfer to Speech? A Benchmark on Overt and Imagined Speech Decoding

脑电基础模型能否迁移至语音?显性与想象语音解码的基准测试

Owais Mujtaba Khanday, Mohamed Baha Ben Ticha, Sanae Belfrouh, Marc Ouellet, Jose A. Gonzalez-Lopez

机构 * University of Granada, Spain(格拉纳达大学) Research Centre for Information and Communication Technologies (CITIC-UGR), Spain(信息与通信技术研究中心) University of Chouaib Doukkali, Morocco(舒艾卜·杜卡利大学) Brain, Mind, and Behavior Research Center (CIMCYC), University of Granada, Spain(大脑、心智与行为研究中心)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文开展首个脑电基础模型语音解码基准测试,对比LaBraM等模型与EEGNet等基线,发现通用脑电预训练未在语音任务上展现一致优势,为语音专用基础模型研究提供依据。

Comments 6 pages, 1 figure, 3 tables, submitted to IberSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28033 2026-07-31 cs.AI 新提交 81%

DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness

DataClawEval:面向真实工业场景的数据工程智能体基准测试

Debin Meng, Jiaming Yang, Zefang Zong, Tengyue Xu, Haining Xie, Yang Li, Peng Chen

机构 * Tencent(腾讯) Xidian University(西安电子科技大学) South China Normal University(华南师范大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DataClawEval是首个针对真实工业数据工程场景的智能体基准,含100项跨5种引擎的任务,用确定性脚本评分,评估16个前沿智能体发现最强模型仅得74.9分,自主数据工程仍是挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27953 2026-07-31 cs.LG 新提交 81%

AutoPref: Automatic Discovery of Task-Specific Preference Objectives for Neural Combinatorial Optimization

AutoPref:面向神经组合优化的任务特定偏好目标的自动发现

Shengda Gu, Kai Li, Xinyi Ke, Haobo Fu, Yifan Zhang, Jian Cheng

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 该研究提出首个LLM引导的AutoPref框架,将偏好目标分解为成对损失与集合感知加权程序,通过分阶段条件搜索策略实现自动发现,在TSP等四类组合优化问题上性能优于手动设计基线。

Comments 8pages, 2figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11015 2026-07-31 cs.AI 版本更新 81%

Numbers Beat Words: A Rigorous On-Premise Benchmark for Coupled MIMO Controller Tuning

从推理中获取结构,从搜索中获取数值:本地部署的开放大语言模型作为耦合MIMO控制器整定的结构先验

Yang Shu, Jiaxuan Chen, Haonan Li

机构 * Jinling Institute of Technology(金陵科技学院) College of Water Resources and Civil Engineering, China Agricultural University(中国农业大学水利与土木工程学院) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对强耦合MIMO过程,提出利用本地部署的开源大语言模型作为结构先验,通过推理耦合关系提出非对称结构,结合经典优化器实现样本高效且可解释的控制器整定。

Comments 17 pages, 7 figures, 6 tables. Substantially revised benchmark, analysis, and presentation

详情

展开后加载摘要…

URL PDF HTML 收藏