arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-21 至 2026-07-21 共收录 113 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 113 篇

2511.16478 2026-07-21 cs.IR cs.CL 版本更新 92%

Music Recommendation with Large Language Models: Challenges, Opportunities, and Evaluation

基于大语言模型的音乐推荐:挑战、机遇与评估

Elena V. Epure, Yashar Deldjoo, Bruno Sguerra, Markus Schedl, Manuel Moussallam

机构 * Deezer Research(Deezer研究机构) Johannes Kepler University Linz(约翰·凯撒大学林茨分校) Linz Institute of Technology(林茨技术研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 探讨音乐推荐系统从依赖信息检索框架向LLM驱动转变面临的挑战与机遇,通过回顾LLMs对音乐相关建模的重塑、审视自然语言处理评估实践,勾勒成功与风险维度,为音乐推荐系统评估提供跨学科视角。

Comments Under review with the ACM Transactions on Recommender Systems (TORS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02104 2026-07-21 cs.LG 版本更新 92%

When Can You Debias an LLM Judge? Identifiability Limits, a Test, and Designs for Top-k Ranking

提出正确的比较:基于偏差感知的贝叶斯主动Top-k排序与LLM裁判

Jian Xu, Delu Zeng, John Paisley, Qibin Zhao

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对LLM裁判存在噪声和系统性偏差(如偏好冗长或格式好的回答)的问题,提出将裁判过程建模为贝叶斯推断,引入显式的裁判特定偏差协变量,并设计一种Top-k感知的主动获取规则,以在固定比较预算下准确识别Top-k项。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05558 2026-07-21 cs.LG 版本更新 92%

Autoregressive Diffusion World Models for Off-Policy Evaluation of LLM Agents

自回归扩散世界模型用于LLM智能体的离线评估

Kaixuan Liu, Guojun Xiong, Weinan Zhang, Shengpu Tang

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出ADWM框架,通过自回归扩散世界模型从预收集轨迹中模拟环境响应,实现无需在线交互的LLM智能体策略离线评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18635 2026-07-21 cs.CL cs.AI cs.CY 91%

No Free Lunch in Language Model Bias Mitigation? Targeted Bias Reduction Can Exacerbate Unmitigated LLM Biases

语言模型偏见缓解中的“无免费午餐”现象?针对性偏见减少可能加剧未缓解的LLM偏见

Shireen Chand, Faith Baca, Emilio Ferrara

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了语言模型偏见缓解的跨类别影响,发现针对性缓解可能加剧其他方面的偏见,强调了多维评估的重要性。

Journal ref AI, 7(1), 24, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04788 2026-07-21 cs.CY 版本更新 90%

From Sycophancy to Deception: A Unified Taxonomy for LLM Spontaneous Misalignment

从幻觉到谋略:一种统一的分类法和基准分析用于LLM欺骗

Jerick Shi, Terry Jingcheng Zhang, Zhijing Jin, Vincent Conitzer

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出统一的LLM欺骗分类法,揭示现有基准在欺骗机制覆盖不足的问题,并为开发者和监管者提供改进建议。

Comments Accepted to ICLR Agents in the Wild: Safety, Security, and Beyond Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17409 2026-07-21 stat.ML cs.LG stat.ME 新提交 90%

Efficient Sequential Evaluation of Large Language Models

大语言模型的高效顺序评估

Chia-Yu Hsu, Shubhanshu Shekhar

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究在固定问题集上顺序评估新大语言模型,基于历史数据构建置信序列,提出增长导向查询规则,分析影响收缩率因素并提出混合查询规则,实验发现简单的均匀采样有时表现更好。

Comments This is a preliminary version; feedback is welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15936 2026-07-21 cs.CY cs.HC 版本更新 90%

Large Language Models in Architecture Studio: A Framework for Learning Outcomes

大型语言模型在建筑工作室中的应用:一种学习成果的学习框架

Juan David Salazar Rodriguez, Sam Conrad Joyce, Nachamma Sockalingam, Khoo Eng Tat, Julfendi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本研究探讨了大型语言模型在建筑工作室中的应用,旨在通过AI干预解决教学挑战并提升学习成果。

Comments This work has been accepted for publication in International Conference on Human-Computer Interaction HCII 2026 (pp. 93-110)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17615 2026-07-21 cs.SD cs.AI 新提交 90%

Re-Sonance: A Dysarthric Asynchronous Real-Time Speech Conversion System Based on a Three-Stage Cascaded ASR-LLM-TTS Architecture

共振:基于三级级联ASR-LLM-TTS架构的构音障碍异步实时语音转换系统

Yuxuan Wu, Yifan Xu, Junkun Wang, Jiayong Jiang, Xin Zhao, Zhaojie Luo

机构 * Southeast University(东南大学) School of Biological Science & Medical Engineering, Southeast University(东南大学生物科学与医学工程学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对构音障碍患者在专业演讲场景的沟通问题,提出基于三级级联ASR-LLM-TTS架构的Re-Sonance系统,集成多种技术,经评估其能提高轻度至中度构音障碍患者语音清晰度与自然度,验证了基于LLM方法增强语音驱动AAC系统的潜力。

Comments Accepted by NCMMSC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06820 2026-07-21 cs.AI 版本更新 90%

When Direct Prediction Fails: Evidence from LLM-Based Misinformation Risk Evaluation

超越表面判断:LLM生成虚假信息的人类基础风险评估

Zonghuan Xu, Xiang Zheng, Yutao Wu, Xingjun Ma

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室) City University of Hong Kong(香港城市大学) Deakin University(迪肯大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究LLM生成虚假信息的风险评估,发现LLM法官在整体评分、项目排序和信号依赖上与人类存在显著差异,且法官间一致性高于人类读者,表明内部一致性不能作为读者反应代理的有效证据。

Comments 9 pages, 1 figure. Substantially revised and reorganized version of arXiv:2604.06820 based on the same study and data; adds stricter participant filtering, held-out prediction analyses, and additional robustness checks

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09721 2026-07-21 cs.CL cs.AI 90%

Cross-Platform Evaluation of Large Language Model Safety in Pediatric Consultations: Evolution of Adversarial Robustness and the Scale Paradox

跨平台评估大语言模型在儿科咨询中的安全性:对抗鲁棒性的演变与规模悖论

Vahideh Zolfaghari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了不同模型和平台在家长焦虑驱动下的LLM安全性,发现较小模型在对抗性压力下表现更优,且安全性与模型架构相关,而非规模。

Journal ref npj Digit. Med. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18110 2026-07-21 cs.LG cs.CL 新提交 89%

LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks

大语言模型作为教练:不可验证任务的体验式学习

Tianzhu Ye, Li Dong, Guanheng Chen, He Zhu, Xun Wu, Shaohan Huang, Furu Wei

机构 * Microsoft Research(微软研究院) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 评测与基准 :LLM(title,summary_cn);post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究不可验证任务,提出体验式学习(EL),将LLM反馈模型从评判转为教练,通过提炼体验知识提供密集监督,在开放式任务上表现优于基于规则的RL,泛化性好且减轻奖励作弊。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16777 2026-07-21 cs.CL cs.AI 新提交 88%

JOR-Bench: Japanese Operations Research Benchmarks for Large Language Models

JOR-Bench:用于大语言模型的日语运筹学基准测试

Yuu Jinnai

机构 * CyberAgent

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 JOR-Bench是用于评估大语言模型解决运筹学问题能力的日语基准测试集,涵盖多种规划问题。通过评估七个LLMs的英文和日语版本,发现多语言模型的OR制定能力语言中立,但存在跨语言差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18066 2026-07-21 cs.CL 新提交 88%

Pancasila-Dilemmas: Evaluating Large Language Models on Indonesian Human Value Dilemmas Grounded in Pancasila

潘查希拉困境:基于潘查希拉对印度尼西亚人类价值困境的大语言模型评估

Supryadi, Irfan, Julianti, Darren Keanly Martin, Jayvin Fernando, Yuqi Ren, Deyi Xiong

机构 * Universitas Universal(印尼环球大学) Beijing Language and Culture University(北京语言大学) Tianjin University(天津大学) School of Artificial Intelligence, Tianjin University(天津大学人工智能学院) School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究基于印尼新闻构建潘查希拉困境数据集,含1834个按潘查希拉五价值观分类的问题,用于评估大语言模型价值对齐。通过母语人士校对及公民回答,评估50个模型,发现各模型在宗教和团结困境案例中表现差,凸显印尼价值观捕捉差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17745 2026-07-21 cs.AI 新提交 88%

WuYu-EnvLE-Bench: A Benchmark for Evaluating Large Language Models in Environmental Law Enforcement

吴语-环境执法基准:评估大语言模型在环境执法中的基准

Ziliang Yang, Yi Zhang, Kaijun Lin, Jiachao Ke, Haihong Xu, Zongguo Wen

机构 * School of Environment, Tsinghua University(清华大学环境学院) College of Economics and Management, Beijing University of Technology(北京工业大学经济与管理学院) State Key Laboratory of Iron and Steel Industry Environmental Protection, School of Environment, Tsinghua University(清华大学环境学院钢铁工业环境保护国家重点实验室) Appraisal Center for Environmental Engineering, Ministry of Ecology and Environment(生态环境部环境工程评估中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究针对大语言模型在环境执法中生成可追溯决策能力不明的问题,构建吴语-环境执法基准,含多任务多子领域实例,用AES和IEI评估模型,发现其在部分任务表现不佳,强调证据与规则感知的执法推理需求。

Comments 98 pages, 45 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16609 2026-07-21 cs.CV cs.CL 新提交 88%

Can Multimodal Large Language Models Understand OCT?

多模态大语言模型能理解光学相干断层扫描(OCT)吗?

Baochen Fu, Wenzhi Deng, Baihao Jin, Yang Li, Zihan Nie, Kailin Jiang, Yuntao Du, Weiye Song

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究探讨多模态大语言模型能否理解OCT,引入OCT - Bench基准,包含多维度细粒度任务,基于多个数据集构建大量选择题,评估20个代表性模型,发现当前模型理解OCT能力不足,为评估模型和推动OCT理解提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21961 2026-07-21 cs.CL 版本更新 88%

PapersPlease: A Benchmark for Evaluating Motivational Values of Large Language Models Based on ERG Theory

《请出示文件:基于ERG理论评估大语言模型动机价值的基准》

Junho Myung, Yeon Su Park, Sunwoo Kim, Shin Yoo, Alice Oh

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究引入PapersPlease基准,由3700个基于ERG理论的道德困境组成,让LLMs充当移民检查员决策。分析六个LLMs发现决策模式及隐含偏好,评估还显示其对社会身份叙述的反应因动机需求和身份线索而异。

Comments Accepted to GEM2 Workshop: Generation, Evaluation & Metrics - ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09497 2026-07-21 cs.CL cs.AI 版本更新 88%

BERT-as-a-Judge: A Robust Alternative to Lexical Methods for Efficient Reference-Based LLM Evaluation

BERT-as-a-Judge: 一种更稳健的替代方法,用于高效参考基于的大语言模型评估

Hippolyte Gisserot-Boukhlef, Nicolas Boizard, Emmanuel Malherbe, Céline Hudelot, Pierre Colombo

机构 * Artefact Research Center(Artefact 研究中心) Diabolocom Cohere

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BERT-as-a-Judge,通过编码器驱动的方法评估参考基于的生成结果,克服了传统词汇方法的局限,提供高效且可靠的评估方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16648 2026-07-21 cs.CR cs.IT math.IT 新提交 88%

Synchronization-Free Algebraic Fingerprints for Large Language Models: From Autoregressive to Diffusion Models

大语言模型的无同步代数指纹:从自回归模型到扩散模型

Jaroslaw Janas, Josef Pieprzyk, Pawel Morawiecki

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 针对大语言模型水印需求,提出无同步水印方案,由相邻令牌生成二元同余作水印,从代数角度分析恢复问题,讨论解码算法,该方法能抗多种操作,避免同步问题,为嵌入不同长度秘密身份提供灵活框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07196 2026-07-21 cs.HC 88%

Large Language Models for Wearable Sensor-Based Human Activity Recognition, Health Monitoring, and Behavioral Modeling: A Survey of Early Trends, Datasets, and Challenges

基于可穿戴传感器的人类活动识别、健康监测与行为建模的大型语言模型:早期趋势、数据集和挑战的综述

Emilio Ferrara

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文综述了大型语言模型在可穿戴传感器数据中的应用,探讨了其在人类活动识别、健康监测和行为建模中的早期趋势、数据集及挑战。

Journal ref Sensors, 24(15), 5045, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16011 2026-07-21 cs.SE cs.AI cs.CL 版本更新 87%

FormulaCode: Evaluating Agentic Optimization on Large Codebases

FormulaCode: 评估在大规模代码库上进行代理优化

Atharva Sehgal, James Hou, Akanksha Sarkar, Ishaan Mantripragada, Swarat Chaudhuri, Jennifer J. Sun, Yisong Yue

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) California Institute of Technology(加州理工学院) Cornell University(康奈尔大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 FormulaCode是一个评估大型真实代码库上代理优化能力的基准,包含957个从科学Python仓库挖掘出的性能瓶颈,配以专家撰写的补丁和平均264.6个社区维护的性能工作负载,揭示了前沿LLM代理在多目标优化上的重大挑战。

Comments ICML Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18108 2026-07-21 cs.CR 新提交 87%

GARAGE: Characterizing the Automation Boundary in LLM-based Attack Graph Generation

GARAGE:基于大语言模型的攻击图生成中自动化边界的特征描述

Daekwon Pi, Sangho Lee, Young Hun Lee, Huy Kang Kim

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 研究针对现代车辆安全CTI合成难题,提出GARAGE框架,通过RAG技术将碎片化CTI转化为特定领域知识库用于攻击图生成,经实验验证能准确转移安全知识,还可作为TARA支持工具提供性价比分析以指导在各LLM层级部署。

Comments 22 pages, 10 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02792 2026-07-21 cs.LG cs.NE 版本更新 86%

From Heuristic Selection to Automated Algorithm Design: LLMs Benefit from Strong Priors

从启发式选择到自动化算法设计:LLMs受益于强先验

Qi Huang, Furong Ye, Ananta Shahane, Thomas Bäck, Niki van Stein

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出利用基准算法引导LLM优化,提升黑箱优化在pbo和bbob基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17979 2026-07-21 cs.LG cs.AI 新提交 86%

Harness Engineering for LLM-Driven GPU Kernel Generation

用于大语言模型驱动的GPU内核生成的工具工程

Yue Shui, Chenyu Ma, Hangfei Xu, Shengzhao Wen, Yanpeng Wang

机构 * Baidu, Inc.(百度公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 在MLSys 2026 FlashInfer竞赛中,针对NVIDIA Blackwell B200 GPU,提出以工具为中心的大语言模型驱动的GPU内核优化系统,分离评估工具与优化控制器,利用Codex等生成候选内核,实验显示优化后平均延迟加速显著,且代理辅助内核效果更佳。

Comments 24 pages, 6 figures. Extended technical report on our submission to the MLSys 2026 FlashInfer AI Kernel Generation Contest. Code: https://github.com/syhya/mlsys26-flashinfer-contest

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16215 2026-07-21 cs.AI cs.CL cs.SE 新提交 86%

RAIL Guard: Closing the Evaluation-to-Remediation Gap in Responsible AI for LLM Agents

RAIL Guard:弥合大语言模型智能体负责任人工智能中评估与修复的差距

Sumit Verma, Pritam Prasun, Pritish Kumar

机构 * Responsible AI Labs(负责任人工智能实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型智能体评估与修复差距问题,提出RAIL Guard闭环负责任人工智能管道,在多维度评估输出并迭代修复。实验表明其闭环修复收敛率高,能减少不安全执行,还区分了可修复与结构维度问题,系统开源。

Comments 15 pages, 10 figures, 4 tables. Code: https://github.com/Responsible-AI-Labs/rail-score-sdk (Python). Benchmark: https://huggingface.co/datasets/responsible-ai-labs/rail-guard-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18086 2026-07-21 cs.AI 新提交 86%

Judge-dependent safety gains and model-specific helpfulness costs of evidence-sufficiency prompting in clinical LLMs

临床大语言模型中证据充分性提示的依赖判断的安全增益和特定模型的有用性成本

Koyar Afrasyab

专题命中 评测与基准 :prompting(title);LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 研究临床大语言模型中证据充分性提示的安全增益及有用性成本,通过在公共数据基准中让四个模型用标准提示和包装器回答问题,发现安全增益有方向和幅度差异且依赖评判者,同时存在模型特定的有用性成本。

Comments https://github.com/KAVentures/clinical-evidence-sufficiency-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01549 2026-07-21 cs.CL cs.SE 版本更新 85%

Octopus: On-device language model for function calling of software APIs

章鱼:用于软件API函数调用的设备端语言模型

Wei Chen, Zhiyuan Li, Mingyuan Ma

机构 * Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 研究利用设备端大语言模型调用软件API,通过编译数据集微调不同参数模型,提升其API交互能力,提出条件掩码技术和新基准,经微调的Octopus模型在API调用上性能超GPT-4,推动自动化软件开发和API集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18144 2026-07-21 cs.LG cs.AI cs.CL 新提交 85%

Do Language Models Dream of Binding Molecules? Benchmarking LLMs under Spatial Constraints

语言模型能否设计出结合分子?在空间约束下对语言模型进行基准测试

Thomas MacDougall, Maksim Kuznetsov, Roman Schutski, Rim Shayakhmetov, Maxim Malkov, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

专题命中 评测与基准 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨通用语言模型在3D分子设计中应对复杂空间约束的能力,引入3D - Fit评估策略,发现语言模型虽落后于先进方法,但有潜力同时处理多种空间约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12281 2026-07-21 cs.CV 版本更新 85%

Cognitive-YOLO: LLM-Driven Architecture Synthesis from First Principles of Data for Object Detection

认知YOLO:基于数据第一性原理的大语言模型驱动的架构合成用于目标检测

Jiahao Zhao

机构 * Xi’an University of Posts and Telecommunications(西安邮电大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对通用目标检测算法在垂直场景的问题,认知YOLO利用大语言模型与自主智能体协作,构建“分析-合成-编译”管道,合成轻量级模型,显著压缩参数数量,在mAP@0.5:0.95上表现良好,平衡了模型紧凑性和特征表示能力。

Comments 11 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18147 2026-07-21 eess.SY cs.AI cs.SY 新提交 84%

LLMs and Agentic AI Systems for Smart Grids: A Tutorial on Architectures and Applications

用于智能电网的大语言模型和智能AI系统:架构与应用教程

Daniela Rojas, Abdulwahab Albassam, Aidan G. Leung, Jett Ngo, Ryan Luo, Peter R. Quawas, Junpyung Kim, Kangkai Liang, Mansi Nanavati, Jonathan Mai, Meng-Chi Tsai, Yun-Tong Tsai, Yize Chen, Yuanyuan Shi

机构 * Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣迭戈分校电气与计算机工程系) Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究智能电网中LLMs和智能AI系统,提出基于求解器的设计原则,通过提示策略等构建模块及四个案例研究实例化该原则,比较不同方案,还提出四组评估框架,明确了各部分分工。

Comments 28 pages, 11 figures, 6 tables; plus supplementary material. Review/tutorial article

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17765 2026-07-21 cs.LG cs.AI cs.DB 新提交 84%

FIFA World Cup 2026 as a Contamination-Free Benchmark for LLM Forecasting Agents: Four Models, a Bookmaker, and 104 Matches

2026年国际足联世界杯作为语言模型预测代理的无污染基准:四个模型、一个博彩公司和104场比赛

Jiacheng Ding, Cong Guo, Jason Xu

机构 * University of Memphis(孟菲斯大学) QuantaInsight(量子洞察)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 介绍WC2026-Agents基准和数据集,用于评估大语言模型作为世界杯预测代理。四个前沿模型对104场比赛运行相同循环,与博彩市场数据配对。揭示模型预测虽有相同首选,但在决策质量等方面差异大,可衡量校准等方面。

详情

展开后加载摘要…

URL PDF HTML 收藏