arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11618 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2798 篇

2608.15396 2026-08-18 cs.AI cs.CL cs.SY eess.SY 新提交 91%

Large Language Model Assisted Operational Monitoring for Battery Energy Storage System Integrated Power Distribution Networks

大型语言模型辅助的电池储能系统集成配电网运行监测

Azmeer Akhtar, Md Fazley Rafy, Anurag K. Srivastava

机构 * West Virginia University(西弗吉尼亚大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究提出了大型语言模型辅助的人工智能监测框架,用于分析电池储能系统集成配电网,可将自然语言问题转为SQL查询,实现电网运行数据的自动化评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07525 2026-08-11 cs.CL cs.AI 新提交 91%

Unified Hallucination Fuzzing for Multimodal Large Language Models

面向多模态大语言模型的统一幻觉模糊测试

Pengfei Zhou, Jiajun Song, Zhiwei Tang, Yixing Ma, Xiaopeng Peng, Donghui Si, Yuhang Xu, Huiqi Song, Yiyuan Miao, Yichen Qian, Weihua Chen, Wangbo Zhao, Bohan Zhuang, Jiasheng Tang, Yang You

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型的幻觉问题,提出含UniHall基准与SAMF自演化模糊测试的评估框架,发现SOTA模型在模糊测试下性能显著下降,存在有用性-幻觉权衡。

Comments 47 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07243 2026-08-10 cs.AI cs.CL cs.NE 新提交 91%

Recipes for Creativity: Iterative Generation and Evaluation in Large Language Models

创造力的秘诀:大语言模型中的迭代生成与评估

Rens Anderson, Tessa Verhoef, Amirhossein Zohrehvand

机构 * Leiden University(莱顿大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本研究以2024年Pillsbury烘焙大赛食谱生成为任务,探究迭代生成对LLM创造力的影响,发现迭代生成-选择可产出与人类基准相当的食谱,且评估器设计是主观创造性搜索的关键变量。

Comments 7 pages, 3 figures, 1 table. Short paper accepted at ICCC'26

Journal ref Proceedings of the 17th International Conference on Computational Creativity (ICCC'26), Coimbra, Portugal, June 29-July 3, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03803 2026-08-05 cs.CL cs.LG 新提交 91%

M-GATE: Multilingual Grammar, Accuracy in Translation, and Efficiency Benchmark for Large Language Models

M-GATE:面向大语言模型的多语言语法、翻译准确性与效率基准

Tomáš Burkert, Angelika Peljak-Łapińska, David Zelený

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 本研究推出多语言基准M-GATE,评估50余种模型的80余种配置,发现翻译与语法能力分离,低资源语言惩罚随模型迭代缩小,推理对翻译提升显著。

Comments 45 pages (97 incl. appendices), 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03416 2026-08-05 cs.AI cs.LG 新提交 91%

AI World Cup 2026: Benchmarking Large Language Models for End-to-End Football Tournament Prediction

2026 AI世界杯:用于端到端足球锦标赛预测的大语言模型基准测试

Jonaid Shianifar, Iias Faiud

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文通过AI世界杯基准测试,对10款大语言模型进行2026年FIFA世界杯端到端预测,发现淘汰赛表现决定排名,GPT-5.5 Thinking夺冠,相关成果已公开以支持后续研究。

Comments 18 pages, 8 figures, 7 tables. Project repository available in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02703 2026-08-05 cs.CL cs.LG 新提交 91%

ARCHead: Activation-Metric Residual Correction for Large Language Model Output Heads

ARCHead:大语言模型输出头的激活度量残差修正

Şuayp Talha Kocabay, Talha Rüzgar Akkuş, Kamer Ali Yuksel

机构 * aiXplain, Inc.(aiXplain公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 ARCHead是一种LM-head压缩器,通过量化低秩核心、分组INT4残差及激活衍生低秩修正,将LM-head存储降3.7-3.9倍,在Qwen3-8B-Base上性能优于朴素INT4,可补充块量化器。

Comments 13 pages, 4 figures. Submitted to ACL Rolling Review (ARR). Code: https://github.com/suayptalha/archead

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27654 2026-07-31 cs.CL cs.AI 新提交 91%

From Single- to Cross-Document: Benchmarking Multi-Granularity Event Analysis of Large Language Models

从单文档到跨文档:大语言模型多粒度事件分析的基准测试

Tao Wen, Shuai Shao, Pei Ke, Xu Han, Jie Zou, Guannan Li, Tao Tian, Jinjie Qiu, Lan Wang, Ke Qin

机构 * University of Electronic Science and Technology of China(电子科技大学) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文推出MiGUE-Bench基准及MiGUE-Pipeline框架,通过四项核心任务评估LLMs多粒度事件分析能力,明确其能力边界与缺陷,为该领域改进提供方向。

Comments 9 pages. Published in the Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), pp. 3464-3472, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23344 2026-07-28 cs.CL cs.LG 新提交 91%

BERT-based Models vs. Large Language Models for Low-Resource Named Entity Recognition: A Comparative Study on Marathi

基于BERT的模型与大语言模型在低资源命名实体识别中的比较研究:以马拉地语为例

Hariom Ingle, Ronit Ghode, Ishwari Gondkar, Jidnyasa Harad, Raviraj Joshi

机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯分校) L3Cube Labs(L3Cube实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 研究比较基于BERT的模型与大语言模型在马拉地语低资源命名实体识别中的表现,通过在MahaNER数据集上微调MahaBERT-v2并与基线及通用模型对比,发现特定任务模型效果更佳,凸显专用架构对低资源语言处理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22218 2026-07-27 cs.CL cs.AI 新提交 91%

Why Large Language Models and Humans Converge and Diverge in Evaluating Creativity

为什么大语言模型与人类在评估创造力时会趋同和背离

Pengzhao Lyu, Yeun Joon Kim, Hanlin Xiao, Yingyue Luna Luan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究探讨大语言模型与人类评估创造力时趋同和背离的原因,通过三项研究和六个模型,识别其评估标准及影响,发现一致性取决于判断证据和模型标准,强调内在品质时趋同,需上下文信息时背离,选评估模型很关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20286 2026-07-23 cs.CL cs.AI 新提交 91%

Sound Probabilistic Safety Bounds for Large Language Models

大语言模型的可靠概率安全边界

Mahdi Nazeri, Anne-Kathrin Schmuck, Sadegh Soudjani, Alessandro Abate

机构 * University of Oxford(牛津大学) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) University of Birmingham(伯明翰大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究提出框架计算大语言模型生成有害输出概率的严格边界,利用克洛普 - 皮尔逊置信区间,通过潜在空间特征优先探索有害分支,能高效计算可靠下界,实验验证方法有效性,为模型评估和认证提供新途径。

Comments The Initial version of this manuscript has been available on OpenReview, see https://openreview.net/forum?id=papImkPLf5

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25984 2026-07-10 cs.AI cs.LG 新提交 91%

InvestPhilBench: A Multi-Layer Benchmark for Evaluating Large Language Model Procedural Reasoning in Expert Investment Philosophy

InvestPhilBench: 评估大型语言模型在专家投资哲学中程序性推理的多层动态基准

Mingguang Chen, Bo Qu

机构 * University of California, Riverside (UCR)(加州大学河滨分校) Illinois Institute of Technology (IIT)(伊利诺伊理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.AI、cs.LG

AI总结 提出InvestPhilBench基准,通过八层认知层级和自动化评分管道,揭示前沿LLM在投资决策程序推理中的复合评分饱和但程序性缺陷隐藏的问题。

Comments 65 pages, 6 figures, 26 tables. Benchmark, data, and code released. v0.6 release; preliminary empirical study (de-confounded multi-model leaderboard forthcoming)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06963 2026-07-09 cs.CR cs.AI cs.CL 新提交 91%

Large Language Models (LLMs) and Generative AI in Cybersecurity and Privacy: A Survey of Dual-Use Risks, AI-Generated Malware, Explainability, and Defensive Strategies

大型语言模型(LLMs)和生成式人工智能在网络安全与隐私中的应用:两用风险、人工智能生成的恶意软件、可解释性及防御策略综述

Kiarash Ahi, Saeed Valizadeh

机构 * Virelya Intelligence Research Labs(Virelya智能研究实验室) Google(谷歌)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 综述大型语言模型和生成式人工智能在网络安全中的应用,涵盖两用风险等多方面。通过回顾众多资料及实际案例研究,给出负责任部署建议与安全路线图,为应对人工智能驱动的网络安全挑战提供关键参考。

Comments Invited survey paper. 10 pages, 5 figures, 2 tables

Journal ref IEEE 6th Silicon Valley Cybersecurity Conference (SVCC), San Francisco, CA, USA, 2025, pp. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06482 2026-07-08 cs.CL cs.AI 新提交 91%

Data Analysis in the Wild: Benchmarking Large Language Models Against Real-World Data Complexities

野外数据分析:针对现实世界数据复杂性对大语言模型进行基准测试

So Hasegawa, Shailaja Keyur Sampat, Lei Liu, Wei-Peng Chen

机构 * Fujitsu Research of America(富士通美国研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对大语言模型在数据分析基准测试无法反映现实情况的问题,引入DataGovBench基准测试,含表格问答和表格洞察两个任务,通过实验发现现有模型有性能差距,为推进相关研究提供挑战基准。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03377 2026-07-07 cs.CL cs.AI 新提交 91%

Spectral Signatures of Large Language Models

大语言模型的频谱特征

Zhuoying Zhang, Ishan V. Prasad, Yuanzhe Hu, Zihang Liu, Hengrui Luo, Pu Ren, Yaoqing Yang

机构 * Rice University(莱斯大学) Dartmouth College(达特茅斯学院) Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 针对大规模管理和量化大语言模型的挑战,采用基于重尾自正则化理论的频谱形状指标,以权重经验谱密度形状信息为模型频谱特征,可用于模型谱系追踪等,还构建语料库进行基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31250 2026-07-01 cs.CL cs.AI 新提交 91%

Probing Stylistic Appropriation using Large Language Models: An Evaluation Framework for Copyright Infringement under EU Law

使用大语言模型探测风格挪用:欧盟法律下版权侵权的评估框架

Noah Scharrenberg, Chang Sun

机构 * Maastricht University(马斯特里赫特大学) Contractuo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出PSALM框架,通过十个评估器将欧盟版权法标准操作化,发现指令调优模型在接触语料前已有非平凡风格相似性,微调导致系统性风格挪用,负偏好优化可降低但残留可检测风格模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26101 2026-06-26 cs.CL cs.AI 新提交 91%

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models

Know2Guess: 一种面向大型语言模型知识边界评估的污染感知多区域基准

Renwei Meng, Bowen Zhang, Jian Wang, Xican Wang, Haoyi Wu, Xuanyan Qiu, Shengan Yang

机构 * Anhui University(安徽大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出一种污染感知多区域基准,通过冻结构建时标签测量从可回答知识到应弃权未知的转变,评估模型在回答与弃权间的可靠性。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24381 2026-06-24 cs.CL cs.AI 新提交 91%

On the Stability of Prompt Ranking in Large Language Model Evaluation

论大语言模型评估中提示排序的稳定性

Shaoshuai Du, Penghao Liang, Yixian Shen, Chuanqi Shi, Hang Zhang, Lun Wang

机构 * University of Amsterdam(阿姆斯特丹大学) Northeastern University(东北大学) University of California San Diego(加州大学圣迭戈分校) Duke University(杜克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究提示排序在常见评估变化下的稳定性,发现顶级提示常变导致选择不可靠,提出基于置信下限的稳定性感知选择策略以提高鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20572 2026-06-23 cs.CL cs.AI 新提交 91%

Investigating Linguistic Steering: An Analysis of Adjectival Effects Across Large Language Model Architectures

探究语言引导:跨大语言模型架构的形容词效应分析

Lars Malmqvist

机构 * Research and Implementation(研究与实现)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);prompting(abstract)

AI总结 本研究利用Shapley值量化形容词对模型性能的引导效应,发现少量形容词具有不成比例的强大影响,但效果非普适;跨模型分析揭示“家族效应”,且形容词的引导方向高度依赖于句法角色和位置。

Comments Accepted for TMLR, https://openreview.net/forum?id=xN7NYpQeBm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16137 2026-06-16 cs.CL cs.AI 新提交 91%

XAI-Grounded Explanation Generation for Speech Deepfake Detection with Training-Free Multimodal Large Language Models

基于XAI的语音深度伪造检测解释生成:使用免训练多模态大语言模型

Yupei Li, Qiyang Sun, Xiaoliang Wu, Chenxi Wang, Berrak Sisman, Björn W. Schuller

机构 * Imperial College London(帝国理工学院) Technical University of Munich(慕尼黑工业大学) University of Southampton(南安普顿大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对语音深度伪造检测缺乏可解释性的问题,提出一种免训练框架,融合XAI证据与多模态大语言模型,生成基于证据的特定解释,在PartialSpoof数据集上内部准确率提升超45%。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12191 2026-06-11 cs.CL cs.AI 新提交 91%

Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application

面向大语言模型的智能体环境工程:环境建模、合成、评估与应用综述

Jiachun Li, Zhuoran Jin, Tianyi Men, Yupu Hao, Kejian Zhu, Lingshuai Wang, Dongqi Huang, Longxiang Wang, Shengjia Hua, Lu Wang, Jinshan Gao, Hongbang Yuan, Ruilin Xu, Kang Liu, Jun Zhao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文从环境工程生命周期出发,系统综述了智能体环境的建模、合成、评估与应用,涵盖八种属性与领域、两种合成范式、四种智能体演化路径及三种环境演化范式。

Comments 63 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14626 2026-08-18 cs.CL cs.AI cs.LG 新提交 90%

LLM Safety Alignment in Low-Resource Languages: A Systematic Literature Review

低资源语言下的大语言模型安全对齐:系统文献综述

Valdini Douglace Lemofouet, Blessing Ngozi Uzor, Paula Chikaodinaka Anyanwu, Danielle Blanche Kapsa, Sukairaj Hafiz Imam, P Sam Sahil, Abigail Oppong, Tassallah Abdullahi, Clemencia Siro, Idris Abdulmumin, Seid Muhie Yimam, Shamsuddeen Hassan Muhammad

机构 * African Institute for Mathematical Sciences (AIMS)(非洲数学科学研究所) Bayero University Kano(卡诺贝罗大学) Brown University(布朗大学) Centrum Wiskunde & Informatica(数学与计算机科学中心) University of Pretoria(比勒陀利亚大学) University of Hamburg(汉堡大学) Imperial College London(伦敦帝国学院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过PRISMA 2020方法学开展系统文献综述,分析50项相关研究,揭示低资源语言下LLM存在多语言安全差距,提出安全对齐分类,并给出未来研究方向。

Comments The paper was accepted at LM4UC workshop organize by IJCAI. I added a screenshot of the decision (Open Review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11454 2026-08-13 cs.SE 新提交 90%

Simplifying Requirements Engineering in the Context of the LGPD: An LLM-Based Investigation

在LGPD背景下简化需求工程:一项基于大语言模型(LLM)的研究

Cinara Gomes de Melo Carneiro, Renato de Freitas Bulcão Neto

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究针对隐私法规合规转化为软件需求的挑战,探究LLM在LGPD框架下简化需求工程的可行性,提出利用法规自动生成用户故事和验收测试场景的方法,验证其能从软件初期确保合规。

Comments The document consists of 12 pages and includes 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07920 2026-08-11 cs.CV 新提交 90%

Forged Peer Judgments Mislead Multimodal LLM Judge Panels: Source-Blind Anchoring and Panel-Consensus Verification

伪造的同行判断会误导多模态大语言模型(LLM)评判小组:无来源锚定与小组共识验证

Yang Shu

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract)

AI总结 研究发现多模态LLM评判小组存在无来源锚定的文本攻击面,伪造同行判断可误导判决,提出的小组共识验证方法能有效阻断此类攻击并降低损害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07881 2026-08-11 cs.AI cs.CL cs.IT cs.LG math.IT 新提交 90%

GRACE: LLM-Grounded Semantic Metric Spaces for Scalable Mixed-Data Clustering

GRACE:用于可扩展混合数据聚类的大语言模型(LLM)基础语义度量空间

Zihua Yang, Zhencheng Xie, Junyang Chen, Liang Xie, Yiqun Zhang, Mengke Li, Yang Lu

机构 * Guangdong University of Technology(广东工业大学) Tsinghua University(清华大学) Peking University(北京大学) Shenzhen University(深圳大学) Xiamen University(厦门大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对混合数据聚类中语义丰富度与可扩展性的矛盾,提出GRACE框架,通过多视角LLM查询实现一次性语义嵌入,兼顾可扩展性与聚类性能,优于11种对比方法。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02507 2026-07-03 cs.AI cs.CL cs.LG cs.MA 新提交 90%

What LLM Agents Say When No One Is Watching: Social Structure and Latent Objective Emergence in Multi-Agent Debates

当无人注视时LLM智能体在说什么:多智能体辩论中的社会结构与潜在目标涌现

Arman Ghaffarizadeh, Danyal Mohaddes, Aliakbar Izadkhah, Shahriar Noroozizadeh

机构 * Independent Researcher(独立研究员) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出双通道辩论框架,研究社会结构(角色、受众、关系)如何导致LLM智能体在公开与私下(OTR)表达中产生系统性分歧,揭示潜在目标的涌现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20661 2026-06-23 cs.AI cs.CL cs.LG 新提交 90%

From Knowing to Acting: Benchmarking Self-Awareness Capability of LLM Agents

从知道到行动:基准测试LLM代理的自我意识能力

Yifan Li, Shengbin Yue, Boyu Feng, Jinhu Qi, Bo Ke, Zixing Song, Hongru Wang, Zhongyu Wei, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) University of Edinburgh(爱丁堡大学) Tencent(腾讯) University of Bristol(布里斯托大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出KAPRO框架和KAware数据集,通过解耦元认知判断与自主执行,评估LLM代理的自我意识能力,发现其与任务成功强相关但在内部能力场景中下降,开源模型易过度使用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16183 2026-06-16 cs.LG cs.AI cs.CL 新提交 90%

LLM-Powered Virtual Population for Demand Simulation and Pricing

基于LLM的虚拟人群用于需求模拟与定价

Chengpiao Huang, Kaizheng Wang

机构 * Columbia University(哥伦比亚大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种LLM驱动的虚拟人群模型,通过混合客户画像和LLM评估购买概率,生成需求分布,支持风险感知定价,在H&M数据集上表现最优。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15136 2026-06-16 cs.PF 新提交 90%

LLMs have Visualization Literacy: Now What? Experiments Exploring LLM Visualization Evaluation Capabilities

LLMs 具备可视化素养:现在呢?探索 LLM 可视化评估能力的实验

Christian Seto, Jacqueline Nguyen, Jiayi Hong, Ross Maciejewski

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过实验评估最新 LLM 在可视化素养、指令遵循和图形完整性方面的能力,发现其可视化素养超越人类,但在指令遵循和识别误导性可视化方面仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14199 2026-06-15 cs.CL cs.AI cs.LG 新提交 90%

OdysSim: Building Foundation Models for Human Behavior Simulation

OdysSim: 构建人类行为模拟的基础模型

Xuhui Zhou, Weiwei Sun, Weihua Du, Jiarui Liu, Haojia Sun, Qianou Ma, Tongshuang Wu, Yiming Yang, Maarten Sap

机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学语言技术研究所)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出OdysSim,通过SOUL分类法统一62个数据集和23个基准任务,采用混合训练、任务特定强化学习和专家蒸馏,构建8B参数行为基础模型OSim,在多数任务上超越前沿模型,并实现更类人输出和零样本迁移。

Comments 34 pages. Code: https://github.com/sunnweiwei/OdysSim ; Models and data: https://huggingface.co/collections/cmu-lti/odyssim

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14551 2026-08-18 cs.CL cs.DL cs.IR cs.LG 新提交 90%

Auxiliary uncertainty signals for LLM-assisted systematic review screening: a benchmark across eight Cohen drug-class reviews

用于大语言模型辅助系统评价筛选的辅助不确定性信号:八项Cohen药物分类综述的基准测试

Arya Rahgozar, Pouria Mortezaagha

机构 * University of Ottawa(渥太华大学) Ottawa Hospital Research Institute(渥太华医院研究所)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对LLM辅助系统评价筛选的不确定性问题,提出BERT+GCN辅助分类器的不确定性信号,在8个Cohen药物分类数据集上验证了提示策略的效率,发现仅弃权路由为帕累托最优且LLM无法自我分类。

Comments 27 pages, 7 figures, 10 tables. Code, prompts, and cached LLM responses at https://github.com/rahgoar/LR-Spectral-BERTGCN-Topological-Undecidability-in-Clinical-AI

详情

展开后加载摘要…

URL PDF HTML 收藏