arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2611 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2611 篇

2608.02620 2026-08-05 cs.CL 新提交 91%

JudgeArena: A Unified Framework for Reproducible LLM-Judge Evaluation

JudgeArena:用于可复现LLM-评判者评估的统一框架

Erlis Lushtaku, Bora Kargi, Ali Elganzory, Fabio Ferreira, Alejandro R. Salamanca, Julia Kreutzer, David Salinas

机构 * University of Freiburg(弗莱堡大学) ELLIS Institute Tübingen(图宾根ELLIS研究所) Microsoft AI(微软人工智能部门) Cohere Labs(Cohere实验室) Prior Labs(Prior实验室)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 JudgeArena是统一主流LLM评判者基准的开源框架,支持可替换评判者,配备调优开源评判者配置,可高精度模拟LMArena Elo分数,减少对闭源模型的依赖,提升评估的透明度与可复现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29431 2026-08-03 cs.AI 新提交 91%

ModelEquivBench: Certifying Multi-Relational Evaluation of LLM-Generated Optimization Models

ModelEquivBench:LLM生成优化模型的多关系验证评估系统

Penglin Zhu, Jungang Xu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出多关系评估系统ModelEquivBench,将其用于评估GPT-5.4等三个LLM生成的优化模型,发现不同模型在特征不同阶段失败,无法简化为单一准确率分数。

Comments 9 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23088 2026-07-28 cs.CR cs.AI 新提交 91%

Poster: Rethinking Security in LLM Code Generation through Real-World Risk Scenarios

海报:通过现实世界风险场景重新思考大语言模型代码生成中的安全性

Lixun Ma, Ruolong Ma, Bei Wang, Feng Wei, Zhenguang Liu, Lorenzo Cavallaro, Wentao Chen

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究LLM代码生成的安全行为,识别出三种风险场景,构建含2700个测试用例的基准评估安全性,发现先进LLMs平均漏洞率超56%,证明安全感知提示可大幅降低风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25332 2026-06-25 cs.CR cs.AI 新提交 91%

Decoupling Reconnaissance and Exploitation: Measuring the Capability Boundaries of LLM-Based Web Penetration Testing

解耦侦察与利用:测量基于LLM的Web渗透测试的能力边界

Liwei Yu, Shuo Li, Ming Zhou, Ge Chu, Yan Guo

机构 * University of Science and Technology of China(中国科学技术大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州先进研究院) Nanjing University of Science and Technology(南京理工大学) Research Institute, Runjian Co., Ltd(润杰有限公司研究院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出解耦评估框架分离侦察与利用阶段,发现LLM代理在准确漏洞上下文下功能成功率可达90.0%,但自主侦察召回率仅约50.0%,揭示了能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19544 2026-06-19 cs.CL 新提交 91%

Reliability without Validity: A Systematic, Large-Scale Evaluation of LLM-as-a-Judge Models Across Agreement, Consistency, and Bias

无效度的可靠性:LLM-as-a-Judge 模型在一致性、稳定性和偏差上的系统性大规模评估

Justin D. Norman, Michael U. Rivera, D. Alex Hughes

机构 * UC Berkeley School of Information(加州大学伯克利分校信息学院)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 本研究通过大规模系统性评估(21个裁判模型、118次运行、约54.1万次判断),发现LLM-as-a-Judge在一致性、稳定性和偏差方面存在普遍问题,包括kappa通缩、排名偏移、高重测信度与严重位置偏差并存,并提出了最小可行验证协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14278 2026-06-15 cs.CL 新提交 91%

Does the Judge Prefer English? Evaluating Language-Switching Invariance in LLM-as-a-Judge

法官偏爱英语吗?评估LLM作为法官时的语言切换不变性

Shaojie Yin

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Judge-LS协议,通过语言切换变体评估LLM作为自动法官的可靠性,发现语言切换导致10.7-14.4%偏好翻转,但翻译等价测试未显示系统英语偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22969 2026-07-28 cs.IR 新提交 91%

When Does Few-Shot Prompting Help? A Systematic Empirical Study of Shot-Count Effects Across Model Scale, Architecture, and Output Parsing Robustness

少样本提示何时起作用?跨模型规模、架构和输出解析鲁棒性的样本数量效应的系统实证研究

Ayush Dwivedi, Ashvi Soni

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究少样本提示中样本数量与模型规模、架构及输出格式合规性对分类性能的影响。通过对五个LLM在六种样本数量配置下研究,发现样本数量与分类性能关系非单调、非普遍且不能仅由模型规模预测,还纠正了影响Llama 3.3 70B性能的解析工件。

Comments 12 pages, 4 figures, 8 tables. Code available at https://github.com/a-dwivedi/few-shot-prompting-study

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07525 2026-08-11 cs.CL cs.AI 新提交 91%

Unified Hallucination Fuzzing for Multimodal Large Language Models

面向多模态大语言模型的统一幻觉模糊测试

Pengfei Zhou, Jiajun Song, Zhiwei Tang, Yixing Ma, Xiaopeng Peng, Donghui Si, Yuhang Xu, Huiqi Song, Yiyuan Miao, Yichen Qian, Weihua Chen, Wangbo Zhao, Bohan Zhuang, Jiasheng Tang, Yang You

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型的幻觉问题,提出含UniHall基准与SAMF自演化模糊测试的评估框架,发现SOTA模型在模糊测试下性能显著下降,存在有用性-幻觉权衡。

Comments 47 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07243 2026-08-10 cs.AI cs.CL cs.NE 新提交 91%

Recipes for Creativity: Iterative Generation and Evaluation in Large Language Models

创造力的秘诀:大语言模型中的迭代生成与评估

Rens Anderson, Tessa Verhoef, Amirhossein Zohrehvand

机构 * Leiden University(莱顿大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本研究以2024年Pillsbury烘焙大赛食谱生成为任务,探究迭代生成对LLM创造力的影响,发现迭代生成-选择可产出与人类基准相当的食谱,且评估器设计是主观创造性搜索的关键变量。

Comments 7 pages, 3 figures, 1 table. Short paper accepted at ICCC'26

Journal ref Proceedings of the 17th International Conference on Computational Creativity (ICCC'26), Coimbra, Portugal, June 29-July 3, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04156 2026-08-06 cs.AI cs.LG 新提交 91%

BrainBench: Benchmarking Large Language Models for Comprehensive EEG Understanding

BrainBench:面向全面脑电理解的大语言模型基准测试

Yangxuan Zhou, Sha Zhao, Yuning Chen, Chen Wu, Jiquan Wang, Shijian Li, Gang Pan

机构 * Zhejiang University(浙江大学) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究推出BrainBench基准测试,涵盖4个子集共17个数据集等,评估大语言模型在两种范式下的脑电理解能力,为相关研究提供可复现测试平台。

Comments 42pages,22pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03803 2026-08-05 cs.CL cs.LG 新提交 91%

M-GATE: Multilingual Grammar, Accuracy in Translation, and Efficiency Benchmark for Large Language Models

M-GATE:面向大语言模型的多语言语法、翻译准确性与效率基准

Tomáš Burkert, Angelika Peljak-Łapińska, David Zelený

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 本研究推出多语言基准M-GATE,评估50余种模型的80余种配置,发现翻译与语法能力分离,低资源语言惩罚随模型迭代缩小,推理对翻译提升显著。

Comments 45 pages (97 incl. appendices), 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03416 2026-08-05 cs.AI cs.LG 新提交 91%

AI World Cup 2026: Benchmarking Large Language Models for End-to-End Football Tournament Prediction

2026 AI世界杯:用于端到端足球锦标赛预测的大语言模型基准测试

Jonaid Shianifar, Iias Faiud

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文通过AI世界杯基准测试,对10款大语言模型进行2026年FIFA世界杯端到端预测,发现淘汰赛表现决定排名,GPT-5.5 Thinking夺冠,相关成果已公开以支持后续研究。

Comments 18 pages, 8 figures, 7 tables. Project repository available in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02703 2026-08-05 cs.CL cs.LG 新提交 91%

ARCHead: Activation-Metric Residual Correction for Large Language Model Output Heads

ARCHead:大语言模型输出头的激活度量残差修正

Şuayp Talha Kocabay, Talha Rüzgar Akkuş, Kamer Ali Yuksel

机构 * aiXplain, Inc.(aiXplain公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 ARCHead是一种LM-head压缩器,通过量化低秩核心、分组INT4残差及激活衍生低秩修正,将LM-head存储降3.7-3.9倍,在Qwen3-8B-Base上性能优于朴素INT4,可补充块量化器。

Comments 13 pages, 4 figures. Submitted to ACL Rolling Review (ARR). Code: https://github.com/suayptalha/archead

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27654 2026-07-31 cs.CL cs.AI 新提交 91%

From Single- to Cross-Document: Benchmarking Multi-Granularity Event Analysis of Large Language Models

从单文档到跨文档:大语言模型多粒度事件分析的基准测试

Tao Wen, Shuai Shao, Pei Ke, Xu Han, Jie Zou, Guannan Li, Tao Tian, Jinjie Qiu, Lan Wang, Ke Qin

机构 * University of Electronic Science and Technology of China(电子科技大学) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文推出MiGUE-Bench基准及MiGUE-Pipeline框架,通过四项核心任务评估LLMs多粒度事件分析能力,明确其能力边界与缺陷,为该领域改进提供方向。

Comments 9 pages. Published in the Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), pp. 3464-3472, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23344 2026-07-28 cs.CL cs.LG 新提交 91%

BERT-based Models vs. Large Language Models for Low-Resource Named Entity Recognition: A Comparative Study on Marathi

基于BERT的模型与大语言模型在低资源命名实体识别中的比较研究:以马拉地语为例

Hariom Ingle, Ronit Ghode, Ishwari Gondkar, Jidnyasa Harad, Raviraj Joshi

机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯分校) L3Cube Labs(L3Cube实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 研究比较基于BERT的模型与大语言模型在马拉地语低资源命名实体识别中的表现,通过在MahaNER数据集上微调MahaBERT-v2并与基线及通用模型对比,发现特定任务模型效果更佳,凸显专用架构对低资源语言处理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22218 2026-07-27 cs.CL cs.AI 新提交 91%

Why Large Language Models and Humans Converge and Diverge in Evaluating Creativity

为什么大语言模型与人类在评估创造力时会趋同和背离

Pengzhao Lyu, Yeun Joon Kim, Hanlin Xiao, Yingyue Luna Luan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究探讨大语言模型与人类评估创造力时趋同和背离的原因,通过三项研究和六个模型,识别其评估标准及影响,发现一致性取决于判断证据和模型标准,强调内在品质时趋同,需上下文信息时背离,选评估模型很关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20286 2026-07-23 cs.CL cs.AI 新提交 91%

Sound Probabilistic Safety Bounds for Large Language Models

大语言模型的可靠概率安全边界

Mahdi Nazeri, Anne-Kathrin Schmuck, Sadegh Soudjani, Alessandro Abate

机构 * University of Oxford(牛津大学) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) University of Birmingham(伯明翰大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究提出框架计算大语言模型生成有害输出概率的严格边界,利用克洛普 - 皮尔逊置信区间,通过潜在空间特征优先探索有害分支,能高效计算可靠下界,实验验证方法有效性,为模型评估和认证提供新途径。

Comments The Initial version of this manuscript has been available on OpenReview, see https://openreview.net/forum?id=papImkPLf5

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25984 2026-07-10 cs.AI cs.LG 新提交 91%

InvestPhilBench: A Multi-Layer Benchmark for Evaluating Large Language Model Procedural Reasoning in Expert Investment Philosophy

InvestPhilBench: 评估大型语言模型在专家投资哲学中程序性推理的多层动态基准

Mingguang Chen, Bo Qu

机构 * University of California, Riverside (UCR)(加州大学河滨分校) Illinois Institute of Technology (IIT)(伊利诺伊理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.AI、cs.LG

AI总结 提出InvestPhilBench基准,通过八层认知层级和自动化评分管道,揭示前沿LLM在投资决策程序推理中的复合评分饱和但程序性缺陷隐藏的问题。

Comments 65 pages, 6 figures, 26 tables. Benchmark, data, and code released. v0.6 release; preliminary empirical study (de-confounded multi-model leaderboard forthcoming)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06963 2026-07-09 cs.CR cs.AI cs.CL 新提交 91%

Large Language Models (LLMs) and Generative AI in Cybersecurity and Privacy: A Survey of Dual-Use Risks, AI-Generated Malware, Explainability, and Defensive Strategies

大型语言模型(LLMs)和生成式人工智能在网络安全与隐私中的应用:两用风险、人工智能生成的恶意软件、可解释性及防御策略综述

Kiarash Ahi, Saeed Valizadeh

机构 * Virelya Intelligence Research Labs(Virelya智能研究实验室) Google(谷歌)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 综述大型语言模型和生成式人工智能在网络安全中的应用,涵盖两用风险等多方面。通过回顾众多资料及实际案例研究,给出负责任部署建议与安全路线图,为应对人工智能驱动的网络安全挑战提供关键参考。

Comments Invited survey paper. 10 pages, 5 figures, 2 tables

Journal ref IEEE 6th Silicon Valley Cybersecurity Conference (SVCC), San Francisco, CA, USA, 2025, pp. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06482 2026-07-08 cs.CL cs.AI 新提交 91%

Data Analysis in the Wild: Benchmarking Large Language Models Against Real-World Data Complexities

野外数据分析:针对现实世界数据复杂性对大语言模型进行基准测试

So Hasegawa, Shailaja Keyur Sampat, Lei Liu, Wei-Peng Chen

机构 * Fujitsu Research of America(富士通美国研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对大语言模型在数据分析基准测试无法反映现实情况的问题,引入DataGovBench基准测试,含表格问答和表格洞察两个任务,通过实验发现现有模型有性能差距,为推进相关研究提供挑战基准。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03377 2026-07-07 cs.CL cs.AI 新提交 91%

Spectral Signatures of Large Language Models

大语言模型的频谱特征

Zhuoying Zhang, Ishan V. Prasad, Yuanzhe Hu, Zihang Liu, Hengrui Luo, Pu Ren, Yaoqing Yang

机构 * Rice University(莱斯大学) Dartmouth College(达特茅斯学院) Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 针对大规模管理和量化大语言模型的挑战,采用基于重尾自正则化理论的频谱形状指标,以权重经验谱密度形状信息为模型频谱特征,可用于模型谱系追踪等,还构建语料库进行基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31250 2026-07-01 cs.CL cs.AI 新提交 91%

Probing Stylistic Appropriation using Large Language Models: An Evaluation Framework for Copyright Infringement under EU Law

使用大语言模型探测风格挪用:欧盟法律下版权侵权的评估框架

Noah Scharrenberg, Chang Sun

机构 * Maastricht University(马斯特里赫特大学) Contractuo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出PSALM框架,通过十个评估器将欧盟版权法标准操作化,发现指令调优模型在接触语料前已有非平凡风格相似性,微调导致系统性风格挪用,负偏好优化可降低但残留可检测风格模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26101 2026-06-26 cs.CL cs.AI 新提交 91%

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models

Know2Guess: 一种面向大型语言模型知识边界评估的污染感知多区域基准

Renwei Meng, Bowen Zhang, Jian Wang, Xican Wang, Haoyi Wu, Xuanyan Qiu, Shengan Yang

机构 * Anhui University(安徽大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出一种污染感知多区域基准,通过冻结构建时标签测量从可回答知识到应弃权未知的转变,评估模型在回答与弃权间的可靠性。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24381 2026-06-24 cs.CL cs.AI 新提交 91%

On the Stability of Prompt Ranking in Large Language Model Evaluation

论大语言模型评估中提示排序的稳定性

Shaoshuai Du, Penghao Liang, Yixian Shen, Chuanqi Shi, Hang Zhang, Lun Wang

机构 * University of Amsterdam(阿姆斯特丹大学) Northeastern University(东北大学) University of California San Diego(加州大学圣迭戈分校) Duke University(杜克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究提示排序在常见评估变化下的稳定性,发现顶级提示常变导致选择不可靠,提出基于置信下限的稳定性感知选择策略以提高鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20572 2026-06-23 cs.CL cs.AI 新提交 91%

Investigating Linguistic Steering: An Analysis of Adjectival Effects Across Large Language Model Architectures

探究语言引导:跨大语言模型架构的形容词效应分析

Lars Malmqvist

机构 * Research and Implementation(研究与实现)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);prompting(abstract)

AI总结 本研究利用Shapley值量化形容词对模型性能的引导效应,发现少量形容词具有不成比例的强大影响,但效果非普适;跨模型分析揭示“家族效应”,且形容词的引导方向高度依赖于句法角色和位置。

Comments Accepted for TMLR, https://openreview.net/forum?id=xN7NYpQeBm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16137 2026-06-16 cs.CL cs.AI 新提交 91%

XAI-Grounded Explanation Generation for Speech Deepfake Detection with Training-Free Multimodal Large Language Models

基于XAI的语音深度伪造检测解释生成:使用免训练多模态大语言模型

Yupei Li, Qiyang Sun, Xiaoliang Wu, Chenxi Wang, Berrak Sisman, Björn W. Schuller

机构 * Imperial College London(帝国理工学院) Technical University of Munich(慕尼黑工业大学) University of Southampton(南安普顿大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对语音深度伪造检测缺乏可解释性的问题,提出一种免训练框架,融合XAI证据与多模态大语言模型,生成基于证据的特定解释,在PartialSpoof数据集上内部准确率提升超45%。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12191 2026-06-11 cs.CL cs.AI 新提交 91%

Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application

面向大语言模型的智能体环境工程:环境建模、合成、评估与应用综述

Jiachun Li, Zhuoran Jin, Tianyi Men, Yupu Hao, Kejian Zhu, Lingshuai Wang, Dongqi Huang, Longxiang Wang, Shengjia Hua, Lu Wang, Jinshan Gao, Hongbang Yuan, Ruilin Xu, Kang Liu, Jun Zhao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文从环境工程生命周期出发,系统综述了智能体环境的建模、合成、评估与应用,涵盖八种属性与领域、两种合成范式、四种智能体演化路径及三种环境演化范式。

Comments 63 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11454 2026-08-13 cs.SE 新提交 90%

Simplifying Requirements Engineering in the Context of the LGPD: An LLM-Based Investigation

在LGPD背景下简化需求工程:一项基于大语言模型(LLM)的研究

Cinara Gomes de Melo Carneiro, Renato de Freitas Bulcão Neto

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究针对隐私法规合规转化为软件需求的挑战,探究LLM在LGPD框架下简化需求工程的可行性,提出利用法规自动生成用户故事和验收测试场景的方法,验证其能从软件初期确保合规。

Comments The document consists of 12 pages and includes 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07920 2026-08-11 cs.CV 新提交 90%

Forged Peer Judgments Mislead Multimodal LLM Judge Panels: Source-Blind Anchoring and Panel-Consensus Verification

伪造的同行判断会误导多模态大语言模型(LLM)评判小组:无来源锚定与小组共识验证

Yang Shu

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract)

AI总结 研究发现多模态LLM评判小组存在无来源锚定的文本攻击面,伪造同行判断可误导判决,提出的小组共识验证方法能有效阻断此类攻击并降低损害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07881 2026-08-11 cs.AI cs.CL cs.IT cs.LG math.IT 新提交 90%

GRACE: LLM-Grounded Semantic Metric Spaces for Scalable Mixed-Data Clustering

GRACE:用于可扩展混合数据聚类的大语言模型(LLM)基础语义度量空间

Zihua Yang, Zhencheng Xie, Junyang Chen, Liang Xie, Yiqun Zhang, Mengke Li, Yang Lu

机构 * Guangdong University of Technology(广东工业大学) Tsinghua University(清华大学) Peking University(北京大学) Shenzhen University(深圳大学) Xiamen University(厦门大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对混合数据聚类中语义丰富度与可扩展性的矛盾,提出GRACE框架,通过多视角LLM查询实现一次性语义嵌入,兼顾可扩展性与聚类性能,优于11种对比方法。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏