arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2611 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2611 篇

2606.16511 2026-07-02 cs.LG 新提交 92%

Tail-Shape Estimation in LLM Evaluation Is Fragile: A Protocol for Diagnosing False Positives

LLM评估中的尾部形状估计是脆弱的:诊断假阳性的协议

Luca Zhou

机构 * Sapienza University of Rome(罗马大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一个协议,用于检验LLM评估中尾部形状估计的假阳性,通过极值理论指标区分尾部重量和尾部质量,并在毒性评估中识别出三种假阳性模式。

Comments 9 pages of main paper, 4 figures and 4 tables in the main paper, more in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31608 2026-07-01 cs.CL 新提交 92%

CLExEval: A Human-in-the-Loop Framework for Qualitative Evaluation of LLM Clinical Reasoning

CLExEval: 一种用于定性评估LLM临床推理的人机协同框架

Ajmal M., Abin Roy, Afthab Salam Kanniyan, Jawadh Abdul Kabeer, Jerin James, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) IIT Madras(印度理工学院马德拉斯分校) Calicut Medical College(卡利卡特医学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出CLExEval框架,通过渐进信息遮蔽和专家注释,揭示LLM临床推理中的冗长偏差、隐藏知识悖论和推理-输出不匹配问题,并验证了LLM作为评判者的局限性。

Comments 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26627 2026-06-26 cs.CR cs.AI 新提交 92%

Agents That Know Too Much: A Data-Centric Survey of Privacy in LLM Agents

知道太多的智能体:LLM智能体中隐私的数据中心调查

Nada Lahjouji, Ashwin Gerard Colaco

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 从数据中心视角调查LLM智能体隐私风险,分类数据源、隐私风险及治理机制,发现信息流控制可覆盖组合和跨会话推理泄露,但缺乏统一隐私策略的基准。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25973 2026-06-25 cs.SE cs.AI 新提交 92%

Helpful or Harmful? Evaluating LLM-Assisted Vulnerability Patching via a Human Study

有益还是有害?通过人类研究评估LLM辅助的漏洞修补

Giulian Biolo, Michael Tezza, Yuanjun Gong, Fabio Massacci

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过人类实验研究LLM辅助漏洞修补的效果,发现其可能加速修补但增加生成不安全代码的风险。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24145 2026-06-24 cs.AI 新提交 92%

T2D-Bench: Evidence-Gated Evaluation of LLM Outputs for Type 2 Diabetes Using a Multi-Layer Clinical-Lifestyle Knowledge Graph

T2D-Bench:基于多层临床-生活方式知识图谱的2型糖尿病LLM输出证据门控评估

Saba A. Farahani, Hung Cao, Ramesh Jain, Amir M. Rahmani

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出T2D-Bench基准,通过多层知识图谱和证据门控机制,检测LLM输出中未满足指南约束的临床遗漏,并在2型糖尿病诊断、用药安全等场景中实现可测量纠正。

Comments 7 pages, 2 figures, 2 tables. Accepted as a poster at AMIA 2026 Annual Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16821 2026-06-24 cs.CL cs.CR cs.CY cs.IR 新提交 92%

How Much Can We Trust LLM Search Agents? Measuring Endorsement Vulnerability to Web Content Manipulation

我们能在多大程度上信任LLM搜索智能体?衡量对网络内容操纵的认可脆弱性

Yimeng Chen, Zhe Ren, Firas Laakom, Yu Li, Dandan Guo, Jürgen Schmidhuber

机构 * Center of Excellence for Generative AI, KAUST(KAUST生成式人工智能卓越中心) Jilin University(吉林大学) Zhejiang University(浙江大学) The Swiss AI Lab, IDSIA-USI/SUPSI(瑞士人工智能实验室 IDSIA-USI/SUPSI) NNAISENSE

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SearchGEO框架,通过五类攻击模式和输出级指标评估13种LLM后端对网络内容操纵的认可脆弱性,发现攻击成功率从0%到31.4%不等,且不同后端对攻击模式的敏感性和部署框架的影响存在显著差异。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22349 2026-06-23 cs.CL cs.HC 新提交 92%

Curiosity as Linguistic Intervention: Using LLM Tutoring Dialogues to Influence Exploratory Learning Behavior

好奇心作为语言干预:利用LLM辅导对话影响探索性学习行为

Gevindu Ganganath, Pasindu Bolonghege, Qianru Lyu, Pradeep Varakantham, Thivya Kandappu

机构 * School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院) Human-Computer Interaction Institute, Carnegie Mellon University(卡内基梅隆大学人机交互研究所)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出CURIOBOT框架,通过LLM对话中的语言干预(新奇性、复杂性、冲突、不确定性)激发探索性学习行为,实验显示对话轮次增加2.4倍。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21856 2026-06-23 cs.CR cs.AI 新提交 92%

Harness-MU: A Safe, Governed, and Effective Harness for Multi-User LLM Agents

Harness-MU:面向多用户LLM代理的安全、可控且有效的框架

Wangxuan Fan, Xiaoyu Nie, Zhongxiang Dai

机构 * OpenAI Codex team(OpenAI Codex团队)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多用户LLM代理的权限冲突与数据泄露问题,提出模型无关、零微调的基础设施框架Harness-MU,通过执行钩子强制执行确定性治理约束,在Muses-Bench基准上实现隐私保护并提升指令遵循准确率高达48.9个百分点。

Comments 15 pages, 4 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19474 2026-06-19 cs.CR cs.AI cs.SE 新提交 92%

Secure Coding Drift in LLM-Assisted Post-Quantum Cryptography Development: A Gamified Fix

LLM辅助后量子密码开发中的安全编码漂移:一种游戏化修复方案

R. D. N. Shakya, C. P. Wijesiriwardana, S. M. Vidanagamachchi, Nalin A. G. Arachchilage

机构 * University of Moratuwa(摩图瓦大学) University of Ruhuna(鲁胡纳大学) RMIT University(皇家墨尔本理工大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出LLM辅助PQC开发中的安全编码漂移模型,通过游戏化框架将LLM转变为主动安全协作者,以缓解长期依赖LLM导致的安全退化。

Comments Accepted for 2026 SIGIR Workshop on Vulnerabilities in Generative Systems for Information Retrieval track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18649 2026-06-19 cs.MA cs.CL cs.CY 新提交 92%

Gender Bias in LLM Hiring Decisions: Evidence from a Japanese Context and Evaluation of Mitigation Strategies

LLM招聘决策中的性别偏见:来自日本语境的证据及缓解策略评估

Serena A. Hoffstedde, Machiko Hirota, Akshara Nadayanur Sathis Kanna, Rihito Kotani, Ujwal Kumar, Gabriele Trovato, Phan Xuan Tan

机构 * Shibaura Institute of Technology, Tokyo, Japan(Shibaura技术学院,东京,日本) Amsterdam University of Applied Sciences, Amsterdam, Netherlands(阿姆斯特丹应用科学大学,阿姆斯特丹,荷兰) University of Pennsylvania, Philadelphia, USA(宾夕法尼亚大学,费城,美国) Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学,匹兹堡,美国) Keio University, Tokyo, Japan(庆应大学,东京,日本)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过60份日本履历书格式的简历和5个先进LLM,发现所有模型均存在显著的亲女性偏见,且简单的提示指令无法缓解,而移除姓名几乎完全消除该偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18797 2026-06-18 cs.CL 新提交 92%

Beyond Scalar Scores: Exploring LLM-based Metrics for Clinical Significance Evaluation in Radiology Reports

超越标量分数:探索基于LLM的放射学报告临床意义评估指标

Qingyu Lu, Ruochen Li, Liang Ding, Yufei Xia, Youxiang Zhu, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) Technical University of Munich(慕尼黑工业大学) Alibaba(阿里巴巴) University of Glasgow(格拉斯哥大学) University of Massachusetts Boston(马萨诸塞大学波士顿分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对放射学报告评估中临床准确性要求,研究基于LLM的指标区分临床错误与无害变体的能力,发现判别偏差,并通过合成数据训练轻量级指标,在成本敏感部署中优于大型模型。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17634 2026-06-17 cs.CL 新提交 92%

Prompt Perturbation for Reliable LLM Evaluation over Comparison Graphs

用于可靠LLM评估的提示扰动方法:基于比较图

Dong Huang, Jianbo Sun, Pengkun Yang

机构 * Department of Statistics and Data Science, Tsinghua University(清华大学统计与数据科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对LLM成对评估中的传递性矛盾问题,提出提示扰动框架,通过生成扰动变体并过滤结构不一致的比较模式,提高排名一致性。

Comments 42 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17507 2026-06-17 cs.AI cs.SE 新提交 92%

LLM-as-Judge in Education: A Curriculum-Grounded Marking Pipeline

教育中的LLM作为评判者:基于课程标准的评分流水线

Xiwei Xu, Chen Wang, Jacky Jiang, Phil Yang, Qian Fu, Mohan Dhall, Wenjie Zhang, Liming Zhu

机构 * NSW Department of Education(新南威尔士州教育部) South Australian Department for Education(南澳大利亚州教育部) OC Selective exam preparation platform(OC精英考试备考平台) Studitory: HSC preparation platform(Studitory: HSC备考平台)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种基于课程标准的可配置LLM评判流水线,用于高利害考试评分,通过整合授权课程工件和评分指南,提高评分一致性、透明度和与官方实践的契合度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16806 2026-06-16 cs.CL 新提交 92%

LLM-based Visual Code Completion for Aerospace Geometric Design

基于LLM的航空航天几何设计视觉代码补全

Hau Kit Yong, Robert Marsh, Edmar A. Silva, András Sóbester, Stuart E. Middleton

机构 * Faculty of Engineering and Physical Sciences, University of Southampton(南安普顿大学工程与物理科学学院) School of Electronics and Computer Science, University of Southampton(南安普顿大学电子与计算机科学学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出基于LLM的视觉编程副驾驶系统,结合ReAct方法和GPT 5.4,用于航空航天几何设计,并构建Wingbuilder插件库和AVPD数据集,用户试验表明系统能生成有用建议但推理速度慢。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16723 2026-06-16 cs.AI 新提交 92%

AgentFairBench: Do LLM Agents Discriminate When They Act?

AgentFairBench: LLM智能体在行动时是否存在歧视?

Triveni Morla, Rohith Reddy Bellibaltu, Manpreet Singh, Manmeet Singh Kapoor

机构 * Florida International University(佛罗里达国际大学) Boston University(波士顿大学) Department of Computer Science and Engineering, Indian Institute of Technology Patna(印度帕纳吉印度理工学院计算机科学与工程系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AgentFairBench基准,通过反事实匹配集和偏差传导框架,评估LLM智能体在招聘、贷款和医疗分诊中的行动公平性,发现统计量级不匹配会夸大歧视,而匹配后Claude Haiku无显著人口统计效应。

Comments Submitted to IEEE Access

Journal ref Under Review (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13221 2026-06-15 cs.LG 新提交 92%

From Uncertain Judgments to Calibrated Rankings: Conformal Elo Estimation for LLM Evaluation

从不确定判断到校准排名:用于LLM评估的共形Elo估计

Bora Kargi, David Salinas

机构 * ELLIS Institute Tübingen(ELLIS 蒂宾根研究所) OpenEuroLLM

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出一种两层次校准方法,通过局部不确定性传播和全局共形预测,将LLM-as-a-judge的Elo评分误差降至17.9 MAE,并提供无分布假设的置信区间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11416 2026-06-11 cs.CR cs.AI 新提交 92%

MPC-Patch-Bench: Security-Aware LLM Code Patch for Multi-Party Computation

MPC-Patch-Bench:面向多方计算的安全感知LLM代码补丁

Yukuan Zhang, Mengxin Zheng, Qian Lou

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多方计算(MPC)软件缺乏仓库级代码修复基准的问题,提出MPC-Patch-Bench,包含数据筛选框架和MPC验证器,评估LLM在MPC仓库级修复中的安全性和数值保真度。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10749 2026-06-10 cs.CR cs.AI 新提交 92%

Toward Secure LLM Agents: Threat Surfaces, Attacks, Defenses, and Evaluation

迈向安全的LLM智能体:威胁面、攻击、防御与评估

Yuchen Ling, Shengcheng Yu, Zhenyu Chen, Chunrong Fang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过生命周期、系统导向的框架,综合247篇论文,围绕信息流、委托权限和持久状态,系统梳理了LLM智能体的威胁面、攻击、防御与评估,指出提示注入和工具控制流劫持仍是主要威胁,持久状态损坏和多智能体传播成为新兴关注点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09234 2026-06-09 cs.SD cs.AI 新提交 92%

End-to-End Training for Discrete Token LLM based TTS System

基于离散令牌LLM的文本转语音系统的端到端训练

Changfeng Gao, Yong Ren, Jun Yuan, Ye Bai, Zhao You, ShiDong Shang

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出统一训练语音分词器、LLM、流匹配模型和奖励模型的端到端框架,通过多任务联合优化提升离散令牌TTS性能,在Seed-TTS-Eval上达到新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08285 2026-06-09 cs.AI cs.CE q-fin.CP q-fin.TR 新提交 92%

Beyond Agent Architecture: Execution Assumptions and Reproducibility in LLM-Based Trading Systems

超越智能体架构:基于LLM的交易系统中的执行假设与可复现性

Junyi Yao, Zihao Zheng

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过审计30项相关研究,发现LLM交易研究中执行假设报告不足,导致结果难以比较,提出需建立执行现实性、可复现性和评估可比性的报告标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08172 2026-06-09 cs.HC cs.AI cs.CY 新提交 92%

The Governance of Human-LLM Interaction: Safety Gating, Civility Steering, and Affective Default Lock-In

人类与LLM交互的治理:安全门控、文明引导与情感默认锁定

Manuele Reani, Hongjian Zhang, Hongyu Tian

机构 * School of Management and Economics, The Chinese University of Hong Kong, Shenzhen, China(管理学院与经济学学院,香港中文大学(深圳))

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过确定性多智能体评估流水线,测量LLM在长程对话中的提示可引导性和风格漂移,提出区分安全门控、文明引导和情感默认锁定的治理框架,揭示提供商对交互形式的控制对多元性、自主性和民主能动性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08146 2026-06-09 cs.AI 新提交 92%

SAGE: An LLM-driven Self Reflective Agentic Framework for Fraud Detection

SAGE: 一种LLM驱动的自我反思智能体框架用于欺诈检测

Yichen Chen, Siying Li, Yuhang Liang, Lijun Wang, Renyang Liu

机构 * National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) China Mobile Communications Group(中国移动通信集团有限公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SAGE,首个端到端LLM驱动的多智能体欺诈检测框架,通过数据诊断树和自然语言梯度优化,在五个数据集上平均F1提升40.86%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07707 2026-06-09 cs.LG 新提交 92%

Decoding Naturalistic Emotion Dynamics from the Brain: An LLM-Enhanced Regression Framework

从大脑解码自然情感动态:一种LLM增强的回归框架

Lemei Zhang, Peng Liu, Hans Dahle Kvadsheim, August Sætre Aasvær, Shuer Ye, Reza Bonyadi, Maryam Ziaei, Jon Atle Gulla

机构 * NTNU(挪威科技大学) Kavli Institute for Systems Neuroscience, NTNU(挪威科技大学卡弗里系统神经科学研究所) Microsoft(微软)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出多目标回归框架,利用LLM从自然叙事中提取连续情感特征,结合动态功能连接和机器学习算法,实现从fMRI数据中解码连续情感轨迹,并揭示可解释的情感特异性脑网络拓扑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12324 2026-08-14 cs.CY cs.AI cs.CL 新提交 91%

When AI Is Your Pastor: A Benchmark for Theological Triage and Pastoral Guidance in Large Language Models

当AI成为你的牧师:大型语言模型的神学分诊与牧灵指导基准测试

Alex Chao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究推出FMG-Bench基准测试,评估LLM在基督教神学分诊与牧灵指导场景的表现,发现结构化框架可提升模型表现与鲁棒性,且该基准仅为测量工具。

Comments Full paper. Code and dataset are available at https://github.com/FideAI/fmg-bench and https://huggingface.co/datasets/FideAI/fmg-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01829 2026-07-03 cs.AI cs.CL 新提交 91%

Pre-Flight: A Benchmark for Evaluating Large Language Models on Aviation Operational Knowledge

Pre-Flight: 评估大型语言模型航空运营知识的基准

Alex Brooker, Tim Hughes

机构 * Airside Labs, London, United Kingdom(Airside Labs,伦敦,英国) Mahino Research, Christchurch, New Zealand(Mahino Research,基督城,新西兰)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出Pre-Flight基准,包含300道多选题,评估LLM在航空运营知识上的表现,发现最强模型准确率82.7%,低于专家水平的95%,表明领域特定评估的必要性。

Comments 9 pages, 1 figure, 2 tables. Benchmark available in inspect_evals (UKGovernmentBEIS/inspect_evals)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31718 2026-07-01 cs.CL cs.AI 新提交 91%

Cross-lingual Relation Extraction with Large Language Models: Zero-Shot, Few-Shot, and Fine-Tuned Evaluation on Romanian

跨语言关系抽取与大语言模型:罗马尼亚语的零样本、少样本和微调评估

Dragos-Mitrut Vasile, Elena-Simona Apostol, Stefan-Adrian Toma, Adrian Paschke, Ciprian-Octavian Truica

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 通过自动翻译数据集结合大语言模型推理,研究罗马尼亚语的跨语言关系抽取,评估Gemma 4 31B在零样本、少样本和QLoRA微调下的性能,并与四种编码器基线对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21820 2026-06-23 cs.SI cs.AI cs.CL 新提交 91%

Generating Public Health Responses using Survey-Augmented Large Language Models

使用调查增强的大语言模型生成公共卫生响应

Leonardo Marciaga, Thuyen Pham, Julia Rezvani, Alina Hyk, Chunyang Liao, Konstantinos Mitsopoulos, Raffaele Vardavas

机构 * Hawk.illinoistech.edu(伊利诺伊理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 研究利用大语言模型生成合成调查数据,以模拟真实人群在流行病中的健康决策行为,发现合成数据能复现人口统计和信念分布,但难以捕捉因素间的协变关系,不能替代真实调查。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11965 2026-08-13 cs.SE 新提交 91%

Developing LLM-based Multi-Agent Systems in Software Engineering: A Mixed-Method Experience Report

在软件工程中开发基于大语言模型(LLM)的多智能体系统:一项混合方法经验报告

Mariama Celi Serafim De Oliveira, Motunrayo Osatohanmen Ibiyo, Marco Gianrusso, Claudio Di Sipio, Davide Di Ruscio, Phuong T. Nguyen

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文通过定量和定性分析,梳理软件工程中基于LLM的MAS现有框架,发现其基本组件覆盖良好但缺高级功能,摘要任务ROUGE分数无显著差异,为相关人员选框架提供指导。

Comments The paper has been peer reviewed and accepted for publication with the Empirical Software Engineering journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04907 2026-08-06 cs.CR cs.AR 新提交 91%

LLM-Assisted Detection and Repair of Hardware Security Vulnerabilities in Verilog Designs

基于Verilog设计的大语言模型辅助硬件安全漏洞检测与修复

Ethen Santana, Gabriel Gyaase, Hao Zheng

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本文提出利用LLM从Verilog硬件设计中识别潜在CWE漏洞的方法,经单模块Verilog数据集迭代评估,证实LLM可增强硬件安全分析,为设计阶段漏洞识别提供自动化可扩展辅助。

Comments 6 Pages, 3 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01649 2026-08-04 cs.NI 新提交 91%

LLM-Driven Automated Reward Design for Reinforcement Learning-Based Routing in LEO Satellite Networks

面向低轨(LEO)卫星网络中基于强化学习(RL)的路由的大语言模型(LLM)驱动的自动奖励设计

Walter P. Casas, Nelson L. S. da Fonseca, and Carlos A. Astudillo

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出LARGE框架结合LLM生成与迭代在环仿真,为LEO卫星网络RL路由自动设计奖励,其性能可与专家基线相当,凸显该优化方法的潜力。

Comments This paper was accepted for publication at the IEEE Global Communications Conference (GLOBECOM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏