arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-11 至 2026-05-11 共收录 415 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 102 篇

2605.06963 2026-05-11 cs.HC cs.AI cs.CL cs.IR 82%

From Surface Learning to Deep Understanding: A Grounded AI Tutoring System for Moodle

从表层学习到深度理解:面向Moodle的 grounded AI 教学系统

Anna Ostrowska, Michał Kukla, Gabriela Majstrak, Jan Opala, Sebastian Pergała, Jan Skwarek, Anna Wróblewska

机构 * Faculty of Mathematics and Information Sciences, Warsaw University of Technology(数学与信息科学学院,华沙技术大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于Moodle的AI教学助手,利用检索增强生成技术提供高质量教育,通过双核心设计实现学生互动式辅导和教师监督内容生成,有效减少信息误导并促进深度理解。

Comments 5 pages, accepted as demo paper at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06903 2026-05-11 cs.CL cs.AI 82%

MELD: Multi-Task Equilibrated Learning Detector for AI-Generated Text

MELD:多任务平衡学习检测器用于AI生成文本

Chenjun Li, Cheng Wan, Johannes C. Paetzold

机构 * Cornell University(康奈尔大学) Weill Cornell Medicine(韦尔医学院) Cornell Tech(康奈尔科技)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MELD通过多任务学习提升AI生成文本检测的鲁棒性与泛化能力,结合生成器、攻击类型和源域头,平衡损失函数以提高检测精度和低误报率。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11777 2026-05-11 cs.CL cs.LG 82%

User eXperience Perception Insights Dataset (UXPID): Synthetic User Feedback from Public Industrial Forums

用户体验感知洞察数据集(UXPID):来自公共工业论坛的合成用户反馈

Mikhail Kulyabin, Jan Joosten, Choro Ulan uulu, Nuno Miguel Martins Pacheco, Fabian Ries, Filippos Petridis, Jan Bosch, Helena Holmström Olsson

机构 * Siemens AG(西门子股份公司) Eindhoven University of Technology(埃因霍温理工大学) Chalmers University of Technology(楚克大学) Malmö University(马尔默大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出UXPID数据集,包含7130条合成匿名用户反馈,用于研究用户需求、用户体验分析及AI驱动反馈处理,尤其在隐私和许可限制下访问真实数据时具有价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07478 2026-05-11 cs.CV 82%

AudioFace: Language-Assisted Speech-Driven Facial Animation with Multimodal Language Models

AudioFace: 基于语言的语音驱动面部动画与多模态语言模型

Kai Zheng, Zejian Kang, Rui Mao, Hongyuan Zou, Yuanchen Fei, Xuanyang Xu, Xiangru Huang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) Tiangong University(天工大学) Hunan University(湖南大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

AI总结 本文提出AudioFace框架,通过语言和发音信息指导语音驱动的面部动作生成,提升语音与面部运动的对应精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07419 2026-05-11 cs.GT 82%

Incentivizing User Data Contributions for LLM Improvement under Withdrawal Rights

在撤回权下激励用户数据贡献以改进大语言模型

Di Feng, Chenhao Zhang, Zhanzhan Zhao

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文研究在撤回权下如何激励用户数据贡献以改进大语言模型,分析了补贴和撤回权的联合设计对协调失败的克服作用,提出通过成本报告和个性化分配消除低效供给,并比较了两种撤回协议的效果。

Comments 31 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07986 2026-05-11 cs.HC cs.AI cs.CY 81%

Towards Apples to Apples for AI Evaluations: From Real-World Use Cases to Evaluation Scenarios

迈向公平的AI评估:从现实使用案例到评估场景

Yee-Yin Choong, Kristen Greene, Alice Qian, Meryem Marasli, Ziqi Yang, Sophia Chen, Laura Dabbish, Anand Rao, Hong Shen

机构 * National Institute of Standards and Technollogy(国家标准与技术研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出一种可重复的流程,通过结构化AI使用案例工作表将高层使用案例转化为详细场景,结合LLM提示和人工审查,生成107个场景,确保评估场景的现实性和人类需求。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07847 2026-05-11 cs.CL 81%

Measuring and Mitigating the Distributional Gap Between Real and Simulated User Behaviors

测量和缓解真实与模拟用户行为之间的分布差距

Shuhaib Mehri, Philippe Laban, Sumuk Shashidhar, Marwa Abdulhai, Sergey Levine, Michel Galley, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research(微软研究院) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出了一种方法,系统评估24个基于LLM的用户模拟器在编程和写作任务中的表现,揭示了真实用户行为与模拟行为之间的显著分布差异,并通过组合互补的模拟器来缩小这一差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07823 2026-05-11 cs.CL 81%

SCENE: Recognizing Social Norms and Sanctioning in Group Chats

SCENE:识别社交规范并实施制裁在群聊中

Mateusz Jacniacki, Maksymilian Bilski

机构 * HumaLike

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 SCENE旨在通过多角色聊天场景识别隐性社交规范并实施制裁,评估LLM在动态社交互动中的适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04565 2026-05-11 cs.MA cs.CL 81%

From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems

从独立大语言模型到整合智能:复合AI系统综述

Jiayi Chen, Junyi Ye, Guiling Wang

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文综述了复合AI系统,探讨了其整合大语言模型与外部组件的方法,分析了四种基础范式,并指出规模化、互操作性等挑战及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07251 2026-05-11 cs.AI 81%

Can Agents Price a Reaction? Evaluating LLMs on Chemical Cost Reasoning

智能体能否定价反应?评估大语言模型在化学成本推理上的能力

Yuyang Wu, Yue Huang, Shuaike Shen, Xujian Wang, Shuhao Zhang, Qiyao Xue, Weichen Liu, Runtian Gao, Jian Ma, Xiangliang Zhang, Olexandr Isayev

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Notre Dame(Notre Dame 大学) University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) University of Pittsburgh(匹兹堡大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ChemCost基准,评估大语言模型在化学成本推理任务中的能力,发现工具访问并非解决问题的充分条件,且在噪声环境下表现下降。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14958 2026-05-11 cs.CL cs.AI 81%

Script Sensitivity: Benchmarking Language Models on Unicode, Romanized and Mixed-Script Sinhala

脚本敏感性:在Unicode、罗马化和混合脚本僧加罗语上对语言模型的基准测试

Minuri Rajapakse, Ruvan Weerasinghe

机构 * School of Computing Informatics Institute of Technology(计算学院信息科技研究院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了语言模型在僧加罗语等低资源、形态丰富的语言上的表现,发现脚本敏感性显著,模型大小与脚本处理能力无关,Unicode性能预测混合脚本鲁棒性但不预测罗马化能力。

Comments Published at SCSE 2026 (9th IEEE International Research Conference on Smart Computing and Systems Engineering). Best Paper Award - Text Analytics Track

Journal ref 2026 9th IEEE International Research Conference on Smart Computing and Systems Engineering (SCSE), vol. 9, pp. 1-6

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07683 2026-05-11 cs.LG cs.AI 81%

Multimodal Cancer Modeling in the Age of Foundation Model Embeddings

多模态癌症建模:在基础模型嵌入时代

Steven Song, Morgan Borjigin-Wang, Irene Madejski, Robert L. Grossman

机构 * Center for Translational Data Science(转化数据科学中心) Department of Computer Science(计算机科学系) University of Chicago(芝加哥大学) Medical Scientist Training Program(医学科学家培训计划) Brown University(布朗大学) Section of Biomedical Data Science(生物医学数据科学部门) Department of Medicine(医学系)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了利用基础模型嵌入进行多模态癌症建模的可能性,展示了多模态融合的优势,并评估了病理报告文本和文本摘要对模型性能的影响。

Comments camera ready version for ML4H 2025, typo corrected

Journal ref Proceedings of the Fifth Machine Learning for Health Symposium, PMLR 297:202-227, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07806 2026-05-11 cs.CL cs.AI cs.LG 80%

Beyond Confidence: Rethinking Self-Assessments for Performance Prediction in LLMs

超越置信度:重新思考用于大语言模型性能预测的自我评估

Sree Bhattacharyya, Samarth Khanna, Leona Chen, Lucas Craig, Tharun Dilliraj, James Z. Wang

机构 * Department of Computer Science and Engineering, College of Engineering, The Pennsylvania State University(计算机科学与工程系,工程学院,宾夕法尼亚州立大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于认知评估理论的多维自我评估框架,通过六个评估维度和置信度预测模型失败,发现能力相关维度在多数场景中表现更优,且努力维度在推理任务中更具预测性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07646 2026-05-11 cs.CL cs.AI cs.LG 80%

MAVEN: Multi-Agent Verification-Elaboration Network with In-Step Epistemic Auditing

MAVEN:具有步骤内认知审计的多智能体验证-扩展网络

Yinsheng Yao, Jiehao Tang, Zhaozhen Yang, Dawei Cheng

机构 * Tongji University(同济大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 MAVEN通过显式角色解耦将LLM转化为有意识的推理者,采用对抗性Skeptic-Researcher-Judge循环,生成可验证的模块化推理轨迹,提升多任务推理质量。

Comments 24 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07515 2026-05-11 cs.CR 80%

An Automated Framework for Cybersecurity Policy Compliance Assessment Against Security Control Standards

面向安全控制标准的自动化网络安全政策合规性评估框架

Bikash Saha, Sandeep Kumar Shukla

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出PROPARAG框架,用于自主评估组织网络安全政策是否符合安全控制标准,通过检索政策证据、评估覆盖范围并生成推荐,实现自动化合规性检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04491 2026-05-11 cs.CY cs.CR 80%

An Evaluation of Chat Safety Moderations in Roblox

在Roblox中聊天安全审核的评估

Priya Kaushik, Sonja Brown, Rakibul Hasan, Sazzadur Rahaman

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文通过分析200万条聊天记录,评估Roblox聊天审核系统的效果,发现大量不安全内容如性侵、欺凌等逃过了审核,并揭示了用户如何通过多种手段规避审核。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19791 2026-05-11 cs.CR 80%

Text-Based Personas for Simulating User Privacy Decisions

基于文本的隐私人物模拟

Kassem Fawaz, Ren Yi, Octavian Suciu, Rishabh Khandelwal, Hamza Harkous, Nina Taft, Marco Gruteser

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Narriva方法,通过生成基于历史隐私决策的文本隐私人物,提升隐私研究的准确性与效率,实现87%的预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02934 2026-05-11 cs.SE 80%

AgenticSZZ: Temporal Knowledge Graph-Guided Agentic Bug-Inducing Commit Identification

AgenticSZZ: 基于时间知识图谱的代理式Bug引发提交识别

Yu Shi, Hao Li, Bram Adams, Ahmed E. Hassan

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本文提出AgenticSZZ,利用时间知识图谱改进Bug引发提交识别,通过构建包含时间与结构关系的知识图谱,并结合LLM代理进行图搜索,提升识别精度与效果。

Comments Add RQ3 with open-source LLMs evaluation, such as DeepSeek-V4-Pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07765 2026-05-11 cs.LG 79%

Pre-trained Tabular Foundation Models as Versatile Summary Networks for Neural Posterior Estimation

预训练表格基础模型作为神经后验估计的多功能总结网络

Elliot Pickens, Chiraag Gohel, Sidharth Satya

机构 * University of Pennsylvania(宾夕法尼亚大学) The George Washington University(乔治·华盛顿大学) Brown University(布朗大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出PFN-NPE,利用预训练的TabPFN作为固定总结网络,通过归一化流实现高效的后验估计,展示其在模拟基于贝叶斯推断中的有效性与多功能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01510 2026-05-11 cs.LG 79%

Flock: A Knowledge Graph Foundation Model via Learning on Random Walks

Flock:通过在随机游走上学习的知识图谱基础模型

Jinwoo Kim, Xingyue Huang, Krzysztof Olejniczak, Kyungbin Min, Michael Bronstein, Seunghoon Hong, İsmail İlkan Ceylan

机构 * KAIST(韩国科学技术院) University of Oxford(牛津大学) TU Wien(维也纳技术大学) AITHYRA

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 Flock通过在随机游走上学习,实现知识图谱的零样本链接预测,解决了传统方法在区分结构相似但语义不同的关系时的限制,展示了强大的泛化能力。

Comments 42 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07749 2026-05-11 cs.CV 78%

Benchmarking Foundation Models for Renal Lesion Stratification in CT

对CT中肾病变分层的医学基础模型进行基准测试

Hartmut Häntze, Sarah de Boer, Myrthe Buser, Alessa Hering, Bram van Ginneken, Mathias Prokop, Jawed Nawabi, Sebastian Ziegelmayer, Lisa Adams, Keno Bressem

机构 * Charité - Universitätsmedizin Berlin, Department of Radiology(柏林夏里特大学医学院放射科) Radboudumc, Diagnostic Image Analysis Group(拉德堡德大学医学中心影像分析组) Klinikum rechts der Isar, TUM University Hospital, Technical University of Munich(慕尼黑技术大学慕尼黑大学医院克林克姆右岸诊所) Charité - Universitätsmedizin Berlin, Institute of Neuroradiology(柏林夏里特大学医学院神经放射科) German Heart Center, TUM University Hospital, Technical University of Munich(德国心脏中心,慕尼黑技术大学慕尼黑大学医院)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文通过对比三种医学基础模型在CT肾病变分类任务中的表现,发现传统放射组学方法在性能上优于深度学习方法,表明当前通用基础模型在捕捉细粒度纹理和形状异质性方面仍有不足。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22944 2026-05-11 cs.CR cs.AI 77%

Is Your Prompt Poisoning Code? Defect Induction Rates and Security Mitigation Strategies

你的提示污染代码了吗?缺陷诱导率与安全缓解策略

Bin Wang, YiLu Zhong, MiDi Wan, WenJie Yu, YuanBing Ouyang, Yenan Huang, Hui Li

机构 * Organization(机构)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 研究探讨了低质量提示对生成代码安全性的负面影响,提出评估框架和基准数据集,并展示高级提示技术可缓解安全风险。

Comments Accepted for publication in Empirical Software Engineering (EMSE) Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07141 2026-05-11 cs.CV cs.AI 77%

Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding

Qwen3-VL-Seg: 解锁基于视觉-语言接地的开放世界指代分割

Yuan Yao, Qiushi Yang, Humen Zhong, Jiangning Wei, Yifang Men, Shuai Bai, Miaomiao Cui, Zhibo Yang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 Qwen3-VL-Seg通过视觉-语言接地框架实现开放世界指代分割,采用轻量级的框引导掩码解码器,结合多尺度空间特征注入和迭代掩码感知查询优化,实现参数高效且精确的像素级分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06865 2026-05-11 cs.LG 77%

Dataset Watermarking for Closed LLMs with Provable Detection

针对闭合大语言模型的可证明检测数据集水印

Pengrun Huang, Kamalika Chaudhuri, Yu-Xiang Wang

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种针对闭合大语言模型的可证明检测数据集水印方法,通过增强随机词对的共现频率来嵌入水印信号,并利用统计检验检测模型生成输出中的共现模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07926 2026-05-11 cs.CL 77%

Comprehensiveness Metrics for Automatic Evaluation of Factual Recall in Text Generation

全面性指标用于文本生成中事实回忆的自动评估

Adam Dejl, James Barry, Alessandra Pascale, Javier Carnerero Cano

机构 * Department of Computing, Imperial College London(伦敦帝国学院计算机系) IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出三种自动评估指标以评估大语言模型生成文本的全面性,发现端到端方法在效果上优于复杂指标,但牺牲了鲁棒性和可解释性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07678 2026-05-11 cs.SE 75%

Characterizing and Mitigating False-Positive Bug Reports in the Linux Kernel

对Linux内核中虚假正例缺陷报告的特征分析与缓解

Jiashuo Tian, Dong Wang, Chen Yang, Haichi Wang, Zan Wang, Junjie Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究Linux内核中虚假正例缺陷报告的问题,通过构建2006份报告数据集,发现虚假正例需与真实缺陷同等努力,主要出现在文件系统和驱动程序中,采用RAG策略可实现91%召回率和88%F1分数。

Comments Accepted in the Research Track in FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07093 2026-05-11 cs.CL cs.AI cs.LG 75%

The Translation Tax Is Not a Scalar: A Counterfactual Audit of English-Source Cue Inheritance in Chinese Multilingual Benchmarks

翻译税并非标量:对中国多语言基准测试中英语源提示继承的反事实审计

Zezheng Lin, Fengming Liu, Handi Li

机构 * OpenAI NeurIPS 2025 workshop(NeurIPS 2025 工作坊)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过反事实审计揭示翻译税并非单一标量,指出翻译基准测试中存在估计器和项目依赖的有效性风险,并提供相关证据和检查清单。

Comments 13 pages, 3 figures. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07158 2026-05-11 cs.IR cs.CL cs.LG 73%

Topic Is Not Agenda: A Citation-Community Audit of Text Embeddings

主题并非议程:文本嵌入的引用社区审计

Junseon Yoo

机构 * Pluto Labs(Pluto实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文通过构建358万篇科学论文的增强引用图,发现文本嵌入的余弦相似性与研究议程的相关性在子领域层面合理,但在更高层次的议程层面失效,揭示了科学RAG系统中的关键缺陷。

Comments 16 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07134 2026-05-11 cs.CL cs.AI 73%

Region4Web: Rethinking Observation Space Granularity for Web Agents

Region4Web: 重新思考网页代理的观察空间粒度

Donguk Kwon, Dongha Lee

机构 * Yonsei University(延世大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Region4Web提出通过功能区域划分重构AXTree,以更紧凑的信息基础提升网页代理任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06696 2026-05-11 cs.AI cs.LG cs.MA 73%

Hidden Coalitions in Multi-Agent AI: A Spectral Diagnostic from Internal Representations

多智能体AI中的隐藏联盟:来自内部表示的谱诊断

Cameron Berg, Susan L. Schneider, Mark M. Bailey

机构 * Reciprocal Research(递归研究) Center for the Future of AI, Mind, and Society(人工智能、心智与社会未来中心) Florida Atlantic University(佛罗里达 Atlantic 大学) Biological and Computational Intelligence Center(生物与计算智能中心) National Intelligence University(国家情报大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过分析多智能体系统内部神经表示的谱分区方法,检测隐藏联盟结构,验证了该方法在强化学习和大语言模型中的有效性,揭示了代表层次结构。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏