arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32006 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32006 篇

2604.26356 2026-04-30 cs.DB 89%

PiLLar: Matching for Pivot Table Schema via LLM-guided Monte-Carlo Tree Search

PiLLar:通过LLM引导的蒙特卡洛树搜索进行立方体表模式匹配

Yunjun Gao, Chuangyu Ouyang, Congcong Ge, Yifan Zhu

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出PiLLar框架,通过LLM引导的蒙特卡洛树搜索实现立方体表模式匹配,解决数据敏感性和匿名化数据带来的挑战,提升匹配精度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24405 2026-04-30 cs.HC 89%

How Personal Characteristics Shape User Exploration of Diverse Movie Recommendations with a LLM-Based Multi-Agent System

个人特征如何塑造用户探索多样化电影推荐的多智能体系统

Yufan Zhou, Yirui Huang, Zhao Wang, Yucheng Jin

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了基于LLM的多智能体系统如何支持用户探索多样化推荐,探讨个人特征对用户体验的影响,发现多智能体系统提升新颖性和多样性,性格特质和AI经验影响感知准确性与多样性。

Comments 11 pages, 2 figures. Accepted by UMAP '26 (34th ACM International Conference on User Modeling, Adaptation and Personalization)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17170 2026-04-28 cs.IR 89%

When LLM Judges Inflate Scores: Exploring Overrating in Relevance Assessment

当大语言模型评分膨胀时:探索相关性评估中的过度评分

Chuting Yu, Hang Li, Guido Zuccon, Joel Mackenzie, Teerapong Leelanupab

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究揭示LLM在相关性评估中存在系统性高估问题,指出模型对不满足信息需求的文本给出高分,且易受文本长度和表层词汇影响,强调需谨慎评估LLM在相关性评估中的应用。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22513 2026-04-27 cs.NI 89%

Benchmarking LLM-Driven Network Configuration Repair

基于大语言模型的网络配置修复基准测试

Ioannis Protogeros, Rufat Asadli, Benjamin Hoffman, Laurent Vanbever

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Cornetto基准测试,用于评估大语言模型在大规模网络配置修复中的功能性和扩展性,发现现有LLM在处理复杂场景时易引入回归问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19742 2026-04-22 cs.SE 89%

PlayCoder: Making LLM-Generated GUI Code Playable

PlayCoder: 使LLM生成的GUI代码可播放

Zhiyuan Peng, Wei Tao, Xin Yin, Chenhao Ying, Yuan Luo, Yiwen Guo

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出PlayCoder框架,通过生成、评估和迭代修复GUI代码,提升代码的逻辑正确性和语义对齐,实现功能正确性和交互逻辑的改进。

Comments September 11, 2025 Submitted to FSE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23542 2026-04-21 cs.CL cs.AI cs.LG 89%

On the Shelf Life of Fine-Tuned LLM-Judges: Future-Proofing, Backward-Compatibility, and Question Generalization

大语言模型判官的保质期:未来证明、向后兼容性和问题泛化

Janvijay Singh, Austin Xu, Yilun Zhou, Yefan Zhou, Dilek Hakkani-Tur, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Dartmouth College(达特茅斯学院)

专题命中 评测与基准 :LLM(title,abstract);SFT(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了细调判官模型在现实部署中的挑战,探讨了未来证明、向后兼容性和问题泛化三个核心问题,并通过实验发现持续学习在适应响应分布变化方面表现更优。

Comments Updated after ICLR 2026 Acceptance; 29 pages;

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13241 2026-04-16 cs.CE 89%

Early-Warning Learner Satisfaction Forecasting in MOOCs via Temporal Event Transformers and LLM Text Embeddings

通过时间事件Transformer和LLM文本嵌入在MOOCs中进行学习者满意度预警预测

Anna Kowalczyk, Jakub Kowalski

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出TET-LLM框架,结合时间事件Transformer、LLM嵌入和短文本主题分布,通过早期信号预测学习者满意度,实验表明其在7天预警范围内RMSE为0.82,AUC为0.77。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12064 2026-04-15 cs.CR cs.SE 89%

LLM-Redactor: An Empirical Evaluation of Eight Techniques for Privacy-Preserving LLM Requests

LLM-Redactor: 对八种隐私保护LLM请求技术的实证评估

Justice Owusu Agyemang, Jerry John Kponyo, Elliot Amponsah, Godfred Manu Addo Boakye, Kwame Opuni-Boachie Obour Agyekum

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文评估了八种隐私保护LLM请求技术,发现组合A+B+C在保护PII和专有代码方面效果最佳,提出基于威胁模型的决策规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20555 2026-03-16 cs.CR 89%

PILOT: Command-line Interface Fuzzing via Path-Guided, Iterative Large Language Model Prompting

PILOT:通过路径引导、迭代式大语言模型提示进行命令行界面模糊测试

Momoko Shiraishi, Yinzhi Cao, Takahiro Shinagawa

专题命中 评测与基准 :large language model(title);language model(title);prompting(title);LLM(abstract)

AI总结 PILOT通过引导路径和迭代式大语言模型提示生成命令行参数和输入文件,提升模糊测试覆盖率并发现51个零日漏洞。

Comments Accepted at the 47th IEEE Symposium on Security and Privacy (IEEE S&P 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00082 2025-12-02 cs.CV 89%

Exploring Diagnostic Prompting Approach for Multimodal LLM-based Visual Complexity Assessment: A Case Study of Amazon Search Result Pages

探索用于多模态大语言模型视觉复杂性评估的诊断提示方法:亚马逊搜索结果页面案例研究

Divendar Murtadak, Yoon Kim, Trilokya Akula

专题命中 评测与基准 :prompting(title,abstract);LLM(title,comments);large language model(abstract);language model(abstract)

AI总结 本研究通过对比诊断提示与传统提示方法,发现其在提升多模态大语言模型对亚马逊搜索结果页面视觉复杂性评估的可靠性方面有显著改进,但仍有待进一步优化。

Comments 9 pages, 4 figures, 9 tables. Study on diagnostic prompting for multimodal LLM-based visual complexity assessment of Amazon search result pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11076 2025-06-16 cs.SE 89%

DCE-LLM: Dead Code Elimination with Large Language Models

Minyu Chen, Guoqiang Li, Ling-I Wu, Ruibang Liu

专题命中 评测与基准 :LLM(title,abstract);large language model(title);language model(title)

Comments Accepted by regular paper in NAACL 2025, with 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05080 2025-04-01 cs.CL cs.AI cs.LG 89%

ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery

Ziru Chen, Shijie Chen, Yuting Ning, Qianheng Zhang, Boshi Wang, Botao Yu, Yifei Li, Zeyi Liao, Chen Wei, Zitong Lu, Vishal Dey, Mingyi Xue, Frazier N. Baker, Benjamin Burns, Daniel Adu-Ampratwum, Xuhui Huang, Xia Ning, Song Gao, Yu Su, Huan Sun

专题命中 评测与基准 :language agent(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments ICLR 2025. 60 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.05658 2023-11-20 cs.RO cs.AI cs.CL cs.CV cs.LG 89%

TidyBot: Personalized Robot Assistance with Large Language Models

Jimmy Wu, Rika Antonova, Adam Kan, Marion Lepert, Andy Zeng, Shuran Song, Jeannette Bohg, Szymon Rusinkiewicz, Thomas Funkhouser

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to Autonomous Robots (AuRo) - Special Issue: Large Language Models in Robotics, 2023 and IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2023. Project page: https://tidybot.cs.princeton.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.09419 2023-05-02 cs.AI cs.CL cs.LG 89%

A Comprehensive Survey on Pretrained Foundation Models: A History from BERT to ChatGPT

Ce Zhou, Qian Li, Chen Li, Jun Yu, Yixin Liu, Guangjing Wang, Kai Zhang, Cheng Ji, Qiben Yan, Lifang He, Hao Peng, Jianxin Li, Jia Wu, Ziwei Liu, Pengtao Xie, Caiming Xiong, Jian Pei, Philip S. Yu, Lichao Sun

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments 99 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14982 2024-02-06 cs.CL cs.AI 89%

LAraBench: Benchmarking Arabic AI with Large Language Models

Ahmed Abdelali, Hamdy Mubarak, Shammur Absar Chowdhury, Maram Hasanain, Basel Mousi, Sabri Boughorbel, Yassine El Kheir, Daniel Izham, Fahim Dalvi, Majd Hawasly, Nizi Nazar, Yousseif Elshahawy, Ahmed Ali, Nadir Durrani, Natasa Milic-Frayling, Firoj Alam

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI;foundation model(comments)

Comments Foundation Models, Large Language Models, Arabic NLP, Arabic Speech, Arabic AI, GPT3.5 Evaluation, USM Evaluation, Whisper Evaluation, GPT-4, BLOOMZ, Jais13b

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00020 2026-08-20 cs.AR cs.AI 版本更新 89%

Large Language Model for Verilog Code Generation: Literature Review and the Road Ahead

用于Verilog代码生成的大型语言模型:文献综述与未来方向

Guang Yang, Wei Zheng, Xiang Chen, Dong Liang, Peng Hu, Yukui Yang, Shaohang Peng, Zhenghan Li, Jiahui Feng, Xiao Wei, Kexin Sun, Deyuan Ma, Haotian Cheng, Yiheng Shen, Xing Hu, Terry Yue Zhuo, David Lo

机构 * Zhejiang University \& Northwestern Polytechnical University China Northwestern Polytechnical University China Nantong University China Zhejiang University China Monash University Australia Singapore Management University Singapore Zhejiang University \& Northwestern Polytechnical University Northwestern Polytechnical University Nantong University Zhejiang University Monash University Singapore Management University

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文综述了LLMs在Verilog代码生成中的应用,分析了现有方法的有效性、局限性及未来研究方向。

Comments Accept in ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14622 2026-08-18 cs.AI 新提交 89%

A Human-Centred Approach to Benchmarking LLMs for Parenting Advice

以人为中心的基准测试大型语言模型(LLM)育儿建议方法

Yunke Zhao, Isobel Voysey, Alastair van Heerden, Rob Hughes, Jun Zhao

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文以育儿专家的多维度评分为标准,采用LLM作为评判者,评估15个LLM在100个育儿场景中英、中文的表现,发现聚合分数掩盖弱点、模型隐性影响育儿风格等,为相关应用提供见解。

Comments 15 pages. Submitted for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00177 2026-08-17 cond-mat.mtrl-sci cs.CL 89%

LLM4Mat-Bench: Benchmarking Large Language Models for Materials Property Prediction

Andre Niyongabo Rubungo, Kangming Li, Jason Hattrick-Simpers, Adji Bousso Dieng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted at NeurIPS 2024-AI4Mat Workshop. The Benchmark and code can be found at https://github.com/vertaix/LLM4Mat-Bench

Journal ref 2025 Mach. Learn.: Sci. Technol. 6 020501

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16009 2026-08-10 cs.AI 版本更新 89%

MEDLEY-BENCH: Benchmarking Behavioural Metacognition and Belief Revision Under Social Pressure in Large Language Models

MEDLEY-BENCH:在AI元认知中规模购买评估但不控制

Farhad Abtahi, Abdolamir Karbalaie, Eduardo Illueca-Fernandez, Fernando Seoane

机构 * Department of Clinical Science, Intervention and Technology (CLINTEC), Karolinska Institutet(临床科学、干预与技术部门(CLINTEC),Karolinska研究所) Department of Clinical Physiology, Karolinska University Hospital(临床生理学部门,Karolinska大学医院) Department of Biomedical Engineering and Health Systems, KTH Royal Institute of Technology(生物医学工程与健康系统部门,KTH皇家理工学院) Department of Textile Technology, University of Borås(纺织技术部门,Borås大学) Department of Medical Technologies, Karolinska University Hospital(医学技术部门,Karolinska大学医院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 MEDLEY-BENCH评估了12种模型家族中35个模型在五个领域130个模糊实例上的行为元认知能力,发现评估能力随模型规模增加而增强,但控制能力不增加,揭示了元认知能力与规模无关的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05208 2026-08-10 cs.CV cs.LG 版本更新 89%

Symbolic Graphics Programming with Large Language Models

基于大语言模型的符号图形编程

Yamei Chen, Haoquan Zhang, Yangyi Huang, Zeju Qiu, Kaipeng Zhang, Yandong Wen, Weiyang Liu

机构 * The Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.LG

AI总结 本文针对大语言模型生成符号图形程序(SGP)能力不足的问题,提出带可验证奖励的强化学习方法,在Qwen-2.5-7B上实现与前沿系统相当的SVG生成性能,揭示SGP是跨模态 grounding 的有效视角。

Comments Accepted by Transactions on Machine Learning Research. (32 pages, 12 figures.) This version refines the paper structure, adds experimental results. Project page: https://spherelab.ai/SGP-Gen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03259 2026-08-07 cs.CL 版本更新 89%

Zero-Shot Multi-Disease Labeling of Chest, Abdomen, and Pelvis CT Reports Using Open-Weight Large Language Models: The Effect of Labeling Conventions

评估大型语言模型在跨器官系统CT放射报告零样本疾病标注中的效果

Michael E. Garcia-Alcoser, Mobina Ghojoghnejad, Fakrul Islam Tushar, David Kim, Kyle J. Lafata, Geoffrey D. Rubin, Joseph Y. Lo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本研究评估了大型语言模型在CT报告零样本疾病标注中的效果,发现轻量级LLMs在多器官系统标注中表现优于规则方法,但需注意二元标签的局限性。

Comments 19 pages, 6 figures, 4 tables. Under review in Radiology: Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22256 2026-08-07 cs.SE cs.AI 版本更新 89%

Agentic Software Issue Resolution with Large Language Models: A Survey

基于大语言模型的代理软件问题解决:综述

Zhonghao Jiang, David Lo, Zhongxin Liu

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡管理大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文综述了基于大语言模型的代理软件问题解决的最新研究,探讨了其方法、挑战及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04828 2026-08-06 cs.CL 新提交 89%

Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?

技能使用:智能体框架中的大语言模型(LLM)真的能使用技能吗?

Jinyi Han, Yuanjian Xu, Ying Liao, Xinyi Wang, Zishang Jiang, Zixiang Di, Fanyang Lu, Zhichao Hu, Yanghua Xiao

机构 * East China Normal University(华东师范大学) Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学) Tencent Hunyuan(腾讯混元)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究推出Skill-Use基准,评估智能体在渐进式披露下的技能使用,发现8个LLM在两个框架下的SU分数仅0.613,技能使用是依赖框架的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25186 2026-08-06 cs.CL 版本更新 89%

CardioBench: A Real-World Data Benchmark for Evaluating Large Language Models in Clinically Authentic Cardiovascular Care Scenarios

MyoCardBench:用于评估临床真实心血管护理场景中大型语言模型的真实世界数据基准

Xiao Li, Mouxiao Bian, Zhaodi Wu, Sijie Ren, Juechen Chen, Lu Lu, Jingru Ding, Yun Zhong, Jie Xu, Yixiu Liang, Junbo Ge

机构 * Shanghai Institute of Cardiovascular Diseases(上海市心血管病研究所) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Minhang Hospital, Fudan University(复旦大学附属闵行医院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 该研究开发MyoCardBench真实世界基准评估大语言模型在心血管护理场景的性能,涵盖多任务数据集,经专家注释审核。7个模型在零样本设置下输出,GPT-5.4表现最佳。此基准为评估模型提供框架,助于发现优势与不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03512 2026-08-05 cs.AI 新提交 89%

Reversing Arrows in Large Language Models

反转大语言模型中的箭头

Sefika Efeoglu, Adrian Paschke

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本研究首次系统探究大语言模型的反向关系方向性,用含5457个实例的基准评估5种开源模型,发现其反向关系分类存在不对称性,关系描述与实体表示会影响性能。

Comments The preprint is under review in a venue

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03154 2026-08-05 cs.CL 新提交 89%

ANCHOR-RE: An Agentic Neuro-Symbolic Framework for Grounded Biomedical Relation Extraction

ANCHOR-RE:用于接地生物医学关系抽取的智能体神经符号框架

Shufan Ming, Yikun Han, Gibong Hong, Rui Zhang, Halil Kilicoglu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 该研究提出ANCHOR-RE框架,将本体引导推理等集成到LLM推理中,在多个BioRE基准及2026年生物医学文章数据集上,该框架性能优于直接LLM提示及部分现有方法,是实用的无训练生物医学文献挖掘方法。

Comments Submitted to Journal of Biomedical Informatics (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01292 2026-08-04 cs.CL 新提交 89%

CrossLex: A Source-Grounded Benchmark for Cross-Jurisdictional Legal Reasoning in Large Language Models

CrossLex:面向大语言模型跨司法辖区法律推理的、基于法律来源的基准测试集

Xiaocui Yang, Xican Tan, Shoujie Chen, Shihan Xiao, Keke Tong, Xinyu Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本文提出基于中、加州、德三国法律来源的CrossLex基准测试集,定义三项任务并提出联合评估指标,发现大语言模型在跨司法辖区法律推理上存在不足,旨在推动相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14191 2026-08-04 cs.CR cs.CL 89%

S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models

Xiaohan Yuan, Jinfeng Li, Dongxia Wang, Yuefeng Chen, Xiaofeng Mao, Longtao Huang, Jialuo Chen, Hui Xue, Xiaoxia Liu, Wenhai Wang, Kui Ren, Jingyi Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted by ISSTA 2025

Journal ref Proceedings of the ACM on Software Engineering, Vol. 2, ISSTA, pp. 2136-2157, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28137 2026-07-31 cs.CY cs.AI 新提交 89%

Asymmetric Communication: Large Language Models and Language Games

非对称通信:大语言模型与语言游戏

Enzo Fenoglio

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过提出非对称通信框架,纠正了AI讨论对大语言模型的错误属性投射,将相关现象重新归类为接收方一侧的现象,为AI治理提供了启示,明确对齐是制度约束工程,责任归人类机构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25620 2026-07-29 cs.AI cs.HC 新提交 89%

Beyond Epistemia: Epistemic Schizologia and Large Language Models as Techno-Semiotic Machines

超越认知:认知分裂症与作为技术符号机器的大语言模型

Federico Cabitza, Gianluca Colombo

机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究大语言模型输出致“认知症”现象,挑战其解释框架。借鉴相关哲学,将大语言模型视为技术符号机器,指出“认知症”是“认知分裂症”后果,强调相关单元是整个实践,为新设计方案奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏