arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-31 至 2026-03-31 共收录 405 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 65 篇

2512.13874 2026-03-31 cs.CV 50%

SAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement Learning

SAGE:基于强化学习训练长视频推理的智能任意时间范围智能体

Jitesh Jain, Jialuo Li, Zixian Ma, Jieyu Zhang, Chris Dongjoo Kim, Sangho Lee, Rohun Tripathi, Tanmay Gupta, Christopher Clark, Humphrey Shi

机构 * Allen AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :post-training(abstract)

AI总结 本文提出SAGE系统,通过多轮推理处理长视频并单轮处理简单问题,结合Gemini-2.5-Flash生成合成数据,提出RL后训练方案,并通过SAGE-Bench验证系统有效性,提升视频推理性能达6.1%。

Comments Project Page: https://praeclarumjj3.github.io/sage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27571 2026-03-31 cs.HC 50%

RAGent: Physics-Aware Agentic Reasoning for Training-Free mmWave Human Activity Recognition

RAGent:面向无训练毫米波人类活动识别的物理感知代理推理

Mingda Han, Huanqi Yang, Zehua Sun, Wenhao Li, Yanni Yang, Guoming Zhang, Yetong Cao, Weitao Xu, Pengfei Hu

专题命中 推理与问题求解 :language model(abstract)

AI总结 RAGent通过物理感知代理推理实现无训练毫米波人类活动识别,利用雷达知识库进行证据驱动推理,无需领域特定训练或适应,实现跨领域鲁棒识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27204 2026-03-31 cs.CR cs.SE 50%

"Elementary, My Dear Watson." Detecting Malicious Skills via Neuro-Symbolic Reasoning across Heterogeneous Artifacts

我的爱,华生。通过神经符号推理跨异构工件检测恶意技能

Shenao Wang, Junjie He, Yanjie Zhao, Yayi Wang, Kan Yu, Haoyu Wang

专题命中 推理与问题求解 :LLM(abstract)

AI总结 本文提出MalSkills框架,通过符号解析与LLM语义分析提取异构工件中的安全敏感操作,构建技能依赖图并进行神经符号推理,实现恶意技能检测,实验表明其在F1得分上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27201 2026-03-31 cs.CV 50%

Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models

理解并缓解多模态推理链模型中的幻觉

Ji Ma, Wei Suo, Peng Wang, Yanning Zhang

机构 * School of Computer Science and Ningbo Institute, Northwestern Polytechnical University, China(西北工业大学计算机学院和宁波研究院) National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, China(国家空天地海一体化大数据应用技术国家工程实验室)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文研究多模态推理链模型中的幻觉问题,发现其源于联想推理步骤中的虚假文本生成,提出一种有效策略缓解幻觉,实验表明方法效果显著且可与其他缓解方法结合提升性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27060 2026-03-31 cs.CV 50%

VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation

VIRST:用于时空分割的视频指导推理助手

Jihwan Hong, Jaeyoung Do

专题命中 推理与问题求解 :language model(abstract)

AI总结 VIRST提出一种端到端框架,统一全局视频推理与像素级分割预测,通过时空融合模块和时间动态锚点更新器,提升动态场景下的分割性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26997 2026-03-31 cs.RO cs.HC 50%

ROSClaw: An OpenClaw ROS 2 Framework for Agentic Robot Control and Interaction

ROSClaw: 一种用于代理机器人控制与交互的OpenClaw ROS 2框架

Irvin Steve Cardenas, Marcus Anthony Arnett, Natalie Catherine Yeo, Lucky Sah, Jong-Hoon Kim

机构 * Advanced Telerobotics Research Lab, Kent State University(肯特州立大学先进远程机器人研究实验室) OpenDive Technologies

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 ROSClaw通过整合OpenClaw代理运行时与ROS 2,实现任意基础模型与ROS-enabled机器人之间的交互,支持动态能力发现、多模态观察归一化、预执行动作验证和结构化审计日志,验证了执行层设计对任务完成与安全行为的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08602 2026-03-31 cs.RO 50%

Mimic Intent, Not Just Trajectories

模仿意图,而非仅仅轨迹

Renming Huang, Chendong Zeng, Wenjing Tang, Jintian Cai, Cewu Lu, Panpan Cai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理与问题求解 :pretraining(abstract)

AI总结 本文提出MINT方法,通过多尺度频域标记解耦行为意图与执行细节,提升模仿学习的适应性和迁移能力,实验显示其在任务基准和真实机器人上的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 107 篇

2603.27504 2026-03-31 cs.CV 90%

Transferring Physical Priors into Remote Sensing Segmentation via Large Language Models

通过大语言模型将物理先验转移到遥感分割中

Yuxi Lu, Kunqi Li, Zhidong Li, Xiaohan Su, Biao Wu, Chenya Huang, Bin Liang

机构 * University of Technology Sydney(悉尼科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);prompting(abstract)

AI总结 本文提出PriorSeg模型,利用物理先验提升遥感图像分割的准确性与物理合理性,通过构建物理中心知识图谱和异构数据集Phy-Sky-SA,无需重新训练即可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09938 2026-03-31 cs.CL 89%

Model Merging in the Era of Large Language Models: Methods, Applications, and Future Directions

大语言模型时代下的模型合并:方法、应用与未来方向

Mingyang Song, Mao Zheng

机构 * Tencent, China(腾讯(中国))

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文探讨了大语言模型时代模型合并的方法、应用及未来方向,通过FUSE分类体系系统回顾了算法空间、下游应用及支持生态系统,识别了关键挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28374 2026-03-31 cs.CY 89%

Using Games to Learn How Large Language Models Work

通过游戏学习大语言模型的工作原理

Allison Chen, Isabella Pu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出两款游戏,通过游戏化方式展示大语言模型的工作原理与数据使用方法,旨在提升AI素养。

Comments CHI Conference on Human Factors in Computing Systems Workshop on Data Literacy

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26142 2026-03-31 cs.HC 89%

Simulating Novice Students Using Machine Unlearning and Relearning in Large Language Models

利用机器去学习和再学习在大语言模型中模拟新手学生

Jiajia Song, Zhihan Guo, Jionghao Lin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出基于机器去学习的知识级模拟方法,通过转换知识丰富的LLM为新手级AI学生,评估其通过教学对话重新学习知识的能力,揭示了学生行为随时间的变化轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08137 2026-03-31 cs.LG cs.CL cs.GR cs.MM 88%

Large Language Models for Computer-Aided Design: A Survey

大型语言模型在计算机辅助设计中的应用:综述

Licheng Zhang, Bach Le, Naveed Akhtar, Siew-Kei Lam, Tuan Ngo

机构 * The University of Melbourne(墨尔本大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文首次系统性地探讨了大型语言模型与计算机辅助设计的结合,分析了其在CAD中的应用领域及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28698 2026-03-31 cs.CL 88%

EpiScreen: Early Epilepsy Detection from Electronic Health Records with Large Language Models

EpiScreen:利用电子健康记录中的大型语言模型进行早期癫痫检测

Shuang Zhou, Kai Yu, Zaifu Zhan, Huixue Zhou, Min Zeng, Feng Xie, Zhiyi Sha, Rui Zhang

机构 * University of Minnesota(明尼苏达大学) Division of Computational Health Sciences, Department of Surgery, University of Minnesota(明尼苏达大学外科学系计算健康科学部) College of Science and Engineering, University of Minnesota(明尼苏达大学科学与工程学院) Department of Neurology, University of Minnesota(明尼苏达大学神经病学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出EpiScreen方法,通过微调大型语言模型实现早期癫痫检测,其在MIMIC-IV数据集和明尼苏达大学私有队列中分别达到0.875和0.980的AUC,临床合作中帮助神经科医生提高诊断准确率。

Comments 24 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27918 2026-03-31 cs.CR cs.AI 88%

Adversarial Attacks on Multimodal Large Language Models: A Comprehensive Survey

对多模态大语言模型的对抗攻击:全面综述

Bhavuk Jain, Sercan Ö. Arık, Hardeo K. Thakur

机构 * Google(谷歌) Bennett University, India(印度贝内特大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文综述了多模态大语言模型面临的对抗威胁,分析了攻击类型及其根源,提出分类框架以提升模型安全性。

Comments Survey paper, 37 pages, 10 figures, accepted at TMLR

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27806 2026-03-31 cs.CL cs.CY 88%

Understanding Teacher Revisions of Large Language Model-Generated Feedback

理解大型语言模型生成反馈的教师修订

Conrad Borchers, Luiz Rodrigues, Newarney Torrezão da Costa, Cleon Xavier, Rafael Ferreira Mello

机构 * Carnegie Mellon University(卡内基梅隆大学) Federal Technological University of Paraná – UTFPR(巴拉那联邦理工大学) Instituto Federal Goiano – IF Goiano(戈亚斯联邦学院) Federal Rural University of Pernambuco – UFRPE(伯南布哥联邦农村大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究探讨教师如何修订AI生成的反馈,发现80%的反馈未修改,编辑反馈通常更长且被缩短,机器学习模型能预测修订决策,修订常简化反馈内容,使其更简洁纠正性。

Comments Accepted as full paper to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09326 2026-03-31 cs.CV 88%

OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models

OddGridBench: 暴露多模态大语言模型在细粒度视觉差异敏感性方面的不足

Tengjin Weng, Wenhao Jiang, Jingyi Wang, Ming Li, Lin Ma, Zhong Ming

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Shenzhen Technology University(深圳技术大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Meituan(美团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出OddGridBench基准,评估多模态大语言模型的视觉差异敏感性,发现其检测能力远低于人类,提出OddGrid-GRPO框架提升模型细粒度视觉辨别能力。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27662 2026-03-31 cs.CV 88%

A Benchmarking Methodology to Assess Open-Source Video Large Language Models in Automatic Captioning of News Videos

一种评估开源视频大语言模型在新闻视频自动字幕生成中性能的基准方法

David Miranda Paredes, Jose M. Saavedra, Marcelo Pizarro

机构 * Universidad de los Andes, Chile(智利洛斯安第斯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出评估开源视频大语言模型在自动新闻视频字幕生成中的方法,使用两个基准数据集评估八种最新模型,发现传统指标在新闻视频字幕生成中表现有限,提出新的主题和实体忠实度指标,结果显示Gemma~3在两个数据集和多数评估维度上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27103 2026-03-31 cs.CV 88%

LLM Enhanced Action Recognition via Hierarchical Global-Local Skeleton-Language Model

通过分层全局-局部骨架-语言模型增强动作识别

Ruosi Wang, Fangwei Zuo, Lei Li, Zhaoqiang Xia

机构 * Northwestern Polytechnical University(西北工业大学) Shandong University of Finance and Economics(山东财经大学)

专题命中 评测与基准 :language model(title,abstract);LLM(title);SLM(abstract)

AI总结 本文提出HocSLM模型,通过分层全局-局部网络和大视觉-语言模型融合骨架与文本信息,提升动作识别的语义表达和跨模态理解能力,实验表明在三个主流数据集上达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05150 2026-03-31 cs.CL 87%

GreekMMLU: A Native-Sourced Multitask Benchmark for Evaluating Language Models in Greek

希腊MMLU:用于评估希腊语言模型多任务基准的原生来源基准

Yang Zhang, Mersin Konomi, Christos Xypolopoulos, Konstantinos Divriotis, Konstantinos Skianis, Giannis Nikolentzos, Giorgos Stamou, Guokan Shang, Michalis Vazirgiannis

机构 * LIX, Ecole Polytechnique(巴黎综合理工学院LIX实验室) MBZUAI(穆罕默德·本·扎耶德人工智能大学) National Technical University of Athens(雅典国家技术大学) University of Ioannina(约阿尼纳大学) University of Peloponnese(伯罗奔尼撒大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

AI总结 希腊MMLU是一个包含45个学科领域的21805道多选题的希腊多任务评估基准,所有题目均源自希腊学术、专业和政府考试,旨在评估语言模型在希腊语言中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04497 2026-03-31 cs.CV cs.AI cs.CL 86%

Vision-Language Agents for Interactive Forest Change Analysis

用于交互式森林变化分析的视觉-语言代理

James Brock, Ce Zhang, Nantheera Anantrasirichai

专题命中 评测与基准 :language agent(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种基于大语言模型的视觉-语言代理,用于处理遥感图像变化解释任务,通过多级变化解释框架和交互式查询提升森林变化分析的准确性与效率。

Comments 5 pages, 4 figures, Accepted into IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27356 2026-03-31 cs.CL cs.AI cs.CY 86%

Culturally Adaptive Explainable LLM Assessment for Multilingual Information Disorder: A Human-in-the-Loop Approach

文化适应性可解释LLM评估用于多语言信息紊乱:一种人机协作方法

Maziar Kianimoghadam Jouneghani

机构 * University of Turin(都灵大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种人机协作框架,通过本地语言标注者生成的解释性理由,评估LLM在多语言信息紊乱中的表现,提升模型的文化适应性和可解释性。

Comments 9 pages, 3 figures, 1 table. Accepted to the Information Disorder Workshop at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26830 2026-03-31 cs.LG cs.AI cs.SE 86%

A Regression Framework for Understanding Prompt Component Impact on LLM Performance

用于理解提示组件对LLM性能影响的回归框架

Andrew Lauziere, Jonathan Daugherty, Taisa Kushner

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出回归框架分析提示特征对LLM性能的影响,通过回归模型解释提示部分对模型表现的解释力,发现错误示例会阻碍模型解决算术问题,正负指令对模型性能有矛盾影响。

Comments 9 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26710 2026-03-31 cs.IR cs.AI cs.CL cs.MA 86%

Agentic AI for Human Resources: LLM-Driven Candidate Assessment

面向人力资源的代理AI:基于大语言模型的候选人评估

Kamer Ali Yuksel, Abdul Basit Anees, Ashraf Elneima, Sanjika Hewavitharana, Mohamed Al-Badrashiny, Hassan Sawaf

机构 * aiXplain, Inc.(aiXplain公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个模块化且可解释的框架,利用大语言模型自动化招聘中的候选人评估。系统整合多种来源生成结构化评估报告,采用LLM生成的评分标准和多代理架构进行细粒度评估,输出透明、可审计的评估报告和推荐。

Comments Published in 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026)

Journal ref 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026), Rabat, Morocco

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26351 2026-03-31 cs.LG 86%

LLM-Assisted Emergency Triage Benchmark: Bridging Hospital-Rich and MCI-Like Field Simulation

基于大语言模型的急救分级基准:连接医院丰富与MCI类现场模拟

Joshua Sebastian, Karma Tobden, KMA Solaiman

机构 * University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一个开放的急救分级基准,通过大语言模型辅助构建,解决现有基准不可用的问题,涵盖医院环境和MCI模拟两种场景,提升临床AI数据集的可重复性和可访问性。

Comments Submitted to GenAI4Health@NeurIPS 2025. This was the first version of the LLM-assisted emergency triage benchmark dataset and baseline models. A related but separate benchmark-focused study on emergency triage under constrained sensing has been accepted at the IEEE International Conference on Healthcare Informatics (ICHI) 2026 (see arXiv:2602.20168)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27949 2026-03-31 cs.CL 85%

EnsemJudge: Enhancing Reliability in Chinese LLM-Generated Text Detection through Diverse Model Ensembles

EnsemJudge: 通过多样化模型集成提升中文LLM生成文本检测的可靠性

Zhuoshang Wang, Yubing Ren, Guoyu Zhao, Xiaowei Zhu, Hao Li, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EnsemJudge框架,通过定制策略和集成投票机制,有效检测中文LLM生成文本,优于基线方法并在NLPCC2025任务中取得第一,验证了其可靠性。

Comments Accepted by NLPCC 2025 Shared Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26845 2026-03-31 cs.SE cs.AI 85%

GISclaw: An Open-Source LLM-Powered Agent System for Full-Stack Geospatial Analysis

GISclaw:一个基于大语言模型的开源代理系统,用于全栈地理空间分析

Jinzhen Han, JinByeong Lee, Yuri Shim, Jisung Kim, Jae-Joon Lee

机构 * Sungkyunkwan University(成均馆大学) Ministry of the Interior and Safety(行政安全部) University of Leeds(利兹大学) Jeonju University(全州大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GISclaw通过集成LLM推理核心、Python沙盒、开源GIS库和交互界面,实现多数据类型的全栈地理空间分析,采用双代理架构和三种创新机制,提升任务成功率至96%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09701 2026-03-31 cs.SE 85%

An Empirical Study of Interaction Smells in Multi-Turn Human-LLM Collaborative Code Generation

多轮人-大语言模型协作代码生成中交互恶臭的实证研究

Binquan Zhang, Li Zhang, Lin Shi, Song Wang, Yuwei Qian, Linhui Zhao, Fang Liu, An Fu, Yida Ye

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过分析真实用户-大语言模型交互数据,揭示多轮协作代码生成中的交互恶臭现象,提出InCE框架以提升交互质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27127 2026-03-31 cs.CR 85%

Red-MIRROR: Agentic LLM-based Autonomous Penetration Testing with Reflective Verification and Knowledge-augmented Interaction

Red-MIRROR:基于大语言模型的自主渗透测试系统,结合反射验证与知识增强交互

Tran Vy Khang, Nguyen Dang Nguyen Khang, Nghi Hoang Khoa, Do Thi Thu Hien, Van-Hau Pham, Phan The Duy

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Red-MIRROR通过引入紧密耦合的记忆-反射架构,解决传统渗透测试中依赖参数知识、记忆碎片化和验证不足的问题,实现复杂Web漏洞的高效检测与验证,其在XBOW基准测试中成功率达到86%。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26942 2026-03-31 cs.HC 85%

The Observability Gap: Why Output-Level Human Feedback Fails for LLM Coding Agents

可观性缺口:为何输出级人类反馈在LLM编码代理中失效

Yinghao Wang, Cheng Wang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究发现,LLM编码代理在缺乏预定义功能的情况下,通过轻量级人类反馈构建可重用函数库时,输出反馈无法有效识别根因,导致持续失败模式。

Comments Accepted to CHI 2026 Workshop on Human-Agent Collaboration

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27694 2026-03-31 cs.CL 84%

Can Large Language Models Simulate Human Cognition Beyond Behavioral Imitation?

大语言模型能否超越行为模仿模拟人类认知?

Yuxuan Gu, Lunjun Liu, Xiaocheng Feng, Kun Zhu, Weihong Zhong, Lei Huang, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL

AI总结 本文通过217位AI研究者纵向研究轨迹构建基准,评估LLM是否能模拟人类认知,提出多维认知对齐指标,系统评估最新LLM及增强技术,探讨其模拟人类认知的能力及提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏