arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-01 至 2026-07-01 共收录 348 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 16 篇

2606.32038 2026-07-01 cs.CL cs.AI cs.LG 新提交 75%

Introspective Coupling: Self-Explanation Training Tracks Behavioral Change Despite Fixed Supervision

内省耦合:尽管监督固定,自我解释训练仍追踪行为变化

Zifan Carl Guo, Laura Ruis, Jacob Andreas, Belinda Z. Li

机构 * MIT EECS(麻省理工学院电气工程与计算机科学系)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究训练语言模型生成解释时,固定反事实解释数据集如何使模型产生内省性解释,追踪自身行为变化,无需更新监督。

Comments 32 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31054 2026-07-01 cs.CV cs.AI cs.CL cs.MM 新提交 73%

ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs

ADAPT: 通过偏好调优实现注意力动态对齐以增强多模态大模型的忠实性

Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Ltd.(华为技术有限公司) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民网传播内容认知国家重点实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大模型生成中的幻觉问题,提出ADAPT框架,通过跨注意力视觉锚点、注意力监督推理和视觉注意力引导DPO直接干预文本到图像的跨注意力动态,在多个基准上将幻觉率降低40%-60%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06734 2026-07-01 cs.LG cs.AI 版本更新 73%

Corruption Robust Offline Reinforcement Learning with Human Feedback

具有人类反馈的鲁棒离线强化学习

Debmalya Mandal, Andi Nika, Parameswaran Kamalaruban, Adish Singla, Goran Radanović

机构 * University of Warwick(华威大学) Max-Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Independent Researcher(独立研究员)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究离线环境下人类反馈强化学习的数据鲁棒性,提出基于置信集和悲观策略的鲁棒方法,首次提供可证明的鲁棒性保证。

Comments Updated Algorithm 1 and the Proof of Theorem 3.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17917 2026-07-01 cs.LG cs.AI cs.CR 版本更新 62%

Not Every Time and Frequency Need to Be Forgotten in Diffusion Unlearning

并非所有时间和频率都需要在扩散遗忘中被遗忘

Jinseong Park, Mijung Park

机构 * Korea Institute for Advanced Study(韩国高等研究院) University of British Columbia(不列颠哥伦比亚大学)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 提出选择性遗忘扩散模型中的时间和频率,通过理论分析分布失真与遗忘-效用权衡,在多种设置下实现更高遗忘成功率和生成质量。

Comments ICML 2026 Workshop FoGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31660 2026-07-01 physics.chem-ph cond-mat.mtrl-sci 新提交 50%

Contrastive Regularization of Machine Learning Potentials

机器学习势的对比正则化

Dimitrios Tzivrailis, Georgios Sotiropoulos, Alberto Rosso, Eiji Kawasaki

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对机器学习势在采样时产生虚假低能态的问题,提出对比正则化MSE(CRMSE),通过KL散度对比项修正分布,使采样恢复物理构象,在MD17分子上达到近定量精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02503 2026-07-01 q-bio.NC 50%

Individual-specific precision neuroimaging of learning-related plasticity

个体特异性精确神经影像学中的学习相关可塑性研究

Simon Leipold, Ryssa Moffat

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出一种个体特异性精确方法,通过高频采集高质量神经影像数据,追踪个体神经变化,结合行为测量和多模态技术,提升对学习轨迹的敏感度和个性化技能学习的理解。

Journal ref Neuroscience & Biobehavioral Reviews (2026), 188, 106824

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19506 2026-07-01 cs.CV 版本更新 50%

Bridging Information Asymmetry: A Hierarchical Framework for Deterministic Blind Face Restoration

弥合信息不对称:一种降低不确定性的分层盲脸修复框架

Zhengjian Yao, Jiakui Hu, Kaiwen Li, Hangzhou He, Xinliang Zhang, Shuang Zeng, Lei Zhu, Yanye Lu

机构 * Biomedical Engineering Department, College of Future Technology, Peking University(北京大学未来技术学院生物医学工程系) Institute of Medical Technology, Peking University Health Science Center(北京大学医学部医学技术研究所) National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 提出Pref-Restore分层框架,通过语义信息增强、纹理保真对齐和保真约束偏好优化,降低盲脸修复中的不确定性,实现身份敏感的高保真重建。

Comments Accepted by TPAMI2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 13 篇

2606.31046 2026-07-01 cs.AI 新提交 92%

OpenLife: Toward Open-World Artificial Life with Autonomous LLM Agents

OpenLife:迈向基于自主LLM代理的开放世界人工生命

Atsushi Masumori, Itsuki Doi, Norihiro Maruyama, Ryosuke Takata, Takashi Ikegami

机构 * Alternative Machine Inc.(Alternative Machine公司) Their Inc.(Their公司) Atomi University(迹见学园女子大学) The University of Tokyo(东京大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出开放世界人工生命范式,通过将无状态LLM与异步进程(记忆、感知、评估、预算代谢)结合,使代理在开放世界中涌现自发活动、个体化、社会结构和自创收入。

Comments Accepted at ALIFE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31145 2026-07-01 cs.CL 新提交 90%

SeKV: Resolution-Adaptive KV Cache with Hierarchical Semantic Memory for Long-Context LLM Inference

SeKV:面向长上下文LLM推理的分辨率自适应KV缓存与层次化语义记忆

Amirhossein Abaskohi, Giuseppe Carenini, Peter West, Yuhang He

机构 * University of British Columbia(不列颠哥伦比亚大学) Microsoft Research(微软研究院)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SeKV,一种分辨率自适应的语义KV缓存方法,通过熵引导的语义片段和GPU-CPU层次化存储,在不丢弃信息的情况下实现按需token级重建,平均性能提升5.9%,GPU内存减少53.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26883 2026-07-01 cs.DL 新提交 89%

EconSimulacra: A Digital Twin Platform of Socio-Economic Systems Powered by LLM Agents

EconSimulacra:基于LLM代理的社会经济系统数字孪生平台

Ryuji Hashimoto, Masahiro Kaneko, Kentaro Ueda, Takehiro Takayanagi, Kiyoshi Izumi

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出EconSimulacra,一种通过共享内部状态机制耦合消费经济、移动性和社交网络的多智能体模拟器,使代理能产生跨领域一致行为,并复现线上关注与线下流行度的非线性关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31368 2026-07-01 cs.SE 新提交 87%

MOA: A Profiling-Guided LLM Framework for Memory-Optimization Automation at Codebase Scale

MOA:一种基于剖析引导的LLM框架,用于代码库规模的内存优化自动化

Jiaxi Liang, Yuanxiang Shi, Zezhou Yang, Chenxiong Qian

专题命中 长上下文与记忆 :LLM(title,title_cn)

AI总结 提出MOA框架,通过三个智能体自动检测和修复大规模代码库中的内存低效问题,在OpenHarmony上识别13种反模式,生成769个补丁,平均堆减少42.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31564 2026-07-01 cs.AI 新提交 81%

ACE: Pluggable Adaptive Context Elasticizer across Agents

ACE: 跨智能体的可插拔自适应上下文弹性化器

Ning Liao, Zihao Long, Xiaoxing Wang, Xue Yang, Yaoming Wang, Ziyuan Zhuang, Xunliang Cai, Rongxiang Weng, Junchi Yan

机构 * Meituan(美团) Shanghai Jiao Tong University(上海交通大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ACE模块,通过无损消息存储和自适应上下文编排,实现历史步骤信息的弹性化处理,在多种智能体框架中优于截断和摘要方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09165 2026-07-01 cs.LG cs.CL 版本更新 81%

Sparse Layers are Critical to Scaling Looped Language Models

稀疏层对扩展循环语言模型至关重要

Ryan Lee, Jacob Biloki, Edward J. Hu, Jonathan May

机构 * USC Information Sciences Institute(美国南加州大学信息科学研究所) Netflix(netflix公司)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究比较了带循环和不带循环的MoE和标准Transformer,发现循环MoE模型在扩展性上优于标准模型,且循环模型在计算质量权衡中具有更好的早退性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31206 2026-07-01 cs.SE 新提交 80%

FeatX: Editing Software by Editing Features for Repository-Level Code Evolution

FeatX: 通过编辑特征来编辑软件以实现仓库级代码演化

Xutian Li, Yifeng Zhu, Xianlin Zhao, Yanzhen Zou, Lu Zhang, Bing Xie

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出特征导向工具FeatX,通过提取层次化史诗-特征结构并调用三阶段演化代理,将特征编辑转化为代码补丁,显著降低认知负荷并提升修改定位F1达42.6%。

Comments 4 pages, Accepted to the Tools and Datasets Track of ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31121 2026-07-01 cs.AI 新提交 79%

The Past Is Prologue: A Plug-in Controller for Selective Updates in Sequentially Evolving LLM Memory

过去即序幕:面向顺序演化的大语言模型记忆的选择性更新插件控制器

Zihan Chen, Songwei Dong, Chengshuai Shi, Peng Wang, Song Wang, Cong Shen, Jundong Li

机构 * University of Virginia(弗吉尼亚大学) Princeton University(普林斯顿大学) University of Central Florida(中佛罗里达大学)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

AI总结 提出Janus插件控制器,通过记忆动量触发器检测异常并基于紧凑混合评估集决定是否接受记忆更新,避免有害覆盖,在六个数据集上提升准确率2.7-4.6点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30986 2026-07-01 cs.CY cs.HC cs.MA econ.GN q-fin.EC 新提交 67%

The Organizational Behavior of Agentic AI: Collective Intelligence in Human-Agent Workflows

代理型人工智能的组织行为:人机协作中的集体智能

Canhui Liu

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn)

AI总结 本文探讨代理型AI集体在组织中的行为,提出其通过上下文架构而非人类动机维持组织模式,并发展上下文交易成本理论解释人机组织行为的异同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31495 2026-07-01 cs.AI cs.LG 新提交 62%

Surprise as a Signal for Plasticity and Metacognition

惊喜作为可塑性和元认知的信号

Louis Mouchon

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出预测误差信号可作为可塑性门控和元认知基础,在冻结编码器上实现持续学习与视觉语言模型自适应,实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30788 2026-07-01 cs.LG cs.CL cs.CR 新提交 62%

Revocable Learned State via Process Sidecars

通过过程侧边栏实现可撤销的学习记忆

John Sweeney

机构 * Sideplane AI

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出过程侧边栏方法,通过两系数编辑族修正安全训练后的记忆方向,实现记忆撤销,理论证明其二阶精度优于任务算术编辑。

Comments 23 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14200 2026-07-01 cs.LG 57%

TS-Haystack: A Multi-Task Retrieval Benchmark for Long-Context Time-Series Reasoning

TS-Haystack:一种用于长上下文时间序列推理的多任务检索基准

Nicolas Zumarraga, Thomas Kaar, Ning Wang, William Tennien, Alpay Hasanli, Max Rosenblattl, Fan Wu, Kevin Riehl, Maxwell A. Xu, Markus Kreft, Kevin O'Sullivan, Elgar Fleisch, Paul Schmiedmayer, Robert Jakob, Patrick Langer

机构 * Agentic Systems Lab, ETH Zurich(1 非常规系统实验室,苏黎世联邦理工学院) Stanford University(2 斯坦福大学) Traffic Engineering Group, Institute for Transport Planning and Systems, ETH Zurich(3 交通工程组,交通规划与系统研究所,苏黎世联邦理工学院) University of Illinois Urbana-Champaign(4 印第安纳大学厄巴纳-香槟分校) Google(5 谷歌) Centre for Digital Health Interventions, ETH Zurich(6 数字健康干预中心,苏黎世联邦理工学院) Centre for Digital Health Interventions, University of St. Gallen(7 数字健康干预中心,圣加尔登大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 本文提出TS-Haystack基准,评估长上下文时间序列推理能力,发现现有TSLMs存在长上下文退化问题,代理检索框架在9/10任务中表现优异。

Comments Workshop version of this paper published at ICLR TSALM 2026. Benchmark generation code and datasets: https://github.com/AI-X-Labs/TS-Haystack

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06845 2026-07-01 cs.CV 版本更新 50%

PA-VAD: Diffusion-Based Pseudo-Only Video Anomaly Detection via Domain-Aligned Memory Updates

PA-VAD: 基于扩散的伪异常视频异常检测通过域对齐记忆更新

Satoshi Hashimoto, Yanan Wang, Hitoshi Nishimura, Mori Kurokawa

机构 * KDDI Research, Inc.(KDDI研究所)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 提出PA-VAD框架,仅用真实正常视频和扩散合成伪异常视频训练检测器,通过域对齐正则化模块(DARM)消除伪异常特征偏差,在多个基准上超越使用真实异常视频的方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 53 篇

2606.31073 2026-07-01 cs.AI cs.MA cs.RO 新提交 92%

MultiUAV-Plat: An LLM-Oriented Platform, Benchmark and Framework for Multi-UAV Collaborative Task Planning

MultiUAV-Plat:面向多无人机协同任务规划的LLM平台、基准测试与框架

Sheng Zhang, Qinglin Li, Yuechao Zang, Xueqin Huang, Yijia Fu, Cheng Zhu

机构 * National Key Laboratory of Information Systems Engineering, National University of Defense Technology(国防科技大学信息系统工程国家重点实验室)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MultiUAV-Plat平台与基准测试,以及Agent4Drone框架,通过LLM驱动的工具交互实现多无人机协同任务规划,在任务通过率等指标上显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12309 2026-07-01 cs.LG cs.AI stat.ML 版本更新 91%

Optimal Self-Consistency for Efficient Reasoning with Large Language Models

最优自一致性:用于大语言模型高效推理

Austin Feng, Marius Alonso, Ambroise Odonnat, Vasilii Feofanov, Ievgen Redko

机构 * Yale University(耶鲁大学) Inria(法国国家信息与自动化研究所) com(42.com)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文分析自一致性(SC)的缩放行为,提出动态分配样本的Blend-ASC变体,平均减少4.8倍样本量,实现最先进的样本效率。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31158 2026-07-01 cs.RO cs.AI 新提交 90%

LLM-Powered Interactive Robotic Action Synthesis from Multimodal Speech, Gestures, and Music

基于多模态语音、手势和音乐的LLM驱动交互式机器人动作合成

Snehasis Banerjee, Ranjan Dasgupta

机构 * TCS Research, Tata Consultancy Services(塔塔咨询服务公司TCS研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出利用大语言模型融合语音、手势和音乐节拍等多模态输入,合成复杂机器人动作序列的框架,实现更自然的人机交互。

Comments IROS 2025 Workshop on Action and Interaction: Humans and Robots in Collaboration

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15488 2026-07-01 cs.CL cs.AI 90%

Multi-Persona Thinking for Bias Mitigation in Large Language Models

多视角思考用于大型语言模型中的偏见缓解

Yuxing Chen, Guoqing Luo, Zijun Wu, Lili Mou

机构 * Dept. Computing Science, Alberta Machine Intelligence Institute (Amii) University of Alberta, Canada(计算科学系,阿尔伯塔机器智能研究所(Amii),阿尔伯塔大学,加拿大) Canada CIFAR AI Chair, Amii(加拿大 CIFAR 人工智能主席,Amii)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出多视角思考(MPT)框架,通过鼓励多视角推理减少社会偏见,实验表明其在降低偏见的同时保持了核心推理能力。

Comments 15 pages

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pp. 27895-27909, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32025 2026-07-01 cs.CL 新提交 87%

Generative Skill Composition for LLM Agents

面向LLM智能体的生成式技能组合

Xinyu Zhao, Zhen Tan, Vaishnav Tadiparthi, Nakul Agarwal, Kwonjoon Lee, Ehsan Moradi Pari, Hossein Nourkhiz Mahjoub, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Arizona State University(亚利桑那州立大学) Honda Research Institute USA(本田美国研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出SkillComposer方法,将技能组合形式化为任务条件技能序列预测,通过约束自回归解码器联合决定技能子集、数量和顺序,在真实技能库上训练并验证其提升下游任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11599 2026-07-01 cs.LG 版本更新 87%

Targeted Tests for LLM Reasoning: An Audit-Constrained Protocol

面向LLM推理的定向测试:一种受审计约束的协议

Hongmin Li

机构 * School of Life Science and Technology, Institute of Science Tokyo(生命科学与技术学院,科学东京研究所) Department of Computational Biology and Medical Sciences, Graduate School of Frontier Sciences(计算生物学与医学科学系,前沿科学研究生院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出一种受审计约束的协议,用于评估LLM推理能力,通过组件自适应提示采样与均匀采样对比,验证了在受控环境下研究定向提示变化的有效性。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30649 2026-07-01 cs.CY 新提交 87%

Thinking Out Loud: Real-Time Deception Monitoring in Asymmetric LLM Negotiations

大声思考:非对称LLM谈判中的实时欺骗监控

Nolan Coffey, Faithful Odoi, Makenzie Johnson, Nasir U. Eisty

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出轻量级实时思维链监控器,在二手车销售场景中检测卖家隐藏缺陷的欺骗行为,实验表明监控能提高买家退出率但存在智能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32029 2026-07-01 cs.CL cs.AI 新提交 85%

When LLMs Read Tables Carelessly: Measuring and Reducing Data Referencing Errors

当LLM粗心阅读表格时:测量并减少数据引用错误

Yuqing Yang, Qi Zhu, Zhen Han, Boran Han, Zhengyuan Shen, Shuai Wang, Vassilis N. Ioannidis, Huzefa Rangwala

机构 * University of Southern California(南加州大学) AWS AI Labs(AWS AI实验室)

专题命中 推理与问题求解 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究系统评估了大型语言模型在表格任务中的数据引用错误,并提出基于批评模型的过滤与拒绝采样方法,将答案准确率提升高达12.0%。

Comments ACL 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31725 2026-07-01 cs.SE 新提交 85%

Do Machines Struggle Where Humans Do? LLM and Human Comprehension of Obfuscated Code

机器会在人类感到困难的地方也遇到困难吗?大语言模型与人类对混淆代码的理解

Jack Le, Anh H. N. Nguyen, Tien N. Nguyen

专题命中 推理与问题求解 :LLM(title,abstract_cn);large language model(abstract);language model(abstract)

AI总结 基于人类对混淆代码理解的研究,评估大语言模型是否共享人类在混淆代码下的失败模式,发现推理调优模型与人类困难模式显著对齐,而指令调优模型相关性接近零。

Comments 13 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29672 2026-07-01 cs.CL 版本更新 84%

How LLMs See Creativity: Zero-Shot Scoring of Visual Creativity with Interpretable Reasoning

LLM如何看待创造力:具有可解释推理的视觉创造力零样本评分

William Orwig, Roger E. Beaty

机构 * Harvard University(哈佛大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究多模态大模型能否零样本评估视觉创造力,并分析其推理过程的可解释性。实验表明模型评分与人类高度一致,但推理并未提升评分准确性。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏