arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-31 至 2026-07-31 共收录 41 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 41 篇

2607.27512 2026-07-31 cs.CL cs.MA cs.SI 新提交 92%

Belief Coevolution in a Social Network of Generalist and Specialist Large Language Models

通用型与专家型大语言模型组成的社交网络中的信念协同演化

Germans Savcisens, Samantha Dies, Courtney Maynard, Tina Eliassi-Rad

机构 * Khoury College of Computer Sciences, Northeastern University(东北大学库尔计算机科学学院) Network Science Institute, Northeastern University(东北大学网络科学研究所) Santa Fe Institute(圣塔菲研究所)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 该研究提出CoevolveSim框架,模拟通用型与专家型LLM组成的社交网络中信念扩散,发现专家型LLM可显著提升共识转变幅度,模拟多智能体LLM系统信念扩散需多样化底层LLM。

Comments 33 pages (14 pages of main text), 7 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28384 2026-07-31 cs.AI 新提交 91%

When Specifications Conflict: A Symmetry-Based Framework for Measuring LLM Preferences

当规范冲突时:一种基于对称性的测量大语言模型(LLM)偏好的框架

Tairan Wang, Liang Zhou, Zikang Zhan, Pingchuan Yan

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出基于对称性的框架,通过含550个实例的数学基准等评估,发现LLM在冲突规范下有系统性偏好,排序为形式类>纯自然语言>输入-输出示例,可跨领域应用。

Comments Submitted to AAAI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28538 2026-07-31 cs.CV cs.LG 新提交 90%

ScaFE: Data-Efficient Scar Classification with LLM-Generated Clinical Feature Programs

ScaFE:基于大语言模型生成的临床特征程序实现数据高效的瘢痕分类

Ruman Wang, Hangting Ye

专题命中 领域大模型 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 ScaFE将LLM临床知识转化为本地可执行的特征程序,结合轻量级随机森林,在瘢痕分类任务中实现数据高效、跨站点的高性能,且决策可审计,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28019 2026-07-31 cs.LG 新提交 90%

Building a User Foundation Model for the Open Web

面向开放网络的用户基础模型构建

Solal Vernier, Ivan Can Arisoy, Merwan Barlier, Blaž Škrlj

机构 * Teads(泰兹)

专题命中 领域大模型 :LLM(summary_cn,abstract);foundation model(title,abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对开放网络RTB场景下用户身份碎片化问题,构建基于自监督学习的用户基础模型,经LLM优化预训练后,在竞价胜率、CTR等生产任务中取得显著性能提升。

Comments RecSys'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28098 2026-07-31 cs.AI cs.CL 新提交 90%

SciDataSailor: Deep Scientific Data Exploring

SciDataSailor:深度科学数据探索

Jiyong Rao, Yicheng Qiu, Chi Zhang, Chunfeng Song, Runkai Zhao

专题命中 领域大模型 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对科学数据仓库交互难题,提出SciDataSailor框架,以带特定机制的MCTS实现轨迹合成,构建了微调模型与含千余任务的评估基准,推动LLM智能体的科学数据探索能力。

Comments 63 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27490 2026-07-31 cs.AI 新提交 89%

MedLLM: An Open Medical Language Model at the Sub-Billion Scale

MedLLM:亚十亿参数规模的开源医疗语言模型

Maxx Richard Rahman, Asim Ahmed, Mihan Mohagheghzadeh, Wolfgang Maass

专题命中 领域大模型 :language model(title,abstract);SFT(abstract,abstract_cn);pretraining(abstract);preference optimization(abstract)

AI总结 本研究提出亚十亿参数规模的开源医疗语言模型MedLLM,经三阶段流程训练,在医疗基准测试中展现出亚十亿规模特有的能力分化现象,为医疗小模型研究提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28119 2026-07-31 cs.CL cs.SI 新提交 88%

Challenges in annotations by humans and LLMs: A case study of evaluative language

人类与大语言模型(LLM)的标注挑战:评价性语言的案例研究

Mirela Imamovic, Aenne Cecilia Kristine Knierim, Khushi Pitroda, Ekaterina Lapshinova-Koltunski

专题命中 领域大模型 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文以TED演讲语料库为对象,对比受训语言学者、专业学者与LLM在评价性语言标注上的表现,发现LLM经微调后F1值达0.77,表现优于专业学者,可辅助复杂标注任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27944 2026-07-31 cs.IR cs.AI 新提交 87%

Interpretable Representation via LLM-Driven Generative Disentanglement for Local-Life Service Recommendation

面向本地生活服务推荐的、基于大语言模型驱动的生成式解缠的可解释表示

Long Zhang, Hao Jiang, Sheng Yu, Fei Pan, Peng Jiang, Kun Gai

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有语义ID生成框架的语义纠缠与黑箱问题,提出LGRID模型,通过生成式解缠范式提升本地生活服务推荐的性能与可解释性,在公开数据集上取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27558 2026-07-31 cs.CV cs.AI 新提交 86%

Drawing-Recode: Annotation Grounding for Parametric CAD Code Generation from Raster 2D CAD Drawings

Drawing-Recode:基于栅格2D CAD图纸的参数化CAD代码生成的标注定位方法

Mingi Kim, Yongjun Kim, Hyungki Kim

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 Drawing-Recode是一种从栅格2D CAD图纸生成参数化CAD代码的框架,通过图像编码器、文本识别模块、交叉注意力与AGL实现标注定位,性能优于基线且对工业扫描图纸鲁棒,可助力制造自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27384 2026-07-31 cs.CL cs.AI 新提交 86%

Same Facts, Different Diagnosis: Measuring and Mitigating Narrative Anchoring in Clinical Language Models

相同事实,不同诊断:临床语言模型中叙事锚定的测量与缓解

Prabhjot Singh, Pritam Deka, Vijay Chennareddy

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Queen’s University Belfast(贝尔法斯特女王大学) Middlesex University London(伦敦密德萨斯大学)

专题命中 领域大模型 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对临床语言模型的叙事锚定偏差,构建含1000个USMLE案例的基准,提出NarrativeShield三智能体流水线,可大幅降低叙事锚定差距并减少不稳定决策,同时发布数据集供相关研究使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27262 2026-07-31 quant-ph cs.AI cs.ET cs.LG 新提交 86%

LLM-Guided Initialization for Accelerated Hybrid Quantum-Classical Medical Image Classification

大语言模型引导的初始化用于加速混合量子-经典医学图像分类

Riza Alaudin Syah, Irwan Alnarus Kautsar, Haza Nuzly Bin Abdull Hamed

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出大语言模型引导的AdaInit初始化方法,结合GPU加速量子模拟,在乳腺X线摄影分类任务中,相比随机初始化大幅提升梯度方差与收敛速度,保持相同分类准确率,验证了方法的有效性与兼容性。

Comments Presented at IAICT 2026, Bali, Indonesia

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28218 2026-07-31 stat.AP 新提交 86%

Bridging Probabilistic LLMs and Deterministic Statistical Validation: The PROVE Multi-Agent Framework for Clinical Trial Reporting

连接概率型大语言模型与确定性统计验证:用于临床试验报告的PROVE多智能体框架

Zhaohua Lu, Cheng Zheng, Yuanyuan Han

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出PROVE多智能体框架,结合LLM与程序化验证器,在临床试验报告TFL验证中,LLM辅助语义匹配可显著提升差异检测的召回率与F1值,兼顾解读灵活性与数值准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27789 2026-07-31 cs.IR 新提交 86%

From Understanding to Action: Feedback-Grounded Policy Discovery for Generative Recommendation

从理解到行动:面向生成式推荐的反馈驱动策略发现

Zhi Chen, Minmao Wang, Xingchen Liu, Haoqiang Liang, Huihuang Lin, Likang Wu, Hongke Zhao, Yulong Wang, Shijie Yi, Fei Pan, Peng Jiang

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对生成式推荐的“理解-行动差距”,提出反馈驱动智能体框架,经蒸馏迁移至轻量模型实现无LLM在线推理,在基准测试与在线A/B测试中均取得推荐效果提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28050 2026-07-31 cs.AI 新提交 85%

IndustryForge-27B: A Domain-Enhanced Multimodal Foundation Model for Industrial CAD

IndustryForge-27B:面向工业CAD的领域增强多模态基础模型

Nianchen Deng, Jiaxin Ai, Tao Hu, Shu Zou, Yurui Dong, Siqi Li, Xinyu Cai, Xuemeng Yang, Licheng Wen, Hongbin Zhou, Hairong Zhang, Pinlong Cai, Botian Shi

专题命中 领域大模型 :foundation model(title,abstract);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 该研究构建基于Qwen3.5-VL-27B的IndustryForge-27B多模态基础模型,整合6个工业CAD子语料库训练,在CAD基准测试中性能远超基础模型与GPT-5.4,可作为工业智能体的通用基础。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27845 2026-07-31 cs.CL cs.AI 新提交 85%

AutoSupervision: Closing the Feedback Loop in Scientific Workflows with Grounded Revision Verification

AutoSupervision:通过基于事实的修订验证闭合科学工作流中的反馈循环

Haobo Li, Eunseo Jung, Wenxiao Zhao, Feng Liu, Jiong Wang, Kaiyi Xu, Zijie Guo, Zixin Chen, Ben Fei, Fenghua Ling, Lei Bai

机构 * Shanghai AI Laboratory(上海人工智能实验室) University of California, Los Angeles(加州大学洛杉矶分校) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出AutoSupervision,利用《自然·通讯》5.6万篇文章的评审记录构建数据集,发现LLM刻画评审关切表现较好但证据验证是瓶颈,为AI辅助科学工作流提供反馈循环闭合方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28229 2026-07-31 cs.CL cs.AI cs.IR cs.LG 新提交 83%

EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents

EMBL AI Librarian:面向AI智能体的生命科学知识层

Luigi Sigillo, Matteo Silvestri, Francesco Tabaro, Rajat Bhatnagar, Syed Irtaza Mubashar, Matt Jeffryes, Daljit Nijjer, Vittorio Perera, Ola Spjuth, Julio Saez-Rodriguez, Melissa Harrison, Fabio Petroni

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究推出EMBL AI Librarian,为AI智能体升级Europe PMC接口,通过LLM统筹检索,在多基准任务中提升性能,代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27856 2026-07-31 cs.CV 新提交 83%

Benchmarking Foundation and Large Language Models for Few-Shot Medical Image Segmentation

基准测试用于小样本医学图像分割的基础模型与大语言模型

Jinghong Liu, Yuchuan Deng, Fanping Liu, Meng Huang, Xirong Li

专题命中 领域大模型 :large language model(title);language model(title)

AI总结 该研究推出统一基准FAME,涵盖四类模型,含14958个样本,评估得出小样本分割的关键规律,助力开发更有效的小样本医学分割方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28466 2026-07-31 cs.AI 新提交 83%

A report-grounded vision-language foundation model for colonoscopy from 280000 routine reports

基于28万份常规报告的肠镜报告驱动的视觉-语言基础模型

Jia Yu, Yan Zhu, Yili He, Zilong Wang, Xinyang Jiang, Peiyao Fu, Ruijie Yang, Tianyi Chen, Siyuan Li, Zhihua Wang, Fei Wu, Quanlin Li, Xian Yang, Pinghong Zhou, Shuo Wang

机构 * Digital Medical Research Center, School of Basic Medical Sciences, Fudan University(复旦大学基础医学院数字医学研究中心) Shanghai Collaborative Innovation Center of Endoscopy(上海内镜诊疗协同创新中心) Zhejiang University(浙江大学) Shanghai Institute for Advanced Study of Zhejiang University(浙江大学上海高等研究院) Alliance Manchester Business School, The University of Manchester(曼彻斯特大学联盟曼彻斯特商学院) Data Science Institute, Imperial College London(伦敦帝国理工学院数据科学研究所) Microsoft Research Asia(微软亚洲研究院)

专题命中 领域大模型 :foundation model(title,abstract);language model(abstract);分类 cs.AI

AI总结 该研究开发了肠镜视觉-语言基础模型EndoCLIP,利用28万份常规肠镜记录恢复的图像-文本对训练,在多项任务中优于通用模型,良恶性分类性能接近专家,可实现临床目标的语言指定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27966 2026-07-31 cs.LG 新提交 83%

What Makes Graph Unified? Principles and Generative Sliding-Window Transformer for Graph Foundation Models

什么使图统一?面向图基础模型的生成式滑动窗口Transformer

Dongxiao He, Siqi Liu, Jitao Zhao, Yawen Li, Yi Wang, Di Jin

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.LG

AI总结 本研究提炼出跨领域图特征统一的四项要求,提出基于拓扑感知滑动窗口特征编码与生成式重构的图基础模型SliGFM,以实现异质节点特征的有效统一与跨领域知识迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28027 2026-07-31 cs.MA cs.AI cs.CE 新提交 81%

VISA: A Structured Description Protocol for Agent-Based Simulation Models Towards Machine Reproducibility

VISA:面向智能体可复现性的智能体仿真模型结构化描述协议

Zhou He

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出VISA结构化描述协议,通过八个表格及可执行规则、LLM技能提升智能体模型可复现性,在三类平台的ABMs上验证了其有效性,将复现障碍转化为可处理的依赖项。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28200 2026-07-31 physics.app-ph cond-mat.mtrl-sci cs.AI 新提交 81%

Vibe-FDTR: An agent-oriented framework for reproducible frequency-domain thermoreflectance data analysis

Vibe-FDTR:一种面向智能体的可复现频域热反射数据分析框架

Fuwei Yang, Weiheng Li, Bai Song

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Vibe-FDTR是面向智能体的FDTR数据分析框架,结合领域代码包与智能体技能,在基准测试中表现优异,可降低计算成本与执行时间,助力低门槛可信热计量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28292 2026-07-31 cs.CL cs.AI cs.CE cs.LG 新提交 80%

CACHE-UK: A Stability-Aware Memory Editor for Sequentially Updated Quantized LLMs in Finance

CACHE-UK:面向金融领域顺序更新量化大语言模型的稳定性感知内存编辑器

Anubhav Lakra, Yue Feng

机构 * Indian Institute of Technology Madras(马德拉斯印度理工学院) University of Birmingham(伯明翰大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对动态金融环境中量化大语言模型的顺序内存编辑退化问题,提出CACHE-UK框架,将知识退化降低11%-17%,测试泛化率达28%,提升6个百分点。

Comments 10 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27682 2026-07-31 cs.IR 新提交 80%

Restoring Collaborative Signals in Semantic-ID Generative Recommendation via Personalized Natural Language

通过个性化自然语言恢复语义-ID生成式推荐中的协同信号

Changjiang Han, Qingyang Li, Yaqiang Zang, Jikun Kang, Pinghua Gong, Xue Liu, Bowei He

专题命中 领域大模型 :LLM(summary_cn,abstract)

AI总结 该研究针对基于LLM的生成式推荐模型中SID丢失协同信号导致准确率受限的问题,提出个性化自然语言引导的框架,通过添加分层协同线索恢复信号,提升推荐准确率。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27822 2026-07-31 nucl-th hep-ph 新提交 80%

CLVisc Agent for autonomous relativistic hydrodynamics studies

用于自主相对论流体动力学研究的CLVisc智能体

Qi Wang, Long-Gang Pang, Shi Pu, Xin-Nian Wang

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究开发了一种基于大语言模型的智能体,通过元技能自主完成相对论重离子碰撞的流体动力学模拟与分析,可应用于CLVisc代码,支持核物理研究的自动化工作流程。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27501 2026-07-31 cs.LG hep-ph 新提交 79%

A Lightweight Foundation Model for Collider Physics with Multi-Domain Adaptation

面向对撞机物理的轻量级基础模型:多领域适配

Liangyu Wu, Qibin Liu, Alexander Yue, Julia Gonski

机构 * Stanford University(斯坦福大学) SLAC National Accelerator Laboratory(SLAC国家加速器实验室)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.LG

AI总结 该研究提出轻量级基础模型NEXUS,以300万参数的全连接自编码器为架构,通过对撞机数据预训练实现多领域适配,在下游任务中提升准确率且计算复杂度低于同规模Transformer。

Comments 18 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25726 2026-07-31 cs.AI 版本更新 79%

Nudging Sustainable Choices through LLM-Generated Recommendation Explanations

通过大语言模型生成的推荐解释推动可持续选择

Haya Halimeh, Dietmar Jannach, Oliver Müller

机构 * Paderborn University(帕德博恩大学) University of Klagenfurt(克拉根福大学)

专题命中 领域大模型 :LLM(title,abstract);分类 cs.AI

AI总结 研究通过大语言模型生成推荐解释,探讨不同可持续性信息框架对用户选择和认知的影响。在速溶咖啡和酒店预订领域进行随机研究,发现框架构建或援引规范能增加可持续选择,虽认知与行为有差异,但为社会公益干预提供实践方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28498 2026-07-31 cs.IR cs.AI cs.CL 新提交 73%

TCA-SIR: Learning Target-Conditioned Abstractions for Scientific Inspiration Retrieval

TCA-SIR:学习面向目标的抽象表示用于科学灵感检索

Yuto Suzuki, Farnoush Banaei-Kashani

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 TCA-SIR将科学灵感检索重新定义为面向目标的抽象学习,在ResearchBench上较MOOSE-Chem提升HitRate@top4%超10个百分点,实现更优检索与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27955 2026-07-31 cs.DL cs.AI cs.CL cs.IR 新提交 73%

SciSchema.org: A Multidisciplinary Collection of Schemas for Structured Scientific Process Descriptions

SciSchema.org:用于结构化科学过程描述的多学科模式集合

Jennifer D'Souza, Sameer Sadruddin, Anisa Rula, Ana Bossler, Andrés Fullana, Enric Bas, Syed Ather, Defne Circi, Anlan Chen, L. Catherine Brinson, Alyssa Columbus, George Demetriou, Dongjun Jeong, Tarun Kumar, Frank Krüger, Sascha Genehr, Kai Budde-Sagert, Anamaria Leonescu, Francesco Lodola, Chiara Florindi, Gagana Balasubramanya Murthy, Samson Oluwapelumi Olagbile, Nazia Riasat, Yan Sha, Kevin Shen, Shaokai Yang

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SciSchema.org发布首个多学科科学过程模式集合,采用人在回路模式挖掘工作流构建,支持科学领域结构化标注等多项应用。

Comments 25 pages, 9 figures, Submitted for peer review to Nature Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27528 2026-07-31 cs.CR cs.AI cs.CL cs.SE 新提交 73%

ThreatForest: Multi-Agent Attack Tree Generation with Pluggable TTP Framework Mapping

ThreatForest:基于可插拔TTP框架映射的多智能体攻击树生成方法

Cristian Leo, Anton Dykyi, Danny Cortegaca, Daniel Begimher, Prakash Jha

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 ThreatForest是首个将代码仓库转化为带TTP映射攻击树及对应缓解措施的端到端多智能体系统,其嵌入编码器是TTP映射准确率的核心瓶颈,相关基准框架可用于同类系统测试。

Comments 20 pages, 12 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28347 2026-07-31 cs.CL cs.SI 新提交 70%

LLMs struggle to simulate human belief updates in controlled environments

大型语言模型(LLMs)难以在受控环境中模拟人类的信念更新

Sebastian Pohl, Harsh Mehta, Pranav Mambayil, Abdul Ghafoor, Franziska Lesigang, Yufang Hou, Christian Hilbe

机构 * IT:U, Interdisciplinary Transformation University Austria(奥地利跨学科转型大学(IT:U))

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究测试六个LLMs模拟人类信念更新的能力,发现Qwen3-32B和GPT-5-Mini仅在提供人类实际初始立场时能匹配人类后立场分布,所有模型存在系统性偏差,模拟仅在现实起始条件下可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏