arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2611 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2611 篇

2606.08194 2026-06-09 cs.CL cs.AI 新提交 86%

GlobeAudio: A Multilingual Multicultural Benchmark for Naturalistic Evaluation of Large Audio-Language Models

GlobeAudio:用于大型音频-语言模型自然主义评估的多语言多文化基准

Ryner Tan, Wenxuan Zhang

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出GlobeAudio基准,包含5637道多语言多选题,评估大型音频-语言模型在自然音频条件下的听觉推理和文化理解能力,发现开源模型和低资源语言存在显著性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18086 2026-07-21 cs.AI 新提交 86%

Judge-dependent safety gains and model-specific helpfulness costs of evidence-sufficiency prompting in clinical LLMs

临床大语言模型中证据充分性提示的依赖判断的安全增益和特定模型的有用性成本

Koyar Afrasyab

专题命中 评测与基准 :prompting(title);LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 研究临床大语言模型中证据充分性提示的安全增益及有用性成本,通过在公共数据基准中让四个模型用标准提示和包装器回答问题,发现安全增益有方向和幅度差异且依赖评判者,同时存在模型特定的有用性成本。

Comments https://github.com/KAVentures/clinical-evidence-sufficiency-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13454 2026-08-14 cs.HC 新提交 86%

Before You Say It: Anticipating Verbal Behavior from Longitudinal Everyday Conversations with LLMs

在你开口前:基于与大语言模型(LLM)的日常纵向对话预测言语行为

Yasith Samaradivakara, Valdemar Danry, Paul Liang, Pattie Maes

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 本研究提出基于LLM的预测性行为建模方法,通过14名参与者超1000小时的纵向对话数据集,证实可预测特定用户言语行为,为构建个性化AI系统提供新方向。

Journal ref The 39th Annual ACM Symposium on User Interface Software and Technology, UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11033 2026-08-12 cs.MA 新提交 86%

Who Are You Explaining To? A Multi-Agent System for Audience-Aware XAI Narratives

你在向谁解释?面向受众感知的XAI叙事多智能体系统

Francesco Musicco, Danilo Danese, Giuseppe Fasano, Angela Lombardi, Alberto Carlo Maria Mancino, Tommaso Di Noia

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对现有XAI叙事无法适配不同受众的问题,提出XstrAI多智能体框架,结合三类LLM智能体与修正循环,在糖尿病、中风风险预测任务中,其叙事适配性与保真度优于多数基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08277 2026-08-11 cs.NI 新提交 86%

WirelessOpsAgent: A Benchmark and Agent Design for Action Assurance in Wireless Networks

WirelessOpsAgent:无线网络行动保障的基准测试与智能体设计

Zijian Lu, Yiping Zuo, Hao Xu, Weicong Chen, Xin He, Jiajia Guo, Shi Jin

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对现有无线网络运维LLM智能体基准未测试执行阶段支持检查的问题,本文提出WirelessOptBench基准与WirelessOpsAgent智能体,使后者在600片段评估中精确行动准确率达0.983,不安全执行率大幅下降。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04120 2026-08-06 cs.HC 新提交 86%

Echoes in the Sky: Computational Thematic Analysis of Online Public Discourse on Bluesky Across Trump's Reelection

空中回响:特朗普连任期间Bluesky平台线上公共话语的计算主题分析

Qile Wang, Ali Salloum, Carolina Coimbra Vieira, Benjamin E. Bagozzi, Mikko Kivelä, Kenneth E. Barner, Matthew Louis Mauriello

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本研究对特朗普连任期间Bluesky平台上的3850万条相关帖子进行分析,采用LLM辅助聚类结合人工验证识别主题,揭示话语与行政命令的主题分布及情绪变化。

Comments Accepted at ASONAM 2026, to appear in the Springer proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01592 2026-08-04 cs.SE 新提交 86%

How Well Do LLMs Generate Taxonomies in the SE Domain? A Multi-perspective Evaluation Framework

大型语言模型在软件工程领域生成分类体系的表现如何?一个多视角评估框架

Sota Nakashima, Yuta Ishimoto, Masanari Kondo, Tao Xiao, Yasutaka Kamei

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出首个SE领域自动化分类体系生成的多视角评估框架,对比TnT-LLM与CLIMB两种方法及5种LLM,揭示二者在质量、效率上的权衡,为SE领域应用该技术提供了可操作见解。

Comments 13 pages, Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026), Research Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25907 2026-07-29 cs.LG cs.AI cs.CL 新提交 86%

Minimizing Targeted Activations: Input-Only Suppression of Evaluation-Awareness Latents in Large Language Models

最小化目标激活:大语言模型中仅输入的评估感知潜在因素抑制

Deepanshu Mody, Samarth Agarwal, Utkarsh Mittal, Dipesh Mahato

机构 * Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型中仅通过输入优化提示来抑制“评估感知”潜在因素,采用特定方法在多种目标结构下对Llama模型进行实验,发现潜在因素可抑制,但激活可读性与行为可控性不同,还解决了相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25447 2026-07-29 cs.MA 新提交 86%

CoRenew: A large language model agent-based policy simulation platform for multifamily residential redevelopment

CoRenew:一个基于大语言模型智能体的多户住宅重建政策模拟平台

Yudi Zhang, Yuming Lin, Li Tian, Yu Wang, Jianghao Yu

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

AI总结 多户住宅重建政策设计面临集体行动难题,CoRenew平台基于大语言模型智能体,整合地理人口数据,能模拟多利益相关者谈判,评估政策组合效果,支持多种输入与可视化导出,经案例验证,可用于不同背景政策评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15555 2026-07-20 cs.IR 新提交 86%

LLMs Encode Relevance as a Layer-Wise Cross-Lingual Signal

语言模型将相关性编码为分层跨语言信号

Pietro Bernardelle, Samaneh Mohtadi, Stefano Civelli, Joel Mackenzie, Gianluca Demartini

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型中查询与文档相关性是否可线性解码,通过引导中等规模模型、提取激活并训练线性探针,发现相关性是深度依赖信号,多语言实验有部分跨语言可移植性,为基于LLM的相关性评估提供表征视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07619 2026-07-09 cs.SE 新提交 86%

Rethinking Code Performance Benchmarks for LLMs

重新思考大语言模型的代码性能基准测试

Nhat Minh Le, Yisen Xu, Zhijie Wang, Tse-Hsun, Chen

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究重新审视大语言模型代码性能基准测试,发现现有测试存在局限。提出基于LLM的多智能体框架生成性能导向测试,能更好暴露运行时差异,在原始测试无显著差异的任务中,该框架生成的测试有显著改进,优于当前最优技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05916 2026-07-08 cs.CR 新提交 86%

Beyond the Syntax: Do Security Experts Trust LLMs for NIDS Rule Engineering?

超越语法:安全专家是否信任大语言模型进行网络入侵检测系统规则工程?

Lorenzo di Filippo, Enkeleda Bardhi, Andrea Agiollo, Alessandro Palma, Silvia Bonomi, Fernando Kuipers

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究网络威胁下NIDS规则工程瓶颈,通过用户研究评估基于LLM的规则生成框架,揭示语法 - 语义悖论,从业者对其自主能力存疑,且大规模模型生成规则有效,小模型大多无效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01953 2026-07-03 cs.SE 新提交 86%

Underspecification does not imply Incoherence: The Risks of Semantic Collapse in Coding Models

欠指定并不意味着不一致:编码模型中语义坍缩的风险

Cedric Richter, Mike Papadakis

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究发现LLM在任务描述欠指定时,常坍缩到单一错误解释,生成一致但行为错位的代码,称为有害语义坍缩,影响多个基准测试。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00596 2026-07-02 cs.CV 新提交 86%

Semantic-Guided Reading Order Reconstruction in Historical Armenian Newspapers with LLMs

基于语义引导的LLM历史亚美尼亚报纸阅读顺序重建

Chahan Vidal-Gorène, Nadi Tomeh, Victoria Khurshudyan

机构 * École nationale des chartes-PSL(法国国立文献学院-巴黎文理研究大学) Inalco(法国国立东方语言文化学院) Calfa

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 针对历史亚美尼亚报纸复杂版面和低资源问题,提出混合方法结合语义区域检测与生成式LLM,排序错误率较几何基线降低76%。

Comments International Conference on Pattern Recognition, 2026, Lyon, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19501 2026-07-01 cs.AI cs.CL cs.LG q-fin.RM 新提交 86%

DeXposure-Claw: An Agentic System for DeFi Risk Supervision

DeXposure-Claw: 一个用于DeFi风险监管的智能体系统

Aijie Shu, Bowei Chen, Wenbin Wu, Cathy Yi-Hsuan Chen, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学) University of Glasgow(格拉斯哥大学) University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对DeFi监管中LLM智能体易误报的问题,提出DeXposure-Claw系统,通过图时间序列基础模型预测风险网络,结合确定性监控和置信度门控生成可审计监管票据,并构建六轴评估基准DeXposure-Bench,实验验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18648 2026-06-24 physics.comp-ph 新提交 86%

Deep Research in Physical Sciences: A Multi-Agent Framework and Comprehensive Benchmark

物理科学中的深度研究:多智能体框架与综合基准

Yigeng Jiang, Tengchao Yang, Taoyong Cui, Jiaxing Wan, Yuan Wang, Weida Wang, Zhiyu Liu, Chuyi Peng, Binzhao Luo, Maoli Gao, Huaihai Huang, Yuqianer Zeng, Ziyang Zheng, Dongchen Huang, Chao Chen, Zichao Liu, Weiping Shen, Shuchen Pu, Siyu Zhou, Runmin Ma, Yusong Hu, Fei Chao, Bo Zhang, Xiawu Zheng, Zifu Wang, Lei Bai, Yunqi Cai, Shufei Zhang

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出PhySciBench基准评估LLM在物理科学中的深度研究能力,并开发DelveAgent多智能体框架,通过自适应规划、双粒度记忆和分层反思机制提升准确率并降低推理成本。

Comments v3: fix error and add data, codes publicly link on Abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23667 2026-06-23 cs.DB 新提交 86%

The Table Says Otherwise: Testing LLMs with Counterfactual Relational Data

表格另有说法:用反事实关系数据测试大语言模型

Xinzhi Wang, Chunwei Liu

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出ContraTable基准,通过配对原始与反事实数据库测试LLM是否基于表格回答,发现模型在复杂推理时易依赖先验知识,强调评估应关注对提供数据的忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22783 2026-06-23 cs.IR 新提交 86%

Breaking the Evaluation Paradox: Evaluating High-Entropy Search with Computationally Irreducible Constraints

打破评估悖论:用计算不可约约束评估高熵搜索

Juntao Wu, Wei Wen, Xianting Huang, Shuai Pang, Ruizhi Qiao, Xing Sun, Ke Wang

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对LLM穷举搜索评估中因人类无法创建完整标注导致的悖论,提出VERITAS框架,通过计算不可约约束构造可验证的稀疏答案搜索任务,实现自动生成完美标注测试用例并精确控制难度。

Comments 25 pages, 5 figures, Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22247 2026-06-23 cs.SE 新提交 86%

Natural Language-Focused Software Engineering via Code-Documentation Equivalence

面向自然语言的软件工程:基于代码-文档等价性

Aryaz Eghbali, Zhongxin Liu, Michael Pradel

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出文档-代码等价性概念,通过自动生成等价文档的方法(Documentary)提升代码理解与编辑任务中LLM的准确性,实验显示准确率提升12.8-24.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20401 2026-06-19 eess.SY cs.SY 新提交 86%

PowerAgentBench-Dyn: A Benchmark for Agentic AI in Power System Dynamic Studies

PowerAgentBench-Dyn:电力系统动态研究中智能体AI的基准测试

Qian Zhang, Andrea Pomarico, Costas Mylonas, Magda Foti, Alberto Berizzi, Le Xie

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出PowerAgentBench-Dyn基准,用于评估基于LLM的智能体在电力系统动态分析任务中的能力,涵盖模型质量审查和安全风险筛选两个任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20243 2026-06-19 cs.SE cs.MA 新提交 86%

Phoenix: Safe GitHub Issue Resolution via Multi-Agent LLMs

Phoenix: 通过多智能体LLM实现安全的GitHub问题解决

Kipngeno Koech, Muhammad Adam, Baimam Boukar Jean Jacques, Joao Barros

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 提出多智能体LLM系统Phoenix,通过六个专业智能体和七层安全控制,在SWE-bench Lite子集上达到75%的解决率,并在真实问题中保持100%正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19338 2026-06-18 cs.CV 新提交 86%

Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games

超越当前观测:评估多模态大语言模型在可控非马尔可夫博弈中的表现

Shengyuan Ding, Xilin Wei, Xinyu Fang, Haodong Duan, Dahua Lin, Jiaqi Wang, Yuhang Zang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :large language model(title);language model(title);foundation model(abstract)

AI总结 提出RNG-Bench基准套件,通过配对记忆和3D迷宫两个博弈,评估多模态大模型在非马尔可夫环境中重建历史观测并据此行动的能力,发现主要错误源于遗忘而非决策,微调可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18789 2026-06-18 eess.SY cs.SY 新提交 86%

PowerAgentBench-SS: A Benchmark for Agentic AI in Power System Steady-State Studies

PowerAgentBench-SS:电力系统稳态研究中智能体AI的基准测试

Costas Mylonas, Magda Foti, Andrea Pomarico, Matheus Duarte, Qian Zhang, Emmanouel Varvarigos

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出PowerAgentBench-SS基准框架,用于评估LLM智能体在电力系统稳态研究中执行工程工作流的能力,通过工具API、验证预算和风险敏感指标区分智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18285 2026-06-18 cs.SI cs.CY 新提交 86%

RELIANCE: Curating and Evaluating Reproductive Health Information on Social Media

RELIANCE: 策展与评估社交媒体上的生殖健康信息

Vaibhav Balloli, Laura Peyton Ellis, Vishala Mishra, Alice Chi, Alex Peahl, Elizabeth Bondi-Kelly

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对TikTok上孕期和产后健康信息,构建专家标注数据集RELIANCE,评估LLM事实核查能力,发现近60%信息准确,但整体与具体声明评估存在15%差距。

Comments Accepted at Datasets and Benchmarks Track, ACM Knowledge Discovery and Data Mining (KDD) 2026. Project page: https://realize-lab.github.io/RELIANCE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15809 2026-06-16 cs.CR 新提交 86%

AttackonCTF: Defending Hardware Security Competition Benchmarks in the Age of LLMs

AttackonCTF: 在LLM时代捍卫硬件安全竞赛基准

Mohamadreza Rostami, Nikhilesh Singh, Stephen Muttathil, Lichao Wu, Chen Chen, Huimin Li, Jeyavijayan Rajendran, Ahmad-Reza Sadeghi

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 针对LLM利用语法比较破解硬件安全竞赛基准的问题,提出首个面向LLM的语义保持混淆框架,将检测准确率降低78.6%,恢复基准可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13684 2026-06-15 cs.CY cs.AI cs.CL cs.LG 新提交 86%

Cross-Dataset Bloom Question Classification: Supervised Models and Prompted LLMs

跨数据集布鲁姆问题分类:监督模型与提示式大语言模型

Abdolali Faraji, Mohammadreza Molavi, Zohreh Rasoulkhani, Mohammadreza Tavakoli, Gábor Kismihók

机构 * Leibniz Information Centre for Science and Technology(莱比锡信息科学与技术研究中心) University of Genoa(热那亚大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 评估监督ML/DL模型和LLM在跨数据集布鲁姆分类中的泛化能力,发现LLM更稳定,并基于最佳提示策略开发了轻量级UI。

Comments Accepted at AIED 2026. Abdolali Faraji and Mohammadreza Molavi contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12407 2026-06-11 cs.CV 新提交 86%

How Seemingly Inconsequential Design Choices Dictate Performance of LLMs in Pathology

看似无关紧要的设计选择如何决定病理学中LLM的性能

Kian R. Weihrauch, Thomas A. Buckley, William Lotter, Arjun K. Manrai

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard Medical School(哈佛医学院) Dana-Farber Cancer Institute(丹娜-法伯癌症研究所)

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract)

AI总结 通过系统因子分析发现,调整补丁大小、放大倍数等输入配置可使通用大语言模型在病理切片任务上性能大幅提升,缩小与专用模型的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10880 2026-06-10 cs.SE 新提交 86%

Writing Better Software Explanations: A Guideline-Based Approach

编写更好的软件解释:一种基于指南的方法

Martin Obaidi, Jean-Carl Kremser, Hannah Deters, Jakob Droste, Marc Herrmann, Kurt Schneider

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出一种结合LLM生成与质量指南的软件解释编写工具,通过生成、检查、迭代修订流程提升效率和质量,实验表明工具支持的解释满意度显著高于纯人工编写。

Comments This paper has been accepted at the research track of the 34th IEEE International Requirements Engineering Conference (RE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13326 2026-08-14 cs.CL 新提交 85%

Beyond Local Accuracy: A Protocol-Level Identifiability Audit for Controlled LLM Reasoning Evaluation

超越局部准确率:面向受控大语言模型推理评估的协议级可识别性审计

Junhao Luo, Ning Huang, Ziqi Sha, Wenxuan Tang, Wei Deng

机构 * School of Statistics and Data Science, Southwestern University of Finance and Economics(西南财经大学统计与数据科学学院)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究提出协议级可识别性审计方法,无需调用模型即可验证LLM评估协议的有效性,发现基础准确率与选择性响应保真度存在显著差异,还确定了冻结策略类的最小识别支持。

Comments 15 pages, 9 figures. Ning Huang, Ziqi Sha, and Wenxuan Tang contributed equally as second authors. Wei Deng is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07517 2026-08-11 cs.HC cs.CL stat.AP 新提交 85%

The Judge Knows When It Knows: Calibrated Abstention for LLM-Based A/B-Test Prediction

法官知道自己何时知晓:基于大语言模型的A/B测试预测的校准弃权(不执行)

Tyler Dooskin, Squoosh Technical Staff

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究探究多模态LLM能否仅通过网页截图预测A/B测试结果,发现Gemini 3 Flash法官表现不佳,提出投票边际关卡隔离置信判断可提升性能,还在人类中重现了共识与真实结果脱节的现象,并发布了相关研究资源。

Comments 15 pages. Pre-registered experimental program with a public, tiered claims ledger; includes powered negative results, a label-validity audit, a cross-judge shared-prior measurement (n_eff ~ 2 of 16 votes), and a first-party 15-expert human baseline. Pre-registrations, statistical harness, human responses, and the full experiment ledger are released

详情

展开后加载摘要…

URL PDF HTML 收藏