arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 5898 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1404 篇

2510.08091 2026-06-23 cs.CL cs.AI cs.HC 版本更新 90%

Arguments that Alter Minds: LLM Rationales Sway Human (and LLM) Notions of Plausibility

改变思维的观点:LLM 理由影响人类(和 LLM)对合理性的看法

Shramay Palta, Peter Rankel, Sarah Wiegreffe, Rachel Rudinger

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究 LLM 生成的赞成/反对理由如何影响人类和 LLM 对常识基准答案的合理性判断,发现理由能显著改变判断,表明 LLM 可影响人类信念。

Comments ACL 2026 Camera-Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13899 2026-06-18 cs.CL cs.AI 版本更新 90%

Do We Still Need Humans in the Loop? Comparing Human and LLM Annotation in Active Learning for Hostility Detection

我们是否仍然需要人在回路中?比较主动学习中用于敌意检测的人类与LLM标注

Ahmad Dawar Hakimi, Lea Hirlimann, Isabelle Augenstein, Hinrich Schütze

机构 * Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心) Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究比较了LLM与人类在主动学习中的标注效果,发现LLM标注成本更低且性能更优,但主动学习在LLM标注下无优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22888 2026-06-16 cs.AI cs.CL 版本更新 90%

JE-IRT: A Geometric Lens on LLM Abilities through Joint Embedding Item Response Theory

JE-IRT: 通过联合嵌入项目反应理论审视LLM能力的几何视角

Louie Hong Yao, Nicholas Jarvis, Tiffany Zhan, Saptarshi Ghosh, Linfeng Liu, Tianyu Jiang

机构 * Independent Researcher(独立研究者) University of Cincinnati(辛辛那提大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出JE-IRT几何框架,将LLM和问题嵌入共享空间,通过方向编码语义、范数编码难度,揭示主题专长和分布外行为,支持新模型高效扩展,并发现与人类分类部分对齐的内部结构。

Comments 35 pages, 17 figures, 9 tables, accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08794 2026-06-12 cs.LG cs.CL 版本更新 90%

One Token to Fool LLM-as-a-Judge

一个令牌就能欺骗LLM裁判

Yulai Zhao, Haolin Liu, Dian Yu, Sunyuan Kung, Meijia Chen, Haitao Mi, Dong Yu

机构 * Princeton University(普林斯顿大学) University of Virginia(弗吉尼亚大学) Tencent AI Lab(腾讯人工智能实验室) Rutgers University(罗格斯大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 发现基于参考的生成式奖励模型易受奖励黑客攻击,表面输入(如非词符号或通用推理开头)能持续引发假阳性奖励,提出使用截断模型输出作为对抗性负例的数据增强策略,构建鲁棒的Master奖励模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24668 2026-06-10 cs.AI cs.LG 版本更新 90%

The Price of Agreement: Measuring LLM Sycophancy in Agentic Financial Applications

同意的代价:在代理金融应用中衡量LLM的谄媚行为

Zhenyu Zhao, Aparna Balagopalan, Adi Agrawal, Dilshoda Yergasheva, Waseem Alshikh, Daniel M. Bikel

机构 * Writer, Inc.(Writer公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 研究评估LLM在金融代理任务中的谄媚行为,发现模型对用户反驳仅表现低至中等性能下降,但偏好信息导致多数模型失败,并测试了输入过滤等恢复方法。

Comments Accepted to ICLR 2026 FinAI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24660 2026-06-09 cs.IR cs.AI cs.LG 版本更新 90%

How Many Tools Should an LLM Agent See? A Chance-Corrected Answer

LLM 智能体应看到多少工具?一种机会校正的答案

Vyzantinos Repantis, Ameya Gawde, Harshvardhan Singh, Joey Blackwell

机构 * II Meta Platforms(Meta平台)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对 LLM 智能体工具选择中候选列表长度优化问题,提出基于机会校正的 Bits-over-Random (BoR) 指标,并将其转化为强化学习奖励,实现每查询自适应深度选择,在保持覆盖率的同时显著减少展示工具数量并提升下游工具选择准确率。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27011 2026-06-08 cs.LG cs.AI 版本更新 90%

Automatic Causal Fairness Analysis with LLM-Generated Reporting

基于LLM生成报告的自适应因果公平性分析

Alessia Berarducci, Eric Rossetto, Alessandro Antonucci, Marco Zaffalon

机构 * Istituto Dalle Molle di Studi sull’Intelligenza Artificiale (IDSIA), USI-SUPSI(日内瓦人工智能研究所(IDSIA)、USI-SUPSI)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出FairMind原型,利用标准公平模型进行因果公平分析,通过反事实查询计算因果效应,并借助LLM零样本生成公平性报告,优于直接LLM分析。

Comments 23 pages, 6 figures, 3 tables, LaTeX; added missing proof for Proposition 3, typos corrected, updated example 1 to have positive values for the Sankey

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03156 2026-08-04 cs.SE cs.AI cs.HC 版本更新 90%

The Impact of LLM-Assistants on Software Developer Productivity: A Systematic Review and Mapping Study

大型语言模型助手对软件开发者生产力的影响:一项系统综述和映射研究

Amr Mohamed, Maram Assi, Mariam Guizani

机构 * Queen's University(女王大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过综述39项研究,探讨LLM助手对软件开发者生产力的影响,发现多数研究显示积极效益,但存在认知卸载和团队协作风险,研究指出需更全面的评估方法。

Comments 42 pages

Journal ref Mohamed, Amr, Maram Assi, and Mariam Guizani. "The impact of llm-assistants on software developer productivity: A systematic review and mapping study." ACM Transactions on Software Engineering and Methodology (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00476 2026-07-08 cs.AI 版本更新 90%

Doing What They Say, Not What They Reason: Locating the Faithfulness Gap in LLM Agents

做他们所说的,而不是他们所推理的:定位LLM智能体中的忠实性差距

Yufeng Wang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 通过将忠实性差距分解为推理-结论和结论-行动两个步骤,在可控的德克萨斯扑克模拟器中研究LLM智能体是否按照其陈述的推理行动。

Comments submitted to COLM social simulation with LLM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10904 2026-08-11 cs.CR 版本更新 90%

When the Defense Writes the Refusal: Auditing Keyword-Scored Evaluation of Inference-Time Defenses for Multimodal Large Language Models

多模态大语言模型推理时防御方法的比较分析

Bulat Nutfullin, Vladimir Evgrafov, Dmitry Namiot

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文比较评估了三种推理时防御方法及其组合在InternVL和Qwen-VL系列共8个模型上的效果,发现无单一防御在所有设置中占优,组合防御导致良性查询过度拒绝率达97-100%,而简单安全提示在保持实用性的同时带来适度安全提升。

Comments 15 pages, 3 figures. Conditionally accepted at DAMDID/RCDL 2026; revised after peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00918 2026-07-28 cs.CL cs.AI cs.LG 版本更新 90%

LIBMoE: A Library for comprehensive benchmarking Mixture of Experts in Large Language Models

LIBMoE:一种用于大规模语言模型混合专家全面基准测试的库

Nam V. Nguyen, Thong T. Doan, Luong Tran, Van Nguyen, Quang Pham

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LibMoE为大规模语言模型混合专家提供统一框架,通过全面分析路由动态、初始化影响及训练模式差异,推动MoE研究标准化与创新。

Comments 40 pages

Journal ref Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15936 2026-07-21 cs.CY cs.HC 版本更新 90%

Large Language Models in Architecture Studio: A Framework for Learning Outcomes

大型语言模型在建筑工作室中的应用:一种学习成果的学习框架

Juan David Salazar Rodriguez, Sam Conrad Joyce, Nachamma Sockalingam, Khoo Eng Tat, Julfendi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本研究探讨了大型语言模型在建筑工作室中的应用,旨在通过AI干预解决教学挑战并提升学习成果。

Comments This work has been accepted for publication in International Conference on Human-Computer Interaction HCII 2026 (pp. 93-110)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21001 2026-07-14 cs.GT 版本更新 90%

Do Large Language Model Voters Strategize? An Oracle-Based Benchmark for Manipulation under Voting Rules

大语言模型选民会策略投票吗?一个基于预言机的投票规则操纵基准测试

Seyed Pouyan Mousavi Davoudi, Alireza Amiri-Margavi, Amin Gholami Davodi, Hamidreza Hasani Balyani, Arshia Gharagozlou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出一个基于预言机的基准测试,通过枚举所有可行报告并计算真实结果,评估大语言模型选民能否发现并执行策略投票,覆盖多种投票规则和提示条件。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29245 2026-06-23 cs.CR cs.CL cs.LG 版本更新 90%

Implicit Identity Technologies for LLMs: Fingerprinting and Watermarking across Datasets, Models, and Generated Content

LLM的隐式身份技术:跨数据集、模型和生成内容的指纹识别与水印

Bing Liu, Shunping Wang, Yufan Zhu, Xinyi Yu, Jing Huang, Linkang Du, Hongbin Pei, Wei Luo

机构 * School of Cyber Science and Engineering, Xi’an Jiaotong University, Xi’an, China(西安交通大学计算机科学与工程学院) State Grid Henan Marketing Service Center, Henan, China(国网河南营销服务中心) Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院) School of Information Technology, Deakin University, Geelong, Australia(迪金大学信息技术学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文综述了LLM指纹识别和水印技术,提出隐式身份统一抽象,并基于生命周期分类法组织数据集、模型和生成内容的技术,建立评估框架。

Comments Accepted by IJCAI-ECAI 2026. 11 pages, 1 figure. Survey and taxonomy of LLM fingerprinting and watermarking for identity, provenance, generated-content attribution, and asset protection

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13341 2026-08-18 cs.LG stat.ML 版本更新 90%

Limits to scalable evaluation at the frontier: LLM as Judge won't beat twice the data

可扩展评估的极限:LLM作为裁判无法超越两倍数据

Florian E. Dorner, Vivian Y. Nastl, Moritz Hardt

机构 * Max Planck Institute for Intelligent Systems, Tübingen(马克斯·普朗克智能系统研究所,图宾根) Tübingen AI Center(图宾根人工智能中心) ETH Zürich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 本文研究了使用LLM作为裁判进行模型评估的局限性,发现当裁判准确性不足时,去偏方法无法显著减少所需的真实标签数量。

Comments ICLR 2025; 27 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26460 2026-08-17 cs.CL 版本更新 90%

Theory-Grounded Evaluation Exposes the Authorship Gap in LLM Personalization

基于理论的评估揭示了LLM个性化中的作者身份差距

Yash Ganpat Sawant

机构 * April 2026(2026年4月)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文通过理论指导的评估方法,揭示了LLM个性化中作者身份差距的问题,采用三种测量传统评估四种个性化方法,发现理论指导的指标能提供更准确的基准。

Comments Accepted at CTB Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04463 2026-08-14 cs.CL 版本更新 90%

The Evaluator Is Part of the Experiment: Measuring Open-Ended LLM Conformity

评估者是实验的一部分:测量开放式大语言模型(LLM)的一致性

Alicia Guerra, Yibo Hu

机构 * Illinois Institute of Technology(伊利诺伊理工大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 该研究提出实验方案测量开放式LLM一致性,发现错误同行输入会降低修订质量,评估者非中立,锚定校准必要,指出翻转率不足以完整衡量开放式一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11008 2026-08-13 cs.CL cs.CY 版本更新 90%

Templated or fully synthetic? Prompt construction as a confound in measuring LLM political stance beyond writing assistance

模板化还是完全合成?提示构造是测量LLM政治立场的混淆因素——超越写作辅助的视角

Ilias Chalkidis

机构 * The National Center for AI in Society (CAISA), University of Copenhagen(哥本哈根大学社会人工智能国家中心(CAISA))

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 该研究针对LLM政治立场检测中模板化提示的混淆问题,扩展IssueBench框架,提出用LLM生成的完全合成提示,验证其在立场测量中更具生态效度,可减少估计偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27204 2026-08-11 cs.CL cs.IR 版本更新 90%

GraphReview: Scientific Paper Evaluation via LLM-based Graph Evidence Expansion

GraphReview: 基于LLM的图消息传递的科学论文评估

Pujun Zheng, Wanying Ren, Jiacheng Yao, Guoxiu He, Star X. Zhao

机构 * School of Economics and Management, East China Normal University(东华师范大学经济管理学院) Institute of Big Data, Fudan University(复旦大学大数据研究院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出GraphReview框架,通过图消息传递整合论文内在质量、同期关联和历时关联,利用LLM生成节点先验和边比较证据,结合个性化PageRank进行质量排序、决策预测和审稿生成,在决策和排序指标上平均提升29.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03238 2026-08-10 cs.AI 版本更新 90%

"LLM Agent Performance" Is Not a Single Evaluation Target

基于LLM的智能体评估统一框架的必要性

Pengyu Zhu, Li Sun, Philip S. Yu, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对当前LLM智能体评估受系统提示、工具集和环境动态等混杂因素影响的问题,提出标准化统一评估框架以提升公平性和可复现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00152 2026-08-07 cs.CR cs.AI 版本更新 90%

PrivacyPeek: Auditing What LLM-Based Agents Acquire, Not Just What They Say

PrivacyPeek: 审计基于LLM的智能体获取了什么,而不仅仅是它们说了什么

Mingxuan Zhang, Jiahui Han, Dadi Guo, Songze Li, Guanchu Wang, Na Zou, Dongrui Liu, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Southeast University(东南大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出PrivacyPeek基准,通过检查工具调用轨迹和探针诱导,评估基于LLM的智能体在获取阶段不必要的敏感信息泄露,发现该问题普遍存在且现有防御效果有限。

Comments 21 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00737 2026-08-07 cs.AI 版本更新 90%

To Call or Not to Call: A Framework to Assess and Optimize LLM Tool Calling

调用还是不调用:评估和优化LLM工具调用的框架

Qinyuan Wu, Soumi Das, Mahsa Amani, Arijit Nag, Seungeon Lee, Krishna P. Gummadi, Abhilasha Ravichander, Muhammad Bilal Zafar

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Ruhr University Bochum(博德姆鲁尔大学) UAR RC Trust(UAR RC信托)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一个基于决策理论的框架,从必要性、效用和可负担性三个关键因素评估LLM的网页搜索工具调用决策,并训练轻量级估计器优化调用,提升任务性能。

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08091 2026-08-04 cs.CL 版本更新 90%

Toward Robust LLM-Based Judges: Taxonomic Bias Evaluation and Debiasing Optimization

迈向鲁棒的基于大语言模型的裁判:偏见评估与去偏优化

Hongli Zhou, Hui Huang, Rui Zhang, Kehai Chen, Bing Xu, Conghui Zhu, Tiejun Zhao, Muyun Yang

机构 * Hongli Zhou(哈尔滨工业大学) Hui Huang(哈尔滨工业大学) Rui Zhang(哈尔滨工业大学) Kehai Chen(哈尔滨工业大学) Bing Xu(哈尔滨工业大学) Conghui Zhu(哈尔滨工业大学) Tiejun Zhao(哈尔滨工业大学) Muyun Yang(哈尔滨工业大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出JudgeBiasBench,通过系统量化LLM裁判偏见,提出偏见感知训练方法,减少偏见并保持评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13317 2026-07-30 cs.CL 版本更新 90%

SkillCAT: Contrastive, Assessment-Augmented and Topology-AwareSkill Self-Evolution for LLM Agents

SkillCAT: 面向LLM智能体的对比评估与拓扑感知技能自进化

Kunfeng Chen, Qihuang Zhong, Juhua Liu, Bo Du

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, Fudan University(复旦大学计算机学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出SkillCAT框架,通过对比因果提取、评估增强进化和拓扑感知任务执行三阶段,实现无需训练的LLM智能体技能自进化,在多个基准上平均提升高达40.40%。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11325 2026-07-30 cs.IR cs.AI 版本更新 90%

Structured Belief State and the First Precision-Aware Benchmark for LLM Memory Retrieval

结构化信念状态与首个面向LLM记忆检索的精度感知基准

Jeffrey Flynt

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对现有LLM记忆系统基准仅评估答案质量而忽略检索精度的问题,提出独立于生成模型的检索精度基准PrecisionMemBench和结构化信念存储系统Tenure,实现89/89测试案例通过且平均精度1.0。

Comments v4 removes duplicate prose and adds external adoption

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06616 2026-07-27 cs.CL 版本更新 90%

Interpretable Depression Detection from Social Media Text Using LLM-Derived Embeddings

使用基于大语言模型的嵌入从社交媒体文本中进行可解释的抑郁症检测

Samuel Kim, Oghenemaro Imieye, Yunting Yin

机构 * Earlham College(埃尔哈姆学院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究利用大语言模型和传统机器学习分类器,针对社交媒体文本进行三项心理健康预测任务。通过多数据集五折交叉验证实验发现,零样本LLMs在二元抑郁分类表现好,细粒度严重程度预测差;基于LLM摘要嵌入的监督模型性能更优,为构建有效可解释评估系统提供方向。

Comments This version of the contribution has been accepted for publication at ICAI 2026, after peer review but is not the Version of Record and does not reflect post-acceptance improvements, or any corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20324 2026-07-22 cs.MA cs.AI 版本更新 90%

When Agents Disagree: The Selection Bottleneck in Multi-Agent LLM Pipelines

当代理人意见不一致:多代理LLM流水线中的选择瓶颈

Artem Maryanskyy, Dmitry Budnikov, Alibek T. Kaliyev

机构 * Uber

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究多代理LLM流水线中团队多样性对输出质量的影响,提出选择瓶颈概念,通过数学公式确定多样性帮助或损害的临界点,并通过实验验证选择机制的重要性。

Comments v2: Updated author list to match the published version. Published in Applied Sciences (MDPI) 2026, DOI: 10.3390/app1010000

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06820 2026-07-21 cs.AI 版本更新 90%

When Direct Prediction Fails: Evidence from LLM-Based Misinformation Risk Evaluation

超越表面判断:LLM生成虚假信息的人类基础风险评估

Zonghuan Xu, Xiang Zheng, Yutao Wu, Xingjun Ma

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室) City University of Hong Kong(香港城市大学) Deakin University(迪肯大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究LLM生成虚假信息的风险评估,发现LLM法官在整体评分、项目排序和信号依赖上与人类存在显著差异,且法官间一致性高于人类读者,表明内部一致性不能作为读者反应代理的有效证据。

Comments 9 pages, 1 figure. Substantially revised and reorganized version of arXiv:2604.06820 based on the same study and data; adds stricter participant filtering, held-out prediction analyses, and additional robustness checks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25031 2026-07-17 cs.AI 版本更新 90%

From Stateless to Situated: Building a Psychological World for LLM-Based Agents

从无状态到情境化:构建基于LLM的情感支持心理世界

Boning Zhao, Yutong Hu, Xinnuo Li

机构 * Tandon School of Engineering New York University New York, USA College of Arts \& Science New York University New York, USA

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LEKIA 2.0架构,通过分离认知层与执行层,构建可持续更新的情境结构,提升多轮交互中的稳定性与可控性,实现31%的改进。

Comments Accepted by WAICA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01311 2026-07-15 cs.CL 版本更新 90%

Catalyst-Agent: Autonomous heterogeneous catalyst screening with an LLM Agent

Catalyst-Agent:基于LLM Agent的自主异质催化剂筛选

Achuth Chandrasekhar, Janghoon Ock, Amir Barati Farimani

机构 * Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA 15213, USA(卡内基梅隆大学机械工程系,匹兹堡,PA 15213,USA) Department of Chemical and Biomolecular Engineering, University of Nebraska--Lincoln, Lincoln, NE 68588, USA(内布拉斯加大学林肯分校化学与生物分子工程系,林肯,NE 68588,USA)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出Catalyst-Agent,一种基于MCP服务器和LLM的AI代理,通过OPTIMADE API探索材料数据库、利用UMA模型计算吸附能,实现闭环自主催化剂筛选,在ORR、NRR和CO2RR反应中成功率达33-41%。

详情

展开后加载摘要…

URL PDF HTML 收藏