arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1289 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1289 篇

2601.22588 2026-07-10 cs.CL cs.AI cs.LG 版本更新 93%

Rethinking LLM-as-a-Judge: Representation-as-a-Judge with Small Language Models via Semantic Capacity Asymmetry

重新思考大语言模型作为评判器:通过语义能力不对称利用小语言模型进行表示作为评判器

Zhuochun Li, Yong Zhang, Ming Li, Yuelyu Ji, Yiming Zeng, Ning Cheng, Yun Zhu, Yanmeng Wang, Shaojun Wang, Jing Xiao, Daqing He

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) University of Pittsburgh(匹兹堡大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Connecticut(康涅狄格大学)

专题命中 评测与基准 :LLM(title,abstract);language model(title,abstract);small language model(title);large language model(abstract)

AI总结 研究探讨小语言模型能否作高效评估器,基于语义能力不对称假设提出“表示作为评判器”范式,通过INSPECTOR框架实例化,实验显示其在推理基准测试中性能出色,为可扩展评估提供了更优选择。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03647 2026-06-24 cs.CL cs.AI cs.LG 版本更新 93%

Breaking the Mirror: Activation-Based Mitigation of Self-Preference in LLM Evaluators

打破镜像:基于激活的LLM评估者自我偏好缓解方法

Dani Roytburg, Matthew Bozoukov, Matthew Nguyen, Jou Barzdukas, Simon Fu, Narmeen Oozeer

机构 * University of Virginia(弗吉尼亚大学) University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学) School of Computer Science(计算机科学学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 针对LLM评估者自我偏好偏见,提出轻量级引导向量方法,在推理时无需重训练即可将不公正自我偏好降低97%,但存在稳定性问题。

Comments Presented at {Mechanistic Interpretability, Evaluations, Reliable-ML} Workshops, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15336 2026-07-30 cs.HC cs.AI 版本更新 93%

Facial-Expression-Aware Prompting for Empathetic LLM Tutoring

面向情感的提示方法用于共情LLM辅导

Shuangquan Feng, Laura Fleig, Ruisen Tu, Philip Chi, Edmund Bu, Melinda Ozel, Junhua Ma, Teng Fei, Virginia R. de Sa

机构 * Neurosciences Graduate Program, University of California San Diego(加州大学圣地亚哥分校神经科学研究生项目) Department of Cognitive Science, University of California San Diego(加州大学圣地亚哥分校认知科学系) Department of Computer Science and Engineering, University of California San Diego(加州大学圣地亚哥分校计算机科学与工程系) Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) Department of Mathematics, University of California San Diego(加州大学圣地亚哥分校数学系) Face the FACS Halıcıoğlu Data Science Institute, University of California San Diego(Halıcıoğlu数据科学研究所)

专题命中 评测与基准 :LLM(title,title_cn);prompting(title);large language model(abstract);language model(abstract)

AI总结 本文研究了在LLM辅导中整合面部表情信号以提升共情响应的效果,通过四种不同方法对比发现,基于动作单元的条件化能提升对面部表情的共情响应,而引导峰值帧选择优于随机帧输入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13717 2026-06-10 cs.CL 版本更新 93%

On Cost-Effective LLM-as-a-Judge Improvement Techniques

关于成本效益的LLM作为评判者的改进技术

Ryan Lail, Luke Markham

专题命中 评测与基准 :LLM(title,title_cn);RLHF(abstract,abstract_cn);language model(abstract);prompting(abstract)

AI总结 研究通过集成评分、任务特定标准注入等四种技术提高LLM评判准确性,在RewardBench 2上达到85.8%准确率,成本效益显著。

Comments Accepted at the ICML 2026 workshops "Statistical Frameworks for Uncertainty in Agentic Systems" and "Combining Theory and Benchmarks: Towards a Virtuous Cycle to Understand and Guarantee Foundation Model Performance". 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06625 2026-07-01 cs.CL 版本更新 93%

FairJudge: An Adaptive, Debiased, and Consistent LLM-as-a-Judge

FairJudge: 一种自适应、去偏且一致的LLM作为评判者

Bo Yang, Lanfei Feng, Yunkui Chen, Yu Zhang, Xiao Xu, Shijian Li

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院)

专题命中 评测与基准 :LLM(title,title_cn);SFT(summary_cn,abstract);分类 cs.CL

AI总结 针对LLM评判系统在适应性、偏见和一致性上的局限,提出FairJudge,通过可学习正则化策略和课程式SFT-DPO-GRPO训练范式,实现自适应、去偏和一致评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20091 2026-07-03 cs.CL cs.AI 版本更新 93%

CreativityPrism: A Cross-Domain Evaluation Framework for Large Language Model Creativity

CreativityPrism:大语言模型创造力的跨域评估框架

Zhaoyi Joey Hou, Bowei Alvin Zhang, Yining Lu, Bhiman Kumar Baghel, Anneliese Brei, Ximing Lu, Meng Jiang, Faeze Brahman, Snigdha Chaturvedi, Haw-Shiuan Chang, Daniel Khashabi, Xiang Lorraine Li

机构 * University of Pittsburgh(匹兹堡大学) Johns Hopkins University(约翰霍普金斯大学) University of Notre Dame(诺特丹大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)

AI总结 提出CreativityPrism框架,整合发散思维、创意写作和逻辑推理三个领域的八项任务,从质量、新颖性和多样性三个维度评估LLM创造力,发现前沿模型在创意写作和逻辑推理上领先,但在发散思维上无显著优势,且各维度间相关性弱。

Comments Published in Transactions on Machine Learning Research (06/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09802 2026-06-17 cs.AI cs.CL 版本更新 93%

Would a Large Language Model Pay Extra for a View? Inferring Willingness to Pay from Subjective Choices

大型语言模型会为景观付费吗?从主观选择中推断支付意愿

Manon Reusens, Sofie Goethals, Toon Calders, David Martens

机构 * Department of Engineering Management, University of Antwerp(安特卫普大学工程管理系) Department of Computer Science, University of Antwerp(安特卫普大学计算机科学系)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 研究在旅行助手场景下,通过多分类逻辑模型分析LLM的主观选择,推断其支付意愿并与人类基准比较,发现LLM在属性层面存在系统偏差且高估支付意愿,但通过条件化偏好可改善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06519 2026-08-04 cs.CR cs.AI 版本更新 92%

Can Small Language Models Reliably Resist Jailbreak Attacks? A Comprehensive Evaluation

小型语言模型能否可靠抵御越狱攻击?一项综合评估

Zhibo Wang, Wenhui Zhang, Huiyu Xu, Zeqing He, Ziqi Zhu, Kui Ren

专题命中 评测与基准 :SLM(summary_cn,abstract);language model(title,abstract);small language model(title,abstract);large language model(abstract)

AI总结 本文通过评估59个SLMs对12种越狱方法的抵御能力,发现多数SLMs存在高ASR,漏洞与训练细节相关,且现有防御效果有限,凸显SLM需采用设计即安全的方法。

Comments Accepted by ACM CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16478 2026-07-21 cs.IR cs.CL 版本更新 92%

Music Recommendation with Large Language Models: Challenges, Opportunities, and Evaluation

基于大语言模型的音乐推荐:挑战、机遇与评估

Elena V. Epure, Yashar Deldjoo, Bruno Sguerra, Markus Schedl, Manuel Moussallam

机构 * Deezer Research(Deezer研究机构) Johannes Kepler University Linz(约翰·凯撒大学林茨分校) Linz Institute of Technology(林茨技术研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 探讨音乐推荐系统从依赖信息检索框架向LLM驱动转变面临的挑战与机遇,通过回顾LLMs对音乐相关建模的重塑、审视自然语言处理评估实践,勾勒成功与风险维度,为音乐推荐系统评估提供跨学科视角。

Comments Under review with the ACM Transactions on Recommender Systems (TORS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20048 2026-06-10 cs.CL cs.CY 版本更新 92%

Culturally uneven urban perception in large language models

大型语言模型通过文化不平等的基线感知城市

Rong Zhao, Wanqi Liu, Zhizhou Sha, Nanxi Su, Yecheng Zhang, Ying Long

机构 * Centre for Advanced Spatial Analysis (CASA), UCL, London, UK(高级空间分析中心(CASA),伦敦大学学院,英国) School of Architecture, Tsinghua University, Beijing, China(清华大学建筑学院,北京,中国) Department of Computer Science, UT Austin, Austin, TX, USA(得克萨斯大学奥斯汀分校计算机科学系,奥斯汀,德克萨斯,美国)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本研究通过全球平衡的街景样本测试前沿LLM的城市感知,发现中性提示实际上偏向欧美文化,且文化提示能改变情感评价但无法恢复人类语义多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10015 2026-08-11 cs.AI cs.CE cs.CL cs.MM 版本更新 92%

FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks

FinTrace: LLM工具调用在长周期金融任务中的轨迹级综合评估

Yupeng Cao, Haohang Li, Weijin Liu, Wenbo Cao, Anke Xu, Lingfei Qian, Xueqing Peng, Minxue Tang, Zhiyuan Yao, Jimin Huang, K. P. Subbalakshmi, Zining Zhu, Jordan W. Suchow, Yangyang Yu

机构 * Stevens Institute of Technology(斯蒂文斯理工学院) Independent Researcher(独立研究者) The FinAI(FinAI) Duke University(杜克大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出FinTrace基准,通过800个专家标注的轨迹评估LLM工具调用,揭示模型在信息利用和最终答案质量上的不足,并通过FinTrace-Training数据集提升中间推理能力,但最终答案质量仍受限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10687 2026-07-03 cs.MA cs.AI cs.CL cs.GT 版本更新 92%

Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents

谁获得奖励 & 谁受到责备?面向多LLM智能体的评估对齐训练信号

Chih-Hsuan, Yang, Tanwi Mallick, Le Chen, Krishnan Raghavan, Amal Gueroudji, Ian T. Foster, Rajeev Thakur

机构 * Argonne National Laboratory(阿贡国家实验室) University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出一个理论框架,结合合作博弈归因与过程奖励建模,将系统级评估转化为智能体信用和消息级信号,用于多LLM智能体训练。

Comments Accepted at the NeurIPS 2025 Workshop on Bridging Language, Agent, and World Models for Reasoning and Planning (LAW 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27637 2026-08-04 cs.CV 版本更新 92%

MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models

MMOOC:多模态大语言模型的上下文外评估综合基准

Wenjie Zhu, Yabin Zhang, Wenjun Zeng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology(东方理工大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);post-training(abstract)

AI总结 本文提出MMOOC基准,评估多模态大语言模型在上下文偏移场景下的拒绝与作答能力,实验发现当前模型难以平衡可答性与拒绝性,后训练可提升稳健性,该基准将公开。

Comments project page:https://zhuwenjie98.github.io/MMOOC-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16127 2026-07-20 cs.CL cs.AI cs.LG 版本更新 92%

AuAu: A Benchmark for Auditing Authoritarian Alignment in Large Language Models

AuAu: 大型语言模型中威权对齐审计基准

Andreas Einwiller, Max Klabunde, Florian Lemmerich

机构 * University of Zurich(苏黎世大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AuAu基准,结合心理测量、情境行为测试和用户提示评估LLM的威权倾向,发现17个模型均存在显著威权响应,且系统提示可操纵多数模型。

Comments v2, 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28304 2026-06-08 cs.CL 版本更新 92%

The Necessity of Setting Temperature in LLM-as-a-Judge

LLM作为评判者中设置温度的必要性

Lujun Li, Lama Sleem, Yangjie Xu, Yewei Song, Aolin Jia, Jerome Francois, Radu State

机构 * University of Luxembourg(卢森堡大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 系统研究温度对LLM评判行为的影响,发现高温降低一致性但暴露不确定性,低温适合稳定任务,高温适合复杂场景,建议温度作为任务相关的设计选择。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30219 2026-08-03 cs.AI cs.CL cs.LG cs.SE 版本更新 92%

EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures

EvalSafetyGap:LLM评估-安全失败的混合调查与概念框架

Buğra Alperen Uluırmak, Rifat Kurban

机构 * Erciyes University(埃里切耶大学) Abdullah Gül University(阿卜杜勒拉赫曼·古尔大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM评估与AI安全中基准分数与潜在属性不一致的测量问题,提出混合调查与概念框架,并通过十模型审计揭示能力与鲁棒性关联不显著、安全差距主要由治理因素驱动。

Comments 74 pages, 2 figures, 4 tables. Hybrid systematic survey and conceptual framework on LLM evaluation and AI-safety failures, synthesizing 373 primary studies (2018-2026). Introduces the EvalSafetyGap framework (Instability Decomposition, Alignment Trilemma) and reports an exploratory ten-model audit. Submitted as a review/survey article; not currently under consideration elsewhere

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06849 2026-08-13 cs.AI cs.CL 版本更新 92%

Causal Agent based on Large Language Model

基于大语言模型的因果智能体

Kairong Han, Kun Kuang, Ziyu Zhao, Junjian Ye, Fei Wu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM难以处理因果问题的挑战,提出Causal Agent框架,构建CausalTQA基准,实验显示其在多层级因果问题及真实数据集上性能优于SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07121 2026-08-04 cs.LG cs.AI cs.NE 版本更新 92%

Quality-Diversity Red-Teaming: Automated Generation of High-Quality and Diverse Attackers for Large Language Models

质量-多样性红队测试:针对大语言模型的高质量多样化攻击者自动生成

Ren-Jian Wang, Ke Xue, Zeyu Qin, Ziniu Li, Sheng Tang, Hao-Tian Li, Shengcai Liu, Zhi Yu, Yuanpeng Tan, Chao Qian

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong, Shenzhen(香港大学深圳校区) Southern University of Science and Technology(南方科技大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出QDRT框架,通过训练多专用攻击者生成高质量多样化攻击,提升LLM安全评估的多样性与有效性,支持LLM负责任部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18269 2026-07-24 cs.AI cs.LG 版本更新 92%

Wisdom of LLM Crowds: Aggregation and Contamination in Language Model Ensembles

语言模型群体的智慧:语言模型集成中的聚合与污染

Igor Douven

机构 * SND / CNRS / Sorbonne University(SND / 法国国家科学研究中心 / 索邦大学)

专题命中 评测与基准 :LLM(title,summary_cn);language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨大语言模型群体是否有群体智慧,通过让15个LLMs对254个二元预测市场问题进行概率估计,评估经典和学习型聚合方法,发现学习型聚合器表现优,训练截止污染影响结果,表明LLM群体有群体智慧效应,但可靠评估需无污染评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25476 2026-07-22 cs.CL cs.AI 版本更新 92%

A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation

大型语言模型的红队框架:以忠实性评估为例

Abrar Alotaibi, Raed Mughus, Moataz Ahmed

机构 * King Fahd University of Petroleum & Minerals(法赫德国王石油矿产大学) Imam Abdulrahman Bin Faisal University(伊玛目阿卜杜勒拉赫曼·本·费萨尔大学) SDAIA-KFUPM Joint Research Center for Artificial Intelligence(沙特数据与人工智能局-法赫德国王石油矿产大学人工智能联合研究中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出一种多角色红队框架,通过攻击者和陪审模型暴露LLM的不忠实问题,在问答任务中攻击成功率提升7.9%,并揭示结构约束和架构设计对安全性的影响。

Comments Preprint submitted to SQJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07385 2026-07-01 cs.CL cs.AI 版本更新 92%

SAGE: A Search-AuGmented Evaluation of Large Language Models on Free-Form QA

SAGE:面向自由形式问答的大语言模型的搜索增强评估

Sher Badshah, Ali Emami, Hassan Sajjad

机构 * Dalhousie University(达尔豪斯大学) Emory University(埃默里大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出SAGE框架,通过主动检索和综合外部证据评估LLM输出的事实性,无需固定参考答案,在多个自由问答基准上实现与人类评估的高度一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19276 2026-06-09 cs.CL cs.LG 版本更新 92%

OpenCompass: A Universal Evaluation Platform for Large Language Models

OpenCompass:大型语言模型的通用评估平台

Maosong Cao, Kai Chen, Haodong Duan, Yixiao Fang, Zhiwei Fei, Tong Gao, Ge Jiaye, Mo Li, Hongwei Liu, Junnan Liu, Yuan Liu, Chengqi Lyu, Han Lyu, Ningsheng Ma, Zerun Ma, Yu Sun, Zhiyong Wu, Linchen Xiao, Zhuozhi Xiong, Jun Xu, Haochen Ye, Zhaohui Yu, Yike Yuan, Songyang Zhang, Yufeng Zhao, Fengzhe Zhou, Peiheng Zhou, Dongsheng Zhu, Lin Zhu, Jingming Zhuo

机构 * OpenCompass Team(OpenCompass团队) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出OpenCompass,一个模块化、高兼容性、灵活且高并发的通用LLM评估平台,支持多种任务场景和主流基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14257 2026-06-23 cs.CL cs.AI cs.IR cs.LG 版本更新 92%

AD-Bench: A Real-World, Trajectory-Aware Advertising Analytics Benchmark for LLM Agents

AD-Bench: 面向LLM智能体的真实世界、轨迹感知广告分析基准

Lingxiang Hu, Yiding Sun, Tianle Xia, Wenwei Li, Ming Xu, Lan Xu, Siying Wang, Wei Xu, Jie Jiang

机构 * Tencent(腾讯)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AD-Bench基准,通过动态真实答案管道和轨迹感知评估,衡量LLM智能体在真实广告分析任务中的多轮工具协作能力,发现最优模型在复杂任务上仍有显著差距。

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04018 2026-06-23 cs.AI cs.CL cs.CY cs.LG 版本更新 92%

AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents

AgentMisalignment:衡量基于LLM的代理中失调行为的倾向性

Akshat Naik, Emma Gouné, Patrick Quinn, Guillermo Bosch, Francisco Javier Campos Zabala, Jason Ross Brown, Edward James Young

机构 * Department of Computer Science(计算机科学系) University of Oxford(牛津大学) Institute of Intelligent Systems and Robotics(智能系统与机器人研究所) Sorbonne Université(索邦大学) The Leverhulme Centre for the Future of Intelligence(未来智能中心) University of Cambridge(剑桥大学) Independent Researcher(独立研究者) Department of Computer Science and Technology(计算机科学与技术系) Department of Engineering(工程系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AgentMisalignment基准,评估LLM代理在真实场景中自发追求非预期目标的倾向,发现更强大的代理平均表现出更高的失调倾向,且个性特征对失调影响显著。

Comments Prepint, under review for NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26331 2026-08-07 cs.AI 版本更新 92%

AI Playing Business Games: Benchmarking Large Language Models on Managerial Decision-Making in Dynamic Simulations

AI 玩商业游戏:在动态模拟中对大型语言模型的管理决策能力进行基准测试

Berdymyrat Ovezmyradov

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究提出一种用于LLM基准测试的可复现开放获取管理模拟器,评估Gemini等五个LLMs在动态商业模拟中的多步骤战略决策能力,为长期决策评估提供新途径。

Comments 34 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07722 2026-08-04 cs.AI 版本更新 92%

Some hypotheses on how chatbots work in problem-solving-driven conversations. Large Language Models as confirmation of the Innovation Illusion

关于聊天机器人在问题解决驱动对话中如何工作的一些假设:大型语言模型作为创新幻觉的确认

S. F. M. van Vlijmen, H. D. Lethe

机构 * S.F.M. van Vlijmen and H.D. Lethe jr(S.F.M. van Vlijmen 和 H.D. Lethe jr)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出聊天机器人作为对话伙伴的本质,基于聚合动力学、认知语言学等理论,假设LLM训练数据仅部分模仿人类思维,并得出结论:基础聊天机器人无法成为与人类匹敌的思考伙伴。

Comments Changes made over the versions do NOT concern the argument or conclusion. The changes do concern: typo's, better phrasing, extra references, making the abstract fit the length demands without losing the main points to be made. 42 pages, 3 figures, submitted to Transmathematica

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18068 2026-07-22 cs.NI cs.AI 版本更新 92%

Human Grounded Evaluation of Large Language Models for Optical Network Automation

用于光网络自动化的大语言模型的人工基础评估

Kiarash Rezaei, Omran Ayoub, Paolo Monti, Carlos Natalino

机构 * University of Applied Sciences and Arts of Southern Switzerland(瑞士南瑞士应用科学与艺术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究针对光网络自动化中LLMs输出质量和成本差异大的问题,提出HuGLEN评估管道,结合LLM评判器和专家评级,用QES排名,用于转换XAI模型输出,结果显示中等规模LLM的QES最高,减轻人工标注负担,助力模型选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16529 2026-07-09 cs.AI cs.HC 版本更新 92%

SycoEval-EM: Sycophancy Evaluation of Large Language Models in Simulated Clinical Encounters for Emergency Care

SycoEval-EM:急诊护理模拟临床场景中大语言模型的谄媚评估

Dongshen Peng, Yi Wang, Austin Schoeffler, Sun-ha Hong, Brian Suffoletto, David Kim, Carl Preiksaitis, Christian Rose

机构 * UNC Chapel Hill(UNC夏洛特山分校) University of Waterloo(滑铁卢大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出SycoEval-EM多智能体模拟框架,评估19个LLM在急诊医学中对患者说服的鲁棒性,发现谄媚率呈双峰分布,静态医学基准无法预测安全表现。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09517 2026-07-03 cs.CL 版本更新 92%

StatEval: A Comprehensive Benchmark for Large Language Models in Statistics

StatEval:大型语言模型在统计学中的综合基准

Yuchen Lu, Run Yang, Yichen Zhang, Shuguang Yu, Ziwei Wang, Jiayi Xiang, Wenxin E, Changyu Zhu, Fan Zhou

机构 * Shanghai University of Finance and Economics(上海财经大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出StatEval基准,包含10万+问题,覆盖本科到研究级统计推理,并开发TRACE管道和自适应评分方法,揭示LLM在基础任务上表现尚可但研究级推理薄弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06910 2026-06-11 cs.CL 版本更新 92%

Language Shapes Mental Health Evaluations in Large Language Models

语言塑造大型语言模型中的心理健康评估

Jiayi Xu, Xiyang Hu

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究多语言LLM在心理健康评估中是否因语言不同而产生系统性偏差,发现中文提示比英文提示导致更高的污名相关评分和更保守的抑郁严重度判断。

详情

展开后加载摘要…

URL PDF HTML 收藏