arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-10 至 2026-08-10 共收录 62 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 62 篇

2608.07378 2026-08-10 eess.AS cs.AI cs.LG 新提交 92%

LSEAD: A Privacy-Preserving LLM-Based Speech Analysis Framework for Early Alzheimer's Disease Screening

LSEAD:一种基于大语言模型(LLM)的隐私保护型语音分析框架,用于阿尔茨海默病(AD)早期筛查

Xin Wang, Yingchao Huang, Yuhan Su, Shanshan Yao, Wei Peng

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出基于开源LLM的隐私保护语音分析框架LSEAD,在ADReSS系列数据集上使AD分类准确率提升最多5个百分点,为早期AD筛查提供了实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05726 2026-08-10 cs.CL cs.AI 交叉投稿 92%

Mitigating Scoring Bias in LLM-as-a-Judge via Random Number Generation

通过随机数生成缓解作为评判者的大语言模型(LLM-as-a-Judge)中的评分偏差

Yuma Asato, Kiyoaki Shirai, Natthawut Kertkeidkachorn

机构 * Japan Advanced Institute of Science and Technology(日本先进科学技术学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM-as-a-Judge的评分偏差问题,提出通过随机数生成识别并校正LLM潜在数字偏差的方法,在四项任务上的表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22148 2026-08-10 cs.AI cs.CL 版本更新 92%

Ratchet: How Reliable Must an LLM Judge Be to Retire a Skill?

Ratchet:一种最小化卫生的自演化LLM代理技能库

Xing Zhang, Yanwei Cui, Guanghui Wang, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS 生成式人工智能创新中心) HSBC Holdings Plc.(汇丰控股有限公司) HSBC Technology Center, China(汇丰技术中心,中国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Ratchet,一种单代理循环,使冻结的LLM能够自行编写、检索、整理和淘汰其自然语言技能,通过整合四个卫生机制提升技能库的生命周期管理,从而在MBPP+ hard-100数据集上显著提升性能。

Comments Code: https://github.com/amazon-science/Self-Evolving-Agents-Ratchet

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08531 2026-08-10 cs.AI 版本更新 92%

ForesightSafety-SAGE:A Fully Automated Scenario Generation and Safety Evaluation Framework for LLM Agents

VESTA: 一种全自动的LLM智能体场景生成与安全评估框架

Lu Jia, Haibo Tong, Feifei Zhao, Jindong Li, Dongqi Liang, Ping Wu, Qian Zhang, Yi Zeng

机构 * BrainCog AI Lab, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所类脑人工智能实验室) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Superalignment(北京市安全人工智能与超级对齐重点实验室) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Long-term AI(长期人工智能)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出VESTA框架,基于五个风险维度自动生成1072个可执行场景,评估12个LLM智能体在任务执行中的行为安全风险,平均攻击成功率达47.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07367 2026-08-10 cs.AI 新提交 91%

People Are Not Just Their Countries. Disentangling Social Determinants of LLM Value Alignment Across Europe

人不只是其所属国家:在欧洲范围内解耦大型语言模型(LLM)价值对齐的社会决定因素

Maria-Louisa Wightman, Guillaume Bied, Tijl De Bie

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 本研究依托欧洲社会调查,发现LLMs与不同社会人口学群体的价值观对齐存在差异,国籍作为单独变量的解释力与全部社会人口学变量相当,国家与社会人口学因素在解释对齐模式上互补。

Comments Accepted at AIES 2026 (9th AAAI/ACM Conference on AI, Ethics, and Society)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07243 2026-08-10 cs.AI cs.CL cs.NE 新提交 91%

Recipes for Creativity: Iterative Generation and Evaluation in Large Language Models

创造力的秘诀:大语言模型中的迭代生成与评估

Rens Anderson, Tessa Verhoef, Amirhossein Zohrehvand

机构 * Leiden University(莱顿大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本研究以2024年Pillsbury烘焙大赛食谱生成为任务,探究迭代生成对LLM创造力的影响,发现迭代生成-选择可产出与人类基准相当的食谱,且评估器设计是主观创造性搜索的关键变量。

Comments 7 pages, 3 figures, 1 table. Short paper accepted at ICCC'26

Journal ref Proceedings of the 17th International Conference on Computational Creativity (ICCC'26), Coimbra, Portugal, June 29-July 3, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06955 2026-08-10 cs.AI cs.CY 新提交 90%

Critical Acclaim Orientation in Large Language Models: Evidence from Film Preference Elicitation

大语言模型中的评论赞誉导向:来自电影偏好诱导的证据

Jonghyun Jee, Aaron Shaw

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究以8种大语言模型为对象,通过200部电影的基准测试,发现模型普遍呈现评论赞誉导向,该导向随模型规模增强,且提示框架会影响评价排名。

Comments 12 pages, 2 figures, accepted to AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07437 2026-08-10 cs.AI 新提交 90%

Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing

Fisher-R1:训练用于可靠假设检验的大语言模型智能体

Jiacheng Miao, Jin Mu, Guanhua Chen, James Zou

机构 * Stanford University(斯坦福大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究构建了含425项多领域假设检验任务的P-Bench基准,训练出Fisher-R1智能体,其在P-Bench上较DeepSeek-V4-Pro单试验成功率平均提升21%,证明强化学习可提升LLM的统计推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06949 2026-08-10 cs.AI 新提交 90%

Does Splitting a Triage Decision Across Agents Hide Bias or Help Catch It? A Multi-Agent Simulation Study of LLM-Based Resource Allocation Under Audit Capacity Constraints

在智能体间拆分分诊决策是隐藏偏差还是有助于发现偏差?审计能力约束下基于大语言模型的资源分配多智能体模拟研究

Paul-Peter Arslan

机构 * Institute for Future Technologies(未来技术研究所)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究通过多智能体模拟发现,在LLM资源分配中拆分决策为多智能体流程未显著改变偏差发生率,但审计能力影响偏差发现率,风险排序审核可提升覆盖范围。

Comments 6 pages, 2 figures, 3 tables. Code and data available at https://github.com/Polpii/policy-town

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07439 2026-08-10 cs.CL quant-ph 新提交 90%

An Exploratory Evaluation of LLM-Assisted Rewriting of Moderate-Complexity Financial Sentences for DisCoCat-Based Sentiment Analysis

基于DisCoCat的情感分析中,大语言模型辅助改写中等复杂度金融句子的探索性评估

Brian Llinas, Nikos Chrisochoides

专题命中 评测与基准 :LLM(title,summary_cn);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本研究提出LLM辅助的预处理工作流,通过改写优化中等复杂度金融句子以适配DisCoCat情感分析,经对比实验验证其可降低电路资源消耗并提升准确率,为可扩展QNLP金融情感分析提供探索性依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03238 2026-08-10 cs.AI 版本更新 90%

"LLM Agent Performance" Is Not a Single Evaluation Target

基于LLM的智能体评估统一框架的必要性

Pengyu Zhu, Li Sun, Philip S. Yu, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对当前LLM智能体评估受系统提示、工具集和环境动态等混杂因素影响的问题,提出标准化统一评估框架以提升公平性和可复现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16009 2026-08-10 cs.AI 版本更新 89%

MEDLEY-BENCH: Benchmarking Behavioural Metacognition and Belief Revision Under Social Pressure in Large Language Models

MEDLEY-BENCH:在AI元认知中规模购买评估但不控制

Farhad Abtahi, Abdolamir Karbalaie, Eduardo Illueca-Fernandez, Fernando Seoane

机构 * Department of Clinical Science, Intervention and Technology (CLINTEC), Karolinska Institutet(临床科学、干预与技术部门(CLINTEC),Karolinska研究所) Department of Clinical Physiology, Karolinska University Hospital(临床生理学部门,Karolinska大学医院) Department of Biomedical Engineering and Health Systems, KTH Royal Institute of Technology(生物医学工程与健康系统部门,KTH皇家理工学院) Department of Textile Technology, University of Borås(纺织技术部门,Borås大学) Department of Medical Technologies, Karolinska University Hospital(医学技术部门,Karolinska大学医院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 MEDLEY-BENCH评估了12种模型家族中35个模型在五个领域130个模糊实例上的行为元认知能力,发现评估能力随模型规模增加而增强,但控制能力不增加,揭示了元认知能力与规模无关的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05208 2026-08-10 cs.CV cs.LG 版本更新 89%

Symbolic Graphics Programming with Large Language Models

基于大语言模型的符号图形编程

Yamei Chen, Haoquan Zhang, Yangyi Huang, Zeju Qiu, Kaipeng Zhang, Yandong Wen, Weiyang Liu

机构 * The Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.LG

AI总结 本文针对大语言模型生成符号图形程序(SGP)能力不足的问题,提出带可验证奖励的强化学习方法,在Qwen-2.5-7B上实现与前沿系统相当的SVG生成性能,揭示SGP是跨模态 grounding 的有效视角。

Comments Accepted by Transactions on Machine Learning Research. (32 pages, 12 figures.) This version refines the paper structure, adds experimental results. Project page: https://spherelab.ai/SGP-Gen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06379 2026-08-10 cs.HC 新提交 89%

Preventive Care Recommendations by Large Language Models

基于大语言模型的预防性护理建议

Eden Avnat, Elia Yanko, Ori Yoran, Raja-Elie E. Abdulnour

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究对比7种LLMs与医生的预防性护理优先级排序,发现LLMs与医生高度一致但对生活方式干预重视不足,部分模型表现更优,强化效果需价值对齐训练等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06861 2026-08-10 cs.AI 新提交 88%

Gated-BEPO: Confidence-Gated Bellman Credit Assignment for Large Language Model Agents

Gated-BEPO:用于大语言模型智能体的置信门控贝尔曼信用分配

Hongxi Yan, Ziyue Huang, Shichao Fan, Qingjie Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究针对大语言模型智能体长视域训练的信用分配问题,提出Gated-BEPO方法,通过经验rollout图推导步骤级信用并结合置信门自适应融合回合与步骤级信用,在多任务基准上取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06769 2026-08-10 cs.CV 新提交 88%

GraphVerse: A Comprehensive Visual Graph Reasoning Benchmark for Multimodal Large Language Models

GraphVerse:面向多模态大语言模型的综合性视觉图推理基准

Yuanfu Sun, Yuanhang Ren, Kang Li, Chuanhao Ji, Jiaxi Li, Jiajin Liu, Ninghao Liu, Qiaoyu Tan

机构 * New York University(纽约大学) Sensetime Research(商汤科技研究院) Tsinghua University(清华大学) New York University Shanghai(上海纽约大学) University of Georgia(佐治亚大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 针对现有多模态大语言模型(MLLMs)评估缺乏结构化视觉推理测试的问题,提出GraphVerse基准,通过以图为中心的图像编辑(GIE)策略和VGR-Score指标,评估MLLMs在单/配对图像场景下的视觉图推理能力,揭示其相关局限并验证方法有效性。

Comments 33 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06871 2026-08-10 cs.AI 新提交 86%

CEDAR: Agent-Orchestrated Tree Search for Goal-Directed Optimization of Complex Systems

CEDAR:面向复杂系统目标导向优化的智能体编排树搜索算法

Yingtao Tian

机构 * Sakana AI

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对复杂系统目标导向设计的难题,提出基于LLM智能体的CEDAR方法,通过LLM驱动的MCTS实现复杂系统的目标导向发现,减少人力投入并促进其跨领域应用。

Comments Accepted as Talk in ALIFE 2026: The 2026 Conference on Artificial Life

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06808 2026-08-10 cs.AI 新提交 86%

Evolving Parallel Algorithm Portfolios via Potential-Aware Instance Generation with LLMs

基于大语言模型的潜在感知实例生成的进化并行算法组合

Shaofeng Zhang, Shengcai Liu, Zhiyuan Wang, Ke Tang

机构 * Southern University of Science and Technology(南方科技大学) Zhongguancun Academy(中关村学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对LLM-ACP在少样本组合优化问题中泛化差的问题,提出PIAC框架,通过无需参考解的潜在增益指标和大语言模型生成多样实例,在TSP、CVRP上较基线实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07038 2026-08-10 cs.SE cs.AI cs.CR 新提交 84%

Beyond Text Matching: Towards Reference-Free Evaluation for Human-Oriented Binary Reverse Engineering

超越文本匹配:面向面向人类的二进制逆向工程的无参考评估

Xiuwei Shang, Li Hu, Xiao Jiang, Jieke Shi, Junda He, Zhou Yang, Shaoyin Cheng, Guoqiang Chen, Weiming Zhang, David Lo

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI

AI总结 本文针对HOBRE的三项任务,首次系统研究LLM-as-a-Judge评估范式,推出无参考基准BinJudgeBench,提出自适应选择最优配置的BinJudge,提升评估相关性并降低API成本。

Comments Accepted by the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07449 2026-08-10 cs.AI cs.CL 新提交 82%

SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent

SkillProx:基于近端文本梯度下降的自进化智能体技能

Mingxuan Zheng, Yujin Zhou, Chuxue Cao, Boqin Yin, Yuyao Zhang, Jiapeng Sun, Shuaishuai Gong, Sirui Han, Yike Guo

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 SkillProx是结合闭环诊断进化与近端优化的自进化智能体技能框架,可提升LLM智能体在分布内外基准的平均准确率3.0个百分点,且两种核心组件具有互补效果。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06884 2026-08-10 cs.CL cs.AI cs.IR 新提交 82%

Georeferencing Non-Gazetteered Place Names using Biological Specimen Records

利用生物标本记录对非 gazetteer 地名进行地理配准

Aneesha Fernando, Surangika Ranathunga, Kristin Stock, Raj Prasanna, Christopher B. Jones

机构 * School of Mathematical and Computational Sciences, Massey University(梅西大学数学与计算科学学院) Joint Centre for Disaster Research, Massey University(梅西大学灾害研究联合中心) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究利用新西兰 Allan Herbarium 的生物标本记录识别非 gazetteer 地名(NGP),通过提取反转空间关系推导位置约束,对比确定性、概率性、LLM 方法的空间推理性能,发现概率推理精度最优,传统建模在高空间精度场景仍具优势。

Comments Accepted for publication in the proceedings of the Conference on Spatial Information Theory (COSIT) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07446 2026-08-10 cs.SE cs.AI cs.CY 新提交 81%

Taxonomy-Driven Analysis of Open-Source AI Risk Mitigation Tools

分类驱动的开源AI风险缓解工具分析

Afreen Alam, Evgenija Popchanovska, Ana Gjorgjevikj, Maryan Rizinski, Lubomir T. Chitkushev, Irena Vodenska, Dimitar Trajanov

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出分类驱动的协议,将21种开源AI风险缓解工具映射到MIT分类法,发现工具在治理等领域存在缺口,为企业AI风险缓解提供实用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07395 2026-08-10 cs.SE cs.AI 新提交 81%

PACE: Primitive-Aware Code Evolution for Automated Algorithm Design

PACE:面向自动算法设计的基元感知代码进化

Zhuoliang Xie, Ruihao Zheng, Xiang Xu, Genghui Li, Zhengkun Wang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有自动算法设计中局部逻辑与程序绑定导致的组件评估困难问题,提出PACE方法,通过EAP解耦逻辑,经实验验证可保留算法组件并发现竞争力算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07196 2026-08-10 cs.AI 新提交 81%

EMAS: Stabilizing Multi-Agent System Evolution through Evidence-Guided Revision

EMAS:通过证据引导的修正稳定多智能体系统演化

Chao Fei, Qingyi Si, Kaihua Liang, Yanghua Xiao, Panos Kalnis, Hongcheng Guo

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 EMAS 是一种不更新 LLM 参数、利用样本经验修正 MAS 拓扑与提示词的方法,在四个基准和两个 LLM 上提升了准确率并降低了 token 成本,表现优于多数基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06940 2026-08-10 cs.AI 新提交 81%

Blind to the Pivotal Vote: Aggregate Independence Metrics Miss Where Verification Actually Helps

对关键投票的忽视:聚合独立性指标遗漏了验证真正有帮助的地方

Yang Shu

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究发现 LLM 评委组的准确率提升集中在关键查询上,提出的按边际分层的单票替换规则可有效提升整体准确率,且总体依赖性诊断与分层效用互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06909 2026-08-10 cs.AI 新提交 81%

Long-Horizon Agent Trajectory Attribution: A Unified Benchmark and Fine-Grained Annotation Framework

长时程智能体轨迹归因:统一基准与细粒度标注框架

Jing Chen, Yang Sun, Li Zhang, Lin Xu, Jie Shi

机构 * Huawei Technologies Ltd.(华为技术有限公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有智能体轨迹基准缺乏细粒度归因分析支持的问题,提出轨迹归因任务,构建含1300余条标注轨迹的统一基准与标注框架,定义两项评估任务并发布可复用标注技能。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06621 2026-08-10 cs.AI 新提交 81%

NxN E-valuation: Hypothesis Certification via a Conformal CRT Null

NxN E-评估:通过共形CRT空假设进行假设验证

Bin Wang, Yan Zhong

机构 * Meta

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出NxN E-评估算法,利用大型训练集让样本互为空假设,实现共形CRT以验证LLM的假设,可作为LLM循环验证和保留数据测试的更优替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19949 2026-08-10 cs.AI cs.CY 版本更新 81%

SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data

SenWorld:用于生成富含上下文评估数据的数字孪生模拟

Zenghui Zhou, Xiaoyang Li, Xiaoxuan Qiao, Zhilang Wei, Tianming Lei

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对智能手机助手评估缺富含上下文且隐私安全数据的问题,提出SenWorld数字孪生模拟方法,通过真实数据构建场景生成评估数据,经实验验证其在数据分布等方面与真实用户基准匹配,能暴露助手故障且隐私安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06485 2026-08-10 cs.CL cs.AI cs.SI 新提交 81%

Do AI Personas Grow? Analyzing and Benchmarking Personality Evolution in LLM Agents After Life Events

AI人格会成长吗?分析并基准化大语言模型智能体在经历生活事件后的人格演变

Ming Wang, Peidong Wang, Xiaocui Yang, Daling Wang, Shi Feng, Fiona Fui-Hoon Nah, Ee-Peng Lim

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究聚焦PC-Agents的人格演变,以大五人格为锚点,引入BFI-Adapt基准,发现其人格转变幅度低于人类、离散度压缩,仅模拟人类人格动态均值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06898 2026-08-10 cs.RO cs.CL cs.HC 新提交 80%

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots

我该如何为我的机器人选择基础模型?支持社会机器人的社区评估框架

Eric Nichols, Alva Markelius, Hatice Gunes

机构 * Honda Research Institute Japan(本田研究所日本分部) University of Cambridge(剑桥大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL

AI总结 针对社会机器人选择基础模型的难题,本文提出三层评估漏斗范式,梳理五个评估维度的适用评估方法,呼吁社区共建评估框架。

Comments 5 pages, 1 figure, 1 table. Accepted at the FoRMA workshop (Foundation Models in the RO-MAN Age: Responsible Development for Social Robotics) at IEEE RO-MAN 2026, Kitakyushu, Japan. Workshop homepage: https://sites.google.com/cam.ac.uk/forma/

详情

展开后加载摘要…

URL PDF HTML 收藏