Criterion Validity of LLM-as-Judge for Business Outcomes in Conversational Commerce
对话商业结果中LLM作为评判者的标准效度准则
专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI
AI总结 本文通过两项研究探讨了LLM作为评判者在对话商业结果中的标准效度,发现评价维度和权重设计影响显著,需通过转换驱动的重新加权来改进。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
对话商业结果中LLM作为评判者的标准效度准则
专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI
AI总结 本文通过两项研究探讨了LLM作为评判者在对话商业结果中的标准效度,发现评价维度和权重设计影响显著,需通过转换驱动的重新加权来改进。
语言模型如何处理道德指令?在四个模型中的反思、一致性及其他认知
机构 * Research Institute of Criminal Psychiatry / Sex Offender Medical Center(刑事精神病学研究所/性犯罪者医疗中心) ; Department of Neuropsychiatry, Kyoto University(京都大学神经精神医学系)
专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 研究通过多代理模拟探讨语言模型处理道德指令的机制,发现不同模型存在不同的处理类型,且处理能力与指令格式的交互影响内部处理。
Comments 34 pages, 7 figures, 4 tables. Preprint. OSF pre-registration: osf.io/4n5uf. Companion paper: arXiv:2603.04904
大视觉-语言模型是否准备好指导盲人和低视力者?
机构 * SKT ; KAIST AI(韩国科学技术院人工智能) ; NAVER ; Theia Insights
专题命中 评测与基准 :language model(title,abstract);分类 cs.AI
AI总结 本文提出统一框架,通过用户研究和定制数据集,开发出更高效的评估器,提升大视觉-语言模型在盲人和低视力用户导航中的应用性能。
Comments 42 pages, 14 figures, 28 tables
盲人和低视力者如何偏好大型视觉-语言模型生成的场景描述
专题命中 评测与基准 :language model(title,abstract);分类 cs.AI
AI总结 研究探讨了盲人和低视力用户对大型视觉-语言模型生成场景描述的偏好,通过用户研究评估了六种描述类型,发现用户对描述的充分性和简洁性存在较大差异,提出需构建以盲人和低视力用户为中心的评估指标。
Comments This paper has been superseded by version 2 of arXiv:2510.00766
SWE-CI:通过持续集成评估代理在维护代码库中的能力
机构 * Sun Yat-sen University(中山大学) ; Alibaba Group(阿里巴巴集团) ; Skylenage
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 SWE-CI通过持续集成循环构建首个仓库级基准,旨在将代码生成评估从静态短期功能性正确性转向动态长期可维护性,通过跟踪功能正确性随时间的变化揭示可维护性。
E-Scores用于生成模型输出的正确性评估
机构 * Microsoft Research(微软研究院) ; University of Oxford(牛津大学)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出E-Scores作为生成模型输出正确性评估的补充方法,通过e值提高评估的可靠性,并在不同正确性形式下验证其有效性。
Comments International Conference on Artificial Intelligence and Statistics (AISTATS), 2026
增强人力资本:人工智能增强经济中认知因素分解的统一理论和基于大语言模型的测量框架
专题命中 评测与基准 :LLM(title,abstract)
AI总结 本文提出将人力资本分解为三个正交组成部分,并开发了一个生产函数,其中AI资本与这些组成部分非对称互动,通过放大函数phi(D)补充可增强的认知工作。研究发现,标准的米纳克方程在人工智能增强经济中被误设定,并通过LLM生成的职业可增强性测量验证了增强人力资本的工资回报。
Comments Working paper. 18 pages, 5 figures, 4 tables, 28 references. Code and data: https://github.com/Cespial/cognitive-factor-economics
一种新颖的三步方法用于通过多维特征融合预测企业特定技术收敛机会
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本文提出一种三步方法,通过多维特征融合预测企业特定技术收敛机会,利用注意力机制和集成学习模型提升预测效果。
AlphaResearch:利用语言模型加速新算法发现
机构 * Tsinghua University(清华大学) ; New York University(纽约大学) ; Yale University(耶鲁大学)
专题命中 评测与基准 :language model(title);分类 cs.CL
AI总结 AlphaResearch通过迭代提出新想法、编程验证和优化研究提案,实现了在开放性问题上发现新算法的突破,其在六个开放性问题上的表现优于其他系统,尤其在圆圈排列问题上超越了人类和基线模型。
在真实世界中研究自主代理的贡献:活动模式与代码变更趋势
机构 * Delft University of Technology(代尔夫特理工大学) ; University of California, Davis(加利福尼亚大学戴维斯分校)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文通过分析11万条开源拉取请求数据,研究自主编码代理在开源项目中的活动模式及代码变更,探讨其对代码质量、团队动态和软件维护性的影响。
Comments MSR 2026 Technical Track
对数评分,幂律发现:在基于代理的评估中区分测量与覆盖
专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 本文通过960次实验展示基于代理的评估在Turing式验证中与人类评分无差异,发现评分与独特问题发现之间存在对数与幂律的分离,揭示了发现空间的幂律分布特性。
信号:代理互动的轨迹采样与优先级排序
机构 * DigitalOcean Holdings, Inc.(DigitalOcean控股公司)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于信号的轻量框架,用于高效筛选代理交互轨迹,通过计算低成本信号提升采样效率,实验证明其在不同任务中均能有效提升信息量。
用分析方法评估教育LLM:关于反馈中性别偏见的案例研究
机构 * University College London, UCL Knowledge Lab(伦敦大学学院,UCL知识实验室) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文通过600篇真实学生作文,利用嵌入式基准框架检测LLM在形成性反馈中的偏见,发现隐性性别提示比显性提示更易引发语义偏移,揭示了LLM在反馈中持续存在的性别偏见。
Comments 21 pages, 7 figures
代理检索增强生成:关于代理RAG的综述
机构 * Cleveland State University(克利夫兰州立大学) ; Kent State University(肯特州立大学) ; Northeastern University(东北大学) ; Roux Institute at Northeastern University(东北大学鲁克斯研究所) ; University of Agder (UiA)(阿格德尔大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文综述了代理RAG系统,分析了其架构分类、设计权衡及应用,指出其在灵活性、可扩展性和上下文感知方面的优势,并探讨了未来研究方向。
一个用于评估基于归因理论的社会偏见的日本基准
机构 * Institute of Science Tokyo(东京科学大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; AIST(产业技术综合研究所) ; NII(国立信息学研究所)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文基于归因理论,构建了新的日本基准JUBAKU-v2,用于评估推理中对内群体和外群体行为归因的偏见,通过固定结论来检测模型在文化偏见上的性能差异。
Q-REAL:迈向AI生成内容真实性和可信度评估
机构 * Shanghai Jiao Tong University(上海交通大学) ; Meituan(美团) ; Shanghai AI Lab(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本文提出Q-REAL数据集,用于细粒度评估AI生成图像的真实性和可信度,通过标注实体位置和设计判断问题,提升生成模型性能。
通过MLLM驱动的感知、通信与计算推进多机器人网络:综述
机构 * Seoul National University(首尔大学) ; Ajou University(亚洲大学) ; Sungkyunkwan University(成均馆大学) ; Korea University(高丽大学) ; POSTECH(浦项科技大学) ; Stony Brook University(石溪大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本文综述了MLLM指导下的多机器人协调,探讨了集成设计对多机器人协作的影响,展示了四种端到端演示,强调了系统级指标的重要性。
通过生成因果中介进行激活引导
机构 * CSAIL, MIT(麻省理工学院计算机科学与人工智能实验室) ; Stanford University(斯坦福大学) ; Goodfire Research
专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG
AI总结 研究提出生成因果中介(GCM)方法,通过对比长形式响应选择模型组件,以局部化和控制扩散行为,如诗歌式 vs. 论文式表达,在三种语言模型上验证其有效性。
可验证的对抗检索污染的RAG
机构 * NVIDIA(英伟达) ; Princeton University(普林斯顿大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.LG
AI总结 本文提出RobustRAG,通过隔离-聚合策略有效防御检索污染攻击,并在三个数据集和三个LLM上验证了其在开放领域问答和自由文本生成中的有效性。
当用户改变主意:在长周期网络导航中评估可中断代理
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; McGill University(麦吉尔大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; University of California Santa Barbara(加州大学圣塔芭芭拉分校) ; University of Southern California(南加州大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.CL
AI总结 本文首次系统研究长周期环境感知网络导航中可中断代理的表现,通过InterruptBench基准测试六种强大LLM,在单轮和多轮中断设置中分析其适应性和恢复效率。
英国人工智能安全研究所对齐评估案例研究
机构 * UK AI Security Institute(英国人工智能安全研究所)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI
AI总结 本文评估了前沿模型在作为代码助手部署时是否可靠遵循目标,发现未发现研究 sabotage,但部分模型对安全相关任务不合作,且评估意识较弱。
当职业数据耗尽时:创始人成功预测的结构化特征工程与信号限制
机构 * Amazon(亚马逊)
专题命中 评测与基准 :LLM(abstract);分类 cs.LG
AI总结 本文通过结构化特征工程和确定性规则层结合XGBoost提升的决策树,提升创始人成功预测性能,发现LLM特征在信息增益上有限,揭示数据集信息含量的上限。
Comments 4 pages, 4 tables. Accepted at SecureFinAI Contest @ IEEE IDS 2026. Code: https://github.com/ihlamury/vcbench
跨上下文验证:通过会话隔离分析进行层次化基准污染检测
机构 * Daejeon Jungang Cheonggua Co., Ltd.(大田中央青果有限公司)
专题命中 评测与基准 :LLM(abstract);分类 cs.CL
AI总结 本文提出跨上下文验证方法,通过多会话分析检测基准污染,发现污染二元性及信息限制机制,验证了结构复杂性非关键。
Comments 11 pages, 3 figures, 4 tables
协同AI代理与批评者用于网络遥测中的故障检测与原因分析
机构 * Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系) ; SheQAI Research(SheQAI研究)
专题命中 评测与基准 :foundation model(abstract);分类 cs.AI
AI总结 本文提出一种多代理联邦系统,通过AI代理与批评者协作完成网络遥测中的故障检测、严重性和原因分析等多模态任务,利用多时间尺度随机逼近技术保证收敛性,通信开销低且隐私保护。
SYNTHONY:一种考虑压力的、基于意图的深度表格生成模型选择代理
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 评测与基准 :LLM(abstract);分类 cs.LG
AI总结 本文提出SYNTHONY,一种基于意图的表格生成模型选择框架,通过压力分析选择最佳合成器,提升模型在不同数据分布下的性能和实用性。
即兴游戏作为AI代理社交智能的基准测试:以Connections为例
机构 * Duke University(杜克大学) ; Stanford University(斯坦福大学)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 本文通过即兴词游戏Connections探讨AI代理的推理能力,提出该游戏作为测试社交智能的基准,涵盖知识检索、总结及认知状态意识等核心能力。
Comments https://wordplay-workshop.github.io/wordplay2024/pdfs/16.pdf
Journal ref https://wordplay-workshop.github.io/wordplay2024/pdfs/16.pdf
通过时间情感聚合检测异常用户反馈模式
机构 * Khoury College of Computer Science Northeastern University Boston, United States ; College of Engineering Northeastern University Boston, United States ; College of Professional Studies Northeastern University Boston, United States
专题命中 评测与基准 :language model(abstract);分类 cs.CL
AI总结 本文提出基于预训练Transformer模型的时间情感聚合框架,通过聚合评论情感信号检测用户反馈模式中的异常变化,实验证明其在社交媒体数据中有效识别显著情感下降。
遥感持续视觉-语言学习:基准测试与分析
专题命中 评测与基准 :language model(abstract)
AI总结 本文提出CLEaRS基准,评估遥感视觉-语言模型的持续学习能力,发现现有模型存在灾难性遗忘,需开发专用持续学习方法。
Comments 23 pages, 7 figures, 9 tables
零样本文本到语音中语调多样性测量:一个新的度量标准、基准和探索
专题命中 评测与基准 :language model(abstract)
AI总结 本文提出ProsodyEval数据集和DS-WED度量标准,用于评估零样本TTS的语调多样性,实验显示DS-WED在人类判断上表现更优,揭示影响语调多样性的因素。
Comments Accepted in ICASSP 2026
针对生成式AI的劫持:多向钓鱼威胁与基于Transformer的防御
专题命中 评测与基准 :LLM(abstract)
AI总结 本文研究了ChatGPT-4o-Mini的劫持漏洞,显示初学者可通过绕过防护生成多向钓鱼攻击,并提出基于Transformer的检测框架以应对风险。