arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-14 至 2026-07-14 共收录 116 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 116 篇

2607.09876 2026-07-14 cs.CV cs.AI q-bio.NC q-bio.QM 新提交 92%

Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data

Prompting-MammAlps:用于相机陷阱数据的细粒度文本到视频检索

Valentin Gabeff, Baptiste Maquignaz, Jennifer Shan, Sepideh Mamooler, Gencer Sumbul, Blair Costelloe, Devis Tuia, Alexander Mathis

机构 * Ecole Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所) University of Konstanz(康斯坦茨大学)

专题命中 评测与基准 :prompting(title,title_cn);LLM(abstract);language model(abstract);分类 cs.AI

AI总结 针对相机陷阱数据自动检索视频的难题,提出Prompting-MammAlps基准及细粒度可解释TVR方法,训练视觉变压器并结合大语言模型处理查询,在基准测试中取得较好成绩,优于零样本VLM。

Comments Accepted at ECCV 2026; Project page: https://cnai.epfl.ch/prompting-mammalps

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10546 2026-07-14 cs.LG 新提交 92%

LLM-PDESR: Robust PDE Discovery via Subdomain Weighted Residuals and LLM-Guided Symbolic Hypothesis Generation

LLM-PDESR:通过子域加权残差和大语言模型引导的符号假设生成进行稳健的偏微分方程发现

Jinyang Du, Hao Ma, Xiaohu Shi, Bo Yang, Yanchun Liang, Heow Pueh Lee, Chunguo Wu

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) School of Big Data and Artificial Intelligence, Guangdong University of Finance and Economics(广东财经大学大数据与人工智能学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, Jilin University(吉林大学符号计算与知识工程教育部重点实验室) School of Computer Science, Zhuhai College of Science and Technology(珠海科技学院计算机科学学院) Department of Mechanical Engineering, National University of Singapore(新加坡国立大学机械工程系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究旨在从噪声数据发现偏微分方程,提出LLM-PDESR框架,结合大语言模型假设生成与数学评估环境,利用五次样条和子域加权残差减轻噪声影响,经帕累托驱动反馈环优化方程,实验表明其在多方面显著优于现有方法。

Comments 28 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11504 2026-07-14 cs.LG cs.CR 版本更新 92%

CTFusion: A CTF-based Benchmark for LLM Agent Evaluation

CTFusion: 一种基于CTF的LLM代理评估基准

Dongjun Lee, Ga-eun Bae, Insu Yun

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出CTFusion,一种基于CTF的评估框架,通过减少竞争影响和数据污染,提升对LLM代理的评估可靠性。

Comments Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD), ICML 2026. Revised to match the camera-ready version. OpenReview: https://openreview.net/forum?id=aUSUvS4dPL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11632 2026-07-14 cs.AI cs.CL cs.LG cs.SI physics.soc-ph 新提交 91%

Reproducing human biases in route choice using large language models: Toward scalable behavioral modeling

使用大语言模型在路径选择中重现人类偏差:迈向可扩展的行为建模

Jiangtao Han, Shoufeng Ma, Shuxian Xu, Geng Li, Shuai Ling, Ning Jia, Zhengbing He

机构 * Laboratory of Computation and Analytics of Complex Management Systems (CACMS), Tianjin University, China(复杂管理系统的计算与分析实验室,天津大学,中国) College of Management and Economics, Tianjin University, China(管理与经济学院,天津大学,中国) Faculty of Science and Engineering, University of Nottingham Ningbo China(科学与工程学院,诺丁汉大学宁波校区,中国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨大语言模型能否在不明确前景理论参数时重现人类路径选择行为偏差,设计行为评估框架并比较,发现其能重现偏差及展现相关决策行为,为人类决策建模及相关研究提供可扩展替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10490 2026-07-14 cs.CR cs.LG 新提交 90%

NetInjectBench: Benchmarking Indirect Prompt Injection in Tool-Using Large Language Model Agents for Network Operations

NetInjectBench:用于网络操作的工具使用大型语言模型代理中间接提示注入的基准测试

Ruksat Khan Shayoni, Muhammad Faraz Shoaib, S M Asif Hossain, M. F. Mridha

机构 * School of Computing, Wichita State University(威斯康星州立大学计算机学院) Department of Computer Science, American International University-Bangladesh(孟加拉国国际大学计算机科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究网络操作中工具使用大型语言模型代理的间接提示注入问题,提出NetInjectBench基准测试。通过多种方法评估,发现单纯执行不安全率高,不同方法可降低该率,元数据感知策略门效果好,表明网络操作代理需执行时授权边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10402 2026-07-14 cs.CR cs.AI cs.SI 新提交 90%

Large Language Models in Misinformation Ecosystems: Misuse, Defense, and Vulnerability

错误信息生态系统中的大语言模型:滥用、防御与脆弱性

Lingwei Wei, Dou Hu, Wei Zhou, Songlin Hu, Philip S. Yu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Illinois Chicago(伊利诺伊大学香槟分校) State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究大语言模型在错误信息生态系统中的问题,引入角色层框架统一风险与防御,组织相关攻击、研究检测与验证方法、分析漏洞及讨论对策,指出从静态检测到风险评估、强化验证管道、部署可审计人工参与验证系统这三个关键挑战。

Comments 35 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21001 2026-07-14 cs.GT 版本更新 90%

Do Large Language Model Voters Strategize? An Oracle-Based Benchmark for Manipulation under Voting Rules

大语言模型选民会策略投票吗?一个基于预言机的投票规则操纵基准测试

Seyed Pouyan Mousavi Davoudi, Alireza Amiri-Margavi, Amin Gholami Davodi, Hamidreza Hasani Balyani, Arshia Gharagozlou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出一个基于预言机的基准测试,通过枚举所有可行报告并计算真实结果,评估大语言模型选民能否发现并执行策略投票,覆盖多种投票规则和提示条件。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10103 2026-07-14 cs.CR cs.CL 新提交 90%

A Survey on LLM Watermarking: Theory and Deployment

大语言模型水印:理论与部署综述

Huy Phan, Kieu Dang, Ojaswi Dulal, Aiham AL Shukairi, Abby Shine, Chase Garner, Phung Lai

机构 * Truman State University(特伦特州立大学) University at Albany, State University of New York(纽约州立大学阿尔巴尼分校)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 综述大语言模型水印技术,通过从业者核心问题组织内容,综合技术家族并分析安全效用权衡,回顾攻击策略、评估协议等,为LLM水印设计提供实际指导,明确可靠部署的研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08359 2026-07-14 cs.CL 版本更新 90%

REAL: Reading Out Transformer Activations for Precise Localization in Language Model Steering

REAL:在语言模型引导中读取Transformer激活以进行精确定位

Li-Ming Zhan, Bo Liu, Chengqiang Xie, Jiannong Cao, Xiao-Ming Wu

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 研究旨在在不改变LLM参数的情况下引导其响应,核心挑战是识别关键内部模块。提出REAL框架,通过训练VQ - AE划分潜在空间,量化模块行为相关性来指导模块选择与引导强度。实验表明该方法能有效干预,提升真实性引导效果且具零样本泛化能力。

Comments need full paper rebuilding

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11390 2026-07-14 cs.SE 新提交 89%

TerraRepair: A Tool-Grounded LLM Agent for Infrastructure-as-Code Repair

TerraRepair:一种用于基础设施即代码修复的工具接地大语言模型代理

Minase Mekete Mengistu, Juri Di Rocco, Phuong T. Nguyen, Davide Di Ruscio

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究探讨工具接地能否改进基于LLM的Terraform修复及何时升级问题。提出TerraRepair工具接地LLM代理,通过检索上下文等操作进行修复。实验表明其能显著提高扫描器验证修复率,凸显工具接地改进修复效果,同时指出特定部署上下文是自主修复的主要限制。

Comments The paper has been peer reviewed and accepted for publication in the proceedings of the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24283 2026-07-14 quant-ph 版本更新 89%

AutoQResearch: LLM-Guided Closed-Loop Policy Search for Adaptive Variational Quantum Optimization

AutoQResearch:基于LLM的闭环策略搜索用于自适应变分量子优化

Monit Sharma, Hoong Chuin Lau

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出AutoQResearch,通过LLM引导的闭环实验框架,实现变分量子优化中求解器的自适应配置,通过阶段确认和低成本评估避免过拟合,展示在最大独立集和车辆路径问题上的有效性。

Comments Accepted at the 2026 IEEE International Conference on Quantum Computing and Engineering (QCE 2026), Quantum-GenAI Co-Design & Co-Discovery (QGDD) Technical Papers Track. QCE26 Technical Paper 238

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11594 2026-07-14 cs.AI cs.GR 新提交 89%

MAGIC: Transition-Aware Generation of Navigable Multi-Scene Game Worlds with Large Language Models

MAGIC:利用大语言模型生成具有可导航多场景的游戏世界并感知过渡

Tsz Hei Fan, Choi Wing Fung, Yuxuan Wan, Shuqing Li, Michael R. Lyu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究利用大语言模型生成多场景游戏世界时面临的问题,提出MAGIC系统,通过四阶段管道将自然语言提示转化为可运行项目,解决跨场景一致性等问题,在新基准测试中表现出色,生成可执行项目且过渡识别指标优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11459 2026-07-14 eess.SY cs.AI cs.SY 新提交 89%

A Multimodal Dataset for Large Language Model Applications in the Energy Domain

用于能源领域大语言模型应用的多模态数据集

Costas Mylonas, Magda Foti

机构 * UBITECH

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 介绍mAIEnergy多模态数据集,整合文本、图像、时间序列及地理空间等数据,统一为结构化格式并伴有元数据与工作流程,可作能源知识库,遵循FAIR原则,助力能源领域大语言模型应用的研究、建模和决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08878 2026-07-14 cs.CL cs.MA 版本更新 89%

PerspectiveGap: A Benchmark for Multi-Agent Orchestration Prompting

PerspectiveGap: 多智能体编排提示的基准测试

Youran Sun, Xingyu Ren, Kejia Zhang, Xinpeng Liu, Jiaxuan Guo

机构 * University of Maryland(马里兰大学) The Chinese University of Hong Kong(香港中文大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(title,abstract);分类 cs.CL

AI总结 提出PerspectiveGap基准,评估LLM为多智能体系统编写编排提示的能力,实验显示模型平均通过率仅14.9%,表明该能力独特且未被充分评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11059 2026-07-14 cs.SE cs.AI cs.CL 版本更新 88%

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks

SWE-MERA:一种用于在软件工程任务中对大型语言模型进行代理评估的动态基准测试

Pavel Adamenko, Mikhail Ivanov, Aidar Valeev, Rodion Levichev, Pavel Zadorozhny, Ivan Lopatin, Dmitry Babaev, Alena Fenogenova, Valentin Malykh

机构 * GigaCode ITMO University(ITMO大学) MWS AI(MWS人工智能) IITU university(IITU大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对现有软件工程基准测试局限性,提出SWE-MERA动态基准测试,通过自动收集GitHub问题及严格验证确保质量,最小化污染风险,利用Aider编码代理评估多个大型语言模型,展示了其强大区分能力及模型性能表现。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10080 2026-07-14 cs.IR 新提交 88%

The Effect of Multi-Lingual and Keyword Adversarial Injection on LLM Relevance Judgment

多语言和关键词对抗性注入对大语言模型相关性判断的影响

Nguyen Khoi Vo, Duy Duong Tuong, Oleg Zendel, Mark Sanderson

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究跨语言提示注入攻击对基于大语言模型的相关性判断的影响,利用TREC数据集和开放权重模型在多语言环境下研究不同注入策略,发现多语言查询注入有效且能绕过现有防御,凸显当前防御差距,强调需更强大评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10235 2026-07-14 cs.CL cs.IR 新提交 87%

Consensus vs. Dissent: Dynamic LLM Modeling of Subjective Preferences in Group Recommenders

共识与异议:群体推荐系统中主观偏好的动态大语言模型建模

Cedric Waterschoot, Nava Tintarev, Francesco Barile

机构 * Maastricht University(马斯特里赫特大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究群体推荐系统中LLMs能否模拟对群体内偏好分布的敏感性并选理想聚合策略。通过微调LLMs、开发模拟模型生成推荐候选并动态选择,经用户研究验证,该方法在满意度和共识方面表现优,凸显LLMs用于适应性调整的优势。

Comments Full paper accepted at the 20th ACM Conference on Recommender Systems (RecSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10059 2026-07-14 cs.AI 新提交 87%

AgentAbstain: Do LLM Agents Know When Not to Act?

AgentAbstain:基于大语言模型的智能体知道何时不行动吗?

Xun Liu, Yi Evie Zhang, Vira Kasprova, Parisa Rabbani, Pardis Sadat Zahraei, Tianyu Zhang, Ali Ebrahimpour-Boroojeny, Varun Chandrasekaran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于大语言模型的智能体何时应弃权的问题,提出AgentAbstain评估框架及AbstainGen全自动管道,通过配对任务基准测试多种前沿LLMs,发现弃权能力与任务解决能力无关,并识别出失败模式,代码和数据集开源。

Comments 56 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19274 2026-07-14 cs.CL 版本更新 87%

HarDBench: A Benchmark for Draft-Based Co-Authoring Jailbreak Attacks for Safe Human-LLM Collaborative Writing

HarDBench: 面向安全人机协作写作的基于草稿的合著越狱攻击基准

Euntae Kim, Soomin Han, Buru Chang

机构 * Korea University(韩国大学) Sogang University(ソガン大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出HarDBench基准,评估大语言模型在协作写作中面对恶意草稿填充的越狱攻击的鲁棒性,并通过偏好优化实现安全-效用平衡的对齐方法。

Comments ACL 2026 Main

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 40785-40831 July 2-7, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11363 2026-07-14 cs.CL cs.AI 新提交 87%

Beyond Sally-Anne: Evaluating Theory of Mind in LLMs using Epistemic Schelling Points

超越莎莉-安妮任务:使用认知谢林点评估大语言模型中的心理理论

Roberta Rocca, Sami Boukortt, Geoff Keeling, Winnie Street

机构 * Paradigms of Intelligence Team(智能范式团队)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究旨在解决大语言模型心理理论评估问题,引入认知不对称谢林任务,通过要求模型在不同认知透明度下收敛于语义谢林点来评估其功能性ToM能力,发现能力差距及协调失败原因,指出社会推理和认知跟踪是瓶颈,为LLM评估与发展提供目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10286 2026-07-14 cs.AI cs.MA 新提交 86%

Can Agentic Trading Systems Pay for Their Own Intelligence?

智能交易系统能否为自身智能付费?

Qiqi Duan, Changlun Li, Chen Wang, Fan Zhang, Mengxiang Wang, Dayi Miao, Peixian Ma, Jiangpeng Yan, Liyuan Chen, Shuoling Liu, Preslav Nakov, Yuyu Luo, Nan Tang

机构 * HKUST(GZ)(香港科技大学(广州)) Paradoox AI(悖论人工智能公司) E Fund Management Co., Ltd(易方达基金管理有限公司) MBZUAI(Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)) The University of Tokyo(东京大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于LLM的交易系统中智能体能否为自身智能付费的问题,引入TradeLens工具包进行评估,通过多方面分析发现可行性取决于智能到利润的转化,不同模型有不同失败模式,重构了此类交易智能体的评估方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11414 2026-07-14 cs.CL 新提交 85%

Confidently Wrong: Detecting Hallucinations in Financial Question Answering from LLM Internal States

自信地犯错:从大语言模型内部状态中检测金融问答中的幻觉

Richard Zhe Wang

机构 * St. John Fisher University(圣约翰费舍尔大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究金融应用中LLMs自信却错误答案(自信幻觉)的检测,通过在残差流训练线性探测器并在FinQA和TAT-QA基准评估,发现探测器检测幻觉优势明显,可作为经济高效分类机制用于高风险金融应用答案审查。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10112 2026-07-14 cs.CR cs.AI 新提交 85%

Minionese: Comprehensive Benchmark and Mechanistic Study of Multilingual LLM Safety

Minionese:多语言大语言模型安全性的综合基准测试与机理研究

Chigozirim Ifebi, Brent Kong, Ayushi Mehrotra

机构 * California Institute of Technology(加州理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多语言大语言模型安全对齐问题,引入涵盖多种语言、资源层级和扰动类型的Minionese基准测试及几何机理分析,发现不同攻击类型漏洞特征不同,指出仅英语安全评估不足,需考虑多因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02951 2026-07-14 cs.CL cs.AI 版本更新 85%

How Annotation Trains Annotators: Competence Development in Social Influence Recognition

标注如何训练标注者:社会影响识别中的能力发展

Maciej Markiewicz, Beata Bajcar, Wiktoria Mieleszczenko-Kowszewicz, Aleksander Szczęsny, Tomasz Adamczyk, Grzegorz Chodak, Karolina Ostrowska, Aleksandra Sawczuk, Jolanta Babiak, Jagoda Szklarczyk, Przemysław Kazienko

机构 * Wrocław University of Science and Technology(弗罗茨瓦夫科技大学) University of Silesia in Katowice(卡托维兹西里西亚大学) SWPS University(SWPS大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了标注过程中标注者能力的变化,通过分析25名标注者对1021条对话的标注,发现标注者自我感知能力提升,专家组效果更显著,影响了基于其标注数据训练的LLM性能。

Comments Accepted to AIED 2026 (27th Conference on Artificial Intelligence in Education)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11517 2026-07-14 cs.CR 新提交 85%

Graph-Based Structural Evaluation of LLM-Translated Adversary Emulation Procedures

基于图的大语言模型翻译的对手模拟程序结构评估

Ahmed M. Elmisery

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型翻译对手模拟程序的评估问题,核心方法是基于图的结构评估(GBSE),将程序建模为有向属性图并计算归一化图编辑距离,主要贡献是应用于跨平台计划评估,揭示技术差异,框架含多种工具和规则且结果可重现验证。

Comments This technical contribution supports the MITRE white paper titled: Evaluating LLMs for Impact-Faithful Translation of Adversary Behavior Across Operating Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06861 2026-07-14 cs.CL cs.AI 版本更新 84%

BiasLab: A Multilingual Dual-Framing Framework for LLM Bias Measurement, Applied to Workplace and HR Contexts

BiasLab:用于大语言模型偏差测量的多语言双框架框架,应用于职场和人力资源领域

William Guey, Wei Zhang, Pei-Luen Patrick Rau, Pierrick Bougault, Vitor D. de Moura, Bertan Ucar, Jose O. Gomes

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型在工作场所和人力资源领域的偏差问题,提出BiasLab多语言双框架框架,结合多种方法对十个模型在六个主题上评估,发现模型有一致方向性偏好,为模型偏差测量提供标准化工具助组织审查。

Comments 15 pages, 4 figures, 6 tables

Journal ref Work: A Journal of Prevention, Assessment and Rehabilitation, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28925 2026-07-14 cs.LG cs.AI cs.IR cs.MA 版本更新 82%

Multi-Agent Routing as Set-Valued Prediction: A WildChat Benchmark and Cost-Aware Evaluation

多智能体路由作为集值预测:一个WildChat基准与成本感知评估

Ananto Nayan Bala, Faisal Muhammad Shah

机构 * Ahsanullah University of Science and Technology(阿萨努拉科学与技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出基于WildChat的多智能体路由基准,包含3000个提示和12个智能体目录,采用集值评估指标和成本感知加权路由,实验表明监督方法优于零样本LLM。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11078 2026-07-14 cs.CV cs.AI 新提交 81%

Do Video-LLMs Actually Watch? Diagnosing Character-Tracking Failures in Long-Form Video

视频语言模型真的在观看吗?诊断长视频中的角色跟踪失败

Mohammad Al-Ratrout, Shayla Sharmin, Aditya Raikwar, Roghayeh Leila Barmaki

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究视频语言模型在长视频中跟踪角色的能力,通过九条件诊断协议测试三个开源模型及Gemini,发现模型准确性非来自角色跟踪,存在性别线索利用问题,还发布诊断工具包揭示基准分数衡量的实际情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17776 2026-07-14 cs.CL 版本更新 81%

DEER: A Benchmark for Evaluating Deep Research Agents on Expert Report Generation

DEER:用于评估深度研究代理在专家报告生成上的基准

Janghoon Han, Heegyu Kim, Changho Lee, Dahm Lee, Min Hyung Park, Hosung Song, Stanley Jungkyu Choi, Moontae Lee, Honglak Lee

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DEER是一个用于评估深度研究代理在专家报告生成中性能的基准,通过系统化的评估标准和主张验证架构,提升报告质量和逻辑完整性。

Comments ICML 2026 (45 pages, 12 figures, 25 tables, 129 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21255 2026-07-14 cs.GT cs.AI math.OC 版本更新 81%

A General Equilibrium Theory of Orchestrated AI Agent Systems

一个 orchestrated AI agent 系统的一般均衡理论

Jean-Philippe Garnier

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于一般均衡理论的AI代理系统模型,通过集中编排实现系统福利最大化,并证明了均衡存在性和收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏