arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-10 至 2026-08-10 共收录 295 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 62 篇

2608.06808 2026-08-10 cs.AI 新提交 86%

Evolving Parallel Algorithm Portfolios via Potential-Aware Instance Generation with LLMs

基于大语言模型的潜在感知实例生成的进化并行算法组合

Shaofeng Zhang, Shengcai Liu, Zhiyuan Wang, Ke Tang

机构 * Southern University of Science and Technology(南方科技大学) Zhongguancun Academy(中关村学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对LLM-ACP在少样本组合优化问题中泛化差的问题,提出PIAC框架,通过无需参考解的潜在增益指标和大语言模型生成多样实例,在TSP、CVRP上较基线实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07038 2026-08-10 cs.SE cs.AI cs.CR 新提交 84%

Beyond Text Matching: Towards Reference-Free Evaluation for Human-Oriented Binary Reverse Engineering

超越文本匹配:面向面向人类的二进制逆向工程的无参考评估

Xiuwei Shang, Li Hu, Xiao Jiang, Jieke Shi, Junda He, Zhou Yang, Shaoyin Cheng, Guoqiang Chen, Weiming Zhang, David Lo

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI

AI总结 本文针对HOBRE的三项任务,首次系统研究LLM-as-a-Judge评估范式,推出无参考基准BinJudgeBench,提出自适应选择最优配置的BinJudge,提升评估相关性并降低API成本。

Comments Accepted by the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07449 2026-08-10 cs.AI cs.CL 新提交 82%

SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent

SkillProx:基于近端文本梯度下降的自进化智能体技能

Mingxuan Zheng, Yujin Zhou, Chuxue Cao, Boqin Yin, Yuyao Zhang, Jiapeng Sun, Shuaishuai Gong, Sirui Han, Yike Guo

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 SkillProx是结合闭环诊断进化与近端优化的自进化智能体技能框架,可提升LLM智能体在分布内外基准的平均准确率3.0个百分点,且两种核心组件具有互补效果。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06884 2026-08-10 cs.CL cs.AI cs.IR 新提交 82%

Georeferencing Non-Gazetteered Place Names using Biological Specimen Records

利用生物标本记录对非 gazetteer 地名进行地理配准

Aneesha Fernando, Surangika Ranathunga, Kristin Stock, Raj Prasanna, Christopher B. Jones

机构 * School of Mathematical and Computational Sciences, Massey University(梅西大学数学与计算科学学院) Joint Centre for Disaster Research, Massey University(梅西大学灾害研究联合中心) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究利用新西兰 Allan Herbarium 的生物标本记录识别非 gazetteer 地名(NGP),通过提取反转空间关系推导位置约束,对比确定性、概率性、LLM 方法的空间推理性能,发现概率推理精度最优,传统建模在高空间精度场景仍具优势。

Comments Accepted for publication in the proceedings of the Conference on Spatial Information Theory (COSIT) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07446 2026-08-10 cs.SE cs.AI cs.CY 新提交 81%

Taxonomy-Driven Analysis of Open-Source AI Risk Mitigation Tools

分类驱动的开源AI风险缓解工具分析

Afreen Alam, Evgenija Popchanovska, Ana Gjorgjevikj, Maryan Rizinski, Lubomir T. Chitkushev, Irena Vodenska, Dimitar Trajanov

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出分类驱动的协议,将21种开源AI风险缓解工具映射到MIT分类法,发现工具在治理等领域存在缺口,为企业AI风险缓解提供实用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07395 2026-08-10 cs.SE cs.AI 新提交 81%

PACE: Primitive-Aware Code Evolution for Automated Algorithm Design

PACE:面向自动算法设计的基元感知代码进化

Zhuoliang Xie, Ruihao Zheng, Xiang Xu, Genghui Li, Zhengkun Wang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有自动算法设计中局部逻辑与程序绑定导致的组件评估困难问题,提出PACE方法,通过EAP解耦逻辑,经实验验证可保留算法组件并发现竞争力算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07196 2026-08-10 cs.AI 新提交 81%

EMAS: Stabilizing Multi-Agent System Evolution through Evidence-Guided Revision

EMAS:通过证据引导的修正稳定多智能体系统演化

Chao Fei, Qingyi Si, Kaihua Liang, Yanghua Xiao, Panos Kalnis, Hongcheng Guo

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 EMAS 是一种不更新 LLM 参数、利用样本经验修正 MAS 拓扑与提示词的方法,在四个基准和两个 LLM 上提升了准确率并降低了 token 成本,表现优于多数基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06940 2026-08-10 cs.AI 新提交 81%

Blind to the Pivotal Vote: Aggregate Independence Metrics Miss Where Verification Actually Helps

对关键投票的忽视:聚合独立性指标遗漏了验证真正有帮助的地方

Yang Shu

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究发现 LLM 评委组的准确率提升集中在关键查询上,提出的按边际分层的单票替换规则可有效提升整体准确率,且总体依赖性诊断与分层效用互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06909 2026-08-10 cs.AI 新提交 81%

Long-Horizon Agent Trajectory Attribution: A Unified Benchmark and Fine-Grained Annotation Framework

长时程智能体轨迹归因:统一基准与细粒度标注框架

Jing Chen, Yang Sun, Li Zhang, Lin Xu, Jie Shi

机构 * Huawei Technologies Ltd.(华为技术有限公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有智能体轨迹基准缺乏细粒度归因分析支持的问题,提出轨迹归因任务,构建含1300余条标注轨迹的统一基准与标注框架,定义两项评估任务并发布可复用标注技能。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06621 2026-08-10 cs.AI 新提交 81%

NxN E-valuation: Hypothesis Certification via a Conformal CRT Null

NxN E-评估:通过共形CRT空假设进行假设验证

Bin Wang, Yan Zhong

机构 * Meta

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出NxN E-评估算法,利用大型训练集让样本互为空假设,实现共形CRT以验证LLM的假设,可作为LLM循环验证和保留数据测试的更优替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19949 2026-08-10 cs.AI cs.CY 版本更新 81%

SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data

SenWorld:用于生成富含上下文评估数据的数字孪生模拟

Zenghui Zhou, Xiaoyang Li, Xiaoxuan Qiao, Zhilang Wei, Tianming Lei

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对智能手机助手评估缺富含上下文且隐私安全数据的问题,提出SenWorld数字孪生模拟方法,通过真实数据构建场景生成评估数据,经实验验证其在数据分布等方面与真实用户基准匹配,能暴露助手故障且隐私安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06485 2026-08-10 cs.CL cs.AI cs.SI 新提交 81%

Do AI Personas Grow? Analyzing and Benchmarking Personality Evolution in LLM Agents After Life Events

AI人格会成长吗?分析并基准化大语言模型智能体在经历生活事件后的人格演变

Ming Wang, Peidong Wang, Xiaocui Yang, Daling Wang, Shi Feng, Fiona Fui-Hoon Nah, Ee-Peng Lim

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究聚焦PC-Agents的人格演变,以大五人格为锚点,引入BFI-Adapt基准,发现其人格转变幅度低于人类、离散度压缩,仅模拟人类人格动态均值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06898 2026-08-10 cs.RO cs.CL cs.HC 新提交 80%

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots

我该如何为我的机器人选择基础模型?支持社会机器人的社区评估框架

Eric Nichols, Alva Markelius, Hatice Gunes

机构 * Honda Research Institute Japan(本田研究所日本分部) University of Cambridge(剑桥大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL

AI总结 针对社会机器人选择基础模型的难题,本文提出三层评估漏斗范式,梳理五个评估维度的适用评估方法,呼吁社区共建评估框架。

Comments 5 pages, 1 figure, 1 table. Accepted at the FoRMA workshop (Foundation Models in the RO-MAN Age: Responsible Development for Social Robotics) at IEEE RO-MAN 2026, Kitakyushu, Japan. Workshop homepage: https://sites.google.com/cam.ac.uk/forma/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06960 2026-08-10 cs.SE cs.CR 新提交 80%

Statistical Analysis of Executability and Program Equivalence in Decompilation for IoT Vulnerability Detection

面向物联网漏洞检测的反编译可执行性与程序等价性统计分析

Minami Yoda, Jialong Li, Yasuyuki Tahara, Yuichi Sei, Yutaka Matsuno

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对物联网固件漏洞检测的反编译问题,提出九维质量评估指标,通过统计分析证明其可有效评估反编译质量,为物联网设备缺陷及黑盒生成模型质量评估提供基础。

Comments Author's English translation of the paper accepted for publication (in Japanese) in Toukei Suri (Proceedings of the Institute of Statistical Mathematics)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06790 2026-08-10 cs.SE 新提交 80%

AgentChaos: Chaos Engineering for Agent Systems via Programmatic Fault Injection

AgentChaos:通过可编程故障注入实现智能体系统的混沌工程

Gou Tan, Zhensu Sun, Jieke Shi, Ting Zhang, Zilong He, Qingfu Wu, Shuai Liang, Weifeng Sun, Junda He, Pengfei Chen, Chuanfu Zhang, Lwin Khin Shar, David Lo

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出AgentChaos框架,在不修改源代码的情况下于LLM API共享层注入故障,评估显示智能体系统鲁棒性取决于自身实现,现有故障诊断方法仍有提升空间。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12738 2026-08-10 cs.CV 版本更新 80%

Direct Visual Grounding by Directing Attention of Visual Tokens

通过引导视觉令牌注意力实现直接视觉 grounding

Parsa Esmaeilkhani, Longin Jan Latecki

机构 * Temple University(特拉华大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 该研究针对VLMs中视觉令牌注意力不足的问题,提出KL注意力损失,结合下一个令牌预测损失,在多个视觉任务上取得显著提升,还引入了用于评估VLMs线条追踪能力的新数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07006 2026-08-10 cs.CL cs.CV 新提交 79%

Does More Retrieved Evidence Help Visual Retrieval-Augmented Generation with Diffusion Language Models?

更多检索到的证据是否有助于基于扩散语言模型的视觉检索增强生成?

Jiankun Wang, Yisen Gao, Ziwei Zhang, Xingcheng Fu, Jiaxin Bai, Chen Gao

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 针对基于扩散语言模型的视觉检索增强生成,研究发现无条件扩大检索证据会因语义冲突降低准确率,提出无需训练的基于熵的候选过滤框架,可平均提升答案准确率2.62个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06967 2026-08-10 cs.CL 新提交 79%

Can Language Models Imagine Without Seeing? Ekphrasis: Measuring Visual Creative Ideation in Text-Only LLMs

语言模型无需视觉输入即可进行想象?Ekphrasis:测量仅文本大型语言模型的视觉创意构想能力

Hongyu Luo, He Wang, Huihao Jing, Hong Ting Tsang, Yuxuan Liu, Wuganjing Song, Yauwai Yim, Chunyang Li, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本研究推出基准Ekphrasis,测量仅文本大型语言模型的视觉创意构想能力,发现该能力与流畅度分离,且其排序可跨模态稳定存在。

Comments 25 pages, 4 main figures, with appendices. Code and data: https://github.com/Imhongyu/Ekphrasis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06663 2026-08-10 cs.CL 新提交 79%

The Horizon Gap: Planning, Memory, Execution, Training, and Evaluation for Long-Horizon LLM Agents

视界差距:长视界大语言模型智能体的规划、记忆、执行、训练与评估

Mingguang Chen, Licheng Wang, Bo Qu

机构 * DeepGrounding(深地研究机构) AlphaAvatar(阿尔法 Avatar 公司)

专题命中 评测与基准 :LLM(title);language model(abstract);分类 cs.CL

AI总结 本文提出长视界大语言模型智能体存在的视界差距,调研1547篇相关论文,厘清长视界等属性,分析领域应对措施并提出开放测量问题。

Comments 39 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20295 2026-08-10 cs.LG cs.AI cs.CV 版本更新 79%

Judge a Book by its Cover: Investigating Multi-Modal LLMs for Multi-Page Handwritten Document Transcription

通过封面判断书籍:调查多模态大语言模型用于多页手写文档转录

Benjamin Gutteridge, Matthew Thomas Jackson, Toni Kukurin, Xiaowen Dong

机构 * University of Oxford(牛津大学) QuantCo

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文研究多模态大语言模型在多页手写文档转录中的应用,提出OCR+PAGE-1和OCR+PAGE-N策略,通过共享页面内容提升转录效果。

Comments 10 pages (36 including references and appendices), 11 figures, accepted at COLM 2026, earlier version accepted at AAAI 2025 Workshop on Document Understanding and Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06672 2026-08-10 cs.CL 新提交 77%

TA-RAG: Tone Awareness as a Design Imperative for Retrieval-Augmented Generation

TA-RAG:将语气感知作为检索增强生成的设计要务

Yong-Bin Kang, Anthony McCosker

机构 * Swinburne University of Technology(斯威本科技大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对标准RAG系统存在的语境脱耦问题,提出TA-RAG框架,将交流对齐与事实准确性并列为核心设计目标,明确语气感知是高风险语境下RAG系统的设计要务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12383 2026-08-10 cs.CL 版本更新 77%

Beyond Binary Detection: A Multi-Dimensional Taxonomy of Cancer Misinformation on Reddit

超越二元检测:Reddit 上癌症错误信息的多维分类法

Aria Pessianzadeh, Pooriya Jamie, Naima Sultana, Georgia Himmelstein, Yuliya Zektser, Patricia Ganz, Homa Hosseinmardi, Amir Ghasemian, Rezvaneh Rezapour

机构 * Drexel University(德雷塞尔大学) UCLA(加州大学洛杉矶分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 研究旨在刻画Reddit上癌症错误信息,引入多维分类法涵盖七个维度。利用专家标注数据评估大语言模型,分析错误信息。发现其约占癌症讨论6%,少样本提示可提高性能,还识别出常见错误信息叙述,为相关建模奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07411 2026-08-10 cs.AI cs.CL cs.IR cs.LG 新提交 75%

GeoBenchLLM: A Comprehensive Benchmark for Evaluating LLMs on Geo-Related Tasks

GeoBenchLLM:评估大语言模型地理相关任务的综合基准

Rodrigo Ferreira Rodrigues, Karim Radouane, Jose G Moreno, Lynda Tamine

机构 * University of Toulouse(图卢兹大学) IRIT(信息与电信科学研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出GeoBenchLLM综合基准,选取12个地理相关公开数据集评估LLMs的地理空间与时间理解能力,发现推理能力与模型规模对性能影响显著,基准可公开获取。

Comments Accepted at CIKM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07167 2026-08-10 cs.AI 新提交 70%

NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs

NiyamAI——一种使用零知识证明实现密码学可验证护栏的意图绑定AI智能体

Aditya Katkar, Om Karkele, Kartik Mandhane, Manisha More, Yash Kashid

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 Niyam-AI是一种基于零知识证明的意图绑定AI智能体框架,通过SHA-256承诺意图合约、Judge模型验证和zk-SNARK确保证明,在Agent-SafetyBench评估中较多款基线护栏实现显著安全性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06785 2026-08-10 cs.CL 新提交 70%

Multi-Perspective Triad Interaction Graph Neural Network for Cognitive Distortion Detection

用于认知扭曲检测的多视角三元组交互图神经网络

Jun Seo Kim, Hye Hyeon Kim

机构 * Gachon University(嘉泉大学) Yonsei University(延世大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对现有认知扭曲检测方法忽略扭曲思维心理结构的问题,提出MTI-GNN模型,在多数据集上验证其性能优于基线模型及生成模型,且各视角均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06539 2026-08-10 cs.CL 新提交 70%

Don't `Well, Actually' Me Unless You Know What You're Talking About: Weak Presupposition Verification Degrades General QA Performance

除非你知道自己在说什么,否则别跟我“嗯,实际上”:弱前提验证会降低通用问答性能

Shenran Wang, Vered Shwartz, Hila Gonen

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(矢量研究所) Amii(阿尔伯塔机器智能研究所) CIFAR(加拿大高级研究所)

专题命中 评测与基准 :LLM(abstract_cn);prompting(abstract);分类 cs.CL

AI总结 该研究指出假前提问答(FPQA)的弱事实核查模块会降低通用问答性能,发现FPQ性能更好的方法往往在正常问题(TPQ)上表现更差,呼吁开发适配现实场景的FPQA方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05825 2026-08-10 cs.CL 版本更新 70%

MoCA: Implicit Social Context Analysis

MoCA:隐式社会语境分析

Wenhao Xu, Kaiwen Zhang, Hao Li, Maowei You, Yongzheng Ji, Siyuan Zuo, Jingxuan Yu, Sina A, Xinyao Tan, Bobo Li, Hao Fei, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学) Wuhan University(武汉大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出隐式社会语境分析(MoCA)新任务,构建含3108个实例的基准数据集,提出CoDAR框架提升模型性能,但模型与人类推理仍存差距,凸显隐式社会理解难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17679 2026-08-10 cs.HC cs.AI 版本更新 70%

PULSE: Agentic Investigation with Passive Sensing for Proactive Affective Intervention in Cancer Survivorship

PULSE:基于被动感知的代理探究用于癌症幸存者的主动干预

Zhiyuan Wang, Subigya Nepal, Ariful Islam, Indrajeet Ghosh, Xinyu Chen, Katharine E. Daniel, Laura E. Barnes, Philip Chow

机构 * Department of Systems and Information Engineering, University of Virginia(系统与信息工程系,弗吉尼亚大学) Center for Behavioral Health and Technology, University of Virginia(行为健康与技术中心,弗吉尼亚大学) Department of Computer Science, University of Virginia(计算机科学系,弗吉尼亚大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出PULSE系统,通过代理感知探究方法,利用智能手机被动感知数据和日记数据,提升对癌症幸存者情绪调节需求的预测准确率,验证了代理推理在主动干预中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07036 2026-08-10 cs.SE cs.CV 新提交 67%

CAS2UML: A Handwritten Sketch-to-PlantUML Dataset for Class and Activity Diagrams

CAS2UML:用于类图和活动图的手绘草图到PlantUML数据集

Simon Scholz, Mersedeh Sadeghi

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 CAS2UML是含557幅手绘类图与活动图及对应PlantUML代码的公开数据集,配套验证工具与脚本,可实现草图转UML方法的可复现基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06908 2026-08-10 cs.CL cs.AI cs.CY cs.LG 新提交 67%

Calibrating WEAT Against Anisotropy: ZCA Whitening as a Geometric Pre-Processing Step for Embedding Association Tests

针对各向异性校准WEAT:将ZCA白化作为嵌入关联测试的几何预处理步骤

Seitaro Ono, Senna Ross, Jun Saiki

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出将ZCA白化作为预处理步骤校准WEAT,可降低嵌入空间各向异性,超30%WEAT结果显著性改变,提升语义相似度,为相关偏差测量提供更可靠基础。

Comments Extended version (with appendices) of a paper accepted at the 9th AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏