arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-24 至 2026-07-24 共收录 297 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 80 篇

2601.03552 2026-07-24 cs.SI 版本更新 86%

From Risk Perception to Behavior Large Language Models-Based Simulation of Pandemic Prevention Behaviors

从风险认知到行为:基于大语言模型的流行病预防行为模拟

Lujia Bo, Mingxuan Chen, Youduo Chen, Xiaofan Gui, Jiang Bian, Chunyan Wang, Yi Liu

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

AI总结 本文提出基于大语言模型的流行病预防行为模拟框架,通过静态和动态模块预测和更新行为,验证了其在不同数据环境下的有效性,并展示了政策放松期间行为变化的模拟结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21300 2026-07-24 cs.CV cs.AI 新提交 83%

Unlearning Under Imbalance: Benchmarking Fairness in Multimodal LLM Unlearning

不平衡下的遗忘:多模态大语言模型遗忘中的公平性基准测试

Lorenzo Orsingher, Thomas De Min, Massimiliano Mancini, Davide Talon, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多模态大语言模型遗忘中的公平性问题,提出FAIRGET基准和FAUN算法,通过模拟现实场景下不平衡的遗忘请求,在考虑数据不平衡性质时遗忘身份,实验证明该方法在遗忘质量和公平性上具有优越性。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17528 2026-07-24 cs.AI cs.AR cs.LG 版本更新 82%

Can AI Agents Really Complete RTL-to-GDS? Lessons from Benchmarking Tool-Interactive EDA Workflows

人工智能代理真的能完成从RTL到GDS的转换吗?基准测试工具交互式EDA工作流程的经验教训

Jinyuan Deng, Zhengrui Chen, Xufeng Wei, Tianyu Xing, Chenyi Wen, Qi Sun, Cheng Zhuo

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究探讨人工智能代理在EDA工作流程中的表现,提出FluxBench进行系统评估,涵盖多种场景并评估多项能力,引入Token ROI指标。结果显示不同代理系统架构性能有差距,特定领域技能不是提升性能的唯一关键,系统设计和基础模型能力也很重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25572 2026-07-24 cs.CL cs.AI 版本更新 82%

PennySynth: RAG-Driven Data Synthesis for Automated Quantum Code Generation

PennySynth:基于RAG的数据合成用于自动量子代码生成

Minghao Shao, Nouhaila Innan, Hariharan Janardhanan, Muhammad Kashif, Alberto Marchisio, Muhammad Shafique

机构 * eBRAIN Lab, Division of Engineering, New York University Abu Dhabi (NYUAD)(eBRAIN实验室,工程系,纽约大学阿布扎比分校) Center for Quantum and Topological Systems (CQTS), NYUAD Research Institute(量子与拓扑系统中心(CQTS),NYUAD研究所) Department of Computer Science and Engineering, NYU Tandon School of Engineering(计算机科学与工程系,纽约大学坦顿工程学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出PennySynth框架,通过检索增强生成和代码感知嵌入,利用13,389个PennyLane指令-代码对数据集,在QHack竞赛中实现52%-68%的pass@5,显著提升量子代码生成的结构有效性和功能正确性。

Comments Accepted at the IEEE International Conference on Quantum Computing and Engineering (QCE), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13026 2026-07-24 cs.LG cs.AI cs.CL 版本更新 82%

Understanding and Accelerating the Training of Masked Diffusion Language Models

理解并加速掩码扩散语言模型的训练

Chunsan Hong, Sanghyun Lee, Chieh-Hsin Lai, Satoshi Hayakawa, Yuhta Takida, Yuki Mitsufuji, Seungryong Kim, Jong Chul Ye

机构 * KAIST(韩国科学技术院) Sony AI(索尼人工智能) University of Tokyo(东京大学) Sony Group Corporation(索尼集团)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了掩码扩散模型训练缓慢的原因,提出bell-shaped时间采样策略,显著提升训练效率和模型性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21468 2026-07-24 cs.HC cs.AI 新提交 81%

Thinkink: 2D Spatial Ink-native Interaction with LLMs

Thinkink:与大语言模型的二维空间原生墨水交互

Mohammad Hasan Payandeh, Daniel Vogel, Jian Zhao

机构 * Cheriton School of Computer Science, University of Waterloo(滑铁卢大学计算机科学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 为将大语言模型融入手写笔记和草图构思,提出Thinkink,通过语义树和轻量级UI实现交互,经三阶段设计,研究不同阶段用户实践及交互挑战,贡献设计启示与交互工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21424 2026-07-24 cs.CL cs.SD 新提交 81%

An Evaluation Framework for Structured Audio Captions Validated by Controlled Perturbations

一种通过受控扰动验证的结构化音频字幕评估框架

Liang-Yuan Wu, Sripathi Sridhar, Mark Cartwright, Magdalena Fuentes

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对结构化音频字幕评估难的问题,提出多轴评估框架,结合大语言模型判断与计算指标,在五个正交轴上评估,通过受控扰动测试协议验证可靠性,能区分释义与损坏。

Comments submitted to DCASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20494 2026-07-24 cs.AI cs.CR cs.LG 新提交 81%

Isolating LLM Alignment from Regex: Zero Coverage and Metric-Dependent Divergence Under Adversarial Mutation

从正则表达式中分离大语言模型对齐:对抗性变异下的零覆盖率和度量相关散度

Alexandre Cristovão Maiorano

机构 * Vertex AI(顶点人工智能)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究在语料库被设计绕过正则表达式时大语言模型对齐情况,引入$L_5$-无正则表达式并评估,发现对齐贡献度量相关,自然语言探针中无额外覆盖率提升,对抗性变体中能检测到子串分类器错过的拒绝。

Comments 15 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11666 2026-07-24 cs.CL cs.AI cs.LG 版本更新 80%

Playing Along: Learning a Double-Agent Defender for Belief Steering via Theory of Mind

扮演:通过理论思维学习双代理守护者以实现信念引导

Hanqi Xiao, Vaidehi Patil, Zaid Khan, Hyunji Lee, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ToM-SB挑战,通过强化学习训练双代理模型以提升信念引导和理论思维能力,结果显示结合两者奖励的模型在对抗任务中表现更优。

Comments First two authors contributed equally. Code: https://github.com/The-Inscrutable-X/AIDoubleAgentDefenders

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11149 2026-07-24 cs.AI 版本更新 79%

The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation

隐藏的足迹:使存储成为大语言模型智能体评估的头等指标

Chenglin Yu, Hongquan Gui, Ying Yu, Tao Zeng, Ming Li

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究大语言模型智能体运行后磁盘持久数据评估问题,引入AgentFootprint基准测试,通过序列化感知度量套件测量多方面指标,解决测量陷阱,给出不同配置差异及存储优化结果,确立持久存储为资源指标。

Comments 17 pages, 5 figures; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28346 2026-07-24 cs.CL 版本更新 79%

When Discourse Pressures Conflict: Information Structure in Vision-Language Model Outputs

当话语压力冲突时:视觉-语言模型输出中的信息结构

Marcell Fekete, Johannes Bjerva, Tamás Káldi

机构 * Department of Computer Science, Aalborg University(奥尔堡大学计算机科学系) Department of Psycholinguistics and Neurolinguistics, ELTE Research Centre for Linguistics(ELTE语言研究中心心理学语言学与神经语言学系) ELTE Bárczi Gusztáv Faculty of Special Needs Education(ELTE巴尔茨吉斯塔夫特殊教育学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 研究视觉-语言模型在视觉问答中是否区分话语旧主题和新焦点,发现模型虽产生信息结构相关结构但过度正则化,倾向于窄响应模板,类似模式崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20584 2026-07-24 eess.IV 新提交 78%

HistoFID- Calibrating Frechet-distance evaluation across pathology foundation models

HistoFID-校准跨病理学基础模型的弗雷歇距离评估

Swapnil Bhat, Devansh Lalwani, Maulik Shah, Sheena Alphones, Rimlee Dutta, Nikita Mulchandani, Roshani Gala, Jay Mehta

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 研究数字病理学中用组织学基础模型取代 Inception 网络后 FID 结果受影响的问题,通过特定比率恢复可比性,划分编码器组,揭示其对生成模型评估结论的影响,还评估了 TuroCompress 编解码器并发布相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21455 2026-07-24 cs.NI 新提交 78%

Out-of-Distribution Detection in Wireless Multimodal Foundation Models for 6G ISAC

6G智能感知与通信无线多模态基础模型中的分布外检测

Mohammad Farzanullah, Akram Bin Sediq, Ali Afana, Melike Erol-Kantarci

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 研究6G智能感知与通信中无线多模态基础模型的分布外检测问题,提出WMFM - OOD框架,通过构建基站原型和温度缩放概率评分机制区分异常,在DeepVerse6G数据集验证,显著优于基线,提升检测灵敏度,保障网络可靠性。

Comments presented at IEEE VTC 2026 Fall, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21220 2026-07-24 cs.NE 新提交 78%

Search Hardness-Aware LLM-Based Problem Formulation for Expensive Simulation-Driven Design

用于昂贵的仿真驱动设计的搜索硬度感知基于大语言模型的问题公式化

Yuchen Li, Handing Wang, Bing Xue, Mengjie Zhang

专题命中 评测与基准 :LLM(title,abstract)

AI总结 针对昂贵仿真驱动设计中公式对搜索效率的影响问题,提出SHA-PF框架,基于搜索硬度定义公式搜索目标并评分,通过大语言模型相关方法搜索公式空间,实验表明该框架发现的公式能显著减少评估次数以达设计要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21065 2026-07-24 cs.CV 新提交 78%

Do Pathology Vision-Language Models Truly See Pathology?

病理学视觉语言模型真的能‘看到’病理学吗?

Chengyang Zhang, Wenchuan Zhang, Bo Li, Xinyu Liu, Jiaming Yang, Mengran Li, Chenxun Deng, Jie Chen, Yang Zhang, Wei Ju, Yuhao Yi, Hong Bu, Jiancheng Lv

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究病理学视觉语言模型评估中被忽视的问题,提出含多类型样本的PathBind基准,通过对多个VLMs评估发现,当前病理学VLMs在答案性能与视觉语义绑定间有显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20498 2026-07-24 cs.AI 新提交 77%

AISE-Bench: A Full-Cycle Curated Benchmark for Information Seeking on Academic Knowledge Graphs

AISE-Bench:用于学术知识图谱信息检索的全周期精选基准测试

Fanjin Zhang, Zhengyang Wang, Ruixuan Huang, Kefan Zhang, Amy Xin, Yuanchun Wang, Shu Zhao, Evgeny Kharlamov, Jie Tang, Juanzi Li

机构 * Renmin University of China(中国人民大学) Anhui University(安徽大学) Z-Lab Z.ai Tsinghua University(清华大学) Bosch Center for AI(博世人工智能中心) University of Oslo(奥斯陆大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对学术知识图谱信息检索基准测试不足的问题,引入AISE-Bench,通过定制工作流程和综合评估协议构建基准测试,为多步API使用的大语言模型智能体提供新测试平台,助力评估与改进。

Comments 9 pages, accepted by KDD 2026

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD '26), August 09-13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20474 2026-07-24 cs.AI 新提交 77%

VeriSimpl: Robust Optimization Modeling from Natural Language using Simplification-based Verification

VeriSimpl:基于简化验证的自然语言鲁棒优化建模

Sumaya Abdul Rahman, Seckhen Ariel Andrade Cuellar, Ghani Raissov, Mohammad Raza

机构 * Gurobi(古罗比) IBM(国际商业机器公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究自然语言到优化建模问题,核心方法是基于简化验证理念,利用优化求解器生成诊断查询让大语言模型推理公式正确性,主要贡献是在优化基准测试中提升准确性并提供高精度自验证信号。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20436 2026-07-24 cs.CL cs.AI cs.SE 新提交 76%

Routing Subspaces: Auditing Evaluation-to-Deployment Mismatch in Fine-Tuned Language Models

路由子空间:审计微调语言模型中评估到部署的不匹配

Phongsakon Mark Konrad, Toygar Tanyel, Serkan Ayvaz

机构 * Centre for Industrial Software, University of Southern Denmark(南丹麦大学工业软件中心) ProMake(宝迈可)

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.AI

AI总结 研究微调语言模型评估到部署的不匹配问题,提出在路径修补告知的中深度窗口拟合配对激活对比并修改结果坐标的方法,在多个模型实例中缩小了差距,还指出单坐标审计的局限性,此审计用于诊断微调检查点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02001 2026-07-24 cs.DB 版本更新 75%

Bespoke OLAP: Synthesizing Workload-Specific One-size-fits-one Database Engines

定制OLAP:合成工作负载特定的定制数据库引擎

Johannes Wehrstein, Timo Eckmann, Matthias Jasny, Carsten Binnig

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract)

AI总结 Bespoke OLAP通过自动化合成流程,生成针对特定工作负载的高性能数据库引擎,实现比通用系统高多个数量级的性能提升。

Comments Accepted to VLDB'26 (Boston)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21292 2026-07-24 cs.AI cs.SY eess.SY 新提交 74%

An LLM-Driven Workflow for Automated Process Control Strategy Generation and Tuning from Dynamic Process Models

一种由大语言模型驱动的工作流程,用于从动态过程模型自动生成和调整过程控制策略

Ari Luna Rueda, Eike Cramer, Klaus Hellgardt, Mehmet Mercangöz

机构 * Imperial College London(帝国理工学院) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 该研究提出由大语言模型驱动的工作流程,用于从动态过程模型自动生成和调整控制策略,将设计任务分解为多步骤,经执行验证和修复,在气体预热器基准测试中生成控制结构与环境,贝叶斯优化降低闭环性能目标约26.5%,证明方法可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21274 2026-07-24 cs.CL cs.AI 新提交 73%

A Comparative Evaluation of Embeddings and LLMs in a Greek Book Publisher Setting - The CUP Dataset

希腊图书出版商环境中嵌入模型和大语言模型的比较评估 - CUP数据集

Katerina Papantoniou, Panagiotis Papadakos, Theodore Patkos, Dimitris Garefalakis, Nikos Vardakis, Dimitris Plexousakis

机构 * ICS-FORTH(希腊计算机科学与技术研究所) Crete University Press(克里特大学出版社)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出希腊图书检索基准CUP数据集,评估稀疏、密集、混合及大语言模型辅助的检索方法,发现多语言嵌入优于希腊特定模型,混合检索最佳,还分析了不同方法在各类查询中的表现及大语言模型相关技术的效果。

Comments Preprint of a manuscript submitted to the 14th EETN Conference on Artificial Intelligence (SETN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20596 2026-07-24 cs.LG cs.CL 新提交 73%

Are Single-Token Sparse Autoencoder Features Causally Necessary? Layer-Depth and SAE-Family Effects

单令牌稀疏自动编码器特征在因果关系上是必要的吗?层深度和SAE家族效应

Seonglae Cho, Zekun Wu, Kleyton Da Costa, Rishi Kalra, Ilham Wicaksono, Adriano Koshiyama

机构 * Holistic AI(整体人工智能公司) University College London(伦敦大学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究SAE特征因果作用在不同家族是否稳定,通过分析六个模型和三个SAE家族的390万个特征,发现单令牌特征聚类紧密且集中在早期层,跨家族因果有差异,其可解释性受训练方法影响,非仅激活函数或规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20558 2026-07-24 cs.LG cs.AI 新提交 73%

StabilityBench: Benchmarking Instability in LLMs

StabilityBench:评估大语言模型中的不稳定性

Emma Kondrup, Zachary Yang, Anne Imouza, Reihaneh Rabbany

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型实际行为难测、现有评估协议有局限的问题,提出StabilityBench基准测试工具,通过注入现实模拟增强现有基准,应用于四个基准测试评估九个模型,发现性能不稳定,还提出StabilityBench-Mini以实现更现实评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20479 2026-07-24 cs.AI cs.CL 新提交 73%

Beyond Liars' Bench: The Impact of Lie Typology, Depth, and Sparsity on Deception Detection in LLMs

超越说谎者基准:谎言类型、深度和稀疏性对大语言模型中欺骗检测的影响

Amr Moustafa, Max Feser, Florian Mai

机构 * University of Bonn(波恩大学) Lamarr Institute for ML and AI(拉马尔机器学习与人工智能研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型欺骗检测问题,通过扩充数据对谎言类型等因素影响检测性能进行系统研究,发现最佳表示深度依赖数据集,更具表达力探测器提升有限,稀疏特征与密集状态表现类似,强调训练数据和谎言类型选择对检测性有显著影响。

Comments Presented at the AI Transparency Conference 2026, forthcoming in the AI Transparency Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20455 2026-07-24 cs.CL cs.AI 新提交 73%

RE-AD: Real-Time Requirement Adherence for Data Labeling

RE-AD:数据标注的实时需求遵循

Siddarth Malreddy, Ishan Nigam, Akshay Arora, Nikhil Mittal, Subrat Sahu

机构 * Uber AI Solutions(优步人工智能解决方案)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对众包数据标注质量问题,引入RE-AD框架,利用大语言模型,通过分解SOP为原子规则、分类并应用分层验证策略来验证标注质量,在合成基准上F1分数达0.749,生产部署中标注者接受并修复大部分错误。

Comments Accepted to The Fifth Generation, Evaluation & Metrics Workshop (GEM) workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05502 2026-07-24 cs.CV cs.AI cs.CL 版本更新 73%

MELLA: Bridging Linguistic Capability and Cultural Groundedness for Low-Resource Language MLLMs

MELLA:弥合低资源语言多模态大语言模型的语言能力与文化根基

Yufei Gao, Jiaying Fei, Nuo Chen, Ruirui Chen, Guohang Yan, Yunshi Lan, Botian Shi

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(东华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Institute of High Performance Computing, A*STAR(高性能计算研究所,A*STAR)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对低资源语言MLLMs文化内涵不足问题,提出MELLA数据集,采用双源策略,结合母语网络图像-替代文本对与生成翻译的图像描述进行监督,经实验表明能减轻文化幻觉,强调数据对齐对低资源语言文化基础多模态理解的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21072 2026-07-24 cs.CV 新提交 71%

Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

展示而非讲述:在生成像素而非语言模型文本中评估空间认知

Xu Wang, Kaixiang Yao, Miao Pan, Xiaohe Zhou, Xuanyu Liu, Wenqi Zhang, Xuhong Zhang

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title)

AI总结 研究图像生成模型空间认知评估问题,提出ProVisE框架及SpatialGen - Bench基准,通过统一设置评估相关模型,发现图像生成模型在像素空间直接外化答案时有竞争力,文本输出语言模型在组合空间推理中有优势,揭示了两者互补优势并建立测试平台。

Comments 36 pages, 14 figures. Project page: https://zju-omniai.github.io/ProVisE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20695 2026-07-24 cs.CY 新提交 71%

Language Models Embody and Amplify Human Cognitive Distortions: What Is to Be Done?

语言模型体现并放大人类认知扭曲:该怎么办?

Arnau Marin-Llobet, Steven A. Lehr, Mahzarin R. Banaji

专题命中 评测与基准 :language model(title)

AI总结 研究指出语言模型存在社会认知偏见,它不仅体现人类偏见,还会放大、加剧并传递偏见,鉴于其对决策影响巨大,提出了从诊断、监管和操作方面应对语言模型偏见问题的对策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21445 2026-07-24 cs.CL 新提交 70%

When Trivia Is Not Trivial: Everyday Knowledge Failures in Multilingual LLMs

当琐事并非微不足道:多语言大语言模型中的日常知识缺陷

Anna Mosolova, Djamé Seddah

机构 * INRIA Paris(法国国家信息与自动化研究所巴黎分部)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究用问答式问题测试多语言大语言模型在各类主题上的表现,引入TriviaRoomQA基准评估其日常等知识,发现模型在知识密集型主题强,流行文化主题弱,且性能因语言而异,揭示了现有基准未捕捉的知识差距。

Comments submitted to the ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20730 2026-07-24 cs.CR cs.AI 新提交 70%

GPE: Evaluating Robust Evidence Aggregation for Fact Verification under Controllable GEO-Style Poisoning

GPE:在可控的地理风格中毒情况下评估用于事实核查的稳健证据聚合

Zhaoqi Wang, Zijian Zhang, Xiaomei Yuan, Pengtao Kou, Jiamou Liu, Zhen Li, Liehuang Zhu

机构 * School of Cyberspace Science and Technology, Beijing Institute of Technology(航天信息科学技术学院,北京理工大学) School of Computer Science, The University of Auckland(计算机科学学院,奥克兰大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大型语言模型利用搜索工具时文档可能被操纵的问题,提出GPE,包含多领域事实核查基准及评估框架,通过实验证明其能揭示仅干净评估无法发现的稳健性下降与效率权衡,凸显对抗性证据环境下评估事实核查的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏