arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-18 至 2026-08-18 共收录 661 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 166 篇

2512.10485 2026-08-18 cs.CR cs.LG cs.SE 版本更新 84%

From Lab to Reality: A Practical Evaluation of Deep Learning Models and LLMs for Vulnerability Detection

从实验室到现实:深度学习模型与LLM在漏洞检测中的实用评估

Chaomeng Lu, Bert Lagaisse

机构 * DistriNet Group-T, KU Leuven(DistriNet集团-T,根特大学)

专题命中 评测与基准 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 系统评估深度学习模型和大型语言模型在真实世界漏洞检测中的表现,发现它们在分布外数据集上性能急剧下降,揭示了学术基准与现实部署之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11496 2026-08-18 cs.GT cs.AI cs.CL cs.MA 版本更新 84%

Sequential LLM Release Facilitates Manipulation in Regulated Markets

毒苹果效应:通过AI代理技术扩展战略操纵中介市场

Eilam Shapira, Moshe Tennenholtz, Roi Reichart

机构 * Faculty of Data and Decision Sciences, Technion – Israel Institute of Technology, Haifa, Israel(以色列理工学院数据与决策科学学院,海法,以色列)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了AI代理技术扩展对博弈论场景中经济影响,发现技术扩展可显著改变均衡收益与监管结果,提出'毒苹果'效应通过释放未被使用的新技术操纵监管设计,损害对手与监管公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03904 2026-08-18 cs.CL cs.AI 版本更新 84%

I-CALM: Incentivizing Confidence-Aware Abstention for LLM Selective Answering

I-CALM:激励基于自信的回避以缓解大语言模型幻觉

Haotian Zong, Binze Li, Yufei Long, Sinyin Chang, Jialong Wu, Gillian K. Hadfield

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究通过仅提示干预减少大语言模型幻觉风险,提出I-CALM框架通过引导自信、奖励回避和加入规范原则提升事实性问题的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16210 2026-08-18 cs.LG stat.ML 新提交 83%

Conditional Evaluation of Language Models with Cheap Auxiliary Signals

基于廉价辅助信号的语言模型条件评估

Zhi Zhang, Lingfeng Lyu, Yue Kang, Doudou Zhou

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Science and Technology of China(中国科学技术大学) Microsoft(微软公司) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :language model(title);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 针对现有语言模型条件评估中廉价辅助信号存在偏差的问题,提出半监督估计器LACE,结合局部中心化与岭控制变量,在多个基准数据集上完成实证评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14694 2026-08-18 cs.AI cs.NI eess.SP 新提交 83%

A Comprehensive Survey of Wireless Foundation Models for AI-Native 6G Networks

面向AI原生6G网络的无线基础模型综合综述

Naveed Khan, Besan Al Sbeihi, Maryam Alshehhi, Nasir Saeed

机构 * College of Engineering, United Arab Emirates University(阿联酋大学工程学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 该综述针对无线基础模型(WFMs)的设计、学习与部署展开统一梳理,明确其概念与分类,综述相关架构、方法及应用,分析关键挑战并展望未来方向,为AI原生6G网络智能系统研发提供参考。

Comments 28 Pages, submitted to IEEE Communications Surveys and Tutorials

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24575 2026-08-18 cs.CV cs.AI 版本更新 83%

VFIG: Vectorizing Complex Figures in SVG with Vision-Language Models

VFIG:利用视觉-语言模型矢量化SVG中的复杂图形

Qijia He, Xunmei Liu, Hammaad Memon, Ziang Li, Zixian Ma, Jaemin Cho, Zhongzheng Ren, Daniel S Weld, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能 Allen 机构) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :language model(title);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出VFIG,一种基于视觉-语言模型的矢量化方法,通过大规模数据集和分层训练策略,实现复杂图形到SVG的高保真转换,并在基准测试中取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15980 2026-08-18 cs.CL cs.LG 新提交 82%

Whose Gold? Annotator-Pool Disagreement Is Large at the Item Level, and Hidden by Small Leaderboards

谁的“金标准”?标注者群体在条目层面分歧巨大,却被小型排行榜掩盖

Anik Jha

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 该研究发现标注者群体在条目层面分歧巨大,小型模型排行榜的一致性是假象,量化了其脆弱性,证明某数据集的标注者无差异假设错误,LLM评判器更贴合大众标注者群体。

Comments Submitted to the HAIC workshop at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14606 2026-08-18 cs.CY cs.AI cs.CL stat.AP 新提交 82%

Plausible but Not Valid: A Psychometric Audit of LLMs as Synthetic Survey Respondents

看似合理但并非有效:对大型语言模型(LLMs)作为合成调查受访者的心理计量学审查

Mantas Lukauskas, Viktorija Šarkauskaitė

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过心理计量学分析发现,虽LLMs可复现人类调查关系的定性方向,但其心理计量学相似性不及高斯copula基线,且存在默许偏移、预测效度下降等问题,无法作为人类调查数据的直接替代品。

Comments 50 pages, 9 figures. Under review. Code and data will be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04074 2026-08-18 cs.AI cs.LG 版本更新 82%

FactReview: Evidence-Grounded Peer Review with Execution-Based Claim Verification

FactReview:基于执行式声明验证的证据驱动同行评审

Ling Yue, Chaoqian Ouyang, Hang Xu, Ruijun Huang, Yuchen Liu, Libin Zheng, Wei Liu, Shaowu Pan, Shimin Di, Min-Ling Zhang

机构 * Rensselaer Polytechnic Institute(罗切斯特理工学院) Sun Yat-sen University(中山大学) Southeast University(东南大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出FactReview系统,通过提取与评审相关的声明、将其与相关工作关联,并在代码可用时在固定修复预算下执行发布工件来审计经验声明,覆盖84%的声明,将评审质量提升至4.86/5,并将评审时间减少58%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20253 2026-08-18 physics.comp-ph cs.AI cs.DC cs.LG 版本更新 82%

SimulCost: A Cost-Aware Benchmark and Toolkit for Automating Physics Simulations with LLMs

SimulCost: 一个用于自动化物理模拟的代价感知基准与工具包

Yadi Cao, Sicheng Lai, Jiahe Huang, Yang Zhang, Zach Lawrence, Rohan Bhakta, Izzy F. Thomas, Mingyun Cao, Chung-Hao Tsai, Zihao Zhou, Yidong Zhao, Hao Liu, Alessandro Marinoni, Alexey Arefiev, Rose Yu

机构 * University of California San Diego(加州大学圣地亚哥分校) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学) University of California, Los Angeles(加州大学洛杉矶分校) California Institute of Technology(加州理工学院) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 针对现有LLM评估忽略工具使用代价的问题,提出SimulCost基准,通过单轮和多轮参数调优任务比较LLM与传统扫描方法在准确性和计算代价上的表现,发现LLM在高精度任务中初始猜测不可靠且多轮模式效率更低。

Comments post conference revision version at ICML; update: removed CGYRO due to bug in cases search. Will add back soon; Make the title consistent w/ pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13079 2026-08-18 cs.AR cs.PL 版本更新 82%

ChipVerilog: A Large-Scale OpenCores-Derived Benchmark for LLM-Based Verilog RTL Generation

ChipVerilog:一个用于基于大语言模型的Verilog RTL生成的大规模、源自OpenCores的基准测试

Yan Tan, Jiping Du, Xiangchen Meng, Yangdi Lyu

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型的Verilog RTL生成,提出ChipVerilog基准测试,它源自OpenCores IP/核心设计,含64个生成目标,涵盖多种设计家族,能体现实际代码规模等,经多种方式验证生成的RTL,揭示大规模RTL生成有挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08759 2026-08-18 cs.CV cs.RO 版本更新 82%

Dissecting Embodied Abilities in Multimodal Language Models through Skill-level Evaluation and Diagnosis

通过技能级评估与诊断解构多模态语言模型的具身能力

Yu Qi, Haibo Zhao, Ziyu Guo, Siyuan Ma, Ziyan Chen, Yaokun Han, Renrui Zhang, Zitiantao Lin, Yizhe Zhu, Shiji Xin, Yijian Huang, Boce Hu, Kai Cheng, Peiheng Wang, Jiazheng Liu, Jiayi Zhang, Yizhe Zhu, Wenqing Wang, Yiran Qin, Haojie Huang, Lawson L. S. Wong

机构 * Northeastern University, Boston, MA, USA The Chinese University of Hong Kong, Hong Kong, China Peking University, Beijing, China Westlake University, Hangzhou, China Harvard University, Cambridge, MA, USA Purdue University, West Lafayette, IN, USA University of Oxford, Oxford, United Kingdom

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

AI总结 本文提出BEAR基准,通过分解具身任务为14个原子技能进行细粒度评估,发现感知能力是推理失败的主要瓶颈,并提出BEAR-Agent多模态对话代理,显著提升具身技能性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16733 2026-08-18 cs.AR cs.AI 新提交 81%

GoalEvolve: From Handcrafted Algorithm Priors to Goal-Driven Evolution of Physical Design Algorithms

GoalEvolve:从手工设计的算法先验到物理设计算法的目标驱动演化

Haixu Liu, Lei Zhou, Yuhao Ren, Yumao Wu, Zhiang Wang

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 GoalEvolve是一个目标驱动的物理设计算法演化框架,通过LLM教师与并行学生智能体协同,在8个ASAP7设计及Codex目标模式下,显著提升了TNS并降低了功耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16344 2026-08-18 cs.CL 新提交 81%

IndicQE-APE: A Benchmark for Quality Estimation and Automatic Post-Editing for Indic Languages

IndicQE-APE:印度语言质量估计与自动后编辑基准

Diptesh Kanojia, Archchana Sindhujan, Sourabh Deoghare, Daria Sokova, Shenbin Qian, Girish Koushik, Tharindu Ranasinghe, Constantin Orăsan, Chrysoula Zerva, Ricardo Rei, Frédéric Blain, André F. T. Martins, Marco Turchi, Matteo Negri, Rajen Chatterjee, Anoop Kunchukuttan, Mitesh M. Khapra, Pushpak Bhattacharyya

机构 * IIT Bombay(印度理工学院孟买分校) University of Oslo(奥斯陆大学) Lancaster University(兰卡斯特大学) INESC-ID Instituto de Telecomunicações(电信研究所) Instituto Superior Técnico(高等技术学院) University of Lisbon(里斯本大学) Sword Health Tilburg University(蒂尔堡大学) Zoom Communications(Zoom通信公司) Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) Apple(苹果公司) Bodhan AI IIT Madras(印度理工学院马德拉斯分校) University of Surrey(萨里大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 本研究构建了涵盖9个方向对的IndicQE-APE基准,对LLM、COMET指标及APE系统进行QE与APE基准测试,揭示质量信号冲突等因素对文本段排名的影响。

Comments Submitted to WMT 2026 for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16045 2026-08-18 cs.DB cs.AI 新提交 81%

Walk Before You Run: The Importance of Data Exploration for Data Analysis Agents

先跑再走:数据探索对数据分析智能体的重要性

Yike Yuan, Virum Ranka, Tina Lasisi, Lin Ma

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究指出LLM数据分析工具存在忽视数据探索步骤的差距,引入两个基准评估数据集理解,发现强模型仍会遗漏逻辑结构,显式数据探索可提升下游任务性能。

Comments 9 pages, 6 figures. Accepted to VLDB 2026 Workshop: DASHSys: Systems for Data-centric Agents with Human-in-the-loop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14863 2026-08-18 cs.SE cs.AI cs.DC 新提交 81%

Evaluating Agentic Code Repair Capabilities in Distributed Systems

评估分布式系统中智能体的代码修复能力

Yibo Yan, Huijuan Wang, Junzhou He, Yizhuo Liang, Shaoyu Wang, Huanchen Sun, Seo Jin Park

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究推出分布式系统代码修复基准DDBench,评估10个LLM的代码修复能力,发现调试上下文可提升准确率且对强弱模型影响不同,分布式调试能凸显单进程基准未体现的推理能力。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14680 2026-08-18 cs.AI cs.SE 新提交 81%

When Agentic Executions Fail: Detecting and Localizing Runtime Faults from Telemetry

当智能体执行失败时:从遥测数据中检测和定位运行时故障

Chenkai Zhang, Yiran Li, Yifang Tian, Michalis Bachras, Hans-Arno Jacobsen

机构 * University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出 AGENTCHAOSBENCH 基准,在智能体系统遥测数据中检测定位运行时故障,实验显示现有 LLM 基线对该任务的解决效果仍远未达标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16859 2026-08-18 cs.CV 新提交 80%

HarnessEval-W: Agentifying the Evaluation of Visual Worlds

HarnessEval-W:将视觉世界评估智能体化

Weiliang Chen, Haowen Sun, Jun Gao, Jiawei Chi, Hanyang Wang, Qiyu Dai, Yihao Li, Hao Li, Jingnan Gao, Yi-Hsin Hung, Xingzhuo Guo, Shangchen Miao, Zhiyuan Shi, Xiang Li, Fengrui Tian, Weihua Du, Ziqi Huang, Shenyuan Gao, Siqiao Huang, Mingyu Liu, Yifei Li, Shizun Wang, Xi Wang, Tianqi Zhang, Xue Luo, Xiyin Ren, Jinshan Ren, Xiaoyang Shen, Xiaobo Hu, Zhiyang Dou, Mingyu Ding, Yichao Yan, Xinchao Wang, Yizhou Wang, Shilong Liu, Wenzhao Zheng, Yueqi Duan, Yuan Gong, Ziwei Liu, Ming-Yu Liu, Jialong Wu, Jiangran Lyu, Fangfu Liu

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 该研究提出智能体化评估流程HarnessEval-W,将LLM生态的harness范式应用于世界模型基准测试,对18个世界模型的330个案例评估,其判断与人类偏好一致且提供可验证诊断,已开源并邀社区贡献。

Comments Project Page: https://mirros-lab.github.io/HarnessEval-W

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16067 2026-08-18 cs.HC 新提交 80%

SiMUSation: An Interactive Visitor Experience Simulation Framework to Support Museum Exhibition Design

SiMUSation:一种支持博物馆展览设计的交互式参观者体验模拟框架

Huanchen Wang, Qiuming Chen, Zhonghao Ji, Ruqi Sun, Zhichao Lu, Yuxin Ma

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 该研究提出SiMUSation交互式框架,通过LLM驱动的角色模拟,支持博物馆展览早期设计,经12人用户研究验证其可辅助设计反思优化。

Comments 15 pages, 7 figures, 3 tables, Accepted by ACM UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15814 2026-08-18 cs.CR 新提交 80%

Assessing Attack Surfaces in Generative Search Engines through Publisher Attributes: A Case Study in Political Domains

基于发布者属性评估生成式搜索引擎的攻击面:政治领域的案例研究

Riku Mochizuki, Shusuke Komatsu, Souta Noguchi, Kazuto Ataka

专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本研究针对政治领域,提出评估框架与“内容注入屏障”指标,发现不同GSE攻击面有别、执政党攻击面更广、用户画像影响小,揭示了GSE的攻击面特征。

Comments Our full paper will be presented at ACM CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16805 2026-08-18 cs.CV cs.AI 新提交 79%

Diagnosing Dense Same-Class Attribute Misbinding in Large Vision-Language Models

诊断大视觉语言模型中的密集同类属性绑定错误

Yuanzhi Xu, Qian Gao, Jun Fan, Guohui Ding, Zhenyu Yang, Yuteng Xiao, Sixue Lin

机构 * Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院)) China Telecom Digital Intelligence Technology Co., Ltd.(中国电信数字智能科技有限公司) Shenyang Aerospace University(沈阳航空航天大学) University of Nottingham Ningbo China(宁波诺丁汉大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本研究提出InstaBind-Lite基准,量化大视觉语言模型的密集同类属性绑定错误(DSCAM),发现其错误率被总准确率掩盖,多数转移来自相邻实例,该基准可评估模型对属性所属实例的认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15578 2026-08-18 cs.SD cs.AI 新提交 79%

ARENA: Automated Red-Teaming for Large Audio Language Models

ARENA:大型音频语言模型的自动化红队测试

Jiaming He, Zhicong Huang, Tian Jin, Zhen Sun, Cheng Hong, Yi Yu, Wenbo Jiang, Xudong Jiang

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出ARENA闭环框架,基于2000个文本-音频数据集训练控制器,在520个AdvBench目标上对多个LALMs实现高FDR/PSR,验证了其在音频红队测试中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15565 2026-08-18 cs.AI 新提交 79%

Admission Without Answers: Label-Free Certification and Experience Learning for LLM-Based Optimization Modeling

无答案准入:基于大语言模型的优化建模的无标注认证与经验学习

Junbo Jacob Lian, Huiling Chen, Hanzhang Qin, Chung-Piaw Teo

机构 * Institute of Operations Research and Analytics(运营研究与分析研究所) National University of Singapore(新加坡国立大学) Wenzhou Buyi Pharmacy(温州布衣药房) College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Wenzhou University(温州大学)

专题命中 评测与基准 :LLM(title);prompting(abstract);分类 cs.AI

AI总结 本文提出AdmitOR这一无标注准入机制,通过跨家族团校准阈值实现模型接纳,在优化建模任务中显著提升接纳精度并减少污染接纳,为无标注场景下的模型准入提供了新方案。

Comments Code and data are available at \url{https://github.com/junbolian/AdmitOR}

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15425 2026-08-18 cs.CV cs.AI 新提交 79%

NumerosityVLM: A Cognitively Inspired Benchmark for Interpreting Numerosity Representations in Vision-Language Models

NumerosityVLM:一种受认知启发的、用于解释视觉-语言模型中数量表征的基准测试

Yiming Fu, Fangjun Li, Xiujin Liu, Ruidong Ma, Hang Yu, Zhichen Lu, Kanwei He, Alessandro Di Nuovo, Angelo Cangelosi, Zhegong Shangguan

机构 * The University of Manchester(曼彻斯特大学) University of Michigan(密歇根大学) Sheffield Hallam University(谢菲尔德哈勒姆大学) Tufts University(塔夫茨大学) ENSTA, Institut Polytechnique de Paris(巴黎综合理工学院国立高等先进技术学校)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究针对视觉-语言模型数量感知研究的基准缺陷,提出受认知启发的NumerosityVLM基准,评估7个模型发现架构对性能影响最大,数量信号出现在视觉编码器早期,差异主要来自语言模型组件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11891 2026-08-18 cs.CY cs.AI cs.HC 版本更新 79%

Benchmark-Based Comparative Assessment of Publicly Benchmarked Indian Foundation Models: A Capability and Evaluation-Maturity Framework

基于基准的公开基准印度基础模型对比评估:能力与评估成熟度框架

Avinash Agarwal, Vridhi Jain

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出能力与评估成熟度框架,对公开基准的印度基础模型与全球同类模型对比评估,发现其在传统基准表现尚可但参与新评估不足,还提出基准成熟度指数,指出能力差距或源于评估生态问题。

Comments 19 pages, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00801 2026-08-18 cs.AI cs.IR 版本更新 79%

The Synthetic Web: Adversarially-Curated Mini-Internets for Diagnosing Epistemic Weaknesses of Language Agents

合成网络:用于诊断语言代理知识弱点的对抗性定制迷你互联网

Shrey Shah, Levent Ozgur

机构 * Microsoft(微软)

专题命中 评测与基准 :language agent(title,abstract);分类 cs.AI

AI总结 本研究提出合成网络基准测试,通过对抗性内容测试揭示语言代理在处理冲突信息时的弱点,为高风险领域中的可靠代理开发提供评估框架。

Comments This version includes a revised manuscript presentation and formatting, expanded methodological and experimental details, enhanced reproducibility documentation, and improved benchmark framing and evaluation descriptions

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18094 2026-08-18 cs.CV cs.AI cs.DB 版本更新 79%

OODBench: Out-of-Distribution Benchmark for Large Vision-Language Models

OODBench: 用于大型视觉-语言模型的分布外基准

Ling Lin, Yang Bai, Heng Su, Congcong Zhu, Yaoxing Wang, Yang Zhou, Huazhu Fu, Jingrun Chen

机构 * University of Science and Technology of China Suzhou Institute for Advanced Research, USTC Key Laboratory of the Ministry of Education for Mathematical Foundations Unmanned System Research Institute, Northwestern Polytechnical University

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 OODBench提出了一种自动化方法,用于构建评估大型视觉-语言模型处理分布外数据能力的基准,并展示了当前模型在面对此类数据时的性能下降。

Comments 54 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15630 2026-08-18 cs.HC cs.AI cs.CL 新提交 79%

Do Assessment Instruments Measure the Same Thing for Humans and LLMs? A Latent Structure Analysis

评估工具对人类和大语言模型(LLMs)是否测量相同的内容?潜在结构分析

Alona Strugatski, Licol Zeinfeld, Giora Alexandron

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过探索性因子分析等方法,发现高中化学和大学入学考试定量推理部分的评估,对人类与六个多模态LLMs测量的潜在结构存在系统性差异,质疑了此类评估用于推断AI能力的效度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14577 2026-08-18 cs.CL cs.AI 新提交 79%

HarmProfile: Characterizing Harmful Distributions in Frontier LLMs

HarmProfile:刻画前沿大语言模型中的有害分布

Zhouyuan Ma, Yutao Wu, Hanxun Huang, Xiang Zheng, Xiao Liu, Yixin Cao, Zuxuan Wu, Xingjun Ma, Yu-Gang Jiang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出HarmProfile基准数据集,收集23个前沿LLMs的超8万条有害输出,发现其有害性与多样性随模型能力增长,潜藏对齐表面下的危险知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16263 2026-08-18 cs.CV 新提交 78%

Seeing Before Answering: Training-Free Visual Layer Profiling for Vision-Language Models

先见后答:面向视觉语言模型的无训练视觉层分析

Ruchen Liu, Yi Yang, Yiming Xu, Michael Ying Yang, Monika Sester, Bodo Rosenhahn

机构 * Leibniz Universität Hannover(汉诺威莱布尼茨大学) University of Bath(巴斯大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 该研究提出无需训练的视觉数据集熵(VDE)方法,可预测视觉语言模型的最优视觉层,缩小搜索范围,相比GW距离更具实用性。

Comments ECCVW'26 eXCV

详情

展开后加载摘要…

URL PDF HTML 收藏