arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2707 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2707 篇

2608.05015 2026-08-06 econ.TH cs.AI cs.LG 新提交 79%

Revealed Rationality: Label-Free Evaluation and Regularization from Representation Theorems

显示理性:基于表示定理的无标签评估与正则化

Isaiah Andrews

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文利用决策理论表示定理的“当且仅当”结构,提出对LLM等AI系统的无标签评估与正则化方法,通过三个实例生成零值连续惩罚项,补充其他训练信号。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05086 2026-08-06 cs.AI cs.CL 新提交 79%

Item Response Theory for AI Safety

面向AI安全的项目反应理论

Joshua Fonseca Rivera, Neil Shah, David Demitri Africa, Konstantinos Voudouris

机构 * Independent(独立研究者)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究将项目反应理论(IRT)应用于192个语言模型的8个安全基准,识别出三个关键因素,证明IRT可降低评估成本并审计模型,建议前沿实验室采用。

Comments 15 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03095 2026-08-05 cs.CL cs.LG 新提交 79%

VIVID: A Culturally Grounded Benchmark Exposing the Figurative Language Gap in Vietnamese NLP

VIVID:面向越南NLP中比喻语言差距的文化基准测试集

Tu Tran Do, Nhat Ngoc Nguyen, Khanh-Tung Tran, Hoang D. Nguyen, Tu Minh Phuong, Long Hoang Dang

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.LG

AI总结 研究团队构建了首个越南文化比喻语言基准VIVID,评估发现越南专用NLP模型远弱于多语言系统,顶尖模型得分不足满分50%,少样本提示未必提升性能,VIVID为相关研究提供关键工具。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25340 2026-07-29 cs.AI cs.CL 新提交 79%

Cardiologent: Multi-Agent Clinical Decision Support for Patient-Level Arrhythmia Assessment, Urgency, and Management

Cardiologent:用于患者级心律失常评估、紧急情况和管理的多智能体临床决策支持

Sukju Oh, Moo-Yong Rhee, Jae-Sik Jang, Sukkyu Sun

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对患者级心律失常决策支持问题,提出多智能体系统Cardiologent,每个信号对应智能体基于测量特征读取数据,整合为心律概况并对照指南推理,经评估在多方面表现最佳,使决策可审核,向连续监测迈进。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20241 2026-07-23 cs.CL cs.AI 新提交 79%

On the Systematic Challenges of Culturally Loaded Machine Translation: Dream of the Red Chamber as the Cultural Lens

论文化负载机器翻译的系统性挑战:以《红楼梦》为文化视角

Yiming Wang, Jiayuan Di

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) School of Foreign Languages, East China University of Science and Technology(华东理工大学外国语学院) Mejiro University(目白大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究以《红楼梦》构建数据集,系统探究基于大语言模型的机器翻译系统中文化负载翻译的挑战,揭示任务、人工评估及自动评估方面的问题,为文化导向的翻译研究提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14524 2026-07-17 cs.AI cs.CL 新提交 79%

WrAFT: a Modularized Automated Writing Evaluation System for Argumentative Essays

WrAFT:一种用于议论文的模块化自动写作评估系统

Adnan Labib, Yixuan Huang, Jiahui Wu, John Maurice Gayed, Zheng Yuan, Qiao Wang

机构 * Department of Informatics, King’s College London(伦敦国王学院信息学系) Waseda University(早稻田大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Sheffield(谢菲尔德大学) Hosei University(法政大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究提出WrAFT这一用于议论文的模块化自动写作评估系统,通过模块化设计及评估多种大语言模型构建,在评分上达先进水平,人机评估反馈认可度高,且开发了公开免费的交互式用户界面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14349 2026-07-17 cs.CL cs.AI 新提交 79%

HABIB_TAZ at SemEval-2026 Task 11: Disentangling Formal Logic from Content via Synthetic Training and Multi-Objective Optimization

HABIB_TAZ参加SemEval-2026任务11:通过合成训练和多目标优化从内容中分离形式逻辑

Abdullah Shaikh, Zain Naqi, Taha Zahid, Sandesh Kumar, Abdul Samad

机构 * Dhanani School of Science & Engineering Habib University(哈比卜大学达纳尼科学与工程学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对SemEval-2026任务11,用基于三段论合成数据集微调的mDeBERTa-v3网络,结合多目标损失函数应对大语言模型形式推理受内容影响的问题,在多个子任务中取得优异成绩,还公开了数据集生成引擎和代码库。

Journal ref Proceedings of the 20th International Workshop on Semantic Evaluation (2026), pp. 1006-1014 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14185 2026-07-17 cs.LG cs.AI 新提交 79%

Closed-Loop Knowledge Dynamics: An Operational Framework for Saturation and Escape

闭环知识动力学:饱和与逃逸的操作框架

Xuening Wu, Shan Yu, Shenqin Yin

机构 * Pfizer(辉瑞公司) Institute of Humanities and Social Science Data, Fudan University(复旦大学人文社会科学数据研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究闭环知识系统饱和及逃逸问题,引入三级操作框架,利用李雅普诺夫漂移条件等刻画系统动态,通过案例展示反馈影响,建立了稳定性工具、干预效果与跨域诊断间的操作联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13041 2026-07-16 cs.CY cs.AI cs.LG cs.MM 新提交 79%

LessonBench-V1: A Benchmark Dataset for Evaluating AI Lesson Generation Agents

LessonBench-V1:用于评估人工智能课程生成代理的基准数据集

Ravidu Suien Rammuni Silva, Ahmad Lotfi, Isibor Kennedy Ihianle, Golnaz Shahtahmassebi, Jordan J. Bird

机构 * Department of Computer Science, Nottingham Trent University, Nottingham, UK(计算机科学系,诺丁汉特伦特大学,诺丁汉,英国) Department of Physics and Mathematics, Nottingham Trent University, Nottingham, UK(物理与数学系,诺丁汉特伦特大学,诺丁汉,英国)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对无标准化基准评估人工智能课程生成系统的问题,引入LessonBench-V1基准数据集,其含人工编写课程与逆向工程课程计划,经人工审核并综合多种教学方法生成,可系统评估相关代理,还提出三维评估管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11951 2026-07-15 cs.AI cs.CL cs.FL cs.PL 新提交 79%

GRID: Grammar-Railed Decoding for Enterprise SQL Generation

GRID:用于企业SQL生成的语法约束解码

Mohsen Arjmandi

机构 * evolutionID GmbH(进化ID有限公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对企业SQL生成需求,提出GRID语法约束解码引擎,通过特定方式确定令牌掩码,编译角色访问控制,有四个保证。经实验,Rust内核降低掩码时间,在Spider上约束解码提升模型可执行率,还具备审计跟踪和篡改检测功能。

Comments 18 pages, 3 figures. Extended version; a condensed version is under review at KDD 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10720 2026-07-14 cs.AI cs.LG cs.MA 新提交 79%

WattCouncil: Context-Aware Household Energy Scenario Generation With Governed LLMs

瓦特委员会:基于受治理大语言模型的情境感知家庭能源情景生成

Mohannad Takrouri, Nicolas M. Cuadrado A., Martin Takáč

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对智能电网因数据受限发展受阻的问题,提出瓦特委员会框架,利用基于大语言模型的代理,在文化、时间和物理等约束下生成家庭能源情景,经实验评估及消融研究验证了其有效性和一致性。

Comments 11 pages, 5 figures

Journal ref The 13th ACM International Conference on Systems for Energy-Efficient Buildings, Cities, and Transportation (BuildSys 26), June 22-25, 2026, Banff, AB, Canada. ACM, New York, NY, USA, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10628 2026-07-14 cs.CL cs.AI cs.HC 新提交 79%

Anamnesis: An Open-Source Platform for Large-Scale Backstory-Conditioned Survey Simulation

记忆回溯:一个用于大规模背景条件调查模拟的开源平台

Song-Ze Yu, Joseph Suh, Serina Chang, David M. Chan

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 介绍开源平台记忆回溯,用于大规模背景条件调查模拟。它运用大语言模型,基于文集和他性框架,支持多模态调查。通过案例研究评估,其产生的意见分布更接近真实数据,为专有模拟服务提供替代。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18613 2026-07-13 cs.CL cs.AI 新提交 79%

Are LLMs Ready to Assist Physicians? PhysAssistBench for Interactive Doctor-Patient-EHR Assistance

LLMs 是否已准备好辅助医生?PhysAssistBench:交互式医患-电子病历辅助基准

Tianming Du, Peijie Yu, Sihan Shang, Danli Shi, My Linh Nguyen, Shengbo Gao, Guangyuan Li, Yinghong Yu, Yan Jiang, Qianlong Zhao, Behzad Bozorgtabar, Shaoxiong Ji, Jiazhen Pan, Daniel Rueckert, Jiancheng Yang

机构 * Aalto University(阿尔托大学) Tencent(腾讯) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Hong Kong Polytechnic University(香港理工大学) Aarhus University(奥胡斯大学) Technical University of Munich(慕尼黑工业大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出PhysAssistBench基准,通过构建交互式患者代理评估LLM在医患-EHR交互中的协调能力,发现当前模型不可靠,瓶颈在于多维度协调而非单一能力。

Comments 34 pages with 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03091 2026-07-07 cs.AI cs.CL cs.CY cs.MA stat.ME 新提交 79%

Silicon Sampling via Cross-Survey Transfer

通过跨调查转移进行硅采样

Chan-Tung Ku, Chan Hsu, Pei-Cing Huang, Frank Cheng-shan Liu, I-Ling Cheng, Yihuang Kang

机构 * National Sun Yat-sen University(国立中山大学) National Chung Hsing University(中国台湾国立中兴大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究提出跨调查转移评估框架,用大语言模型根据部分问题答案预测同调查中其他不同问题答案。利用2024年台湾选举与民主化研究数据等,发现零样本大语言模型精度及不同结构可预测性层级等,明确硅采样前景与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20659 2026-07-07 cs.AI cs.LG cs.SE 新提交 79%

Skill Coverage: A Test Adequacy Metric for Agent Skills

技能覆盖率:一种用于智能体技能的测试充分性度量

Boyin Tan, Xiaowei Huang, Youcheng Sun

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Liverpool(利物浦大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出技能覆盖率度量,通过提取技能文档中的行为约束并评估智能体轨迹是否提供足够证据来测试技能,发现现有基准仅覆盖39.90%-43.98%的约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01305 2026-07-03 cs.CR cs.AI cs.LG 新提交 79%

Generative AI and Federated Learning for Intrusion Detection Systems: A Survey

生成式人工智能与联邦学习在入侵检测系统中的应用:综述

Jiefei Liu, Abu Saleh Md Tayeen, Pratyay Kumar, Qixu Gong, Wenbin Jiang, Huiping Cao, Satyajayant Misra, Jayashree Harikumar

机构 * Department of Computer Science, New Mexico State University(新墨西哥州立大学计算机科学系) University of Hartford(哈特福德大学) DEVCOM Analysis Center(DEVCOM分析中心)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了生成式AI和联邦学习在入侵检测中的应用,涵盖模型分类、任务目标及集成方法,并讨论了数据质量、对抗风险等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23884 2026-07-02 cs.CL cs.AI 新提交 79%

One Year Later...The Harms Persist, But So Do We!

一年后...伤害持续,但我们仍在!

Annika Marie Schoene, Cansu Canca, Gautham Vijay Kumar, Anson Antony

机构 * Northeastern University(东北大学) Florida International University(佛罗里达国际大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究评估六种商用大语言模型在16种DSM-5条件下的安全性,发现除自杀和自伤外,其他精神障碍(如进食障碍、物质使用障碍、重度抑郁障碍)的防护失败率高达100%,呼吁按临床条件定义伤害类别并实施防护。

Comments 20 pages, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32004 2026-07-01 cs.AI cs.LG cs.LO cs.SC 新提交 79%

PolicyGuard: From Organizational Policies to Neuro-SymbolicCompliance Review Engines

PolicyGuard: 从组织策略到神经符号合规审查引擎

Sameer Malik, Ayush Singh, Amar Prakash Azad

机构 * Fujitsu Research India Private Limited, Bengaluru, India(富士通研究印度私人有限公司,印度班加罗尔)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 提出PolicyGuard框架,将组织策略转化为可执行的神经符号审查引擎,通过分离策略形式化、局部文档解释和符号合规评估,实现显式、可维护且可系统测试的文档合规审查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31464 2026-07-01 cs.CL cs.AI 新提交 79%

Team MKC at CLPsych 2026: Capturing and Characterizing Mental Health Changes through Social Media Timeline Dynamics

Team MKC 在 CLPsych 2026:通过社交媒体时间线动态捕捉和表征心理健康变化

Kyomin Hwang, Hyeonjin Kim, Hyunho Lee, Nojun Kwak

机构 * Seoul National University(首尔大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于大语言模型的流水线,通过分析用户按时间排序的帖子,实现帖子级评估和用户级时间建模,以支持心理健康的早期检测和持续监测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31435 2026-07-01 cs.AI cs.CL 新提交 79%

CDR-Bench: Evaluating Faithful Execution of Compositional, Order-Sensitive Data Refinement Recipes

CDR-Bench:评估组合式、顺序敏感数据精炼配方的忠实执行

Yuchen Huang, Xiang Li, Zhenqing Ling, Sijia Li, Qianli Shen, Daoyuan Chen, Yi R. Fung, Yaliang Li

机构 * HKUST(香港科技大学) NUS(新加坡国立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出CDR-Bench基准,包含3462个高质量任务,评估LLM在组合式和顺序敏感设置下直接执行数据精炼配方的能力,发现当前LLM缺乏程序忠实性。

Comments 29 pages, 20 figures. Corresponding authors: Daoyuan Chen and Yi R. Fung

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22166 2026-06-23 cs.DL cs.AI cs.LG 新提交 79%

Rebuttals Move Peer-Review Scores, but Initial-Review Structure Bounds the Movement

反驳会改变同行评审分数,但初始评审结构限制了变化幅度

Mathieu Louis, Tibo Vanleke, Vincent Ginis, Andres Algaba

机构 * Data Analytics Lab, Vrije Universiteit Brussel(自由大学布鲁塞尔数据分析实验室) imec-SMIT, Vrije Universiteit Brussel(imec-SMIT,自由大学布鲁塞尔) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI、cs.LG

AI总结 利用ICLR 2024-2025的73,000条评审轨迹,结合LLM分析,发现反驳能改变分数,但初始评审结构已预测大部分变化,且可测量的交换信号多为反驳失败模式。

Comments 26 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09178 2026-06-23 cs.CL cs.AI 新提交 79%

Culturally-Adapted Red-Teaming Across East and Southeast Asian Contexts: A Methodological and Comparative Analysis

跨东亚和东南亚语境的文化适应红队测试:方法论与比较分析

Hyeji Choi, Yongtaek Lim, Minwoo Kim

机构 * University of California, Berkeley(加州大学伯克利分校) Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型的多语言安全评估,通过构建直接翻译与文化适应数据集,发现文化适应提示的攻击成功率平均提升9.3个百分点,直接翻译低估风险,且文化深度评分显著低于文化适应版本,表明适应文化语境对有效评估至关重要。

Comments Accepted to ICML 2026 Workshop on Culture X AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19595 2026-06-19 cs.LG cs.AI 新提交 79%

IHBench: Evaluating Post-Interruption Recovery in Voice Agents with Structured Workflows

IHBench:评估语音代理在结构化工作流中的中断后恢复能力

Ahmad Salimi, Wentao Ma, Yuzhi Tang, Dongming Shen, Mu Li, Alex Smola

机构 * Boson AI

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出IHBench基准,评估语音代理在结构化工作流中处理中断后的恢复能力,涵盖任务完成和恢复质量两个维度,实验表明闭源模型比开源模型更鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18782 2026-06-18 cs.CL cs.AI 新提交 79%

RedactionBench

RedactionBench:基于上下文完整性的隐私保护基准测试

Sean Brynjólfsson, Shashvat Jayakrishnan, Esha Sali, Diptanshu Purwar, Madhav Aggarwal

机构 * A10 Networks, Inc.(A10网络公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 RedactionBench通过200个跨11个领域的文档,评估红actions的上下文隐私问题,提出R-Score指标,揭示红actions的主观性,推动隐私保护系统的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18193 2026-06-17 cs.CR cs.AI cs.CL 新提交 79%

A Red-Team Study of Anthropic Fable 5 & Opus 4.8 Models

Anthropic Fable 5 与 Opus 4.8 模型的红队研究

Nicola Franco

机构 * AI4I

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过 HackAgent 框架对两个前沿大语言模型进行自动化越狱攻击,发现尽管模型抵抗大部分攻击,但自适应迭代攻击仍能成功,且残差表面比总体框架更大。

Comments White paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13802 2026-06-15 cs.SE cs.AI cs.HC cs.LG 新提交 79%

A Benchmark and Framework for Evaluating Next Action Predictions in Spreadsheets

电子表格中下一步动作预测的基准测试与框架

Tejas Agrawal, Vu Le, Sumit Gulwani, Gust Verbruggen

机构 * University of Waterloo(多伦多大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);SLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 针对电子表格缺乏自动补全功能的问题,提出一个基准测试,通过人工整理动作序列和在线评估方法,比较多种预测模型,分析动作保存、误报、效率等特性。

Comments Accepted at ICML 2026. Code and benchmark: https://github.com/Tej-55/NAPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12754 2026-06-12 cs.CL cs.AI 新提交 79%

LLMs Can Better Capture Human Judgments--With the Right Prompts

LLMs 能更好地捕捉人类判断——使用合适的提示

Danica Dillion, Chen Cecilia Liu, Baihui Wang, Daniele Barolo, Tanmay Rajore, Niket Tandon, Pranathi Ravikumar, Kurt Gray

机构 * Complexity Science Hub, Vienna(维也纳复杂科学中心) The Ohio State University(俄亥俄州立大学) University of Cambridge(剑桥大学) University of Chicago(芝加哥大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 通过简单提示策略,LLMs 能恢复人类反应的完整分布,并减少对措辞变化的敏感性,提升 AI-人类对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16263 2026-08-18 cs.CV 新提交 78%

Seeing Before Answering: Training-Free Visual Layer Profiling for Vision-Language Models

先见后答:面向视觉语言模型的无训练视觉层分析

Ruchen Liu, Yi Yang, Yiming Xu, Michael Ying Yang, Monika Sester, Bodo Rosenhahn

机构 * Leibniz Universität Hannover(汉诺威莱布尼茨大学) University of Bath(巴斯大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 该研究提出无需训练的视觉数据集熵(VDE)方法,可预测视觉语言模型的最优视觉层,缩小搜索范围,相比GW距离更具实用性。

Comments ECCVW'26 eXCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16081 2026-08-18 cs.CV 新提交 78%

SafeGesture: Evaluating Fine-Grained Hand Gesture Understanding in Vision-Language Models through Scenario-Conditioned Safety Interpretation

SafeGesture:通过场景条件安全解释评估视觉语言模型的细粒度手势理解能力

Taegang Kim, Saleh Afroogh, Junfeng Jiao

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Urban Information Lab, The University of Texas at Austin(德克萨斯大学奥斯汀分校城市信息实验室)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出SafeGesture基准,评估5款视觉语言模型的细粒度手势安全理解能力,发现模型存在感知与推理脱节,瓶颈为场景条件安全推理而非手势识别。

Comments 14 pages, 22 tables, 2 figures. Code and benchmark resources available at https://github.com/The-Responsible-AI-Initiative/SafeGesture

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15539 2026-08-18 cs.CV 新提交 78%

CrossView: Can Vision-Language Models Reason Across Cameras?

CrossView:视觉-语言模型能否跨相机进行推理?

Sahil Shah, S P Sharan, Harsh Goel, Manvik Pasula, Adithya Hebbalae, Minkyu Choi, Sandeep P. Chinchali

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出CrossView多相机视频问答基准,评估发现GPT-5.2等模型跨相机推理准确率低,开源模型表现更差,该基准可用于测试模型联合处理多视角的能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏