arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-15 至 2026-04-15 共收录 328 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 74 篇

2604.12284 2026-04-15 cs.CR 50%

WebAgentGuard: A Reasoning-Driven Guard Model for Detecting Prompt Injection Attacks in Web Agents

WebAgentGuard: 一种基于推理的守护模型,用于检测Web代理中的提示注入攻击

Yulin Chen, Tri Cao, Haoran Li, Yue Liu, Yibo Li, Yufei He, Le Minh Khoi, Yangqiu Song, Shuicheng Yan, Bryan Hooi

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出WebAgentGuard,一种基于推理的多模态守护模型,用于检测Web代理中的提示注入攻击。通过构建合成多模态数据集并采用推理密集型监督微调和强化学习,模型在多个基准测试中优于现有方法,同时保持代理的实用性,不引入额外延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 61 篇

2604.12218 2026-04-15 cs.LG cs.SE 93%

LLM-Enhanced Log Anomaly Detection: A Comprehensive Benchmark of Large Language Models for Automated System Diagnostics

基于大语言模型的日志异常检测:一种全面的大型语言模型基准测试,用于自动化系统诊断

Disha Patel

机构 * Department of Computer Science(计算机科学系) California State University, Fullerton(加州州立大学弗雷斯诺分校)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文通过四个公开数据集评估了基于大语言模型和传统方法的日志异常检测,发现微调的Transformer模型在F1分数上表现最佳,而基于提示的LLM在零样本设置中展现出显著优势,且无需标注数据。

Comments 5 pages, 4 tables, code available at https://github.com/disha8611/llm-log-anomaly-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12312 2026-04-15 cs.CL 92%

CompliBench: Benchmarking LLM Judges for Compliance Violation Detection in Dialogue Systems

CompliBench:对话系统中LLM判别器合规性违规检测基准测试

Jingbo Yang, Guanyu Yao, Bairu Hou, Xinghan Yang, Nikolai Glushnev, Iwona Bialynicka-Birula, Duo Ding, Shiyu Chang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) Cresta

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CompliBench基准测试,用于评估LLM判别器在多轮对话中检测和定位违规指南的能力。通过自动化数据生成管道解决数据稀缺问题,展示小型判别器模型在合成数据上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12545 2026-04-15 cs.AI cs.CY 91%

Cross-Cultural Simulation of Citizen Emotional Responses to Bureaucratic Red Tape Using LLM Agents

跨文化模拟公民对官僚繁文缛节的情感反应使用LLM代理

Wanchun Ni, Jiugeng Sun, Yixian Liu, Mennatallah El-Assady

机构 * ETH Zurich(苏黎世联邦理工学院) City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 本文通过LLM代理模拟不同文化背景下公民对官僚繁文缛节的情感反应,发现模型在东方文化中表现较弱,提出RAMO交互界面以改进模型性能。

Comments To appear in the CHI 2026 Workshop on PoliSim

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22359 2026-04-15 cs.AI cs.CL 91%

League of LLMs: A Benchmark-Free Paradigm for Mutual Evaluation of Large Language Models

语言模型联盟:一种无需基准的多轮相互评估范式

Qianhong Guo, Wei Xie, Xiaofang Cai, Enze Wang, Shuoyoucheng Ma, Xiaobing Sun, Tian Xia, Kai Chen, Xiaofeng Wang, Baosheng Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Institute of High Performance Computing, A*STAR(A*STAR高性能计算研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出无需基准的语言模型评估范式League of LLMs,通过多轮相互评估区分模型能力并保持高稳定性,揭示传统方法难以捕捉的实证发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09601 2026-04-15 cs.AI cs.CE 90%

Hubble: An LLM-Driven Agentic Framework for Safe, Diverse, and Reproducible Alpha Factor Discovery

Hubble:一种基于LLM的代理框架,用于安全、多样且可重复的阿尔法因子发现

Runze Shi, Shengyu Yan, Yuecheng Cai, Chengxi Lv

机构 * Celestial Quant Lab, Canada(加拿大天体量化实验室) The University of British Columbia, Canada(加拿大不列颠哥伦比亚大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Hubble结合大语言模型和领域特定操作语言,通过抽象语法树执行沙盒、双通道检索增强生成模块和家族感知选择机制,实现安全、多样且可重复的阿尔法因子发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12064 2026-04-15 cs.CR cs.SE 89%

LLM-Redactor: An Empirical Evaluation of Eight Techniques for Privacy-Preserving LLM Requests

LLM-Redactor: 对八种隐私保护LLM请求技术的实证评估

Justice Owusu Agyemang, Jerry John Kponyo, Elliot Amponsah, Godfred Manu Addo Boakye, Kwame Opuni-Boachie Obour Agyekum

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文评估了八种隐私保护LLM请求技术,发现组合A+B+C在保护PII和专有代码方面效果最佳,提出基于威胁模型的决策规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12108 2026-04-15 cs.SE cs.AI 89%

LLM-Based Automated Diagnosis Of Integration Test Failures At Google

基于LLM的谷歌集成测试故障自动诊断

Celal Ziftci, Ray Liu, Spencer Greene, Livio Dalloro

机构 * GoogleUSA(美国谷歌)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出Auto-Diagnose工具,利用LLM高效诊断集成测试故障,通过分析日志生成摘要并集成至代码审查系统,实验证明其高准确率和用户认可。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20635 2026-04-15 cs.CL cs.AI 88%

Why Did Apple Fall: Evaluating Curiosity in Large Language Models

苹果为何坠落:评估大语言模型中的好奇心

Haoyu Wang, Sihang Jiang, Yuyan Chen, Xiaojun Meng, Jiansheng Wei, Yitong Wang, Yanghua Xiao

机构 * Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(上海数据科学 key laboratory,计算机科学学院,复旦大学) Huawei Large Model Data Technology Lab(华为大模型数据技术实验室) Cornell University(康奈尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文基于人类好奇心评估量表,设计评估框架,发现大语言模型对知识有更强的渴求,但在不确定环境中仍保守,好奇心可提升推理与学习能力。

Comments ACL 2026 findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12268 2026-04-15 cs.SE cs.CL 88%

CodeSpecBench: Benchmarking LLMs for Executable Behavioral Specification Generation

CodeSpecBench: 用于可执行行为规范生成的LLM基准测试

Zaoyu Chen, Jianbo Dai, Boyu Zhu, Jingdong Wang, Huiming Wang, Xin Xu, Haoyang Yuan, Zhijiang Guo, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Edinburgh(爱丁堡大学) UCL(伦敦大学学院) CUHK (SZ)(香港中文大学(深圳)) SUTD(新加坡科技设计大学) HKUST(香港科技大学) CUHK(香港中文大学) HKUST (GZ)(香港科技大学(广州))

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CodeSpecBench,一个基于执行评估协议的LLM可执行行为规范生成基准,评估了15种最新LLM在函数和仓库级任务中的表现,发现仓库级任务性能显著下降,且规范生成比代码生成更具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12128 2026-04-15 cs.CL 88%

When Self-Reference Fails to Close: Matrix-Level Dynamics in Large Language Models

当自我参照失效时:大型语言模型中的矩阵级动态

Ji Ho Bae

机构 * JRTI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究自我参照输入如何改变大型语言模型的内部矩阵动态,发现自我参照并非总是不稳定,非闭合真理递归(NCTR)提示导致注意力有效秩异常升高,且在多个指标上比稳定自我参照更不稳定。

Comments 14 pages, 4 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11120 2026-04-15 cs.AI 88%

Persona Non Grata: Single-Method Safety Evaluation Is Incomplete for Persona-Imbued LLMs

不受欢迎的人:针对具有人格特征的LLM,单一方法的安全性评估是不完整的

Wenkai Li, Fan Yang, Shaunak A. Mehta, Koichi Onoue

机构 * Carnegie Mellon University(卡内基梅隆大学) Fujitsu Research of America Inc.(富士通美国研究公司)

专题命中 评测与基准 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.AI

AI总结 本文指出,针对具有人格特征的LLM,仅通过提示进行的安全性评估不完整,因为提示和激活引导暴露了不同的、依赖于架构的漏洞特征。研究显示,激活引导的漏洞无法通过提示侧排名预测,且在不同架构模型中表现各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12851 2026-04-15 cs.CY 88%

Can Persona-Prompted LLMs Emulate Subgroup Values? An Empirical Analysis of Generalisability and Fairness in Cultural Alignment

基于人物提示的LLM能否模拟子群体价值观?对文化契合性一般性和公平性的实证分析

Bryan Chen Zhengyu Tan, Zhengyuan Liu, Xiaoyuan Yi, Jing Yao, Xing Xie, Nancy F. Chen, Roy Ka-Wei Lee

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文探讨LLM在细粒度价值观对齐中的挑战,通过新加坡案例研究发现,即使使用GPT-4.1等先进模型,预测子群体偏好准确率仅57.4%,但通过结构化数值偏好微调可提升17.4%,但存在预存的公平性偏见。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09152 2026-04-15 cs.AI 87%

PrivacyReasoner: Can LLM Emulate a Human-like Privacy Mind?

PrivacyReasoner: LLM能否模拟出类似人类的隐私思维?

Yiwen Tu, Xuan Liu, Lianhui Qin, Haojian Jin

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出PrivacyReasoner,通过构建基于三个核心理念的代理架构,模拟人类隐私思维,评估结果显示其在预测个人隐私关切和跨领域泛化方面优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12191 2026-04-15 cs.AI 87%

Beyond Scores: Diagnostic LLM Evaluation via Fine-Grained Abilities

超越分数:通过细粒度能力进行诊断LLM评估

Xu Zhang, Xudong Gong, Jiacheng Qin, Qiang Wang, JiaQi Liao, Zhe Wang, Dawei Feng, Bo Ding

机构 * College of Computer Science Technology, National University of Defense Technology, Changsha, Hunan, China State Key Laboratory of Complex \& Critical Software Environment, Changsha, Hunan, China National Key Laboratory of Parallel School of Humanities Social Sciences, School of Public Administration, Beihang University, Beijing, China

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于细粒度能力的诊断框架,通过多维项目反应理论估计模型能力,实现对不同任务的精准评估,提升模型改进和任务选择的针对性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18646 2026-04-15 cs.SE cs.AI cs.CL 87%

SEW: Self-Evolving Agentic Workflows for Automated Code Generation

SEW:自演化代理工作流用于自动化代码生成

Siwei Liu, Jinyuan Fang, Han Zhou, Yingxu Wang, Zaiqiao Meng

机构 * University of Aberdeen(阿伯丁大学) University of Glasgow(格拉斯哥大学) University of Cambridge(剑桥大学) MBZUAI(马克斯·普朗克智能系统研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SEW框架,通过自演化方法自动设计和优化多代理工作流,提升代码生成任务的性能,实验表明在LiveCodeBench上比仅使用基础LLM提升12%。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11767 2026-04-15 cs.PL cs.MA cs.SE 87%

$λ_A$: A Typed Lambda Calculus for LLM Agent Composition

$λ_A$: 一种用于LLM代理组合的类型lambda演算

Qin Liu

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出$λ_A$类型lambda演算,通过引入oracle调用、有界固定点、概率选择和可变环境扩展简单类型lambda演算,证明类型安全性和终止性,并展示其在代理配置检测中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23200 2026-04-15 cs.CR cs.HC 87%

From Coordinates to Context: An LLM-Bootstrapped Semantic Encoding Framework for Privacy-Preserving Mobile Sensing Stress Recognition

从坐标到语境:一种基于大语言模型的语义编码框架,用于隐私保护的移动传感压力识别

Hoang Khang Phan, Nhat Tan Le

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 本文提出一种隐私增强的语义位置编码框架,利用自托管的OSM引擎和LLM引导的静态地图进行人友好的特征提取,解决隐私保护和可解释性问题,通过实验验证其在压力识别中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11978 2026-04-15 cs.AI 86%

The Long-Horizon Task Mirage? Diagnosing Where and Why Agentic Systems Break

长远任务的幻觉?诊断代理系统何时及为何失效

Xinyu Jessica Wang, Haoyue Bai, Yiyou Sun, Haorui Wang, Shuibai Zhang, Wenjie Hu, Mya Schroder, Bilge Mutlu, Dawn Song, Robert D Nowak

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过HORIZON基准测试分析LLM代理在长周期任务中的失效模式,提出轨迹驱动的评估方法,并通过人类标注验证其有效性,为构建更可靠的代理系统提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09443 2026-04-15 cs.CL cs.AI 86%

Many-Tier Instruction Hierarchy in LLM Agents

多层级指令层级在大语言模型代理中的应用

Jingyu Zhang, Tianjian Li, William Jurayj, Hongyuan Zhan, Benjamin Van Durme, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Many-Tier Instruction Hierarchy (ManyIH) 以解决多源指令冲突,通过12层级的测试任务验证模型在复杂冲突场景下的表现,揭示了细粒度可扩展指令冲突解决的迫切需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12548 2026-04-15 cs.CR 86%

DeepSeek Robustness Against Semantic-Character Dual-Space Mutated Prompt Injection

DeepSeek 对语义-字符双空间变异提示注入的鲁棒性

Junyu Ren, Xingjian Pan, Wensheng Gan, Philip S. Yu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出PromptFuzz-SC框架,通过结合语义变换和字符级混淆,评估LLM对提示注入的鲁棒性,实验显示双空间变异在攻击性能上表现最佳,提升了攻击成功率和隐蔽性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09936 2026-04-15 cs.LG cs.NA math.NA 84%

SciML Agents: Write the Solver, Not the Solution

SciML代理:编写求解器,而非解决方案

Saarth Gaonkar, Xiang Zheng, Haocheng Xi, Rishabh Tiwari, Kurt Keutzer, Dmitriy Morozov, Michael W. Mahoney, Amir Gholami

机构 * UC Berkeley(加州大学伯克利分校) LBNL(劳伦斯伯克利国家实验室) ICSI(国际计算机科学研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.LG

AI总结 本文探讨利用LLM编写科学机器学习求解器,通过设计新数据集评估不同模型在ODE问题中的表现,发现引导提示和微调能有效提升求解准确性。

Journal ref NeurIPS 2025 Math-AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12119 2026-04-15 cs.CV cs.LG 83%

Beyond Perception Errors: Semantic Fixation in Large Vision-Language Models

超越感知误差:大型视觉-语言模型中的语义固定

Md Tanvirul Alam

机构 * Rochester Institute of Technology(罗切斯特理工学院)

专题命中 评测与基准 :language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 研究发现大型视觉-语言模型在面对提示指定的替代映射时,倾向于保留默认解释,通过VLM-Fix基准测试揭示了语义固定现象,且通过训练和激活调整可部分修复误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12126 2026-04-15 cs.AI cs.CL 82%

Long-Horizon Plan Execution in Large Tool Spaces through Entropy-Guided Branching

在大规模工具空间中通过熵引导分支实现长周期计划执行

Rongzhe Wei, Ge Shi, Min Cheng, Na Zhang, Pan Li, Sarthak Ghosh, Vaibhav Gorde, Leman Akoglu

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出熵引导分支算法,解决大规模工具库中长周期任务执行的挑战,通过动态扩展高预测熵的决策分支,提升任务成功率和计算效率。

Comments This work was completed during an internship at Amazon

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12049 2026-04-15 cs.CL cs.AI 82%

Leveraging Weighted Syntactic and Semantic Context Assessment Summary (wSSAS) Towards Text Categorization Using LLMs

利用加权语法和语义上下文评估摘要(wSSAS)实现基于LLMs的文本分类

Shreeya Verma Kathuria, Nitin Mayande, Sharookh Daruwalla, Nitin Joglekar, Charles Weber

机构 * Tellagence Inc.(Tellagence公司) Villanova School of Business, Villanova University(维拉诺瓦大学商学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出wSSAS框架,通过两阶段验证方法提升文本分类的准确性和可重复性,实验表明其在不同数据集上有效降低分类熵。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09121 2026-04-15 cs.CL cs.AI cs.SD 82%

Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition

交互式语音识别:迈向人样交互和语义连贯性评估的代理语音识别

Peng Wang, Yanqiao Zhu, Zixuan Jiang, Qinyuan Chen, Xingjian Zhao, Xipeng Qiu, Wupeng Wang, Zhifu Gao, Xiangang Li, Kai Yu, Xie Chen

机构 * X-LANCE Lab, Shanghai Jiao Tong University(上海交通大学X-LANCE实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Xi'an Jiaotong University(西安交通大学) Fudan University(复旦大学) Tongyi Fun Team, Alibaba Group(阿里巴巴集团 Tongyi 团队)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于LLM的代理框架,通过语义反馈提升语音识别的语义准确性和交互修正能力,实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12177 2026-04-15 cs.AI cs.CL cs.CR cs.LG 82%

Policy-Invisible Violations in LLM-Based Agents

基于大语言模型的智能体中的政策不可见违规

Jie Wu, Ming Gong

机构 * Atlassian

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了大语言模型智能体在执行符合语法、用户授权和语义合适的行为时,仍可能因决策时缺乏关键事实而违反组织政策的问题,提出了PhantomPolicy基准和Sentinel框架以提升政策执行效果。

Comments 26 pages,1 figure, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12468 2026-04-15 cs.HC 82%

Detecting LLM-Assisted Academic Dishonesty using Keystroke Dynamics

利用键盘动态检测由大型语言模型辅助的学术不端行为

Atharva Mehta, Rajesh Kumar, Aman Singla, Kartik Bisht, Yaman Kumar Singla, Rajiv Ratn Shah

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 本文提出利用键盘动态行为检测由LLM辅助的学术不端,扩展数据集并引入 paraphrasing 条件,通过对比文本检测器和人类评估者,证明基于键盘动态的模型在实际部署中表现更优。

Comments 16 pages, 4 figures, 6 tables, extension of IJCB 2024 paper, and to appear in IEEE TBIOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13035 2026-04-15 cs.CV cs.CL 81%

SceneCritic: A Symbolic Evaluator for 3D Indoor Scene Synthesis

SceneCritic: 一种用于3D室内场景合成的符号评估器

Kathakoli Sengupta, Kai Ao, Paola Cascante-Bonilla

机构 * Stony Brook University(石溪大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SceneCritic,一种基于空间本体的符号评估器,用于评估3D室内场景合成的语义、方向和几何一致性,通过不同批评模式验证模型的空间结构构建与修正能力。

Comments Project Page: https://lab-spell.github.io/SceneCritic/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12875 2026-04-15 cs.AI 81%

AISafetyBenchExplorer: A Metric-Aware Catalogue of AI Safety Benchmarks Reveals Fragmented Measurement and Weak Benchmark Governance

AISafetyBenchExplorer:一个基于指标的AI安全基准目录揭示了测量碎片化和弱基准治理

Abiodun A. Solanke

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AISafetyBenchExplorer,通过多表结构记录195个AI安全基准的元数据、指标定义等,揭示当前基准体系中测量标准化滞后于基准繁衍的问题,强调碎片化而非稀缺性是领域的主要失败模式。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏