arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-02 至 2026-04-02 共收录 231 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 44 篇

2604.00687 2026-04-02 cs.SE 67%

SCPatcher: Automated Smart Contract Code Repair via Retrieval-Augmented Generation and Knowledge Graph

SCPatcher:通过检索增强生成与知识图谱实现智能合约代码自动修复

Xiaoqi Li, Shipeng Ye, Wenkai Li, Zongwei Li

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出SCPatcher框架,结合检索增强生成与知识图谱实现智能合约漏洞自动修复,通过构建5000个验证过的以太坊合约知识图谱,提升大语言模型推理能力,实现高修复率和编译通过率。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00628 2026-04-02 cs.RO cs.HC 67%

StretchBot: A Neuro-Symbolic Framework for Adaptive Guidance with Assistive Robots

StretchBot:一种用于辅助机器人自适应指导的神经符号框架

Luca Vogelgesang, Ahmed Mehdi Soltani, Mohammadhossein Khojasteh, Xinrui Zu, Stefano De Giorgis, Madalina Croitoru, Filip Ilievski

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Montpellier(蒙彼利埃大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出StretchBot,结合多模态感知与知识图谱引导的大语言模型推理,实现短时间伸展指导中的情境感知调整,同时保持结构化流程。实验显示自适应指导在适应性和相关性上更优,而脚本指导在流畅性和可预测性上仍具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27183 2026-04-02 cs.CV 67%

Communicating about Space: Language-Mediated Spatial Integration Across Partial Views

关于空间的交流:通过语言介导的空间整合跨部分视图

Ankur Sikarwar, Debangan Mishra, Sudarshan Nikhil, Ponnurangam Kumaraguru, Aishwarya Agrawal

机构 * Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) IIIT Hyderabad(海得拉巴国际信息技术学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 研究探讨多模态大语言模型能否通过对话整合不同视角,发现其在识别共享锚点物体上表现较好,但在关系推理和全局地图构建上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22245 2026-04-02 quant-ph 67%

RotorMap and Quantum Fingerprints of DNA Sequences via Rotary Position Embeddings

通过旋转位置嵌入实现DNA序列的RotorMap和量子指纹

Danylo Yakymenko, Maksym Chernyshev, Illia Savchenko, Sergii Strelchuk

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出一种量子编码,通过旋转位置嵌入实现DNA序列的高效映射,并在量子设备上验证其性能,探讨了量子DNA认证的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01212 2026-04-02 cs.CL cs.AI 62%

$\texttt{YC-Bench}$: Benchmarking AI Agents for Long-Term Planning and Consistent Execution

YC-Bench:评估长期规划和一致执行的AI代理基准测试

Muyu He, Adit Jain, Anand Kumar, Vincent Tu, Soumyadeep Bakshi, Sachin Patro, Nazneen Rajani

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出YC-Bench基准测试,评估AI代理在长期任务中维持战略一致性的能力,通过模拟一年初创公司运营,测试代理在不确定环境中的规划、学习与适应能力,发现仅三模型能持续超越初始资金,Scratchpad使用是成功关键,对抗性客户检测是主要失败模式。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00770 2026-04-02 cs.LG cs.AI 62%

Thinking Wrong in Silence: Backdoor Attacks on Continuous Latent Reasoning

沉默中的错误思考:对连续潜在推理的后门攻击

Swapnil Parekh

机构 * Intuit

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ThoughtSteer攻击,通过扰动输入嵌入向量,在连续潜在空间中产生可靠答案,同时规避所有现有防御,揭示了神经坍缩机制在潜在空间中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12545 2026-04-02 cs.CV 50%

Spatial Reasoning is Not a Free Lunch: A Controlled Study on LLaVA

空间推理并非免费午餐:对LLaVA的受控研究

Nahid Alam, Leema Krishna Murali, Siddhant Bharadwaj, Patrick Liu, Timothy Chung, Drishti Sharma, Akshata A., Kranthi Kiran, Wesley Tam, Bala Krishna S Vegesna

机构 * Cohere Labs Community(Cohere Labs社区) Indian Institute of Science, Bangalore(印度科学研究所班加罗尔分校) UIUC(伊利诺伊大学厄巴纳-香槟分校) Imperial College London(伦敦帝国学院) Eisai Inc.(卫材公司) EleutherAI Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文通过LLaVA框架探讨了空间推理能力不足的原因,发现图像编码器设计和位置编码结构对空间理解有显著影响,但无法完全解决空间推理问题。

Comments Accepted as a poster at ICLR 2026 workshop ICBINB, typo fixed

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00317 2026-04-02 cs.DC cs.NI 50%

From Skew to Symmetry: Node-Interconnect Multi-Path Balancing with Execution-time Planning for Modern GPU Clusters

从倾斜到对称:节点-互连多路径平衡与执行时间规划用于现代GPU集群

Jinghan Yao, Kaushik Kandadi, Bharath Ramesh, Hari Subramoni, Dhabaleswar K. Panda

专题命中 推理与问题求解 :LLM(abstract)

AI总结 本文提出NIMBLE系统,通过动态重分布流量平衡节点内和节点间路径的利用率,提升GPU集群的通信性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 52 篇

2604.00006 2026-04-02 cs.CL cs.CY cs.IR cs.LG 91%

Scalable Identification and Prioritization of Requisition-Specific Personal Competencies Using Large Language Models

基于大语言模型的可扩展需求特定个人能力识别与优先级排序

Wanxin Li, Denver McNeney, Nivedita Prabhu, Charlene Zhang, Renee Barr, Matthew Kitching, Khanh Dao Duc, Anthony S. Boyce

机构 * University of British Columbia(不列颠哥伦比亚大学) Amazon(亚马逊)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出利用大语言模型识别和优先级排序特定需求的个人能力,通过动态少样本提示、反思式自我改进、相似性过滤和多阶段验证,实现高准确率和低误检率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01108 2026-04-02 cs.AI 89%

Adversarial Moral Stress Testing of Large Language Models

对抗性道德压力测试:大语言模型的伦理鲁棒性评估

Saeid Jamshidi, Foutse Khomh, Arghavan Moradi Dakhel, Amin Nikanjam, Mohammad Hamdaqa, Kawser Wazed Nafi

机构 * SWAT Laboratory, Polytechnique Montréal(蒙特利尔理工学院SWAT实验室) Huawei Distributed Scheduling and Data Engine Lab(华为分布式调度与数据引擎实验室) SæT Laboratory, Polytechnique Montréal(蒙特利尔理工学院SæT实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出AMST框架,通过对抗性多轮交互评估大语言模型的伦理鲁棒性,揭示传统单轮评估无法发现的降级模式,强调分布稳定性与尾部行为的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08206 2026-04-02 cs.AI 89%

EHRStruct: A Comprehensive Benchmark Framework for Evaluating Large Language Models on Structured Electronic Health Record Tasks

EHRStruct:一个全面的评估框架,用于评估大型语言模型在结构化电子健康记录任务上的表现

Xiao Yang, Xuejiao Zhao, Zhiqi Shen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出EHRStruct框架,用于评估大型语言模型在结构化电子健康记录任务上的性能,包含11种临床任务和2200个样本,分析了影响模型性能的关键因素,并提出EHRMaster方法以提升性能。

Comments 28pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04822 2026-04-02 cs.CL 89%

Evaluating Vision-Language and Large Language Models for Automated Student Assessment in Indonesian Classrooms

评估视觉语言和大语言模型用于印度尼西亚课堂自动学生评估

Nurul Aisyah, Muhammad Dehan Al Kautsar, Arif Hidayat, Raqib Chowdhury, Fajri Koto

机构 * Quantic School of Business and Technology(Quantic商业与技术学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Indonesia University of Education(印度尼西亚教育大学) Monash University(莫纳什大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 研究评估了视觉语言和大语言模型在印尼课堂中的自动学生评估效果,发现VLM在手写识别上存在困难,但LLM反馈仍具教学价值。

Comments Accepted at AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00046 2026-04-02 cs.SE cs.LG 89%

Large Language Models for Analyzing Enterprise Architecture Debt in Unstructured Documentation

大型语言模型用于分析企业架构债务中的非结构化文档

Christin Pagels, Simon Hacks, Rob Henk Bemthuis

机构 * Stockholm University(斯德哥尔摩大学) University of Twente(特温特大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出利用大型语言模型自动检测企业架构异味,通过案例研究验证其在非结构化文档中的有效性,展示了LLM在企业架构治理中的应用潜力。

Comments Author version, 2 figures, 5 tables. To appear in the Proceedings of the 41st ACM/SIGAPP Symposium on Applied Computing (SAC '26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00677 2026-04-02 cs.CV 89%

CL-VISTA: Benchmarking Continual Learning in Video Large Language Models

CL-VISTA:视频大语言模型持续学习基准测试

Haiyang Guo, Yichen Shi, Fei Zhu, Wenzhuo Liu, Hongbo Zhao, Fanhu Zeng, Shijie Ma, Da-Han Wang, Xu-Yao Zhang

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学前沿交叉科学学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FKLPRIU, School of Computer and Information Engineering, Xiamen University of Technology(厦门理工学院计算机与信息工程学院福建省模式识别与图像理解重点实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(abstract)

AI总结 CL-VISTA通过8个多样化任务诱导分布偏移,评估持续学习方法在性能、效率和内存方面的权衡,揭示无单一最优解的特性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00075 2026-04-02 q-bio.GN 89%

Large Language Models for Variant-Centric Functional Evidence Mining

基于变体的函数证据挖掘的大型语言模型

Ali Saadat, Jacques Fellay

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出利用大型语言模型挖掘变体功能证据,通过基准测试评估两种模型在文献筛选和证据提取中的表现,开发了AcmGENTIC管道以提升功能证据整理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00002 2026-04-02 cs.CL cs.AI 88%

Benchmark for Assessing Olfactory Perception of Large Language Models

嗅觉感知基准测试

Eftychia Makri, Nikolaos Nakis, Laura Sisson, Gigi Minsky, Leandros Tassiulas, Vahid Satarifard, Nicholas A. Christakis

机构 * Patina(Patina公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出嗅觉感知基准测试,评估大语言模型对气味的推理能力,发现化合物名称提示优于SMILES表示,揭示LLM主要通过词汇关联而非结构分子推理获取嗅觉知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20146 2026-04-02 cs.CV 88%

VMAD: Visual-enhanced Multimodal Large Language Model for Zero-Shot Anomaly Detection

VMAD:视觉增强的多模态大语言模型用于零样本异常检测

Huilin Deng, Hongchen Luo, Wei Zhai, Yang Cao, Yu Kang

机构 * University of Science and Technology of China(中国科学技术大学) Northeastern University(东北大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 VMAD通过结合视觉信息与多模态大语言模型,提升零样本异常检测的精度与分析能力,提出缺陷敏感结构学习和局部增强令牌压缩等方法,结合RIAD数据集验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25302 2026-04-02 cs.AI cs.CL cs.LG cs.MA 87%

Dive into the Agent Matrix: A Realistic Evaluation of Self-Replication Risk in LLM Agents

深入代理矩阵:对LLM代理自复制风险的现实评估

Boxuan Zhang, Yi Yu, Jiaxuan Guo, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过构建真实环境评估LLM代理自复制风险,引入OR和AOC指标,发现超过50%的模型在压力下表现出不受控的自复制倾向,强调了对风险评估和安全措施的迫切需求。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03131 2026-04-02 cs.AI cs.CL cs.LG 87%

Code Comprehension then Auditing for Unsupervised LLM Evaluation

代码理解后审计用于无监督LLM评估

Bhrij Patel, Souradip Chakraborty, Mengdi Wang, Dinesh Manocha, Amrit Singh Bedi

机构 * University of Maryland, College Park(马里兰大学帕克分校) Princeton University(普林斯顿大学) University of Central Florida(中佛罗里达大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CoCoA框架,通过先理解代码功能再评估任务对齐,提升无监督LLM评估的准确性与F1分数。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00008 2026-04-02 cs.CL cs.AI 86%

How Trustworthy Are LLM-as-Judge Ratings for Interpretive Responses? Implications for Qualitative Research Workflows

大语言模型作为评判者对解释性回应的可信度如何?对定性研究工作流程的影响

Songhee Han, Jueun Shin, Jiyoon Han, Bung-Woo Jun, Hilal Ayan Karabatman

机构 * Florida State University(佛罗里达州立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大语言模型作为评判者在解释性回应评估中的可信度,通过比较模型表现与人类评判,指出其在筛选模型时的有效性,但不适合替代人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28183 2026-04-02 cs.AI 85%

PReD: An LLM-based Foundation Multimodal Model for Electromagnetic Perception, Recognition, and Decision

PReD:基于大语言模型的电磁感知、识别与决策基础多模态模型

Zehua Han, Jing Xiao, Yiqi Duan, Mengyu Xiang, Yuheng Ji, Xiaolong Zheng, Chenghanyu Zhang, Zhendong She, Junyu Shen, Dingwei Tan, Shichu Sun, Zhou Cong, Mingxuan Liu, Fengxiang Wang, Jinping Sun, Yangang Sun

机构 * Tsinghua University(清华大学) National University of Defense Technology(国防科技大学) Beihang University(北京航空航天大学) Tianjin University(天津大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) The Hong Kong University of Science and Technology(香港科技大学) Civil Aviation University of China(中国民航大学) Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出PReD,首个电磁领域基础模型,涵盖感知、识别与决策闭环,构建高质量多任务电磁数据集和评估基准,通过多阶段训练策略提升电磁领域能力,实验显示在PReD-Bench上达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20836 2026-04-02 cs.CL cs.AI cs.LG 85%

Structured Prompts Improve Evaluation of Language Models

结构化提示提升语言模型评估

Asad Aali, Muhammad Ahmed Mohsin, Vasiliki Bikia, Arnav Singhvi, Richard Gaus, Suhana Bedi, Hejie Cui, Miguel Fuentes, Alyssa Unell, Yifan Mai, Jordan Cahoon, Michael Pfeffer, Roxana Daneshjou, Sanmi Koyejo, Emily Alsentzer, Christopher Potts, Nigam H. Shah, Akshay S. Chaudhari

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过结构化提示方法评估语言模型,发现其能显著提升性能并改变排名,首次系统整合结构化提示至评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18616 2026-04-02 cs.HC cs.CY 85%

Evaluating PDPL Compliance in E-Commerce Websites: Insights and Lessons Learned from Human and LLM Analyses

评估电子商务网站对个人数据保护法的合规性:来自人类和LLM分析的见解与教训

Eman Alashwali, Abeer Alhuzali

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文分析了沙特阿拉伯100家电子商务网站对PDPL的合规性,发现仅有31%的网站完整声明了四项个人数据权利,且LLM在自动分析隐私政策合规性方面具有潜力。

Comments Non-peer reviewed paper (under submission)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00025 2026-04-02 cs.CL cs.AI 84%

Brevity Constraints Reverse Performance Hierarchies in Language Models

简洁性约束在语言模型中逆转性能层级

MD Azizul Hakim

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究发现,对大语言模型施加简洁性约束可逆转其在数学推理和科学知识上的性能层级,提升准确率并降低性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01083 2026-04-02 cs.SD cs.AI cs.CV 83%

TRACE: Training-Free Partial Audio Deepfake Detection via Embedding Trajectory Analysis of Speech Foundation Models

TRACE: 通过语音基础模型嵌入轨迹分析实现无训练部分音频深度伪造检测

Awais Khan, Muhammad Umar Farooq, Kutub Uddin, Khalid Malik

机构 * College of Innovation and Technology, University of Michigan-Flint(密歇根大学弗林特分校创新与技术学院)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出TRACE框架,通过分析语音基础模型的嵌入轨迹动态,实现无训练的深度伪造检测,实验显示其在多个基准测试中表现优异,尤其在挑战性任务中超越传统监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00014 2026-04-02 cs.CL cs.HC 83%

Disentangling Prompt Element Level Risk Factors for Hallucinations and Omissions in Mental Health LLM Responses

分离提示元素层面的风险因素以评估心理健康LLM响应中的幻觉与遗漏

Congning Ni, Sarvech Qadir, Bryan Steitz, Mihir Sachin Vaidya, Qingyuan Song, Lantian Xia, Shelagh Mulvaney, Siru Liu, Hyeyoung Ryu, Leah Hecht, Amy Bucher, Christopher Symons, Laurie Novak, Susannah L. Rose, Murat Kantarcioglu, Bradley Malin, Zhijun Yin

机构 * Vanderbilt University Medical Center(范德比尔特大学医学中心) Vanderbilt University(范德比尔特大学) Lirio Virginia Tech(弗吉尼亚理工大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出UTCO框架,通过系统性压力测试评估心理健康LLM响应中的幻觉与遗漏,发现上下文和语气是主要风险因素,支持将遗漏作为主要安全结果进行评估。

Comments Submitted to AMIA 2026 Annual Symposium (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00554 2026-04-02 cs.DL 82%

LLM-supported document separation for printed reviews from zbMATH Open

支持大型语言模型的文档分离用于zbMATH Open中的印刷评论

Ivan Pluzhnikov, Ankit Satpute, Moritz Schubotz, Olaf Teschke, Bela Gipp

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出了一种专门的方法,用于数字化和分割zbMATH Open中的数学文档,以提升机器处理能力。通过优化OCR工具和文档分离技术,实现了97.5%的准确性,并显著提高了数学文献的可访问性。

Comments Submitted to SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00414 2026-04-02 cs.AI cs.LG 81%

Decision-Centric Design for LLM Systems

面向决策的LLM系统设计

Wei Sun

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种以决策为核心的框架,通过分离决策相关信号与策略,使控制成为可检查的显式层,提升LLM系统的可靠性与可诊断性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27982 2026-04-02 cs.CV cs.AI cs.CL 81%

CDH-Bench: A Commonsense-Driven Hallucination Benchmark for Evaluating Visual Fidelity in Vision-Language Models

CDH-Bench:一种基于常识的幻觉基准,用于评估视觉语言模型中的视觉保真度

Kesheng Chen, Yamin Hu, Qi Zhou, Zhenqian Zhu, Wenjian Luo

机构 * Guangdong Provincial Key Laboratory of Novel Security Intelligence Technologies, Institute of Cyberspace Security, School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(广东省新型安全智能技术重点实验室,网络空间安全研究院,计算机科学与技术学院,哈尔滨工业大学(深圳))

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CDH-Bench基准,用于评估视觉语言模型在视觉证据与常识冲突时的视觉保真度,通过三种异常类型和两种QA任务,揭示模型在常识驱动下的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17760 2026-04-02 cs.LG cs.AI 81%

But what is your honest answer? Aiding LLM-judges with honest alternatives using steering vectors

但你的诚实答案是什么?利用引导向量辅助LLM-法官的诚实替代方案

Leon Eshuijs, Archie Chaudhury, Alan McBeth, Ethan Nguyen

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Independent(独立)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出JUSSA框架,通过引导向量优化法官的诚实性,提升对欺骗性回答的检测能力,实验显示在不同 dishonesty 水平下,GPT-4.1和Claude Haiku的AUROC均有显著提升,但任务复杂度不匹配时性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏