arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-10 至 2026-04-10 共收录 70 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 70 篇

2604.07369 2026-04-10 cs.LG cs.AI 91%

The Role of Emotional Stimuli and Intensity in Shaping Large Language Model Behavior

情绪刺激与强度在塑造大语言模型行为中的作用

Ameen Patel, Felix Lee, Kyle Liang, Joseph Thomas

机构 * Irvington High School(欧文顿高中) Glen A. Wilson High School(格伦·A·威尔逊高中) Del Norte High School(德尔诺特高中) California High School(加利福尼亚高中)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文研究了四种情绪在情感提示中的影响,发现积极情绪刺激提升模型准确性并降低毒性,但会增加顺从行为。

Journal ref Poster Presentation at AACL Student Research Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08293 2026-04-10 cs.SE cs.AI 89%

CIAO - Code In Architecture Out - Automated Software Architecture Documentation with Large Language Models

CIAO - 代码输入,架构输出 - 利用大语言模型实现自动化软件架构文档生成

Marco De Luca, Tiziano Santilli, Domenico Amalfitano, Anna Rita Fasolino, Patrizio Pelliccione

机构 * University of Naples Federico II(那不勒斯腓特烈二世大学) University of Southern Denmark(南丹麦大学) Gran Sasso Science Institute(格兰萨索科学研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出CIAO方法,利用大语言模型从GitHub仓库自动生成系统级架构文档,基于ISO/IEC/IEEE标准模板,评估显示文档被开发者认为有价值且准确,但存在图表质量和高层次上下文建模的局限。

Comments Manuscript accepted for the 23rd International Conference on Software Architecture (ICSA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22416 2026-04-10 cs.CL cs.IR 89%

Hallucination Detection and Evaluation of Large Language Model

大语言模型的幻觉检测与评估

Chenggong Zhang, Haopeng Wang, Hexi Meng

机构 * Department of Electrical and Computer Engineering, University of California, Los Angeles(加州大学洛杉矶分校电气与计算机工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出HHEM模型,通过轻量级分类框架有效检测大语言模型幻觉,提升效率并保持高准确率,通过对比分析不同模型的检测效果,发现HHEM在时间与准确性上表现优异,但总结任务中存在局部幻觉问题,引入分段检索并分析模型规模与幻觉的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07273 2026-04-10 stat.ME stat.AP 89%

Impact of Label Noise from Large Language Models Generated Annotations on Evaluation of Diagnostic Model Performance

大型语言模型生成标注的标签噪声对诊断模型性能评估的影响

Mohammadreza Chavoshi, Hari Trivedi, Janice Newsome, Aawez Mansuri, Chiratidzo Rudado Sanyika, Rohan Satya Isaac, Frank Li, Theo Dapamede, Judy Gichoya

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文研究了大型语言模型生成的标签噪声对诊断模型性能评估的影响,通过模拟框架分析了标签误差对模型表现的敏感性,并指出在不同疾病患病率下,标签质量对性能估计的系统性偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07705 2026-04-10 cs.RO 89%

Vision-Language Navigation for Aerial Robots: Towards the Era of Large Language Models

面向大语言模型时代的空中机器人视觉-语言导航

Xingyu Xia, Lekai Zhou, Yujie Tang, Xiaozhou Zhu, Hai Zhu, Wen Yao

机构 * Defense Innovation Institute, Chinese Academy of Military Sciences(军事科学院国防创新研究院) Intelligent Game and Decision Laboratory(智能博弈与决策实验室) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文综述了空中机器人视觉-语言导航领域,分析了大语言模型与视觉-语言模型的整合,归纳了五类架构方法,指出了评估体系的不足,并提出了七个开放性问题。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02781 2026-04-10 cs.LG cs.AI 88%

An Automated Survey of Generative Artificial Intelligence: Large Language Models, Architectures, Protocols, and Applications

生成人工智能的自动化调查:大型语言模型、架构、协议和应用

Eduardo C. Garrido-Merchán, Álvaro López López

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文调查了生成人工智能领域,重点分析了前沿大型语言模型的架构、训练方法和性能,涵盖多个模型家族及部署协议,总结了各行业应用案例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07749 2026-04-10 cs.CL 88%

Beyond Social Pressure: Benchmarking Epistemic Attack in Large Language Models

超越社会压力:大型语言模型中知识攻击的基准测试

Steven Au, Sujit Noronha

机构 * Independent Researcher(独立研究员)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出PPT-Bench基准测试,用于评估大型语言模型中的知识攻击,通过不同压力类型测试模型在面对知识、价值观或身份挑战时的一致性与反应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07363 2026-04-10 cs.LG 88%

Benchmark Shadows: Data Alignment, Parameter Footprints, and Generalization in Large Language Models

基准阴影:大型语言模型中的数据对齐、参数足迹与泛化

Hongjian Zou, Yidan Wang, Qi Ding, Yixuan Liao, Xiaoxin Chen

机构 * Vivo AI Lab, Shenzhen, China(维沃人工智能实验室,深圳,中国) Hong Kong University of Science and Technology, Hong Kong, China(香港科技大学,香港,中国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文研究了大型语言模型中基准表现与广度能力之间的差异,通过数据干预发现数据分布影响参数适应与泛化能力,提出参数空间诊断方法揭示不同训练模式的结构特征。

Comments 28 pages, 26 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18472 2026-04-10 cs.AI cs.CV 88%

Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding

多模态大语言模型在离散符号理解中的认知不匹配

Yinghui Li, Jiayi Kuang, Peng Xing, Daixian Liu, Yongheng Zhang, Junnan Dong, Shu-Yu Guo, Yangning Li, Qingyu Zhou, Wenhao Jiang, Hai-Tao Zheng, Ying Shen, Liang Lin, Philip S. Yu

机构 * Tsinghua University(清华大学) Sun Yat-sen University(中山大学) Independent Researcher(独立研究员) The Hong Kong Polytechnic University(香港理工大学) Guangdong Laboratory of AI and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究发现多模态大语言模型在离散符号识别上表现欠佳,而在复杂推理任务上表现较好,揭示了当前系统依赖语言先验而非稳健视觉基础的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07054 2026-04-10 cs.CL 87%

Sell More, Play Less: Benchmarking LLM Realistic Selling Skill

多卖少玩:LLM真实销售技能基准测试

Xuanbo Su, Wenhao Hu, Haibo Su, Yunzhang Chen, Le Zhan, Yanqi Yang, Leo Huang

机构 * SF Express(顺丰速运)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出SalesLLM基准测试,通过30,074个剧本配置和1,805个多轮场景评估大语言模型的销售能力,采用自动评估流程和用户模型CustomerLM提升模拟真实性,实验显示LLM在销售任务上的表现差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02711 2026-04-10 eess.SP 87%

Foundation Models Defining A New Era In Sensor-based Human Activity Recognition: A Survey And Outlook

基于传感器的人类活动识别的基石模型:一种综述与展望

Sizhen Bian, Mengxi Liu, Lala Shakti Swarup Ray, Bo Zhou, Bin Guo, Zhiwen Yu, Thomas Ploetz, Paul Lukowicz, Siyu Yuan, Vitor Fortes Rey

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文综述了基于传感器的人类活动识别中的基石模型,分析了九种技术轴上的设计模式与权衡,并探讨了数据整理、多模态对齐、个性化、隐私和负责任部署等开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08381 2026-04-10 cs.CL cs.AI 86%

A GAN and LLM-Driven Data Augmentation Framework for Dynamic Linguistic Pattern Modeling in Chinese Sarcasm Detection

一种基于GAN和LLM的数据增强框架用于中文讽刺检测中的动态语言模式建模

Wenxian Wang, Xiaohu Luo, Junfeng Hao, Xiaoming Gu, Xingshu Chen, Zhu Wang, Haizhou Wang

机构 * School of Cyber Science and Engineering, Sichuan University(四川大学网络空间安全学院) State Key Laboratory of Fluid Power and Mechatronic Systems, Zhejiang University(浙江大学流体动力与机电系统国家重点实验室) Law School, Sichuan University(四川大学法学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于GAN和LLM的数据增强框架,动态建模用户语言模式以提升中文讽刺检测效果,通过合成SinaSarc数据集并扩展BERT架构,实验表明模型在非讽刺和讽刺类别中均取得最高F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07494 2026-04-10 cs.SE cs.AI cs.LG 86%

Triage: Routing Software Engineering Tasks to Cost-Effective LLM Tiers via Code Quality Signals

Triage: 通过代码质量信号将软件工程任务路由到成本效益高的LLM层级

Lech Madeyski

机构 * Wroclaw University of Science and Technology(弗罗茨瓦夫理工大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Triage利用代码健康度指标作为路由信号,将任务分配到最便宜的模型层级,通过分析代码质量与模型层级成本的关系,提升任务处理效率。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04989 2026-04-10 cs.SE cs.CY cs.LG 85%

BacPrep: Lessons from Deploying an LLM-Based Bacalaureat Assessment Platform

BacPrep: 从部署一个基于大语言模型的本科评估平台中获得的教训

Adrian-Marius Dumitran, Radu Dita, Angela Liliana Dumitran

机构 * University of Bucharest(布加勒斯特大学) Universitatea Creștină "Dimitrie Cantemir"(迪米特里·坎特米尔基督教大学) Cu Drag si Sport SRL(Cu Drag si Sport 有限公司) Softbinator Technologies(Softbinator 技术公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 BacPrep利用大语言模型进行自动评估,旨在为罗马尼亚本科考试提供免费资源。通过分析学生解题,发现评估中存在不一致性和误差,提出改进架构以提高准确性。

Comments First version ACCEPTED at BBGI (ITS 2025 Workshop) Second versions ACCEPTED at ITS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15494 2026-04-10 cs.SE cs.AI cs.PF 85%

Do AI Models Dream of Faster Code? An Empirical Study on LLM-Proposed Performance Improvements in Real-World Software

AI模型是否梦想着更快的代码?对LLM在现实软件中提出性能改进的实证研究

Lirong Yi, Gregory Gay, Philipp Leitner

机构 * Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过65个性能关键的开源Java项目任务,评估LLM生成复杂工程问题的性能,发现其解法波动大且低于人类开发者,指出当前算法任务基准评估过于乐观,需转向更复杂的代理系统以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08212 2026-04-10 cs.CV 85%

Vision-Language Foundation Models for Comprehensive Automated Pavement Condition Assessment

面向综合自动化路面状况评估的视觉-语言基础模型

Blessing Agyei Kyem, Joshua Kofi Asamoah, Anthony Dontoh, Armstrong Aboah

机构 * North Dakota State University(北达科他州立大学) University of Memphis(孟菲斯大学)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出PaveInstruct数据集和PaveGPT模型,通过领域特定指令微调提升视觉-语言模型在路面状况评估中的性能,实现20%以上的提升,并满足ASTM D6433标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08044 2026-04-10 cs.AR 85%

A Full-Stack Performance Evaluation Infrastructure for 3D-DRAM-based LLM Accelerators

面向基于3D-DRAM的LLM加速器的全栈性能评估基础设施

Cong Li, Chenhao Xue, Yi Ren, Xiping Dong, Yu Cheng, Yinbo Hu, Fujun Bai, Yixin Guo, Xiping Jiang, Qiang Wu, Zhi Yang, Zhe Cheng, Yuan Xie, Guangyu Sun

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出ATLAS框架,通过统一抽象支持任意LLM推理场景,验证其在真实硅片上的高精度模拟性能,为3D-DRAM内存系统和加速器微架构设计提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08031 2026-04-10 cs.RO cs.CV 85%

Open-Ended Instruction Realization with LLM-Enabled Multi-Planner Scheduling in Autonomous Vehicles

基于LLM的多规划器调度的开放式指令实现用于自动驾驶车辆

Jiawei Liu, Xun Gong, Fen Fang, Muli Yang, Bohao Qu, Yunfeng Hu, Hong Chen, Xulei Yang, Qing Guo

机构 * Jilin University(吉林大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局) Tongji University(同济大学) NKIARI Nankai University(南开大学) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE(教育部知识驱动人机智能工程研究中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种基于大语言模型的指令实现框架,通过实时反馈调度多个基于模型预测控制的运动规划器,提高任务完成率并降低LLM查询成本,同时确保安全性和可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08294 2026-04-10 cs.CV cs.AI cs.CL 84%

Can Vision Language Models Judge Action Quality? An Empirical Evaluation

视觉语言模型能否评判动作质量?一项实证评估

Miguel Monte e Freitas, Rui Henriques, Ricardo Rei, Pedro Henrique Martins

机构 * Sword Health Instituto Superior Técnico, Universidade de Lisboa(里斯本大学高等技术学院) INESC-ID(INESC-ID研究所)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了视觉语言模型在动作质量评估中的表现,发现现有模型在多个领域仅略高于随机水平,且存在预测偏差,提示细粒度动作质量评估存在根本性困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04791 2026-04-10 cs.AI 83%

Timer-S1: A Billion-Scale Time Series Foundation Model with Serial Scaling

Timer-S1: 一种十亿级时间序列基础模型与串行扩展

Yong Liu, Xingjian Su, Shiyu Wang, Haoran Zhang, Haixuan Liu, Yuxuan Wang, Zhou Ye, Yang Xiang, Jianmin Wang, Mingsheng Long

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :foundation model(title,abstract);post-training(abstract);分类 cs.AI

AI总结 Timer-S1通过三维串行扩展提升时间序列预测能力,采用稀疏TimeMoE块和通用TimeSTP块,实现长周期预测并减少误差积累,基于TimeBench数据集取得最佳MASE和CRPS分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12009 2026-04-10 cs.CL 81%

FinTruthQA: A Benchmark for AI-Driven Financial Disclosure Quality Assessment in Investor -- Firm Interactions

FinTruthQA:投资者与企业互动中人工智能驱动的财务披露质量评估基准

Peilin Zhou, Ziyue Xu, Xinyu Shi, Jiageng Wu, Yikang Jiang, Dading Chong, Wang Dong, Jun Chen, Bin Ke, Jie Yang

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 FinTruthQA通过6000个真实财务问答数据,评估投资者与企业互动中的财务披露质量,发现现有模型在回答可读性和相关性上表现较弱,预训练语言模型在复杂任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05674 2026-04-10 cs.CR cs.AI 79%

Towards Effective Offensive Security LLM Agents: Hyperparameter Tuning, LLM as a Judge, and a Lightweight CTF Benchmark

迈向高效的攻击性安全LLM代理:超参数调优、LLM作为裁判以及一个轻量级CTF基准

Minghao Shao, Nanda Rani, Kimberly Milner, Haoran Xi, Meet Udeshi, Saksham Aggarwal, Venkata Sai Charan Putrevu, Sandeep Kumar Shukla, Prashanth Krishnamurthy, Farshad Khorrami, Ramesh Karri, Muhammad Shafique

机构 * New York University(纽约大学) New York University Abu Dhabi(纽约大学阿布扎比分校) Indian Institute of Technology Kanpur(印度理工学院坎普尔分校) International Institute of Information Technology Hyderabad(国际信息技术学院海得拉巴分校)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文系统研究了驱动代理成功的关键因素,提出CTFJudge框架和CTF Competency Index指标,分析超参数对性能的影响,并开放CTFTiny基准供研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07652 2026-04-10 cs.AI cs.HC 79%

Bridging Natural Language and Interactive What-If Interfaces via LLM-Generated Declarative Specification

通过LLM生成的声明性规范桥接自然语言与交互式假设分析接口

Sneha Gathani, Sirui Zeng, Diya Patel, Ryan Rossi, Dan Marshall, Cagatay Demiralp, Steven Drucker, Zhicheng Liu

机构 * University of Maryland, College Park(马里兰大学帕克分校) Adobe Research(Adobe研究院) Microsoft Research(微软研究院) AWS AI Labs(AWS人工智能实验室) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出一种两阶段工作流,通过Praxa规范语言将自然语言假设分析问题转化为交互式可视化界面,提升假设分析工具的交互性和准确性。

Comments 17 pages 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04418 2026-04-10 cs.HC cs.AI 79%

Justified or Just Convincing? Error Verifiability as a Dimension of LLM Quality

合理还是有说服力?错误可验证性作为LLM质量的一个维度

Xiaoyuan Zhu, Kimberly Le Truong, Riccardo Fogliato, Gokul Swamy, Weijian Zhang, Minglai Yang, Longtian Ye, Bangya Liu, Minghao Liu, Andrew Ilyas, Steven Wu

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft Core AI(微软核心人工智能)

专题命中 评测与基准 :LLM(title);post-training(abstract);分类 cs.AI

AI总结 本文提出错误可验证性作为LLM质量的新维度,通过实验发现传统方法无法提升该维度,引入两种方法提升可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22683 2026-04-10 cs.CV cs.AI 79%

SUPERGLASSES: Benchmarking Vision Language Models as Intelligent Agents for AI Smart Glasses

SUPERGLASSES:基于智能眼镜的视觉语言模型智能体基准测试

Zhuohang Jiang, Xu Yuan, Haohao Qu, Shanru Lin, Kanglong Liu, Wenqi Fan, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出SUPERGLASSES基准,通过真实世界数据评估智能眼镜的多模态交互能力,提出SUPERLENS模型在VQA任务中超越GPT-4o,揭示了任务特定解决方案的重要性。

Journal ref 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition- FINDINGS Track (CVPRF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18787 2026-04-10 cs.CV cs.LG 79%

Understanding Task Transfer in Vision-Language Models

理解视觉-语言模型中的任务迁移

Bhuvan Sachdeva, Karan Uppal, Abhinav Java, Vineeth N. Balasubramanian

机构 * Microsoft Research India(微软研究院印度)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本文研究视觉-语言模型中任务迁移的系统性影响,提出PGF指标衡量任务迁移对性能的影响,揭示任务间的正负迁移关系,指导更高效的模型训练。

Comments CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26241 2026-04-10 cs.CV cs.CL 79%

Which Way Does Time Flow? A Psychophysics-Grounded Evaluation for Vision-Language Models

时间如何流逝?基于心理物理学的评估用于视觉-语言模型

Shiho Matta, Lis Kanashiro Pereira, Peitao Han, Fei Cheng, Shigeru Kitazawa

机构 * Kyoto University(京都大学) Center for Information and Neural Networks(信息与神经网络中心) National Institute of Information and Communications Technology(国立信息通信技术研究所) The University of Osaka(大阪大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文通过心理物理学验证的基准测试评估了视觉-语言模型对时间方向的理解能力,发现大多数模型表现接近随机,且在物理不可逆过程和因果手动动作上远低于人类水平。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20718 2026-04-10 cs.CV cs.AI 79%

MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models

MM-MoralBench: 一种多模态道德评估基准用于大型视觉-语言模型

Bei Yan, Jie Zhang, Zhiyuan Chen, Shiguang Shan, Xilin Chen

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 为评估大型视觉-语言模型的道德对齐性,提出MM-MoralBench基准,通过多模态场景测试模型在六个道德基础上的判断与分类能力,揭示模型存在显著的道德偏见问题。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08016 2026-04-10 cs.AI cs.LG 79%

Wiring the 'Why': A Unified Taxonomy and Survey of Abductive Reasoning in LLMs

阐明‘为何’:对大语言模型中演绎推理的统一分类和调查

Moein Salimi, Shaygan Adim, Danial Parnian, Nima Alighardashi, Mahdi Jafari Siavoshani, Mohammad Hossein Rohban

机构 * Sharif University of Technology(谢里夫理工大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文首次系统调研大语言模型中的演绎推理,提出统一的两阶段定义,分类现有工作,并通过基准测试和对比分析揭示当前方法的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07964 2026-04-10 cs.AI cs.LG 79%

Are we still able to recognize pearls? Machine-driven peer review and the risk to creativity: An explainable RAG-XAI detection framework with markers extraction

我们仍然能识别珍珠吗?机器驱动的同行评审与创造力风险:一个可解释的RAG-XAI检测框架与标记提取

Alin-Gabriel Văduva, Simona-Vasilica Oprea, Adela Bâra

机构 * Bucharest University of Economic Studies(布加勒斯特经济研究大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RAG-XAI框架,通过标记提取检测自动化评审,以保留科学的透明度和创造力,实验显示其在检测性能上显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏