arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-09 至 2026-04-09 共收录 65 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 65 篇

2604.06562 2026-04-09 cs.AI 89%

On Emotion-Sensitive Decision Making of Small Language Model Agents

小语言模型代理的情绪敏感决策研究

Jiaju Lin, Xingjian Du, Qingyun Wu, Ellen Wenting Zou, Jindong Wang

机构 * Pennsylvania State University(宾夕法尼亚州立大学) University of Rochester(罗切斯特大学) William & Mary(威廉与玛丽学院)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);SLM(abstract);分类 cs.AI

AI总结 本文研究小语言模型在情绪影响下的决策机制,通过结合情绪诱导与结构化博弈评估,发现情绪扰动系统影响战略选择,但行为不稳定且不完全符合人类预期。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06213 2026-04-09 cs.CL cs.AI 88%

Invisible Influences: Investigating Implicit Intersectional Biases through Persona Engineering in Large Language Models

不可见的影响:通过大型语言模型中的角色工程探究隐性交叉偏见

Nandini Arimanda, Achyuth Mukund, Sakthi Balan Muthiah, Rajesh Sharma

机构 * Shiv Nadar University Chennai(钦奈希夫纳达尔大学) Plaksha University(普拉克沙大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过角色工程研究大型语言模型中的隐性交叉偏见,提出BADx指标,揭示角色上下文对偏见动态影响的机制,评估五种LLM在不同角色框架下的表现。

Comments 11 pages, 5 figures, ACM WebScience Conference, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23435 2026-04-09 cs.SD cs.AI cs.MM eess.AS 88%

AudioRole: An Audio Dataset for Character Role-Playing in Large Language Models

AudioRole: 一个用于大型语言模型角色扮演的音频数据集

Wenyu Li, Xiaoqi Jiao, Yi Chang, Guangyan Zhang, Yiwen Guo

机构 * Westlake University(西湖大学) Tencent LIGHTSPEED STUDIOS(腾讯LIGHTSPEED STUDIOS) Independent Researcher(独立研究员)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出AudioRole数据集,通过13部电视剧1000+小时的100万+角色对话,提供同步音频文本对及角色身份标注,结合ARP-Eval评估框架,验证了GLM-4-Voice在角色扮演中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06906 2026-04-09 cs.CL cs.AI cs.CY 86%

The AI Skills Shift: Mapping Skill Obsolescence, Emergence, and Transition Pathways in the LLM Era

人工智能技能转变:在大语言模型时代映射技能过时、出现及转型路径

Rudra Jadhav, Janhavi Danve

机构 * Savitribai Phule Pune University(萨维特里巴伊·普纳大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过SAFI指数评估职业技能的自动化可行性,揭示高风险技能、需提升技能及AI增强技能的分布,发现数学和编程自动化可行性最高,而主动倾听和阅读理解最低。

Comments 11 pages, 12 figures, 2 tables, 17 references. Code and data available at

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06814 2026-04-09 cs.LG cs.AI 86%

OmniTabBench: Mapping the Empirical Frontiers of GBDTs, Neural Networks, and Foundation Models for Tabular Data at Scale

OmniTabBench:映射GBDT、神经网络和基础模型在大规模表格数据上的经验前沿

Dihong Jiang, Ruoqi Cao, Zhiyuan Dang, Li Huang, Qingsong Zhang, Zhiyu Wang, Shihao Piao, Shenggao Zhu, Jianlong Chang, Zhouchen Lin, Qi Tian

机构 * Huawei Cloud(华为云) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OmniTabBench,最大的表格数据基准,包含3030个数据集,通过大规模实验验证各模型家族无单一优势,提供更清晰的指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18196 2026-04-09 cs.CL cs.AI 86%

Contrastive Decoding Mitigates Score Range Bias in LLM-as-a-Judge

对比解码缓解LLM-as-a-Judge的分数范围偏差

Yoshinari Fujinuma

机构 * Patronus AI

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对LLM作为评判者时的分数范围偏差问题,提出对比解码方法,通过提升与人类评判的Spearman相关性,平均提升11.7%。

Comments To appear at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06663 2026-04-09 cs.CY cs.AI 85%

Restoring Heterogeneity in LLM-based Social Simulation: An Audience Segmentation Approach

在基于大语言模型的社会模拟中恢复异质性:一种受众细分方法

Xiaoyou Qin, Zhihong Li, Xiaoxiao Cheng

机构 * School of Journalism, Fudan University(复旦大学新闻学院) College of Media and International Culture, Zhejiang University(浙江大学传媒与国际文化学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过受众细分方法恢复基于大语言模型的社会模拟中的异质性,利用美国气候意见调查数据,比较不同细分配置在两个大语言模型上的表现,发现适度细化能提升性能,但过度细化可能损害结构和预测忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05172 2026-04-09 cs.AI 85%

ClawsBench: Evaluating Capability and Safety of LLM Productivity Agents in Simulated Workspaces

ClawsBench: 评估LLM生产力代理在模拟工作区中的能力和安全性

Xiangyi Li, Kyoung Whan Choe, Yimin Liu, Xiaokun Chen, Chujun Tao, Bingran You, Wenbo Chen, Zonglin Di, Jiankai Sun, Shenghan Zheng, Jiajun Bao, Yuanli Wang, Weixiang Yan, Yiyuan Li, Han-chung Lee

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ClawsBench通过高保真模拟服务和结构化任务评估LLM代理在真实生产力场景中的能力与安全性,揭示了代理在多服务协作和安全关键场景中的表现及潜在风险。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06188 2026-04-09 cs.HC cs.AI cs.CL 84%

LLM Spirals of Delusion: A Benchmarking Audit Study of AI Chatbot Interfaces

大语言模型的幻觉螺旋:AI聊天机器人界面的基准测试审计研究

Peter Kirgis, Ben Hawriluk, Sherrie Feng, Aslan Bilimer, Sam Paech, Zeynep Tufekci

机构 * Princeton University(普林斯顿大学) Phillips Exeter Academy(菲利普斯埃克塞特学院) Independent(独立)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过56次20轮对话测试ChatGPT-4o和ChatGPT-5,发现API与聊天界面环境存在显著差异,揭示了自动化测试方法的不足及政策选择对行为的影响。

Comments Accepted at the 2nd Annual Conference of the International Association for Safe and Ethical Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06233 2026-04-09 cs.AI 83%

Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules

盲性拒绝:语言模型拒绝帮助用户规避不公正、荒谬和不合法的规则

Cameron Pattison, Lorenzo Manuali, Seth Lazar

机构 * Vanderbilt University(范德堡大学) University of Michigan(密歇根大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究探讨语言模型在面对不公正规则时的拒绝行为,发现模型在无安全风险情况下仍拒绝帮助,且其拒绝行为与规范推理能力脱节。

Comments 9 pages body text, 38 pages total, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06505 2026-04-09 cs.CL cs.AI 82%

MedConclusion: A Benchmark for Biomedical Conclusion Generation from Structured Abstracts

MedConclusion:一个用于从结构化摘要中生成生物医学结论的基准数据集

Weiyue Li, Ruizhi Qian, Yi Li, Yongce Li, Yunfan Long, Jiahui Cai, Yan Luo, Mengyu Wang

机构 * Harvard AI and Robotics Lab, Harvard Medical School(哈佛大学医学院哈佛人工智能与机器人实验室) University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学肯普纳自然与人工智能研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出MedConclusion数据集,包含570万篇PubMed结构化摘要,用于生物医学结论生成。通过配对摘要非结论部分与原始结论,提供证据到结论推理的自然监督。数据集还包含期刊级元数据,支持跨生物医学领域的子组分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06846 2026-04-09 cs.CL cs.AI 81%

MedDialBench: Benchmarking LLM Diagnostic Robustness under Parametric Adversarial Patient Behaviors

MedDialBench:在参数对抗患者行为下评估LLM诊断鲁棒性的基准测试

Xiaotian Luo, Xun Jiang, Jiangcheng Wu

机构 * Shanda Group(盛大集团)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 MedDialBench通过控制患者行为维度,评估LLM在不同行为下的诊断鲁棒性,发现信息污染对准确率的影响大于信息缺失,且模型存在不同的脆弱性特征。

Comments 9 pages, 4 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06216 2026-04-09 cs.CL cs.AI 81%

Blending Human and LLM Expertise to Detect Hallucinations and Omissions in Mental Health Chatbot Responses

融合人类与LLM专业知识以检测心理健康聊天机器人中的幻觉与遗漏

Khizar Hussain, Bradley A. Malin, Zhijun Yin, Susannah Leigh Rose, Murat Kantarcioglu

机构 * Vanderbilt University Medical Center, Nashville, TN, USA(范德比尔特大学医学中心,纳什维尔,田纳西州,美国)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出融合人类专业知识与LLM的框架,通过五个分析维度提取可解释特征,提升心理健康聊天机器人中幻觉与遗漏检测的准确性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06736 2026-04-09 cs.CL cs.DB 79%

SQLStructEval: Structural Evaluation of LLM Text-to-SQL Generation

SQLStructEval: 对LLM文本到SQL生成的结构评估

Yixi Zhou, Fan Zhang, Zhiqiao Guo, Yu Chen, Haipeng Zhang, Preslav Nakov, Zhuohan Xie

机构 * ShanghaiTech University(上海科技大学) The University of Tokyo(东京大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出SQLStructEval框架,通过抽象语法树分析LLM生成的SQL查询结构,发现现代LLM在相同输入下生成的查询结构多样且易受输入变化影响,通过编译式流程提升执行准确性和结构一致性。

Comments 17 pages, including figures and tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06826 2026-04-09 cs.CL cs.AI 79%

Environmental, Social and Governance Sentiment Analysis on Slovene News: A Novel Dataset and Models

斯洛文尼亚新闻的环境、社会和治理情绪分析:一个新型数据集和模型

Paula Dodig, Boshko Koloski, Katarina Sitar Šuštar, Senja Pollak, Matthew Purver

机构 * Eindhoven University of Technology(埃因霍温理工大学) Jožef Stefan Institute(约瑟夫·斯特凡研究所) University of Ljubljana(卢布尔雅那大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出首个公开的斯洛文尼亚ESG情绪数据集及模型,评估了单语和多语模型、嵌入式分类器和大型语言模型在ESG情绪检测中的性能。

Comments Accepted at the The 7th Financial Narrative Processing Workshop at LREC 26'

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06765 2026-04-09 cs.CL cs.AI 79%

TeamLLM: A Human-Like Team-Oriented Collaboration Framework for Multi-Step Contextualized Tasks

TeamLLM: 一种类人团队导向的多步骤上下文任务协作框架

Xiangyu Wang, Jin Wu, Haoran Shi, Wei Xia, Jiarui Yu, Chanjin Zheng

机构 * Department of Educational Psychology, East China Normal University(华东师范大学教育心理学系) Lab of Artificial Intelligence for Education, East China Normal University(华东师范大学教育人工智能实验室) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海教育人工智能研究院) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) Cascadia Institute for Neurotechnology (CIN)(卡斯卡迪亚神经技术研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TeamLLM通过引入四类团队角色和三阶段多LLM协作机制,提升多步骤上下文任务性能,提出CGPST基准测试集并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06212 2026-04-09 cs.SE cs.AI cs.CL 79%

Code Sharing In Prediction Model Research: A Scoping Review

预测模型研究中的代码共享:一项范围综述

Thomas Sounack, Raffaele Giancotti, Catherine A. Gao, Lasai Barreñada, Hyeonhoon Lee, Hyung-Chul Lee, Leo Anthony Celi, Karel G. M. Moons, Gary S. Collins, Charlotta Lindvall, Tom Pollard

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过综述预测模型研究中的代码共享现状,发现代码共享率随时间增加,但普遍存在可重现实体不足的问题,为TRIPOD-Code扩展提供实证基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10354 2026-04-09 cs.CL cs.AI cs.DL cs.IR 79%

Knowledge Graphs Generation from Cultural Heritage Texts: Combining LLMs and Ontological Engineering for Scholarly Debates

从文化遗产文本生成知识图谱:结合大语言模型和本体工程用于学术辩论

Andrea Schimmenti, Valentina Pasqual, Fabio Vitali, Marieke van Erp

机构 * Università degli Studi di Bologna(博洛尼亚大学) KNAW Humanities Cluster(荷兰皇家艺术与科学学院人文集群)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ATR4CH方法,通过大语言模型提取文化遗产文本知识,实现复杂知识的结构化表示,提升学术辩论中的知识查询能力。

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02434 2026-04-09 cs.SE 78%

Who's Who? LLM-assisted Software Traceability with Architecture Entity Recognition

谁是谁?基于LLM的软件可追溯性与架构实体识别

Dominik Fuchß, Haoyu Liu, Sophie Corallo, Tobias Hey, Jan Keim, Johannes von Geisau, Anne Koziolek

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出ArTEMiS方法,通过语义推理实现架构实体匹配,结合ExArch自动构建SAM,提升软件架构与代码的可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06793 2026-04-09 cs.SE cs.AI 77%

Evaluating Repository-level Software Documentation via Question Answering and Feature-Driven Development

通过问答和基于特征的开发评估仓库级软件文档

Xinchen Wang, Ruida Hu, Cuiyun Gao, Pengfei Gao, Chao Peng

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Independent Researcher, China(独立研究者)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SWD-Bench基准,通过功能驱动的问答任务评估仓库级文档质量,揭示现有方法局限,并展示高质量文档对SWE-Agent问题解决率的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06327 2026-04-09 cs.SD cs.AI 77%

A Novel Automatic Framework for Speaker Drift Detection in Synthesized Speech

一种用于合成语音中说话人漂移检测的新型自动框架

Jia-Hong Huang, Seulgi Kim, Yi Chieh Liu, Yixian Shen, Hongyi Zhu, Prayag Tiwari, Stevan Rudinac, Evangelos Kanoulas

机构 * University of Amsterdam(阿姆斯特丹大学) Georgia Institute of Technology(佐治亚理工学院) Halmstad University(哈尔姆斯塔德大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种自动框架,通过将说话人漂移检测转化为语音层面的二元分类任务,利用余弦相似度和大语言模型进行检测,建立了说话人漂移作为独立研究问题的理论基础。

Comments The paper has been accepted by the IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06209 2026-04-09 cs.CL 77%

TelcoAgent-Bench: A Multilingual Benchmark for Telecom AI Agents

TelcoAgent-Bench:电信AI代理的多语言基准测试

Lina Bariah, Brahim Mefgouda, Farbod Tavakkoli, Enrique Molero, Louis Powell, Merouane Debbah

机构 * Research Institute for Digital Future, Khalifa University(哈利法大学数字未来研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出TelcoAgent-Bench和TelcoAgent-Metrics,用于评估多语言电信LLM代理,通过结构化指标评估意图识别、工具执行、解决正确性和稳定性,以量化LLM代理在电信环境中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04563 2026-04-09 cs.CV cs.AI 77%

Temporal Inversion for Learning Interval Change in Chest X-Rays

时间倒置用于学习胸部X光片的区间变化

Hanbin Ko, Kyungmin Jeon, Doowoong Choi, Chang Min Park

机构 * Interdisciplinary Program in Bioengineering, Seoul National University Graduate School(首尔大学研究生院生物工程跨学科项目) Integrated Major in Innovative Medical Science, Seoul National University Graduate School(首尔大学研究生院创新医学科学综合专业) Dept. of Radiology, Seoul National University Hospital(首尔大学医院放射科) Seoul National University College of Medicine(首尔大学医学院) Inst. of Medical and Biological Engineering, Seoul National University Medical Research Center(首尔大学医学研究中心医学与生物工程研究所)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出TILA框架,通过时间倒置增强模型对时间变化的敏感性,改进了胸部X光片的区间变化检测与分类。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10477 2026-04-09 cs.CL 77%

PEEM: Prompt Engineering Evaluation Metrics for Interpretable Joint Evaluation of Prompts and Responses

PEEM:提示工程评估指标用于可解释地联合评估提示和响应

Minki Hong, Eunsoo Lee, Sohyun Park, Jihie Kim

机构 * Department of Computer Science and Artificial Intelligence, Dongguk University(东国大学计算机科学与人工智能系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出PEEM,一种联合且可解释的提示和响应评估框架,通过9个轴线评估提示和响应质量,结合LLM评估器输出评分和解释,提升提示设计的可解释性和优化效果。

Comments This is a preprint version of a paper accepted to IEEE Access. The final published version is available at DOI: 10.1109/ACCESS.2026.3679809

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07181 2026-04-09 cs.CL 77%

PACIFIC: Can LLMs Discern the Traits Influencing Your Preferences? Evaluating Personality-Driven Preference Alignment in LLMs

PACIFIC:LLM能否辨别影响您偏好的特质?评估LLM中由性格驱动的偏好对齐

Tianyu Zhao, Siqi Li, Yasser Shoukry, Salma Elmalaki

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过实验发现,基于用户性格特征的偏好对齐可显著提升个性化问答准确性,提出PACIFIC数据集及自动检索框架,用于改进LLM回答生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07304 2026-04-09 cs.SE cs.AI 77%

Chatbot-Based Assessment of Code Understanding in Automated Programming Assessment Systems

基于聊天机器人的代码理解评估在自动化编程评估系统中的应用

Eduard Frankford, Erik Cikalleshi, Ruth Breu

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了聊天机器人在自动化编程评估中的应用,提出混合苏格拉底框架以整合对话验证,解决代码理解评估中的挑战。

Comments 12 pages, accepted for publication at CSEDU 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06755 2026-04-09 cs.SE 75%

Babbling Suppression: Making LLMs Greener One Token at a Time

babbling suppression:使LLMs在每个token上更环保

Lola Solovyeva, Fernando Castor

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究LLM代码生成中的babbling问题,提出babbling suppression方法,通过整合测试执行减少冗余输出,降低能耗和开发者认知负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06714 2026-04-09 cs.AI cs.CL cs.CV cs.LG 75%

Steering the Verifiability of Multimodal AI Hallucinations

操控多模态AI幻觉的可验证性

Jianhong Pang, Ruoxi Cheng, Ziyi Ye, Xingjun Ma, Zuxuan Wu, Xuanjing Huang, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究多模态AI幻觉的可验证性差异,提出基于激活空间的干预方法,通过区分明显和隐秘幻觉,实现对模型可验证性的精细控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19640 2026-04-09 cs.CV 75%

Focus on What Really Matters in Low-Altitude Governance: A Management-Centric Multi-Modal Benchmark with Implicitly Coordinated Vision-Language Reasoning Framework

聚焦低空治理中真正重要的问题:一种以管理为中心的多模态基准与隐式协调的视觉-语言推理框架

Hao Chang, Zhihui Wang, Lingxiang Wu, Wei An, Boyang Li, Zaiping Lin, Weidong Sheng, Jinqiao Wang

机构 * National University of Defense Technology(国防科技大学) Zidong Taichu (Beijing) Technology Co., Ltd.(紫东太初(北京)科技有限公司) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Wuhan AI Research(武汉人工智能研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出GovLA-10K多模态基准和GovLA-Reasoner框架,通过功能显著目标和隐式协调的视觉-语言推理提升低空治理中的管理需求理解与执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03013 2026-04-09 cs.CR 75%

LLMs, You Can Evaluate It! Design of Multi-perspective Report Evaluation for Security Operation Centers

LLMs, You Can Evaluate It! 多视角报告评估设计用于安全运营中心

Hiroyuki Okada, Tatsumi Oba, Naoto Yanai

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文设计多视角报告评估框架MESSALA,利用LLM提升安全运营中心分析报告质量,实验表明其评估结果最接近资深分析师。

详情

展开后加载摘要…

URL PDF HTML 收藏