arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2607.19670 2026-07-23 cs.MA 新提交 89%

Same Game, Different Story: A Minimal Conservative Strategic Robustness Benchmark for Large Language Model Agents

相同博弈,不同故事:大语言模型智能体的最小保守战略稳健性基准

Seyed Pouyan Mousavi Davoudi, Alireza Amiri-Margavi, Amin Gholami Davodi, Hamidreza Hasani Balyani, Arshia Gharagozlou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究大语言模型智能体在战略环境中的可靠性,通过“相同博弈,不同故事”基准,以收益不变框架变化下行动分布不变性定义稳健性,经二次分析已发表数据得出社会关系框架会改变模型行为,应分别评估稳健性与能力。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13820 2026-07-16 cs.SE 新提交 89%

PROBE: Benchmarking Code Generation in Large Language Models

PROBE:大语言模型中代码生成的基准测试

Rodrigo Pato Nogueira, Marco Vieira, João R. Campos

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 针对大语言模型代码生成评估不足,介绍PROBE基准框架,基于多维度评估代码,用于评估多种模型和语言,发现LLMs虽有成果,但处理难题及小模型在特定语言上有困难,且常因易避免错误失败。

Comments Accepted for publication in Empirical Software Engineering (Springer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16304 2026-07-15 cs.CR cs.SE 版本更新 89%

An Evaluation of Large Language Models for Detection of Malicious Python Packages

注意差距:评估LLMs在高层面恶意包检测与细粒度指标识别中的表现

Ahmed Ryan, Ibrahim Khalil, Abdullah Al Jahid, Md Erfan, Sungbin Park, Akond Ashfaque Ur Rahman, Md Rayhanur Rahman

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文评估了LLMs在恶意包检测与细粒度指标识别中的性能差异,发现通用模型在过滤威胁方面表现优异,但专用编码模型在识别严格结构的攻击时更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09595 2026-07-09 cs.AI cs.CL cs.LG 版本更新 89%

LiveOIBench: Can Large Language Models Outperform Human Contestants in Informatics Olympiads?

LiveOIBench:大语言模型在信息学奥林匹克竞赛中能超越人类参赛者吗?

Kaijian Zou, Aaron Xiong, Yunxiang Zhang, Frederick Zhang, Yueqi Ren, Jirong Yang, Ayoung Lee, Shitanshu Bhushan, Lu Wang

机构 * University of Michigan(密歇根大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型在信息学奥林匹克竞赛中的表现,引入含403个专家策划问题的LiveOIBench基准,通过四个关键特性评估34个模型,发现GPT - 5等不及顶级人类参赛者,还表明强大推理模型特点及基准数据污染少。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02964 2026-07-08 cs.CR 版本更新 89%

External Data Extraction Attacks against Retrieval-Augmented Large Language Models

针对检索增强型大语言模型的外部数据提取攻击

Yu He, Yifei Chen, Yiming Li, Shuo Shao, Leyi Qi, Boheng Li, Dacheng Tao, Zhan Qin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究针对检索增强型大语言模型的外部数据提取攻击,提出统一框架并开发SECRET攻击方法,该方法含自适应优化与聚类聚焦触发策略,实验显示其显著优于先前攻击,能有效提取数据,呼吁关注此新兴威胁。

Comments Accepted by IEEE TIFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03734 2026-07-07 cs.SE 新提交 89%

Fault Detection and Explainable Classification in Automotive HIL Validation via Denoising Autoencoders and In-Context Large Language Models

通过去噪自编码器和上下文大语言模型进行汽车硬件在环验证中的故障检测与可解释分类

Mohammad Abboush, Hamza Ouarrad, Andreas Rausch

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 提出用于汽车实时验证中故障检测与分类的通用且可解释的两阶段框架,先以去噪自编码器标记异常,再用大语言模型分类并给出解释,评估显示该方法有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28618 2026-06-30 cs.SE 89%

Evaluating LLMs on Java Code Snippet Adaptation Using a Mutation-Injection Framework

使用突变注入框架评估LLM在Java代码片段适配上的表现

Ali Aman, Muhammad Asaduzzaman, Shaowei Wang, Chanchal K. Roy

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 通过突变注入框架构建Java代码片段数据集,研究无指令条件下LLM对代码片段的适配能力,分析适配类型难度、复杂度影响及所需上下文范围。

Comments Accepted in the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05366 2026-06-30 cs.CL cs.AI cs.LG 89%

Lost in Execution: On the Multilingual Robustness of Tool Calling in Large Language Models

在执行中迷失:大型语言模型在多语言环境下的工具调用鲁棒性研究

Zheng Luo, T Pranav Kutralingam, Ogochukwu N Okoani, Wanpeng Xu, Hua Wei, Xiyang Hu

机构 * University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了多语言环境下大型语言模型工具调用的鲁棒性,通过MLCL基准测试发现参数值语言不匹配是主要失败模式,尽管策略减少错误但无法恢复英语水平性能。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03546 2026-06-30 cs.CL cs.AI cs.HC cs.LG 89%

Value-Action Alignment in Large Language Models under Privacy-Prosocial Conflict

大语言模型在隐私与亲社会冲突下的价值-行动对齐

Guanyu Chen, Chenxiao Yu, Xiyang Hu

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨大语言模型在隐私与亲社会冲突中的价值-行动对齐,通过多组结构方程模型分析隐私关注与亲社会性对数据共享的影响,提出价值-行动对齐率(VAAR)作为评估指标。

Comments Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26960 2026-06-26 cs.NI 新提交 89%

Toward Agentic SysAdmin: Rethinking System Administration with AI Agents

迈向智能系统管理:用AI智能体重新思考系统管理

Gianmaria Frigo, Davide Saladino, Alberto Castagnaro, Francesco Marchiori, Denis Donadel, Luca Pajola, Mauro Conti

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 提出NetLLMeval框架,通过实时网络仿真自动评估LLM在系统管理任务中的表现,发现求解器设计显著影响准确性,本地模型在合适配置下可媲美前沿大模型。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26196 2026-06-26 cs.CL cs.AI cs.CV cs.LG cs.MM 新提交 89%

From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models

从结构到协同:多模态大语言模型中视觉-语言感知范式演进综述

Haoxiang Sun, Tao Wang, Li Yuan, Jian Zhao, Jiancheng Lv

机构 * School of Computer Science, Sichuan University(四川大学计算机学院) School of Electronic and Computer Engineering, Peking University Shenzhen Graduate School(北京大学深圳研究生院电子与计算机工程学院) Institute of Artificial Intelligence (TeleAI), China Telecom and Northwestern Polytechnical University(中国电信与西北工业大学人工智能研究院(TeleAI))

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文系统综述多模态大语言模型中统一视觉-语言感知的范式演进,提出五阶段分类法,梳理各阶段代表性方法,并指出开放挑战与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26109 2026-06-26 cs.CY cs.MA 新提交 89%

Simulating Eating Disorder Patients with LLMs: Evaluating Psychological Persona Stability in Multi-Turn Conversations

使用LLM模拟饮食障碍患者:评估多轮对话中的心理角色稳定性

Jennifer Haase, Jana Gonnermann-Müller, See Heng Yim, Nicolas Leins, Jan Mendling, Sebastian Pokutta

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究通过饮食障碍案例和双评估框架,发现LLM在模拟患者时过度稳定且不准确,系统性地高估严重程度12-30%,并存在“缺失中间态”问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24655 2026-06-24 cs.CL cs.AI cs.LG cs.PF 新提交 89%

AI-PAVE-Br: Leveraging Large Language Models for Enhanced Product Attribute Value Extraction through a Golden Set Approach

AI-PAVE-Br:利用大语言模型通过黄金集方法增强产品属性值提取

Murilo Gazzola, Hugo Gobato Souto, Samuel Silva, Júlia Schubert Peixoto, Felipe Siqueira, André Luis Pedroso de Morais, Caio Gomes

机构 * LuizaLabs – Center of Excellence in Artificial Intelligence(LuizaLabs人工智能卓越中心) Department of Computing and Informatics – Mackenzie Presbyterian University(计算与信息学系-麦金西 Presbyterian大学) Institute of Mathematics and Computer Sciences - University of São Paulo(数学与计算机科学研究所-圣保罗大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对巴西电商产品数据爆炸和复杂性,提出AI-PAVE-Br系统,利用大语言模型和精心标注的黄金集,显著提升葡萄牙语产品属性值提取的准确性。

Journal ref Proceedings of the 15th Symposium in Information and Human Language Technology (STIL 2025), Brazilian Computer Society (SBC), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22269 2026-06-23 cs.CL cs.AI cs.LG 新提交 89%

Evaluating Large Language Models for Hausa and Fongbe Machine Translation: Benchmarks, Failures, and Metric Reliability

评估大语言模型在豪萨语和丰贝语机器翻译中的表现:基准、失败与指标可靠性

Mahounan Pericles Adjovi, Roald Eiselen, Prasenjit Mitra

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲校区) North-West University(西北大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究评估了四种大语言模型在英语到豪萨语和丰贝语(两种西非低资源语言)的翻译质量,发现质量因语言而异,模型排名不一致,且自动指标与人类判断的相关性波动大,建议采用多指标评估并注意神经指标的局限性。

Comments 19 pages, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13812 2026-06-15 q-fin.CP q-fin.GN 新提交 89%

CFOs Meet LLMs

CFO 与 LLM 相遇

John R. Graham, Campbell R. Harvey, Manish Jha

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究利用大语言模型扮演特定公司CFO,基于杜克-美联储CFO调查数据预测经济乐观情绪,发现LLM能有效复现个体人类反应,为金融研究和政策提供可扩展的高频预期数据。

Comments 21 pages, 4 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11712 2026-06-11 cs.CL cs.AI cs.LG 新提交 89%

Substrate Asymmetry in User-Side Memory: A Diagnostic Framework

用户侧记忆中的子模块不对称性:一个诊断框架

Youwang Deng

机构 * EpistemicaLab — Independent Research(EpistemicaLab — 独立研究)

专题命中 评测与基准 :RLHF(summary_cn,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一个诊断框架,将LLM用户侧记忆分解为行为一致性、事实存在和事实缺失三个正交子模块,发现参数记忆与检索记忆在不同子模块上存在不对称性,且RLHF调优加剧了这种不对称性。

Comments Preprint. Code: https://github.com/EpistemicaLab/substrate-asymmetry-memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07341 2026-06-08 cs.CR 新提交 89%

Empirical Evaluation of Large Language Models for Migration of Code Fragments to Post-Quantum Cryptography

大型语言模型在代码片段向后量子密码迁移中的实证评估

Javier Pallarés de Bonrostro, Ana I. González-Tablas, María Isabel González Vasco

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn)

AI总结 评估大型语言模型在将经典密码代码片段迁移至后量子密码中的能力,通过微调GPT-4.1-mini实现92.5%的功能正确率,优于零样本基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00462 2026-06-02 cs.CL cs.AI cs.LG 89%

Short-form Text Rewriting with Phi Silica

短文本改写与 Phi Silica

Divya Tadimeti, Shawn Pan, Sameera Lanka, Chenghui Zhou, Sadid Hasan

机构 * IEEE ICAD

专题命中 评测与基准 :LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究通过数据集整理、提示蒸馏、参数高效微调和评估,将小语言模型 Phi Silica 适配于短文本改写任务,结果表明微调提高了语义保真度、减少了幻觉并提升了与 GPT-5-chat 改写的偏好胜率。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20638 2026-06-02 cs.CL cs.AI cs.LG 89%

Uncovering Competency Gaps in Large Language Models and Their Benchmarks

揭示大型语言模型及其基准测试中的能力差距

Maty Bohacek, Nino Scherrer, Nicholas Dufour, Thomas Leung, Christoph Bregler, Stephanie C. Y. Chan

机构 * University of Zurich(苏黎世大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种基于稀疏自编码器概念激活的新方法,自动发现模型在细粒度概念上的弱点(模型差距)和基准测试覆盖不平衡(基准差距),并通过内部表示评估和跨基准比较进行验证。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09301 2026-05-28 q-fin.PM 89%

Constructing a Portfolio Optimization Benchmark Framework for Evaluating Large Language Models

构建用于评估大语言模型的投资组合优化基准框架

Hanyong Cho, Jang Ho Kim

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究提出一个基准框架,通过具有数学显式解的投资组合优化问题评估大语言模型的金融决策能力,实验显示GPT-4在基于风险的目标上表现最佳,而Llama 3.1-70B整体性能最低。

Comments Poster presented at the AI for Finance Symposium '25, The 6th ACM International Conference on AI in Finance (ICAIF '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21154 2026-05-21 cs.CL cs.AI cs.LG 89%

Automated ICD Classification of Psychiatric Diagnoses: From Classical NLP to Large Language Models

精神病诊断的ICD分类自动化:从经典NLP到大语言模型

Fernando Ortega, Raúl Lara-Cabrera, Jorge Dueñas-Lerín, Alejandro de la Torre-Luque, Mercé Salvador Robert, Enrique Baca-García

机构 * Department of Sistemas Informáticos, Universidad Politécnica de Madrid, Spain(西班牙马德里理工大学信息系统系) KNODIS Research Group, Universidad Politécnica de Madrid, Spain(西班牙马德里理工大学KNODIS研究组) CIBERSAM ISCIII, Spain(西班牙ISCIII CIBERSAM) Department of Legal Medicine, Psychiatry and Pathology. Complutense University of Madrid, Spain(西班牙马德里康普顿斯大学法医学、精神病学与病理学系) Hospital Universitario de Móstoles, Universidad Rey Juan Carlos, Spain(西班牙雷阿尔皇家卡洛斯大学莫斯特oles大学医院) Department of Psychiatry, University Hospital Jimenez Díaz Fundation, Madrid, Spain(西班牙圣地亚哥· jiménez Díaz基金会精神病科部) Department of Psychiatry, University Hospital Rey Juan Carlos, Móstoles, Spain(西班牙雷阿尔皇家卡洛斯大学莫斯特oles医院精神病科部) Department of Psychiatry, General Hospital of Villalba, Madrid, Spain(西班牙维拉尔巴医院精神病科部) Department of Psychiatry, University Hospital Infanta Elena, Madrid, Spain(西班牙伊菲格尼亚医院精神病科部) Department of Psychology, Universidad Catolica del Maule, Talca, Chile(智利马尔学院心理学系) Department of Psychiatry, Madrid Autonomous University, Madrid, Spain(西班牙马德里自治大学精神病科部)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出利用NLP和机器学习技术将自由文本描述映射到国际疾病分类(ICD),以自动化精神病诊断分析,通过评估从经典频率模型到先进大语言模型的多种文本表示方法,展示了transformer嵌入在捕捉隐含语义线索和细致医学术语方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15876 2026-05-21 cs.CV 89%

Unlocking Dense Metric Depth Estimation in VLMs

解锁VLMs中的密集度量深度估计

Hanxun Yu, Xuan Qu, Yuxin Wang, Jianke Zhu, Lei Ke

机构 * Zhejiang University(浙江大学) Tencent Hunyuan LLM(腾讯混元大模型) HKUST(香港科技大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract,abstract_cn);foundation model(abstract,abstract_cn)

AI总结 本文提出DepthVLM,一种将单个VLM转换为原生密集几何预测器的简单有效框架,同时保持其多模态能力。通过在LLM主干上附加轻量级深度头,并在统一的视觉-文本监督范式下进行训练,DepthVLM能够在单次前向传递中生成高分辨率深度图和语言输出。此外,还引入了一个统一的室内-室外度量深度基准,实验表明DepthVLM在推理效率、复杂3D空间推理等方面均优于现有VLMs和纯视觉模型。

Comments Project Page: https://depthvlm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13898 2026-05-15 cs.SE 89%

Bidirectional Empowerment of Metamorphic Testing and Large Language Models: A Systematic Survey

双向赋能:变形测试与大语言模型的相互促进:系统综述

Zheng Zheng, Zenghui Zhou, Yinwang Xu, Daixu Ren, Tsong Yueh Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文系统综述了93项研究,探讨变形测试与大语言模型之间的双向赋能关系,提出分类框架,分析其在验证、评估和自动化测试中的应用。

Comments Daixu Ren is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12772 2026-05-14 cs.CV 89%

Just Ask for a Table: A Thirty-Token User Prompt Defeats Sponsored Recommendations in Twelve LLMs

只需请求一张表格:一个三十个标记的用户提示在十二个LLM中击败了赞助推荐

Andreas Maier, Jeta Sopa, Gozde Gul Sahin, Paula Perez-Toro, Siming Bayer

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universit\"at Erlangen-N\"urnberg, Germany

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究发现,一个三十个标记的用户提示能显著降低LLM中的赞助推荐率,且核心结论在不同模型中保持一致,但实现过程中存在潜在失败因素。

Comments Submitted to Workshop on Textual Information Processing & Synthesis in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13050 2026-05-13 cs.LG cs.AI cs.CL cs.CV cs.SD eess.AS 89%

Modality-Inconsistent Continual Learning of Multimodal Large Language Models

多模态大语言模型的模态不一致持续学习

Weiguo Pian, Shijian Deng, Shentong Mo, Mingrui Liu, Yunhui Guo, Yapeng Tian

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Carnegie Mellon University(卡内基梅隆大学) George Mason University(乔治·梅森大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MICL,一种针对多模态大语言模型的持续学习场景,涉及不一致的模态和变化的任务类型。通过伪目标生成模块和基于指令的知识蒸馏,解决任务类型转移导致的遗忘问题,实验验证了方法的有效性。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09723 2026-05-05 cs.CL cs.AI cs.LG stat.ME 89%

ALIGNS: Unlocking nomological networks in psychological measurement through a large language model

ALIGNS:通过大型语言模型解锁心理测量中的规范网络

Kai R. Larsen, Sen Yan, Roland M. Mueller, Lan Sang, Mikko Rönkkö, Ravi Starzl, Donald Edmondson

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ALIGNS利用大型语言模型构建包含55万+指标的规范网络,首次将大语言模型应用于测量验证基础问题,通过三个评估发现心理测量中的新维度和潜在问题。

Comments Error in algorithm explanation

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18473 2026-04-29 cs.CL cs.AI cs.LG 89%

Principled Detection of Hallucinations in Large Language Models via Multiple Testing

通过多重检验原则检测大语言模型中的幻觉

Jiawei Li, Akshayaa Magesh, Venugopal V. Veeravalli

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过多重检验方法系统整合多个评估分数,实现受控的幻觉检测,验证了方法在不同模型和数据集上的鲁棒性。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22492 2026-04-27 eess.IV cs.CV 89%

MTT-Bench: Predicting Social Dominance in Mice via Multimodal Large Language Models

MTT-Bench:通过多模态大语言模型预测小鼠的社会支配

Yunquan Chen, Haoyu Chen

机构 * Department of Communication Systems, KTH Royal Institute of Technology(通信系统系,皇家理工学院) CMVS, University of Oulu(奥卢大学CMVS)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(abstract)

AI总结 本文提出MTT-Bench基准,利用多模态大语言模型分析小鼠行为视频,预测社会支配等级,无需显式标签进行零样本推理,展示了在乙学和社会行为分析中的应用潜力。

Comments 8 pages, 2 figures. Submitted to conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16872 2026-04-21 cs.DL 89%

Do Large Language Models know Which Published Articles have been Retracted?

Mike Thelwall

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23657 2026-04-17 cs.SE 89%

Secret Leak Detection in Software Issue Reports using LLMs: A Comprehensive Evaluation

利用LLM在软件问题报告中检测秘密泄露:全面评估

Sadif Ahmed, Md Nafiu Rahman, Zahin Wahab, Gias Uddin, Rifat Shahriyar

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文通过大规模分析和实用检测流程,评估了GitHub问题中泄露秘密的检测方法,结合正则表达式和LLM进行分类,提升检测精度与召回率。

Comments Accepted at the International Conference on Mining Software Repositories (MSR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏