arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-08 至 2026-04-08 共收录 69 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 69 篇

2604.05995 2026-04-08 cs.CL cs.AI cs.LG 91%

The Model Agreed, But Didn't Learn: Diagnosing Surface Compliance in Large Language Models

模型已达成一致,但未学习:诊断大语言模型中的表面合规性

Xiaojie Gu, Ziying Huang, Weicong Hong, Jian Xie, Renze Lou, Kai Zhang

机构 * Independent Researcher(独立研究员) Cornell Tech(康奈尔科技校区) The Ohio State University(俄亥俄州立大学) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 研究通过引入诊断框架,揭示大语言模型在记忆修改中存在表面合规现象,指出编辑方法可能仅模仿输出而非改变内部信念,导致认知不稳定和记忆不可逆。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05755 2026-04-08 cs.SE cs.AI 89%

CAKE: Cloud Architecture Knowledge Evaluation of Large Language Models

CAKE:大型语言模型云架构知识评估

Tim Lukas Adam, Phongsakon Mark Konrad, Riccardo Terrenzi, Florian Girardo Lukas, Rahime Yilmaz, Krzysztof Sierszecki, Serkan Ayvaz

机构 * Centre for Industrial Software(工业软件中心) University of Southern Denmark(南丹麦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出CAKE基准测试,评估大型语言模型对云原生软件架构的理解,涵盖四个认知层次和五个主题,通过多选和自由回答形式评估22种模型配置,发现多选准确率随参数增加而稳定,自由回答持续区分模型,推理增强提升表现,工具增强则降低小型模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04168 2026-04-08 cs.CL cs.IR 89%

A Semi-Automated Annotation Workflow for Paediatric Histopathology Reports Using Small Language Models

一种用于儿童病理科报告的半自动化标注工作流程使用小型语言模型

Avish Vijayaraghavan, Jaskaran Singh Kawatra, Sebin Sabu, Jonny Sheldon, Will Poulett, Alex Eze, Daniel Key, John Booth, Shiren Patel, Jonny Pearson, Dan Schofield, Jonathan Hope, Pavithra Rajendran, Neil Sebire

机构 * Imperial College London(帝国理工学院) NHS England(英国国家医疗服务体系) Great Ormond Street Hospital(大奥蒙德街儿童医院) University College London(伦敦大学学院)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出一种基于小型语言模型的半自动化标注流程,用于从非结构化电子病历数据中提取结构化信息,尤其针对儿童病理科报告,通过临床监督和少量示例提升提取准确性。

Comments 36 pages, includes supplementary information

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06048 2026-04-08 cond-mat.mtrl-sci 89%

Large Language Model Assisted Discovery of Optimal Dopants for Enhanced Thermoelectric Performance in CoSb$_3$ Based Skutterudites

基于大语言模型的优化掺杂剂发现以提高CoSb$_3$基硫化物的热电性能

Yagnik Bandyopadhyay, Dylan Noel Serrao, Houlong L. Zhuang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出一种数据驱动方法,利用大语言模型加速发现高性能CoSb$_3$基硫化物,通过训练回归头预测热电优值,降低均方误差,并通过密度泛函理论和分子动力学计算验证预测的掺杂剂性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11548 2026-04-08 cs.CR 89%

Copyright Protection for Large Language Models: A Survey of Methods, Challenges, and Trends

大型语言模型的版权保护:方法、挑战与趋势的综述

Zhenhua Xu, Xubin Yue, Zhebo Wang, Haobo Zhang, Qichen Liu, Xixiang Zhao, Jingxuan Zhang, Wenjun Zeng, Wengpeng Xing, Dezhang Kong, Changting Lin, Meng Han

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文综述了大型语言模型版权保护现状,重点探讨了模型指纹技术,涵盖文本水印与模型水印的关联、多种文本水印技术对比、模型指纹分类、指纹转移与去除技术及评估指标,揭示了开放挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10287 2026-04-08 cs.LG cs.CL 88%

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models

OutSafe-Bench:一种用于大型语言模型多模态攻击内容检测的基准测试

Yuping Yan, Yuhan Xie, Yuanshuai Li, Yingchao Yu, Lingjuan Lyu, Yaochu Jin

机构 * School of Engineering, Westlake University(西湖大学工学院) Sony AI(索尼人工智能)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出OutSafe-Bench,首个多模态时代内容安全评估测试套件,包含四类模态大规模数据集及多维交叉风险评分指标,评估九种内容风险类别,揭示九种先进MLLM的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00946 2026-04-08 eess.IV cs.CV 88%

Ultrasound-based detection and malignancy prediction of breast lesions eligible for biopsy: A multi-center clinical-scenario study using nomograms, large language models, and radiologist evaluation

基于超声的乳腺病变 biopsy 推荐和恶性预测:一种结合 BIRADS 特征和定量形态学特征的多中心临床场景研究,使用 nomograms、大型语言模型和放射科医生评估

Ali Abbasian Ardakani, Afshin Mohammadi, Taha Yusuf Kuzan, Beyza Nur Kuzan, Hamid Khorshidi, Ashkan Ghorbani, Alisa Mohebbi, Fariborz Faeghi, Sepideh Hatamikia, U Rajendra Acharya

机构 * Shahid Beheshti University of Medical Sciences(沙希德·贝赫什提医科大学) Urmia University of Medical Science(乌尔米耶医科大学) University of Health Sciences(健康科学大学) Kartal Dr. Lütfi Kırdar City Hospital(卡尔塔尔·吕特菲·克尔达尔市医院) University of Padova(帕多瓦大学) Universal Scientific Education and Research Network (USERN)(全球科学教育与研究网络(USERN)) Tehran University of Medical Sciences(德黑兰医科大学) Danube Private University(多瑙河私立大学) Austrian Center for Medical Innovation and Technology (ACMIT)(奥地利医学创新与技术中心(ACMIT)) University of Southern Queensland(南昆士兰大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文研究了结合 BIRADS 特征和定量形态学特征的 nomogram 在乳腺病变 biopsy 推荐和恶性预测中的性能,对比了放射科医生和大型语言模型的诊断效果,展示了 nomogram 的优越性。

Comments Academic Radiology (2026)

Journal ref "Ultrasound-based detection and malignancy prediction of breast lesions eligible for biopsy: A multi-center clinical-scenario study using nomograms, large language models, and radiologist evaluation." Academic Radiology (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05774 2026-04-08 q-bio.GN cs.CL 88%

GenomeQA: Benchmarking General Large Language Models for Genome Sequence Understanding

GenomeQA:用于基因组序列理解的通用大型语言模型基准测试

Weicai Long, Yusen Hou, Junning Feng, Houcheng Su, Shuo Yang, Donglin Xie, Yanlin Zhang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Hong Kong(香港大学) Peking University(北京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 GenomeQA旨在评估通用大型语言模型在基因组序列推理任务中的表现,包含5200个样本,涵盖六个任务家族,揭示模型在直接接触原始基因组序列时的表现。

Comments 18 pages, 9 figures, coference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05224 2026-04-08 cs.AI 88%

Attribution Bias in Large Language Models

大语言模型中的归因偏差

Eliza Berman, Bella Chang, Daniel B. Neill, Emily Black

机构 * New York University(纽约大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出AttriBench基准数据集,用于研究大语言模型在引用归因中的种族、性别和交集群体偏差问题,并发现即使前沿模型在引用归因任务上也存在显著挑战。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06071 2026-04-08 cs.CL cs.AI cs.HC 88%

Stories of Your Life as Others: A Round-Trip Evaluation of LLM-Generated Life Stories Conditioned on Rich Psychometric Profiles

你生命中的故事:基于丰富心理测量资料的LLM生成生命故事的往返评估

Ben Wigler, Maria Tsfasman, Tiffany Matej Hrkalovic

机构 * LoveMind AI Jheronimus Academy of Data Science(耶罗尼米斯数据科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文通过LLM生成生命故事并回收心理测量数据,验证了LLM在编码和解码个体差异方面的鲁棒性,展示了心理特征与语言表达之间的关系。

Comments Under review at COLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05575 2026-04-08 cs.SE 88%

Bias Ahead: Sensitive Prompts as Early Warnings for Fairness in Large Language Models

提前预警:敏感提示作为大语言模型公平性的早期预警

Gianmario Voria, Martina De Lucia, Alessandra Raia, Andrea De Lucia, Gemma Catolino, Fabio Palomba

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出敏感提示作为公平性评估的新方法,通过构建SensY数据集评估LLM对敏感提示的响应,发现模型虽能提供事实正确答案,但常忽视伦理和情境影响,开发自动分类器预测提示敏感性,强调提前预警公平风险的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05083 2026-04-08 cs.CL cs.AI cs.LG 87%

Beyond LLM-as-a-Judge: Deterministic Metrics for Multilingual Generative Text Evaluation

超越LLM作为裁判:多语言生成文本评估的确定性度量

Firoj Alam, Gagan Bhatia, Sahinur Rahman Laskar, Shammur Absar Chowdhury

机构 * Qatar Computing Research Institute, HBKU, Qatar(卡塔尔哈马德·本·哈利法大学卡塔尔计算研究所) UPES, India(印度UPES大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出OmniScore,一种基于小参数模型的确定性度量,用于多语言生成文本评估,提供低延迟和一致性的评分方法,通过大规模合成监督训练,验证了其在问答、翻译和总结任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04997 2026-04-08 cs.IR cs.AI cs.CL cs.CV cs.LG 87%

Evaluation of Embedding-Based and Generative Methods for LLM-Driven Document Classification: Opportunities and Challenges

嵌入式与生成方法在LLM驱动文档分类中的评估:机遇与挑战

Rong Lu, Hao Liu, Song Hou

专题命中 评测与基准 :LLM(title);language model(abstract);SFT(abstract);prompting(abstract)

AI总结 本文比较了基于嵌入和生成模型在地学技术文档分类中的表现,发现增强的生成视觉-语言模型在零样本准确率上表现更优,但监督微调对训练数据不平衡敏感。

Comments Accepted at the IMAGE'25 Workshop (PCW-11), Society of Exploration Geophysicists (SEG). Published version available at https://doi.org/10.1190/image2025-w11-03.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05872 2026-04-08 cs.CR cs.AI cs.CL 86%

Swiss-Bench 003: Evaluating LLM Reliability and Adversarial Security for Swiss Regulatory Contexts

瑞士基准003:评估大语言模型在瑞士监管环境中的可靠性与对抗安全性

Fatih Uenal

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出瑞士基准003,扩展HAAS评估框架至八个维度,评估十种前沿模型在瑞士特定任务中的可靠性与对抗安全性,揭示模型在数据保护和安全方面的表现差异。

Comments 23 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05593 2026-04-08 cs.AI cs.CL 86%

Label Effects: Shared Heuristic Reliance in Trust Assessment by Humans and LLM-as-a-Judge

标签效应:人类和LLM-as-a-Judge在信任评估中的共享启发式依赖

Xin Sun, Di Wu, Sijing Qin, Isao Echizen, Abdallah El Ali, Saku Sugawara

机构 * National Institute of Informatics (NII)(国立信息学研究所) University of Amsterdam(阿姆斯特丹大学) University of Tokyo(东京大学) Hitotsubashi University(一桥大学) Centrum Wiskunde & Informatica (CWI)(荷兰数学与计算机科学研究中心) Utrecht University(乌得勒支大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示人类和LLM在信任评估中受标签影响的共同机制,通过对比人类和模型的反应,发现标签对信任判断有显著偏倚,提出需警惕标签敏感的LLM评估有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05483 2026-04-08 cs.AI cs.CL 86%

Can We Trust a Black-box LLM? LLM Untrustworthy Boundary Detection via Bias-Diffusion and Multi-Agent Reinforcement Learning

我们能信任一个黑盒大语言模型吗?通过偏见扩散和多智能体强化学习进行大语言模型不可信边界检测

Xiaotian Zhou, Di Tang, Xiaofeng Wang, Xiaozhong Liu

机构 * Worcester Polytechnic Institute(伍斯特理工学院) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GMRL-BD算法,通过知识图谱和多智能体强化学习识别大语言模型在特定主题上的偏见边界,实验表明该算法能以少量查询高效检测不可信边界,并发布包含多个流行大语言模型的标注数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05719 2026-04-08 cs.CR cs.AI cs.SE 85%

Hackers or Hallucinators? A Comprehensive Analysis of LLM-Based Automated Penetration Testing

黑客还是幻觉?对基于LLM的自动化渗透测试的全面分析

Jiaren Peng, Zeqin Li, Chang You, Yan Wang, Hanlin Sun, Xuan Tian, Shuqiao Zhang, Junyi Liu, Jianguo Zhao, Renyang Liu, Haoran Ou, Yuqiang Sun, Jiancheng Zhang, Yutong Jiao, Kunshu Song, Chao Zhang, Fan Shi, Hongda Sun, Rui Yan, Cheng Huang

机构 * School of Cyber Science and Engineering, Sichuan University(四川大学网络空间安全学院) Institute for Network Sciences and Cyberspace, Tsinghua University(清华大学网络科学与网络空间研究院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) National University of Singapore(新加坡国立大学) College of Electronic Engineering, National University of Defense Technology(国防科技大学电子工程学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文对基于LLM的自动化渗透测试框架进行系统分析和大规模评估,揭示其架构设计和性能差异,为未来研究提供结构化分类和基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05371 2026-04-08 cs.AI 85%

LLM-as-Judge for Semantic Judging of Powerline Segmentation in UAV Inspection

基于LLM的语义判断用于无人机巡检中的电力线分割

Akram Hossain, Rabab Abdelfattah, Xiaofeng Wang, Kareem Abdelfatah

机构 * School of Computing Sciences and Computer Engineering, The University of Southern Mississippi(南密西西比大学计算科学与计算机工程学院) Electrical Engineering Department, University of South Carolina(南卡罗来纳大学电气工程系) Computer Science Department, Faculty of Computers & Artificial Intelligence, Fayoum University(法尤姆大学计算机与人工智能学院计算机科学系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究利用大语言模型作为语义判断器,评估无人机搭载模型生成的电力线分割结果可靠性,通过设计两个评估协议测试其重复性和感知敏感性,证明在约束条件下LLM能可靠监控关键任务的分割质量。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06556 2026-04-08 cs.SE cs.CL 85%

MultiFileTest: A Multi-File-Level LLM Unit Test Generation Benchmark and Impact of Error Fixing Mechanisms

MultiFileTest:一个多文件级LLM单元测试生成基准及错误修复机制的影响

Yibo Wang, Congying Xia, Wenting Zhao, Jiangshu Du, Chunyu Miao, Zhongfen Deng, Philip S. Yu, Chen Xing

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Salesforce Research(Salesforce研究院) Scale AI

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MultiFileTest基准,评估多文件级代码的单元测试生成性能,发现前沿LLM表现一般,且存在执行及级联错误,进一步评估了错误修复机制的效果。

Comments Published at ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07291 2026-04-08 cs.CR 85%

Evaluating LLM-based Personal Information Extraction and Countermeasures

评估基于大语言模型的个人信息提取及应对措施

Yupei Liu, Yuqi Jia, Jinyuan Jia, Neil Zhenqiang Gong

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究评估了基于大语言模型的个人信息提取技术及防御策略,通过系统测量研究对比了多种方法的性能,发现大语言模型在提取个人信息上表现优异,但通过提示注入可有效防御其攻击。

Comments USENIX Security Symposium 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05427 2026-04-08 cs.RO 85%

Pre-Execution Safety Gate & Task Safety Contracts for LLM-Controlled Robot Systems

预执行安全闸门与任务安全合同用于LLM控制的机器人系统

Ike Obi, Vishnunandan L. N. Venkatesh, Weizheng Wang, Ruiqi Wang, Dayoon Suh, Temitope I. Amosa, Wonse Jo, Byung-Cheol Min

机构 * SMART Laboratory, Department of Computer and Information Technology, Purdue University(普渡大学计算机与信息技术系SMART实验室) Department of Information and Telecommunication Engineering, Incheon National University(仁川国立大学信息与通信工程系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出SafeGate和Task Safety Contracts,通过神经符号安全架构和约束检查,提升LLM控制机器人系统的安全性,减少缺陷命令的执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05135 2026-04-08 cs.CL cs.CE 83%

SenseAI: A Human-in-the-Loop Dataset for RLHF-Aligned Financial Sentiment Reasoning

SenseAI:一种用于RLHF对齐的金融情感推理的人机协同数据集

Berny Kabalisa

专题命中 评测与基准 :RLHF(title,abstract);LLM(abstract);分类 cs.CL

AI总结 SenseAI通过整合推理链、置信度评分和市场结果,为金融情感推理提供RLHF对齐的数据支持,揭示模型行为中的系统性模式及改进机会。

Comments Dataset available on request (bernykabalisa18@gmail.com) See GitHub for dataset snapshot and automated data collection script demo https://github.com/bernykabalisa18-netizen/SenseAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04953 2026-04-08 cs.CV cs.AI cs.HC cs.IR cs.MM 81%

Generative AI for Video Trailer Synthesis: From Extractive Heuristics to Autoregressive Creativity

生成AI用于视频预告片合成:从提取启发式方法到自回归创造力

Abhishek Dharmaratnakar, Srivaths Ranganathan, Debanshu Das, Anushree Sinha

机构 * Google LLC(谷歌有限责任公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文综述了自动视频预告片生成领域从启发式提取到深度生成合成的转变,探讨了自回归Transformer、LLM协同流程和文本到视频基础模型等生成技术,并讨论了高保真神经合成的伦理挑战。

Comments 7 pages, 3 figures, accepted in WSDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05930 2026-04-08 cs.CL cs.AI 81%

"I See What You Did There": Can Large Vision-Language Models Understand Multimodal Puns?

我看出你在那儿:大型视觉-语言模型能否理解多模态双关语?

Naen Xu, Jiayi Sheng, Changjiang Li, Chunyi Zhou, Yuyuan Li, Tianyu Du, Jun Wang, Zhihui Fu, Jinbao Li, Shouling Ji

机构 * Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Palo Alto Networks Hangzhou Dianzi University(杭州电子科技大学) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) OPPO Research Institute(OPPO研究院) Qilu University of Technology(齐鲁工业大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型视觉-语言模型理解多模态双关语的能力,提出多模态双关语生成流程和MultiPun数据集,通过评估发现模型在区分真实双关语与干扰项上表现不足,并提出提示级和模型级策略提升理解性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05955 2026-04-08 cs.SE cs.AI 79%

Does Pass Rate Tell the Whole Story? Evaluating Design Constraint Compliance in LLM-based Issue Resolution

通过率能讲述全部故事吗?评估基于LLM的问题解决的设计约束合规性

Kai Yu, Zhenhao Zhou, Junhao Zeng, Ying Wang, Xueying Du, Zhiqiang Yuan, Junwei Liu, Ziyu Zhou, Yujia Wang, Chong Wang, Xin Peng

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出设计感知问题解决方法,引入bench基准,通过挖掘和验证真实项目中的设计约束,评估LLM在问题解决中设计约束的合规性,发现测试通过率高并不代表设计合规性好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05674 2026-04-08 cs.CR cs.AI 79%

From Incomplete Architecture to Quantified Risk: Multimodal LLM-Driven Security Assessment for Cyber-Physical Systems

从不完整架构到量化风险:面向网络物理系统的多模态LLM驱动安全评估

Shaofei Huang, Christopher M. Poskitt, Lwin Khin Shar

机构 * Singapore Management University(新加坡管理大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出ASTRAL方法,利用多模态LLM重构和分析网络物理系统架构,通过提示链、少样本学习和架构推理实现安全威胁识别和风险量化评估。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08528 2026-04-08 cs.CL cs.SD eess.AS 79%

On The Landscape of Spoken Language Models: A Comprehensive Survey

关于语音语言模型的景观:全面综述

Siddhant Arora, Kai-Wei Chang, Chung-Ming Chien, Yifan Peng, Haibin Wu, Yossi Adi, Emmanuel Dupoux, Hung-Yi Lee, Karen Livescu, Shinji Watanabe

机构 * Carnegie Mellon University(卡内基梅隆大学) National Taiwan University(国立台湾大学) Toyota Technological Institute at Chicago(丰田芝加哥技术研究所) Hebrew University of Jerusalem(耶路撒冷希伯来大学) ENS - PSL, EHESS, CNRS(巴黎高等师范学院 - 巴黎文理研究大学、社会科学高等研究院、法国国家科学研究中心)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文综述了语音语言模型的发展,分析了其架构、训练和评估方法,探讨了关键挑战与未来方向。

Comments Published in Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20231 2026-04-08 cs.CY cs.AI cs.CL 79%

Moral Mazes in the Era of LLMs

大语言模型时代中的道德迷宫

Dang Nguyen, Harvey Yiyun Fu, Peter West, Ari Holtzman, Chenhao Tan

机构 * University of Chicago(芝加哥大学) University of British Columbia(不列颠哥伦比亚大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过HR模拟器研究LLM在职场社交情境中的表现,发现LLM在邮件风格上更正式且富有同理心,但人类在某些情况下表现不佳,而人类改写后的邮件可超越两者,揭示混合优势。

Comments 47 pages (including appendix), 7 figures, 2 tables in the main body. v2: updated title and abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05289 2026-04-08 cs.SE 78%

FLARE: Agentic Coverage-Guided Fuzzing for LLM-Based Multi-Agent Systems

FLARE:基于LLM的多智能体系统代理覆盖引导模糊测试

Mingxuan Hui, Xinyue Li, Lu Wang, Chengcheng Wan, Yifan Wang, Yimian Wang, Feiyue Song, Beining Shi, Yixi Li, Yaxiao Li

专题命中 评测与基准 :LLM(title,abstract)

AI总结 FLARE通过代理定义提取规范和行为空间,构建测试或acles进行覆盖引导模糊测试,发现多智能体系统中的失败案例,实现96.9%的代理间覆盖和91.1%的代理内覆盖。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06170 2026-04-08 cs.CL 77%

Paper Circle: An Open-source Multi-agent Research Discovery and Analysis Framework

Paper Circle:一个开源的多智能体研究发现与分析框架

Komal Kumar, Aman Chadha, Salman Khan, Fahad Shahbaz Khan, Hisham Cholakkal

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) AWS Generative AI Innovation Center, Amazon Web Services(亚马逊云科技生成式AI创新中心)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Paper Circle,一个开源多智能体研究发现与分析框架,通过多智能体系统降低学术文献查找、评估和理解的难度,结合发现与分析流程,生成结构化输出。

Comments 19 pages, 7 figures, 8 tables, ACL main (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏