arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31906 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31906 篇

2505.14549 2026-04-28 cs.CR cs.AI 90%

Can Large Language Models Really Recognize Your Name?

大语言模型真的能识别你的名字吗?

Dzung Pham, Peter Kairouz, Niloofar Mireshghallah, Eugene Bagdasarian, Chau Minh Pham, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Google Research(谷歌研究) Carnegie Mellon University(卡内基梅隆大学) Google Research, University of Massachusetts Amherst(谷歌研究,马萨诸塞大学阿默斯特分校) University of Maryland, College Park(马里兰大学学院市分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究大语言模型在短文本中处理模糊人名的可靠性问题,构建AmBench基准测试集,发现模型对模糊人名的识别率下降20-40%,揭示隐私保护中的公平性问题。

Comments ACM FAccT '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20677 2026-04-24 cs.CL 90%

Intersectional Fairness in Large Language Models

大语言模型中的交叉公平性

Chaima Boufaied, Ronnie De Souza Santos, Ann Barcomb

机构 * University of Calgary(卡尔加里大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文评估了六个大语言模型在交叉人口属性上的公平性,发现模型在模糊情境中表现良好,但在解歧情境中受刻板印象影响,且跨群体结果分布不均。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06080 2026-04-22 cond-mat.mtrl-sci cs.LG 90%

Regression with Large Language Models for Materials and Molecular Property Prediction

利用大语言模型进行材料和分子性质预测的回归

Ryan Jacobs, Maciej P. Polak, Lane E. Schultz, Hamed Mahdavi, Vasant Honavar, Dane Morgan

机构 * Department of Materials Science and Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校材料科学与工程系) Department of Computer Science and Engineering, The Pennsylvania State University(宾夕法尼亚州立大学计算机科学与工程系) College of Information Sciences and Technology, The Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院) Artificial Intelligence Research Laboratory, The Pennsylvania State University(宾夕法尼亚州立大学人工智能研究实验室) Center for Artificial Intelligence Foundations and Scientific Applications, The Pennsylvania State University(宾夕法尼亚州立大学人工智能基础与科学应用中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文探讨了大语言模型在材料和分子性质回归任务中的能力,通过在QM9数据集和28种材料属性上评估LLaMA 3,发现其在生成损失微调下能提供与随机森林或全连接神经网络相当的回归结果,但误差率较高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07037 2026-04-22 cs.CL 90%

Beyond Monolingual Assumptions: A Survey of Code-Switched NLP in the Era of Large Language Models across Modalities

超越单一语言假设:在大语言模型时代跨语言自然语言处理的综述

Rajvee Sheth, Samridhi Raj Sinha, Mahavir Patil, Himanshu Beniwal, Mayank Singh

机构 * IIT Gandhinagar(印度理工学院加尔各答分校) NMIMS Mumbai(孟买NMIMS学院) SVNIT Surat(Surat SVNIT学院) LINGO Research Group(LINGO研究小组)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文综述了大语言模型时代跨语言自然语言处理的研究,分析了327项研究,涵盖五类研究领域、15+任务、30+数据集和80+语言,指出现有挑战及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17132 2026-04-21 cs.CL 90%

Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive Decoding

请拒绝回答我!通过自适应对比解码缓解大语言模型中的过度拒绝问题

Yupeng Qi, Ziyu Lyu, Lixin Cui, Lu Bai, Feng Xia

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学信息科学与技术学院深圳校区) School of Information, Central University of Finance and Economics(中央财经大学信息学院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出自适应对比解码方法,通过对比安全提示下的输出分布,缓解大语言模型的过度拒绝问题,同时保持对恶意查询的高拒绝率。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23889 2026-04-21 cs.CY cs.AI 90%

How Large Language Models Systematically Misrepresent American Climate Opinions

大型语言模型如何系统性地歪曲美国气候观点

Sola Kim, Jieshu Wang, Marco A. Janssen, John M. Anderies

机构 * School of Sustainability, Arizona State University(亚利桑那州立大学可持续发展学院) Department of Technology and Society, Stony Brook University(石溪大学技术与社会系) School of Human Evolution and Social Change, Arizona State University(亚利桑那州立大学人类进化与社会变革学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究了大型语言模型在分析美国气候观点时对交集身份的代表性问题,发现模型压缩了观点多样性,可能影响气候治理公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09671 2026-04-21 cs.CL 90%

Table Question Answering in the Era of Large Language Models: A Comprehensive Survey of Tasks, Methods, and Evaluation

在大语言模型时代表问题回答的综合调查:任务、方法和评估

Wei Zhou, Bolei Ma, Annemarie Friedrich, Mohsen Mesgar

机构 * Bosch Center for Artificial Intelligence, Renningen, Germany(博世人工智能研究中心,德国Renningen) LMU Munich & Munich Center for Machine Learning, Germany(慕尼黑大学 & 慕尼黑机器学习中心,德国) University of Augsburg, Germany(奥格斯堡大学,德国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文综述了表问题回答任务,探讨了基于大语言模型的方法,分析了现有基准和任务设置,并指出了未被系统覆盖的及时主题,为该领域提供了一个统一的基础。

Comments Accepted at ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15508 2026-04-20 cs.CY cs.AI 90%

LLMbench: A Comparative Close Reading Workbench for Large Language Models

LLMbench: 一种用于大型语言模型的比较性近距离阅读工作台

David M. Berry

机构 * University of Sussex(苏塞克斯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 LLMbench通过可视化工具分析大型语言模型输出的生成结构,提供概率分布、文本可能性等分析,用于批判性研究生成式AI模型。

Comments 22 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13846 2026-04-20 cs.CL 90%

Beyond Static Personas: Situational Personality Steering for Large Language Models

超越静态人设:面向大语言模型的情境性人格引导

Zesheng Wei, Mengxiang Li, Zilei Wang, Yang Deng

机构 * University of Science and Technology of China(中国科学技术大学) Singapore Management University(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出IRIS框架,通过分析人设神经元揭示情境依赖性,实现无训练的神经元引导方法,在PersonalityBench和SPBench上验证了其在复杂情境下的泛化与鲁棒性。

Comments Accepted to Findings of ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03699 2026-04-20 cs.CL 90%

RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models

RedBench:用于大型语言模型全面红队测试的通用数据集

Quy-Anh Dang, Chris Ngo, Truong-Son Hy

机构 * Knovel Engineering Lab(Knovel工程实验室) Knovel Engineering Singapore(Knovel工程新加坡) VNU University of Science(越南科学技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 RedBench通过整合37个基准数据集,提供标准化的风险分类和领域框架,用于系统评估大型语言模型的安全性,促进鲁棒性比较和未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15124 2026-04-17 cs.CL 90%

Blinded Multi-Rater Comparative Evaluation of a Large Language Model and Clinician-Authored Responses in CGM-Informed Diabetes Counseling

盲评大型语言模型与临床医生撰写的回应在连续葡萄糖监测指导下的糖尿病咨询

Zhijun Guo, Alvina Lai, Emmanouil Korakas, Aristeidis Vagenas, Irshad Ahamed, Christo Albor, Hengrui Zhang, Justin Healy, Kezhi Li

机构 * Institute of Health Informatics, University College London(健康信息学研究所,伦敦大学学院) University College London Hospitals NHS Foundation Trust(伦敦大学学院医院 NHS 基础信托) Dartford and Gravesham NHS Foundation Trust(达特福德和格拉夫萨姆 NHS 基础信托) Royal Free London NHS Foundation Trust(伦敦皇家自由 NHS 基础信托)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文通过盲评评估了基于检索的大型语言模型对话代理与临床医生撰写的回应在连续葡萄糖监测指导下的糖尿病咨询中的表现,发现对话代理在同理心和可操作性方面得分更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11227 2026-04-17 cs.CL cs.CY 90%

Language of Thought Shapes Output Diversity in Large Language Models

语言形态影响大语言模型的输出多样性

Shaoyang Xu, Wenxuan Zhang

机构 * iNLP Lab, Singapore University of Technology and Design(新加坡科技设计大学iNLP实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文研究了语言形态对大语言模型输出多样性的影响,通过多语言思考策略提升输出多样性,并在实际应用中展现文化知识的广泛覆盖。

Comments acl2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13804 2026-04-16 cs.LG 90%

Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning

角色超越言语:通过强化学习利用角色扮演评估音频大语言模型

Dongjie Fu, Fangming Feng, Xize Cheng, Linjun Li, Zhou Zhao, Tao Jin

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出RoleJudge框架,通过多模态评估系统评估语音与角色的一致性,引入RoleChat数据集并采用多阶段训练和标准对齐强化学习,验证了多维评估框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05452 2026-04-16 cs.CL 90%

LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models

LLMEval-Fair: 一个大规模纵向研究,探讨大型语言模型的稳健与公平评估

Ming Zhang, Yujiong Shen, Jingyi Deng, Yuhui Wang, Huayu Sha, Kexin Tan, Qiyuan Peng, Yue Zhang, Junzhe Wang, Shichun Liu, Yueyuan Huang, Jingqi Tong, Changhao Jiang, Yilong Wu, Zhihao Zhang, Mingqi Wu, Mingxu Chai, Zhiheng Xi, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan NLP Group(复旦大学自然语言处理组)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 LLMEval-Fair通过动态评估框架和抗污染数据整理,揭示了静态基准无法检测的模型性能上限和数据污染问题,提供了更可靠的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10971 2026-04-14 cs.CV cs.AI 90%

MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Models

MMR-AD:一个大规模多模态数据集,用于基于多模态大语言模型的通用异常检测基准测试

Xincheng Yao, Zefeng Qian, Chao Shi, Jiayang Song, Chongyang Zhang

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);post-training(abstract)

AI总结 本文提出MMR-AD数据集,用于评估多模态大语言模型在通用异常检测中的性能,揭示当前SOTA模型与工业需求的差距,并提出基于推理的Anomaly-R1模型,实现了异常检测与定位的显著提升。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03758 2026-04-07 cs.SE cs.AI 90%

AutoReSpec: A Framework for Generating Specification using Large Language Models

AutoReSpec:一种利用大语言模型生成规范的框架

Ragib Shahariar Ayon, Shibbir Ahmed

机构 * Texas State University(德克萨斯州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出AutoReSpec框架,通过动态选择LLM和提示配置,结合协作模型反馈,提升规范生成的准确性和效率,实验显示其在成功概率和完整性上优于现有方法。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22625 2026-03-25 cs.IR cs.CL 90%

Leveraging Large Language Models to Extract and Translate Medical Information in Doctors' Notes for Health Records and Diagnostic Billing Codes

利用大型语言模型提取和翻译医生笔记中的医疗信息用于健康记录和诊断收费代码

Peter Hartnett, Chung-Chi Huang, Sarah Hartnett, David Hartnett

机构 * Department of Computer Science & Information Technologies, Frostburg State University(弗罗斯堡州立大学计算机科学与信息科技系) Department of Emergency Medicine, FAU Charles E Schmidt College of Medicine(FAU查尔斯·E·施密特医学院急诊医学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文研究利用本地大语言模型提取医生笔记中的临床信息并翻译为ICD-10-CM诊断代码,探讨隐私保护下的医疗信息提取方法,发现需结合人类辅助以提高准确性。

Comments 45 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16643 2026-03-17 cs.CV cs.AI 90%

From Evaluation to Defense: Advancing Safety in Video Large Language Models

从评估到防御:推进视频大语言模型的安全性

Yiwei Sun, Peiqi Jiang, Chuanbin Liu, Luohao Lin, Zhiying Lu, Hongtao Xie

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

AI总结 本文提出VideoSafety-R1框架,通过创新方法提升视频大语言模型的安全性,实验显示其在多个安全数据集上取得显著提升。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00772 2026-02-13 cs.DB cs.LG stat.AP 90%

Reliable Curation of EHR Dataset via Large Language Models under Environmental Constraints

通过环境约束下的大型语言模型可靠地整理EHR数据集

Raymond M. Xiong, Panyu Chen, Tianze Dong, Jian Lu, Louis Hu, Nathan Yu, Benjamin Goldstein, Danyang Zhuo, Anru R. Zhang

机构 * Duke University(杜克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 CELEC通过环境约束下的大型语言模型可靠地整理EHR数据集,提升数据提取和分析的准确性和隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22636 2026-02-10 cs.AI 90%

Statistical Estimation of Adversarial Risk in Large Language Models under Best-of-N Sampling

在最佳-N采样下对大语言模型中的对抗风险进行统计估计

Mingqian Feng, Xiaodong Liu, Weiwei Yang, Chenliang Xu, Christopher White, Jianfeng Gao

机构 * University of Rochester(罗切斯特大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本研究提出SABER方法,通过Beta分布建模样本成功概率,利用解析缩放定律预测大规模对抗风险,显著降低估计误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19236 2026-01-30 cs.CL 90%

Evaluating Text Creativity across Diverse Domains: A Dataset and Large Language Model Evaluator

在不同领域评估文本创造力:一个数据集和大语言模型评估器

Qian Cao, Xiting Wang, Yuzhuo Yuan, Yahui Liu, Fang Luo, Ruihua Song

机构 * Renmin University of China(中国人民大学) Beijing Normal University(北京师范大学) Kuaishou Technology(快手科技)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出了一种基于CreataSet数据集的CrEval评估器,通过结合人类和合成数据提升大语言模型的创造力评估效果。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16444 2026-01-27 cs.CL 90%

Exploring the Effects of Alignment on Numerical Bias in Large Language Models

探索对大型语言模型中数值偏差的影响

Ayako Sato, Hwichan Kim, Zhousi Chen, Masato Mita, Mamoru Komachi

机构 * Tokyo Metropolitan University(东京 Metropolitan 大学) Hitotsubashi University(立命馆大学) CyberAgent Inc.(CyberAgent 公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

AI总结 本文研究了对齐对大型语言模型数值偏差的影响,发现对齐会增加偏差,并提出分数范围调整作为缓解策略。

Comments Accepted at AIBSD 2026 (Workshop at AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17344 2026-01-27 cs.CL 90%

The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents

阴影自我:大型语言模型代理中的内在价值偏差

Chen Chen, Kim Young Il, Yuan Yang, Wenhao Su, Yilin Zhang, Xueluan Gong, Qian Wang, Yongsen Zheng, Ziyao Liu, Kwok-Yan Lam

机构 * Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 研究提出IMPRESS框架,系统评估大型语言模型代理中的内在价值偏差风险,发现其在不同模型中普遍存在,且受上下文化和框架机制显著影响。

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16549 2026-01-26 cs.AI 90%

LLM is Not All You Need: A Systematic Evaluation of ML vs. Foundation Models for text and image based Medical Classification

LLM并非万能:对ML与基础模型在文本和图像医学分类中的系统评估

Meet Raval, Tejul Pandit, Dhvani Upadhyay

机构 * University of Southern California Los Angeles, USA(美国南加州大学) Dhirubhani Ambani University Gandhinagar, India(印度达尔布哈尼·阿班尼大学)

专题命中 评测与基准 :LLM(title,abstract);foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文系统评估了ML与基础模型在医学分类中的表现,发现传统ML模型在多数任务中表现优异,而PEFT方法的效果依赖于适应策略。

Comments 9 pages, 5 figures, 3 tables, paper accepted in AAIML'26 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11003 2026-01-26 cs.SE cs.AI 90%

EmbedAgent: Benchmarking Large Language Models in Embedded System Development

EmbedAgent: 在嵌入式系统开发中评估大型语言模型

Ruiyang Xu, Jialun Cao, Mingyuan Wu, Wenliang Zhong, Yaojie Lu, Ben He, Xianpei Han, Shing-Chi Cheung, Le Sun

机构 * University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Peng Cheng Laboratory(鹏城实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 本文提出EmbedAgent和Embedbench,用于评估LLMs在嵌入式系统开发中的能力,发现通用LLMs在特定任务中表现不佳,提出检索增强生成和编译器反馈策略以提升性能。

Comments 12 pages, accepted by International Conference on Software Engineering (ICSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05582 2026-01-12 cs.CL 90%

Can large language models interpret unstructured chat data on dynamic group decision-making processes? Evidence on joint destination choice

大型语言模型能否在动态群体决策过程中解释非结构化聊天数据?关于共同目的地选择的证据

Sung-Yoo Lim, Koki Sato, Kiyoshi Takami, Giancarlos Parady, Eui-Jin Kim

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本研究探讨了大型语言模型在解释动态群体决策过程中非结构化聊天数据的能力,通过日本共同用餐活动的数据,评估了LLM在自动标注和捕捉显性与隐性决策因素方面的潜力与局限。

Comments 23 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05339 2026-01-12 cs.CR cs.AI 90%

Multi-turn Jailbreaking Attack in Multi-Modal Large Language Models

多轮劫持攻击在多模态大语言模型中的应用

Badhan Chandra Das, Md Tasnim Jawad, Joaquin Molto, M. Hadi Amini, Yanzhao Wu

机构 * Knight Foundation School of Computing and Information Science, Florida International University(骑士基金会计算与信息科学学院,佛罗里达国际大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出多轮劫持攻击及FragGuard防御机制,评估其在多模态大语言模型中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02716 2025-12-17 cs.AI 90%

Menta: A Small Language Model for On-Device Mental Health Prediction

Menta:一种用于设备端心理健康预测的小型语言模型

Tianyi Zhang, Xiangyuan Xue, Lingyan Ruan, Shiya Fu, Feng Xia, Simon D'Alfonso, Vassilis Kostakos, Ting Dang, Hong Jia

机构 * The University of Melbourne(墨尔本大学) The University of Auckland(奥克兰大学) RMIT University(皇家墨尔本理工学院)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

AI总结 Menta是一种优化的小型语言模型,用于设备端社交媒体数据中的多任务心理健康预测,通过联合训练和平衡损失函数在多个任务上提升了性能,同时保持较小的模型大小和低资源需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06272 2025-12-09 cs.CL cs.CE 90%

Golden Touchstone: A Comprehensive Bilingual Benchmark for Evaluating Financial Large Language Models

黄金触点:一种全面的双语基准,用于评估金融大语言模型

Xiaojun Wu, Junxi Liu, Huanyi Su, Zhouchi Lin, Yiyan Qi, Chengjin Xu, Jiajun Su, Jiajie Zhong, Fuwei Wang, Saizhuo Wang, Fengrui Hua, Jia Li, Jian Guo

机构 * IDEA Research(IDEA研究机构) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Nanjing University(南京大学) South China Normal University(华南师范大学) DataArcTech Ltd.(DataArcTech有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

AI总结 本研究提出Golden Touchstone双语基准,用于全面评估金融大语言模型的性能,通过对比分析揭示模型在处理复杂金融信息时的优势与局限。

Comments Published in Findings of EMNLP 2025

Journal ref In Findings of the Association for Computational Linguistics: EMNLP 2025, pages 22544-22560, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05339 2025-12-08 cs.LG 90%

Taxonomy-Adaptive Moderation Model with Robust Guardrails for Large Language Models

具有鲁棒防护栏的分类适应调谐模型用于大型语言模型

Mahesh Kumar Nandwana, Youngwan Lim, Joseph Liu, Alex Yang, Varun Notibala, Nishchaie Khanna

机构 * Project Lead(项目负责人)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 Roblox Guard 1.0通过指令微调提升大型语言模型的安全性,采用输入输出调谐和可扩展的安全分类评估框架。

Comments To be presented at AAAI-26 PerFM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏