arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-08 至 2026-04-08 共收录 285 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 38 篇

2604.05168 2026-04-08 cs.AI 77%

Instruction-Tuned LLMs for Parsing and Mining Unstructured Logs on Leadership HPC Systems

指令调优的LLM用于领导型HPC系统上解析和挖掘无结构日志

Ahmad Maroof Karimi, Jong Youl Choi, Charles Qing Cao, Awais Khan

机构 * Oak Ridge National Laboratory(橡树岭国家实验室) University of Tennessee(田纳西大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于指令调优的LLM框架,利用链式推理解析HPC日志,结合领域特定日志模板和示例对LLaMA模型进行微调,实现高精度的日志解析与挖掘,验证了其在大规模日志数据上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05266 2026-04-08 cs.MM 75%

LLM2Manim: Pedagogy-Aware AI Generation of STEM Animations

LLM2Manim: 基于教学的AI生成STEM动画

Aastha Joshi, Hongyi Ke, Meet Gajjar, Aaron Christian, Qi Wang, Jun Chen

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种半自动化的人工介入流程,利用大语言模型生成符合多媒体学习原理的STEM动画,实验显示动画教学在学习效果、参与度和认知负荷方面优于传统PPT。

Comments 12 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05355 2026-04-08 cs.AI cs.CL 73%

ETR: Entropy Trend Reward for Efficient Chain-of-Thought Reasoning

ETR:熵趋势奖励用于高效推理链推理

Xuan Xiong, Huan Liu, Li Gu, Zhixiang Chi, Yue Qiu, Yuanhao Yu, Yang Wang

机构 * University of Toronto(多伦多大学) McMaster University(麦克马斯特大学) Concordia University(康考迪亚大学) University of Ottawa(渥太华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ETR,通过轨迹感知的目标促进逐步不确定性降低,提升推理效率与准确性,实验表明在多个基准上显著提升性能。

Comments ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10815 2026-04-08 cs.AI cs.CL cs.IR cs.SC 73%

DRIFT: Decompose, Retrieve, Illustrate, then Formalize Theorems

DRIFT: 分解、检索、示例,然后形式化定理

Meiru Zhang, Philipp Borchert, Milan Gritta, Gerasimos Lampouras

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DRIFT框架通过分解数学陈述并检索相关定理,提升大语言模型在形式化证明中的前提检索能力,显著提高F1分数和跨分布性能。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06079 2026-04-08 cs.CV cs.AI 70%

Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning

通过双自一致性强化学习实现科学图形程序合成

Juekai Lin, Yun Zhu, Honglin Lin, Sijing Li, Tianwei Lin, Zheng Liu, Xiaoyang Wang, Wenqiao Zhang, Lijun Wu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出双自一致性强化学习框架,结合高质量数据集和多维基准,提升科学图形到可编辑TikZ代码的转换能力,实现视觉与结构的高精度优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05757 2026-04-08 cs.CL 70%

Identifying Influential N-grams in Confidence Calibration via Regression Analysis

通过回归分析识别影响置信度校准的关键n-gram

Shintaro Ozaki, Wataru Hashimoto, Hidetaka Kamigaito, Katsuhiko Hayashi, Taro Watanabe

机构 * Nara Institute of Science and Technology (NAIST)(奈良先端科学技术大学院大学) The University of Tokyo(东京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过回归分析识别与置信度相关的语言表达,发现LLM在推理时仍保持高置信度,并通过抑制这些表达可实现置信度校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04570 2026-04-08 cs.CV cs.CL 70%

Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm

通过视频思考:视频生成作为一种有前途的多模态推理范式

Jingqi Tong, Yurong Mou, Hangcheng Li, Mingzhe Li, Yongzhuo Yang, Ming Zhang, Qiguang Chen, Tianyi Liang, Xiaomeng Hu, Yining Zheng, Xinchi Chen, Jun Zhao, Xuanjing Huang, Xipeng Qiu

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究所) Shanghai Innovation Institute(上海创新研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) The Chinese University of Hong Kong(香港中文大学) Central South University(中南大学) Fudan University(复旦大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出'通过视频思考'范式,利用视频生成模型实现多模态推理,通过VideoThinkBench评估显示Sora-2在视觉和文本任务中均表现出色,证明视频生成模型在统一多模态理解与生成中的潜力。

Comments 34 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05900 2026-04-08 cs.CV 67%

AICA-Bench: Holistically Examining the Capabilities of VLMs in Affective Image Content Analysis

AICA-Bench:全面评估VLMs在情感图像内容分析中的能力

Dong She, Xianrong Yao, Liqun Chen, Jinghe Yu, Yang Gao, Zhanpeng Jin

专题命中 推理与问题求解 :language model(abstract);prompting(abstract)

AI总结 本文提出AICA-Bench基准,通过情感理解、推理和生成三个任务评估VLMs在情感图像分析中的能力,发现其在强度校准和描述深度方面存在不足,并提出GAT提示方法提升性能。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21210 2026-04-08 cs.CV 67%

Toward Generalizable Forgery Detection and Reasoning

朝通用伪造检测与推理方向发展

Yueying Gao, Dongliang Chang, Bingyao Yu, Haotian Qin, Muxi Diao, Lei Chen, Kongming Liang, Zhanyu Ma

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出FDR-Task任务,利用多模态大语言模型实现伪造检测与推理,通过MMFR数据集和FakeReasoning框架提升检测与推理性能。

Comments Accepted to IEEE TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01025 2026-04-08 cs.AI cs.CL 62%

Hypothesis-Driven Feature Manifold Analysis in LLMs via Supervised Multi-Dimensional Scaling

基于监督多维缩放的LLMs特征流形分析假设

Federico Tiblias, Irina Bigoulaeva, Jingcheng Niu, Simone Balloccu, Iryna Gurevych

机构 * Technical University of Darmstadt(达姆施塔特工业大学) Ubiquitous Knowledge Processing Lab (UKP Lab)(泛在知识处理实验室 (UKP Lab)) National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE) Zuse School ELIZA, Technical University of Darmstadt(Zuse School ELIZA, 达姆施塔特工业大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SMDS方法,通过分析特征流形几何结构揭示语言模型的语义表示机制,发现不同特征呈现不同的几何形态并支持动态推理。

Comments Published in TMLR (March 2026) | OpenReview: https://openreview.net/forum?id=vCKZ40YYPr | Code: https://github.com/UKPLab/tmlr2026-manifold-analysis

Journal ref Transactions on Machine Learning Research (TMLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05217 2026-04-08 cs.LG cs.CL 62%

On the Geometry of Positional Encodings in Transformers

关于变换器中位置编码几何的探讨

Giansalvo Cirrincione

机构 * Laboratoire LTI, Université de Picardie Jules Verne(皮卡第儒勒·凡尔纳大学LTI实验室)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了变换器中位置编码的几何特性,通过理论推导证明了位置编码在解决顺序敏感任务中的必要性,并提出基于Hellinger距离的MDS方法优化编码质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05075 2026-04-08 cs.AI cs.CL 62%

MMORF: A Multi-agent Framework for Designing Multi-objective Retrosynthesis Planning Systems

MMORF:一种用于设计多目标逆合成规划系统的多智能体框架

Frazier N. Baker, Trieu Nguyen, Reza Averly, Botao Yu, Daniel Adu-Ampratwum, Huan Sun, Xia Ning

机构 * Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系) Department of Mathematics and Statistics, University of South Florida(南佛罗里达大学数学与统计系) Division of Medicinal Chemistry and Pharmacognosy, The Ohio State University(俄亥俄州立大学药物化学与生药学系) Department of Biomedical Informatics, The Ohio State University(俄亥俄州立大学生物医学信息学系) Translational Data Analytics Institute, The Ohio State University(俄亥俄州立大学转化数据分析研究所)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MMORF框架,通过多智能体系统解决多目标逆合成规划问题,展示了MASIL和RFAS在安全、成本和约束任务中的优越性能。

Comments 36 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01346 2026-04-08 cs.CR cs.AI cs.LG cs.RO 62%

Safety, Security, and Cognitive Risks in World Models

世界模型中的安全性、安全性和认知风险

Manoj Parmar

机构 * SovereignAI Security Labs(SovereignAI安全实验室)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了世界模型在自主决策中的安全、安全及认知风险,提出了轨迹持久性和表征风险的定义,并通过实验验证了对抗攻击的效果,强调了对世界模型的严谨性要求。

Comments version 2, 29 pages, 1 figure (6 panels), 3 tables. Empirical proof-of-concept on GRU/RSSM/DreamerV3 architectures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05273 2026-04-08 cs.CL 57%

Beneath the Surface: Investigating LLMs' Capabilities for Communicating with Subtext

表层之下:研究LLMs在使用隐喻沟通中的能力

Kabir Ahuja, Yuxuan Li, Andrew Kyle Lampinen

机构 * Google DeepMind(谷歌DeepMind) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 本文研究语言模型是否能利用隐喻进行沟通,并引入四个新评估套件。发现前沿模型倾向于过于直白的沟通,但在某些情况下能通过共同基础减少直白线索,但难以推断隐含的共同基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05080 2026-04-08 cs.SE cs.AI cs.LO cs.MA 57%

Nidus: Externalized Reasoning for AI-Assisted Engineering

Nidus:面向AI辅助工程的外部化推理

Danil Gorinevski

机构 * cybiont GmbH(cybiont有限公司)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 Nidus通过外部化推理机制,实现了AI辅助软件交付中的V模型机械化,通过约束表面确保工程不变量的可靠性,提出递归自治理、协同机制、规范强化和治理剧场预防四项贡献。

Comments 19 pages, 3 figures, 5 tables. Evaluated on self-hosting deployment. Patent pending (CH000371/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17652 2026-04-08 q-bio.QM cs.CV 50%

TeamPath: Building MultiModal Pathology Experts with Reasoning AI Copilots

TeamPath: 构建多模态病理专家的推理AI助手

Tianyu Liu, Weihao Xuan, Hao Wu, Peter Humphrey, Marcello DiStasio, Mohamed Kahila, Alfonso Garcia Tan, Heli Qi, Rui Yang, Simeng Han, Tinglin Huang, Fang Wu, Chen Liu, Qingyu Chen, Nan Liu, Irene Li, Hua Xu, Hongyu Zhao

机构 * Interdepartmental Program in Computational Biology and Biomedical Informatics, Yale University(耶鲁大学计算生物学与生物医学信息学跨学科项目) Department of Biostatistics, Yale University(耶鲁大学生物统计学系) Broad Institute of MIT and Harvard(博德研究所) Department of Complexity Science and Engineering, The University of Tokyo(东京大学复杂科学与工程系) Center for Advanced Intelligence Project, RIKEN(理化学研究所先进智能项目中心) Department of Pathology, Yale University(耶鲁大学病理学系) Department of Anatomical Pathology, Singapore General Hospital(新加坡中央医院解剖病理学系) Center for Biomedical Data Science, Duke–NUS Medical School, Singapore, Singapore(杜克-新加坡国立大学医学院生物医学数据科学中心) Department of Computer Science, Yale University(耶鲁大学计算机科学系) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 推理与问题求解 :language model(abstract)

AI总结 TeamPath通过强化学习和路由增强方案,整合多模态数据提升病理诊断与跨模态生成能力,为临床提供可靠的信息交流系统。

Comments 45 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 69 篇

2604.05995 2026-04-08 cs.CL cs.AI cs.LG 91%

The Model Agreed, But Didn't Learn: Diagnosing Surface Compliance in Large Language Models

模型已达成一致,但未学习:诊断大语言模型中的表面合规性

Xiaojie Gu, Ziying Huang, Weicong Hong, Jian Xie, Renze Lou, Kai Zhang

机构 * Independent Researcher(独立研究员) Cornell Tech(康奈尔科技校区) The Ohio State University(俄亥俄州立大学) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 研究通过引入诊断框架,揭示大语言模型在记忆修改中存在表面合规现象,指出编辑方法可能仅模仿输出而非改变内部信念,导致认知不稳定和记忆不可逆。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05755 2026-04-08 cs.SE cs.AI 89%

CAKE: Cloud Architecture Knowledge Evaluation of Large Language Models

CAKE:大型语言模型云架构知识评估

Tim Lukas Adam, Phongsakon Mark Konrad, Riccardo Terrenzi, Florian Girardo Lukas, Rahime Yilmaz, Krzysztof Sierszecki, Serkan Ayvaz

机构 * Centre for Industrial Software(工业软件中心) University of Southern Denmark(南丹麦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出CAKE基准测试,评估大型语言模型对云原生软件架构的理解,涵盖四个认知层次和五个主题,通过多选和自由回答形式评估22种模型配置,发现多选准确率随参数增加而稳定,自由回答持续区分模型,推理增强提升表现,工具增强则降低小型模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04168 2026-04-08 cs.CL cs.IR 89%

A Semi-Automated Annotation Workflow for Paediatric Histopathology Reports Using Small Language Models

一种用于儿童病理科报告的半自动化标注工作流程使用小型语言模型

Avish Vijayaraghavan, Jaskaran Singh Kawatra, Sebin Sabu, Jonny Sheldon, Will Poulett, Alex Eze, Daniel Key, John Booth, Shiren Patel, Jonny Pearson, Dan Schofield, Jonathan Hope, Pavithra Rajendran, Neil Sebire

机构 * Imperial College London(帝国理工学院) NHS England(英国国家医疗服务体系) Great Ormond Street Hospital(大奥蒙德街儿童医院) University College London(伦敦大学学院)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出一种基于小型语言模型的半自动化标注流程,用于从非结构化电子病历数据中提取结构化信息,尤其针对儿童病理科报告,通过临床监督和少量示例提升提取准确性。

Comments 36 pages, includes supplementary information

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06048 2026-04-08 cond-mat.mtrl-sci 89%

Large Language Model Assisted Discovery of Optimal Dopants for Enhanced Thermoelectric Performance in CoSb$_3$ Based Skutterudites

基于大语言模型的优化掺杂剂发现以提高CoSb$_3$基硫化物的热电性能

Yagnik Bandyopadhyay, Dylan Noel Serrao, Houlong L. Zhuang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出一种数据驱动方法,利用大语言模型加速发现高性能CoSb$_3$基硫化物,通过训练回归头预测热电优值,降低均方误差,并通过密度泛函理论和分子动力学计算验证预测的掺杂剂性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11548 2026-04-08 cs.CR 89%

Copyright Protection for Large Language Models: A Survey of Methods, Challenges, and Trends

大型语言模型的版权保护:方法、挑战与趋势的综述

Zhenhua Xu, Xubin Yue, Zhebo Wang, Haobo Zhang, Qichen Liu, Xixiang Zhao, Jingxuan Zhang, Wenjun Zeng, Wengpeng Xing, Dezhang Kong, Changting Lin, Meng Han

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文综述了大型语言模型版权保护现状,重点探讨了模型指纹技术,涵盖文本水印与模型水印的关联、多种文本水印技术对比、模型指纹分类、指纹转移与去除技术及评估指标,揭示了开放挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10287 2026-04-08 cs.LG cs.CL 88%

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models

OutSafe-Bench:一种用于大型语言模型多模态攻击内容检测的基准测试

Yuping Yan, Yuhan Xie, Yuanshuai Li, Yingchao Yu, Lingjuan Lyu, Yaochu Jin

机构 * School of Engineering, Westlake University(西湖大学工学院) Sony AI(索尼人工智能)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出OutSafe-Bench,首个多模态时代内容安全评估测试套件,包含四类模态大规模数据集及多维交叉风险评分指标,评估九种内容风险类别,揭示九种先进MLLM的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00946 2026-04-08 eess.IV cs.CV 88%

Ultrasound-based detection and malignancy prediction of breast lesions eligible for biopsy: A multi-center clinical-scenario study using nomograms, large language models, and radiologist evaluation

基于超声的乳腺病变 biopsy 推荐和恶性预测:一种结合 BIRADS 特征和定量形态学特征的多中心临床场景研究,使用 nomograms、大型语言模型和放射科医生评估

Ali Abbasian Ardakani, Afshin Mohammadi, Taha Yusuf Kuzan, Beyza Nur Kuzan, Hamid Khorshidi, Ashkan Ghorbani, Alisa Mohebbi, Fariborz Faeghi, Sepideh Hatamikia, U Rajendra Acharya

机构 * Shahid Beheshti University of Medical Sciences(沙希德·贝赫什提医科大学) Urmia University of Medical Science(乌尔米耶医科大学) University of Health Sciences(健康科学大学) Kartal Dr. Lütfi Kırdar City Hospital(卡尔塔尔·吕特菲·克尔达尔市医院) University of Padova(帕多瓦大学) Universal Scientific Education and Research Network (USERN)(全球科学教育与研究网络(USERN)) Tehran University of Medical Sciences(德黑兰医科大学) Danube Private University(多瑙河私立大学) Austrian Center for Medical Innovation and Technology (ACMIT)(奥地利医学创新与技术中心(ACMIT)) University of Southern Queensland(南昆士兰大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文研究了结合 BIRADS 特征和定量形态学特征的 nomogram 在乳腺病变 biopsy 推荐和恶性预测中的性能,对比了放射科医生和大型语言模型的诊断效果,展示了 nomogram 的优越性。

Comments Academic Radiology (2026)

Journal ref "Ultrasound-based detection and malignancy prediction of breast lesions eligible for biopsy: A multi-center clinical-scenario study using nomograms, large language models, and radiologist evaluation." Academic Radiology (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05774 2026-04-08 q-bio.GN cs.CL 88%

GenomeQA: Benchmarking General Large Language Models for Genome Sequence Understanding

GenomeQA:用于基因组序列理解的通用大型语言模型基准测试

Weicai Long, Yusen Hou, Junning Feng, Houcheng Su, Shuo Yang, Donglin Xie, Yanlin Zhang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Hong Kong(香港大学) Peking University(北京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 GenomeQA旨在评估通用大型语言模型在基因组序列推理任务中的表现,包含5200个样本,涵盖六个任务家族,揭示模型在直接接触原始基因组序列时的表现。

Comments 18 pages, 9 figures, coference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05224 2026-04-08 cs.AI 88%

Attribution Bias in Large Language Models

大语言模型中的归因偏差

Eliza Berman, Bella Chang, Daniel B. Neill, Emily Black

机构 * New York University(纽约大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出AttriBench基准数据集,用于研究大语言模型在引用归因中的种族、性别和交集群体偏差问题,并发现即使前沿模型在引用归因任务上也存在显著挑战。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06071 2026-04-08 cs.CL cs.AI cs.HC 88%

Stories of Your Life as Others: A Round-Trip Evaluation of LLM-Generated Life Stories Conditioned on Rich Psychometric Profiles

你生命中的故事:基于丰富心理测量资料的LLM生成生命故事的往返评估

Ben Wigler, Maria Tsfasman, Tiffany Matej Hrkalovic

机构 * LoveMind AI Jheronimus Academy of Data Science(耶罗尼米斯数据科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文通过LLM生成生命故事并回收心理测量数据,验证了LLM在编码和解码个体差异方面的鲁棒性,展示了心理特征与语言表达之间的关系。

Comments Under review at COLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05575 2026-04-08 cs.SE 88%

Bias Ahead: Sensitive Prompts as Early Warnings for Fairness in Large Language Models

提前预警:敏感提示作为大语言模型公平性的早期预警

Gianmario Voria, Martina De Lucia, Alessandra Raia, Andrea De Lucia, Gemma Catolino, Fabio Palomba

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出敏感提示作为公平性评估的新方法,通过构建SensY数据集评估LLM对敏感提示的响应,发现模型虽能提供事实正确答案,但常忽视伦理和情境影响,开发自动分类器预测提示敏感性,强调提前预警公平风险的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05083 2026-04-08 cs.CL cs.AI cs.LG 87%

Beyond LLM-as-a-Judge: Deterministic Metrics for Multilingual Generative Text Evaluation

超越LLM作为裁判:多语言生成文本评估的确定性度量

Firoj Alam, Gagan Bhatia, Sahinur Rahman Laskar, Shammur Absar Chowdhury

机构 * Qatar Computing Research Institute, HBKU, Qatar(卡塔尔哈马德·本·哈利法大学卡塔尔计算研究所) UPES, India(印度UPES大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出OmniScore,一种基于小参数模型的确定性度量,用于多语言生成文本评估,提供低延迟和一致性的评分方法,通过大规模合成监督训练,验证了其在问答、翻译和总结任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04997 2026-04-08 cs.IR cs.AI cs.CL cs.CV cs.LG 87%

Evaluation of Embedding-Based and Generative Methods for LLM-Driven Document Classification: Opportunities and Challenges

嵌入式与生成方法在LLM驱动文档分类中的评估:机遇与挑战

Rong Lu, Hao Liu, Song Hou

专题命中 评测与基准 :LLM(title);language model(abstract);SFT(abstract);prompting(abstract)

AI总结 本文比较了基于嵌入和生成模型在地学技术文档分类中的表现,发现增强的生成视觉-语言模型在零样本准确率上表现更优,但监督微调对训练数据不平衡敏感。

Comments Accepted at the IMAGE'25 Workshop (PCW-11), Society of Exploration Geophysicists (SEG). Published version available at https://doi.org/10.1190/image2025-w11-03.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05872 2026-04-08 cs.CR cs.AI cs.CL 86%

Swiss-Bench 003: Evaluating LLM Reliability and Adversarial Security for Swiss Regulatory Contexts

瑞士基准003:评估大语言模型在瑞士监管环境中的可靠性与对抗安全性

Fatih Uenal

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出瑞士基准003,扩展HAAS评估框架至八个维度,评估十种前沿模型在瑞士特定任务中的可靠性与对抗安全性,揭示模型在数据保护和安全方面的表现差异。

Comments 23 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏