arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-23 至 2026-02-23 共收录 27 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 27 篇

2602.17791 2026-02-23 cs.CY 89%

The Digital Divide in Generative AI: Evidence from Large Language Model Use in College Admissions Essays

生成式AI的数字鸿沟:来自大学录取文书使用大型语言模型的证据

Jinsook Lee, Conrad Borchers, AJ Alvero, Thorsten Joachims, Rene F. Kizilcec

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究探讨了生成式AI在大学录取文书中的使用差异及其对录取结果的影响,发现低社会经济地位学生更依赖AI写作工具,但其录取成功率下降更明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17672 2026-02-23 cs.HC cs.AI cs.CL cs.CR cs.CY 86%

Assessing LLM Response Quality in the Context of Technology-Facilitated Abuse

评估在技术辅助虐待情境下的LLM响应质量

Vijay Prakash, Majed Almansoori, Donghan Hu, Rahul Chatterjee, Danny Yuxing Huang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了四种LLM在技术辅助虐待情境下的响应质量,揭示其在支持幸存者方面的有效性和局限性,并提出改进建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25860 2026-02-23 cs.AI cs.CL cs.HC 86%

Through the Judge's Eyes: Inferred Thinking Traces Improve Reliability of LLM Raters

通过裁判之眼:推断的思考轨迹提升LLM评分器的可靠性

Xingjian Zhang, Tianhong Gao, Suliang Jin, Tianhao Wang, Teng Ye, Eytan Adar, Qiaozhu Mei

机构 * University of Michigan(密歇根大学) University of California, San Diego(加州大学圣地亚哥分校) University of Minnesota(明尼苏达大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过人与LLM协作框架推断思考轨迹,提升LLM评分器的可靠性及人类与LLM之间的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03283 2026-02-23 cs.SE 86%

Exploring Generalizable Automated Program Repair with Large Language Models

探索大型语言模型在通用自动程序修复中的应用

Viola Campos, Ridwan Shariffdeen, Adrian Ulges, Yannic Noller

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

AI总结 本文探讨了大型语言模型在自动程序修复中的应用,发现不同模型在不同语言上表现各异,需结合多个模型以提高修复效果,并指出故障定位的不完美会显著影响修复准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18372 2026-02-23 cs.HC cs.AI 85%

"How Do I ...?": Procedural Questions Predominate Student-LLM Chatbot Conversations

如何做到?

Alexandra Neagu, Marcus Messer, Peter Johnson, Rhodri Nelson

机构 * Imperial College London, London, United Kingdom(伦敦帝国学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了学生与LLM聊天机器人对话中程序性问题的主导地位,发现其在总结性评估中更为突出,但现有分类方案存在局限性。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17696 2026-02-23 cs.LG cs.AI 84%

Can LLM Safety Be Ensured by Constraining Parameter Regions?

通过约束参数区域能否确保大语言模型的安全性?

Zongmin Li, Jian Su, Farah Benamara, Aixin Sun

机构 * Nanyang Technological University(南洋理工大学) Institute for Infocomm Research (I 2 R)(信息通信研究所) IRIT, Université de Toulouse, CNRS, Toulouse INP(图卢兹大学IRIT研究所、法国国家科学研究中心) IPAL, CNRS-NUS-A*STAR(IPAL、法国国家科学研究中心-南洋理工大学-A*STAR)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文评估了四种安全区域识别方法,发现其在不同粒度和数据集下重叠程度低,表明现有方法难以可靠地识别稳定的安全区域。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18031 2026-02-23 cs.CV cs.AI cs.LG 84%

ViGText: Deepfake Image Detection with Vision-Language Model Explanations and Graph Neural Networks

ViGText: 基于视觉-语言模型解释和图神经网络的深度伪造图像检测

Ahmad ALBarqawi, Mahmoud Nazzal, Issa Khalil, Abdallah Khreishah, NhatHai Phan

机构 * New Jersey Institute of Technology(新泽西理工学院) Old Dominion University(旧 Dominion 大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 ViGText结合视觉-语言模型解释和图神经网络,提升深度伪造检测的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17770 2026-02-23 cs.CV cs.LG 83%

CLUTCH: Contextualized Language model for Unlocking Text-Conditioned Hand motion modelling in the wild

CLUTCH:解锁野外文本条件手部运动建模的上下文化语言模型

Balamurugan Thambiraja, Omid Taheri, Radek Danecek, Giorgio Becherini, Gerard Pons-Moll, Justus Thies

机构 * Technical University of Darmstadt(德累斯顿技术大学) Max-Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Tuebingen(图宾根大学) Tubingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 CLUTCH通过引入3D-HIW数据集和SHIFT架构,提出基于LLM的手部动画系统,提升野外手部运动建模的保真度与泛化能力。

Comments ICLR2026; Project page: https://balamuruganthambiraja.github.io/CLUTCH/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17814 2026-02-23 cs.CV cs.IR cs.LG 81%

VQPP: Video Query Performance Prediction Benchmark

VQPP:视频查询性能预测基准

Adrian Catalin Lutu, Eduard Poesina, Radu Tudor Ionescu

机构 * University of Bucharest / Bitdefender(布加勒斯大学/Bitdefender) University of Bucharest(布加勒斯大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出VQPP基准,用于视频查询性能预测,包含两个数据集和两个系统,探索预检索和后检索预测器,并展示其在训练大型语言模型上的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17867 2026-02-23 cs.LG cs.CL 81%

ADAPT: Hybrid Prompt Optimization for LLM Feature Visualization

ADAPT:LLM特征可视化中的混合提示优化

João N. Cardoso, Arlindo L. Oliveira, Bruno Martins

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 ADAPT通过结合束搜索与自适应梯度突变,改进LLM特征可视化方法,实现更高效的特征激活优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18012 2026-02-23 cs.SE 80%

DeCEAT: Decoding Carbon Emissions for AI-driven Software Testing

DeCEAT:为AI驱动的软件测试解码碳排放

Pragati Kumari, Novarun Deb

专题命中 评测与基准 :large language model(abstract);language model(abstract);small language model(abstract);SLM(abstract)

AI总结 DeCEAT框架通过评估SLMs在测试生成中的环境与性能权衡,揭示了提示设计对可持续性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09282 2026-02-23 cs.AI cs.DC cs.LG cs.SE 79%

Cluster Workload Allocation: Semantic Soft Affinity Using Natural Language Processing

集群工作负载分配:利用自然语言处理的语义软亲和力

Leszek Sliwko, Jolanta Mizeria-Pietraszko

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用自然语言处理实现语义软亲和力的集群工作负载分配方法,通过LLM提升调度准确性,验证了其在复杂场景中的有效性。

Comments This is the accepted version of the paper published in IEEE Access (2026). The final version is available at: https://doi.org/10.1109/ACCESS.2026.3665989

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17081 2026-02-23 cs.CL 77%

MUCH: A Multilingual Claim Hallucination Benchmark

MUCH:一个多语言声称幻觉基准

Jérémie Dentan, Alexi Canesse, Davide Buscaldi, Aymen Shabou, Sonia Vanier

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MUCH是一个多语言声明幻觉基准,通过提供24个生成logits和高效分割算法,评估声明级不确定性量化方法在现实条件下的性能和效率。

Comments To appear in Proceedings of LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18152 2026-02-23 cs.CL cs.CY physics.soc-ph 77%

The Statistical Signature of LLMs

大语言模型的统计特征

Ortal Hadad, Edoardo Loru, Jacopo Nudo, Niccolò Di Marco, Matteo Cinelli, Walter Quattrociocchi

机构 * Department of Computer Science, Sapienza University of Rome(计算机科学系,罗马萨皮恩扎大学) Department of Computer, Control and Management Engineering, Sapienza University of Rome(计算机、控制与管理工程系,罗马萨皮恩扎大学) Department of Legal, Social, and Educational Sciences, Tuscia University(法律、社会与教育科学系,图斯西亚大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过无损压缩分析揭示大语言模型生成文本的统计特征,发现其在受控和中介情境中比人类文本更具规律性和可压缩性,但小尺度下这种差异会减弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02740 2026-02-23 cs.HC cs.CY 75%

Framing Responsible Design of AI for Mental Well-Being: AI as Primary Care, Nutritional Supplement, or Yoga Instructor?

为心理健康福祉负责任地设计AI:AI作为初级保健、营养补充剂或瑜伽导师?

Ned Cooper, Jose A. Guridi, Angel Hsing-Chi Hwang, Beth Kolko, Emma Elizabeth McGinty, Qian Yang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文探讨了如何负责任地设计用于心理健康支持的AI工具,通过类比不同角色(如初级保健、营养补充剂或瑜伽导师)来界定其责任和评估标准。

Comments 16 pages, 1 figure, 2 tables. To appear at CHI '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17311 2026-02-23 cs.CL cs.AI 73%

FLUKE: A Linguistically-Driven and Task-Agnostic Framework for Robustness Evaluation

FLUKE:一种基于语言驱动且任务无关的鲁棒性评估框架

Yulia Otmakhova, Hung Thinh Truong, Rahmad Mahendra, Zenan Zhai, Rongxin Zhu, Daniel Beck, Jey Han Lau

机构 * The University of Melbourne(墨尔本大学) Oracle(Oracle公司) Universitas Indonesia(印度尼西亚大学) RMIT University(皇家墨尔本理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 FLUKE通过系统性语言变化评估模型鲁棒性,揭示任务依赖性、模型脆弱性和语言特征使用与鲁棒性无关的结论。

Comments Accepted to EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13662 2026-02-23 cs.CV cs.AI 70%

LeafNet: A Large-Scale Dataset and Comprehensive Benchmark for Foundational Vision-Language Understanding of Plant Diseases

LeafNet:一个大规模数据集和全面基准,用于植物病害的基础视觉-语言理解

Khang Nguyen Quoc, Phuong D. Dao, Luyl-Da Quach

机构 * School of Electrical Engineering, Korea University(韩国大学电气工程学院) Department of Integrative Biology, The University of Texas at Austin(德克萨斯大学奥斯汀分校整合生物学系) Department of Software Engineering, FPT University(FPT大学软件工程系)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 LeafNet通过大规模多模态数据集和基准测试,揭示了VLMs在植物疾病理解中的性能差异,强调了多模态架构在提升诊断精度中的关键作用。

Comments 26 pages, 13 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09650 2026-02-23 cs.LG 70%

Cultivating Pluralism In Algorithmic Monoculture: The Community Alignment Dataset

在算法单一性中培育多元主义:社区对齐数据集

Lily Hong Zhang, Smitha Milli, Karen Jusko, Jonathan Smith, Brandon Amos, Wassim Bouaziz, Manon Revel, Jack Kussman, Yasha Sheynin, Lisa Titus, Bhaktipriya Radharapu, Jane Yu, Vidya Sarma, Kris Rose, Maximilian Nickel

机构 * FAIR at Meta(Meta 的 FAIR 部门) Governance at Meta(Meta 的治理部门) AI at Meta(Meta 的人工智能部门) Social Issues Research at Meta(Meta 的社会问题研究部门) AI Policy Team at Meta(Meta 的人工智能政策团队) Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过构建社区对齐数据集,探讨如何通过负相关采样提升LLM对不同偏好的适应能力,推动算法多元主义发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17687 2026-02-23 cs.IR cs.AI cs.CL cs.LG 67%

IRPAPERS: A Visual Document Benchmark for Scientific Retrieval and Question Answering

IRPAPERS: 一个用于科学检索和问答的视觉文档基准

Connor Shorten, Augustas Skaburskas, Daniel M. Jones, Charles Pierse, Roberto Esposito, John Trengrove, Etienne Dilocker, Bob van Luijt

机构 * Weaviate

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 IRPAPERS基准通过比较图像和文本检索系统,揭示了多模态混合搜索在科学文档检索和问答中的优势。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18092 2026-02-23 cs.CL cs.AI cs.CY 62%

Perceived Political Bias in LLMs Reduces Persuasive Abilities

感知到的LLM政治偏见会降低说服能力

Matthew DiGiuseppe, Joshua Robison

机构 * Leiden University(莱顿大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究发现,感知到的LLM政治偏见会降低其在对话中的说服效果,表明说服力受政治中立性感知的影响。

Comments 39 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04587 2026-02-23 cs.CL cs.AI cs.CY 62%

VILLAIN at AVerImaTeC: Verifying Image-Text Claims via Multi-Agent Collaboration

VILLAIN 在 AVerImaTeC 上:通过多智能体协作验证图像-文本声明

Jaeyoon Jung, Yejun Yoon, Kunwoo Park

机构 * School of AI Convergence, Soongsil University(人工智能融合学院,顺世大学) MAUM AI Inc.(MAUM人工智能公司) Department of Intelligent Semiconductors, Soongsil University(智能半导体系,顺世大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 VILLAIN 通过多智能体协作验证图像-文本声明,实现事实核查系统的高效准确验证。

Comments A system description paper for the AVerImaTeC shared task at the Ninth FEVER Workshop (co-located with EACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08831 2026-02-23 cs.CV cs.LG cs.RO 57%

View Invariant Learning for Vision-Language Navigation in Continuous Environments

连续环境中视觉语言导航的视角不变学习

Josh Qixuan Sun, Huaiyuan Weng, Xiaoying Xing, Chul Min Yeum, Mark Crowley

机构 * Department of Electrical and Computer Engineering, University of Waterloo(电气与计算机工程系,滑铁卢大学) Department of Civil and Environmental Engineering, University of Waterloo(土木与环境工程系,滑铁卢大学) Department of Electrical and Computer Engineering, Northwestern University(电气与计算机工程系,西北大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.LG

AI总结 本文提出VIL框架,通过对比学习和教师-学生机制提升连续环境中视觉语言导航的视角鲁棒性,实验表明其在多个基准数据集上性能优越。

Comments This paper is accepted to RA-L 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18083 2026-02-23 cs.CV cs.LG 57%

Comparative Assessment of Multimodal Earth Observation Data for Soil Moisture Estimation

多模态地球观测数据在土壤含水量估计中的比较评估

Ioannis Kontogiorgakis, Athanasios Askitopoulos, Iason Tsardanidis, Dimitrios Bormpoudakis, Ilias Tsoumas, Fotios Balampanis, Charalampos Kontoes

机构 * BEYOND EO Centre, IAASARS, National Observatory of Athens(BEYOND EO中心、IAASARS、雅典国家天文台) Artificial Intelligence, Wageningen University & Research(人工智能,瓦赫宁根大学与研究所)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本研究通过多模态地球观测数据结合机器学习,提出高分辨率土壤含水量估计框架,验证了传统特征工程在稀疏数据回归任务中的有效性。

Comments This paper has been submitted to IEEE IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17910 2026-02-23 cs.AI 57%

Alignment in Time: Peak-Aware Orchestration for Long-Horizon Agentic Systems

时间对齐:面向长时间 horizon 代理系统的峰值感知 orchestration

Hanjing Shi, Dominic DiFranzo

机构 * Lehigh University(莱维大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 APEMO通过时间-情感信号优化计算分配,提升长horizon代理系统轨迹质量和重用概率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01331 2026-02-23 cs.HC cs.AI 57%

ChoiceMates: Supporting Unfamiliar Online Decision-Making with Multi-Agent Conversational Interactions

ChoiceMates: 通过多智能体对话交互支持陌生在线决策

Jeongeon Park, Bryan Min, Kihoon Son, Jean Y. Song, Xiaojuan Ma, Juho Kim

机构 * University of California, San Diego(加州大学圣迭戈分校) School of Computing, KAIST(韩国科学技术院计算机学院) Information and Interaction Design, Yonsei University(延世大学信息与交互设计) Hong Kong University of Science(香港科学大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 ChoiceMates通过多智能体对话交互帮助用户更高效地进行陌生在线决策。

Comments Accepted to IUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18306 2026-02-23 cs.SE 50%

ReqElicitGym: An Evaluation Environment for Interview Competence in Conversational Requirements Elicitation

ReqElicitGym: 一种用于会话需求 elicitation 中面试能力评估的评估环境

Dongming Jin, Zhi Jin, Zheng Fang, Linyu Li, XiaoTian Yang, Yuanpeng He, Xiaohong Chen

专题命中 评测与基准 :LLM(abstract)

AI总结 ReqElicitGym通过引入新数据集和交互式评估机制,系统评估LLM在会话需求 elicitation 中的面试能力,揭示其在隐含需求识别上的不足。

Comments 22page, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17768 2026-02-23 cs.CV 50%

KPM-Bench: A Kinematic Parsing Motion Benchmark for Fine-grained Motion-centric Video Understanding

KPM-Bench: 一种用于细粒度运动中心视频理解的运动解析动作基准

Boda Lin, Yongjie Zhu, Xiaocheng Gong, Wenyu Qin, Meng Wang

机构 * Kuaishou Technology(快手科技)

专题命中 评测与基准 :post-training(abstract)

AI总结 KPM-Bench通过整合运动学计算与语言解析,构建了一个用于细粒度运动中心视频理解的开源基准,提出MoPE算法以提升运动描述的准确性与可靠性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏