arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11618 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2798 篇

2608.05155 2026-08-07 cs.CL cs.AI 新提交 88%

Beyond Sentiment: Comparing Traditional NLP and LLM-Based Multi-Dimensional Analysis for Political News Evaluation

超越情感:对比传统NLP与基于大语言模型的多维分析在政治新闻评估中的应用

Maryam Fooladi, Federico Bottino

机构 * Kakashi Ventures Accelerator (KVA)(卡卡西风险投资加速器(KVA)) Newjee(新吉)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 本文对比传统NLP的RoBERTa情感分析与基于LLM的多维框架分析,发现前者存在“中性坍缩”局限,后者可捕捉政治话语多维特征,更适配SSH研究需求。

Comments Accepted at PoliticalNLP 2026, the 3rd Workshop on Natural Language Processing for Political Sciences, co-located with LREC 2026. 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03219 2026-08-05 cs.AI cs.CL 新提交 88%

Reachability Is Not Realization: Tracing the Sources of LLM Benchmark Gains

可达性并非可实现性:追溯大语言模型基准测试增益的来源

Yanchao Li, Wanhao Liu, Jiaqing Xie, Ben Gao, Yanbo Wang, Tianfan Fu, Yuqiang Li

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 该研究针对LLM基准测试增益,建立问题级审计方法,发现可实现性与可达性常不同步,提出能力扩展声明需报告匹配条件下的可实现性能与可达性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26397 2026-07-30 cs.CL cs.LG q-bio.QM 新提交 88%

Knowledge before Reasoning: EC-Reason-Bench, a Training-Free Diagnostic Benchmark for LLM Enzyme Classification

推理前的知识:EC-Reason-Bench,一种用于大语言模型酶分类的无训练诊断基准

Linyu Li, Zhi Jin, Yichi Zhang, Dongming Jin, Yuanpeng He, Huanyao Zhang, Xuan Zhang, Gadeng Luosang, Nyima Tashi

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.LG

AI总结 该研究针对通用LLM酶分类中EC编号二至四级准确率近乎为零的问题,提出无训练诊断基准EC-Reason-Bench,分解四个维度评估,发现外部知识优先于推理等关键结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22883 2026-07-28 cs.SE cs.AI cs.LG 新提交 88%

Evaluating and Mitigating the Misguidance Effect of Buggy Code in LLM-Generated Unit Tests

评估和减轻大语言模型生成单元测试中错误代码的误导效应

Junda Zhao, Shurui Zhou, Eldan Cohen

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究大语言模型生成单元测试时错误代码的误导效应,提出新指标衡量,分析其双重影响,引入基于规范的单元测试生成范式,有效减少误导性测试,增加有效测试,改善测试生成管道,适用于各类代码。

Comments 24 pages, 7 figures, 12 tables. Accepted at ISSTA 2026; to appear in Proceedings of the ACM on Software Engineering (PACMSE), Vol. 3, No. ISSTA, Article ISSTA113

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19361 2026-07-23 cs.CL cs.AI 新提交 88%

Stateful Guardrails for Multi-Turn LLM Systems: A Conversational Risk Accumulation Framework

多轮大语言模型系统的有状态防护栏:一个对话风险累积框架

Sanjay Mishra, Divya Chukkapalli, Ganesh R. Naik

机构 * College of Medicine and Public Health, Flinders University(弗林德斯大学医学与公共卫生学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究多轮大语言模型系统的对话风险累积问题,提出会话层CRA框架,跟踪三个轨迹信号,提供评分方法,发布多个基准测试集及评估协议,重点在于分布内会话评分,为大语言模型安全防护提供新方法。

Comments 45 pages, 10 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19219 2026-07-22 cs.CL cs.AI 新提交 88%

Beyond Score Prediction: LLM-Based Essay Scoring and Feedback Generation via Reinforcement Learning with Rubric Rewards

超越分数预测:基于强化学习和评分标准奖励的基于大语言模型的作文评分与反馈生成

Xuefeng Jin, Jiashuo Zhang, Teng Cao, Bin Yang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究基于大语言模型的作文评分与反馈生成,提出RLAES框架,通过强化学习联合优化。引入RFE评估框架,提出AGFO和ACR方法。实验表明RFE能捕捉一致性,RLAES-AGFO在评分性能上最佳,保持反馈质量同时避免反馈退化。

Comments 12 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14108 2026-07-17 cs.CL cs.AI cs.SE 新提交 88%

Eta Given Delta: Defining LLM Tool Efficiency With Marginal Tool Utility

给定增量的埃塔:用边际工具效用定义大语言模型工具效率

Nyx Iskandar

机构 * Foam(泡沫)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 研究提出用于评估LLM智能体轨迹中工具调用率的工具效率及边际工具效用指标,用LLM-as-a-Judge确定边际工具效用符号,区别于间接测效率的 prior work,直接测效率,为LLM评估研究及相关工程做贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13801 2026-07-16 cs.CR cs.AI cs.LG 新提交 88%

Traffic-Aware Randomized Smoothing for LLM-Based Network Intrusion Detection

基于大语言模型的网络入侵检测的流量感知随机平滑

Zhenpeng Li

机构 * Guangzhou Health Science College(广州健康科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究基于大语言模型的网络入侵检测系统对流量操纵的鲁棒性,提出流量感知随机平滑方法TA-RS,通过在特定子空间注入噪声,提升认证准确率,不同数据集表现有差异,还探究了方法局限性及改进策略。

Comments 44 pages, 14 figures, 14 tables. Submitted to Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08143 2026-07-10 cs.CL cs.AI cs.IR 新提交 88%

ICDAR 2026 HIPE-OCRepair Competition on LLM-Assisted OCR Post-Correction for Historical Documents

ICDAR 2026关于历史文档的大语言模型辅助OCR后校正的HIPE-OCRepair竞赛

Maud Ehrmann, Emanuela Boros, Juri Opitz, Andrianos Michail, Florian Wagner, Simon Clematide

机构 * École Polytechnique Fédérale de Lausanne (EPFL), Switzerland(瑞士联邦理工学院洛桑分校) University of Zurich, Switzerland(苏黎世大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 ICDAR 2026的HIPE-OCRepair竞赛旨在评估大语言模型辅助历史文档OCR后校正系统能力,提供可重现评估框架。四支队伍提交不同策略系统,结果显示虽能提高OCR质量,但性能因多种因素而异,还存在过度校正问题,相关资源已发布供后续研究。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00292 2026-07-02 cs.NI cs.AI cs.CL 新提交 88%

An LLM-Based Framework for Intent-Driven Network Topology Design

基于LLM的意图驱动网络拓扑设计框架

Kholoud El-Habbouli, Fen Zhou, Stephane Huet

机构 * CERI-LIA, University of Avignon(阿维尼翁大学CERI-LIA实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一个结合分层建模和系统验证的约束驱动流水线,利用大语言模型从自然语言需求生成结构有效且符合约束的网络拓扑,并通过多模型对比评估其正确性和弹性。

Comments submitted to IEEE CNSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27226 2026-06-26 cs.AI cs.CL 新提交 88%

Ask, Don't Judge: Binary Questions for Interpretable LLM Evaluation and Self-Improvement

询问而非评判:用于可解释的LLM评估和自我改进的二元问题

Sangwoo Cho, Kushal Chawla, Pengshan Cai, Zefang Liu, Chenyang Zhu, Shi-Xiong Zhang, Sambit Sahu

机构 * Capital One, AI Foundations(Capital One人工智能基础)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出BINEVAL框架,将评估标准分解为原子二元问题,聚合为可解释的多维分数,在多项基准上匹配或超越强基线,并支持迭代提示优化。

Comments Acceepted to the Second Workshop on Compositional Learning at ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26429 2026-06-26 cs.LG cs.CL 新提交 88%

DualEval: Joint Model-Item Calibration for Unified LLM Evaluation

DualEval: 联合模型-项目校准的统一LLM评估

Aaron J. Li, Hao Huang, Youngmin Park, Yitong Ma, Wei-Lin Chiang, Li Chen, Cho-Jui Hsieh, Bin Yu, Ion Stoica

机构 * University of California, Berkeley(加州大学伯克利分校) Arena University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 提出DualEval框架,通过联合模型-项目校准统一静态基准和竞技场式评估,生成可靠模型排名并支持基准压缩和异常检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23915 2026-06-24 cs.CL cs.IR cs.LG 新提交 88%

Do LLM Attribution Metrics Transfer? Auditing Retrieval-Augmented Generation Evaluation Across Datasets and Constructs

LLM归因指标是否可迁移?跨数据集和构念的检索增强生成评估审计

Tianyu Ding, Aditya Nannapaneni, Juan Pablo De la Cruz Weinstein

机构 * Amazon Web Services(亚马逊云服务)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本研究审计了八种自动归因评分器在三个评估构念上的表现,发现没有评分器能在所有数据集上保持最佳性能,指标排名会反转,且简单选择最佳平均评分器会导致显著遗憾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23127 2026-06-23 cs.AI cs.CL cs.SE 新提交 88%

Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation

管理LLM智能体中的程序性记忆:控制、适应与评估

Julia Belikova, Rauf Parchiev, Evgeny Egorov, Grigorii Davydenko, Gleb Gusev, Andrey Savchenko, Maksim Makarenko

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出AFTER基准(382个企业任务,22种程序性技能),评估技能在任务、角色和模型间的迁移,实验表明程序性记忆可提升3.7-6.7点性能,跨模型准确率达73.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22329 2026-06-23 cs.CL cs.AI 新提交 88%

BabelJudge: Measuring LLM-as-a-Judge Reliability Across Languages and Agent Trajectories

BabelJudge: 跨语言和智能体轨迹中LLM作为评判者可靠性的测量

Shreyas KC

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出BabelJudge基准,通过受控扰动生成已知标签的成对样本,无监督地测量评判模型的位置偏差、冗长偏差、顺序不一致和跨语言退化,发现Swahili顺序一致性接近随机。

Comments 8 pages, 4 figures. Source code, benchmark toolkit, and reproduction scripts at https://github.com/Shreyaskc/BabelJudge

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20631 2026-06-23 cs.AI cs.LG 新提交 88%

Harnessing Agent Skills: Architectural Patterns and a Reference Architecture for Skill-Mediated LLM Agents

驾驭智能体技能:技能中介LLM智能体的架构模式与参考架构

Boming Xia, Liming Zhu, Zhenchang Xing, Qinghua Lu, Dino Sejdinovic, Xiwei Xu

机构 * Responsible AI Research (RAIR) Centre(负责任人工智能研究中心) Adelaide University(阿德莱德大学) University of New South Wales(新南威尔士大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出十种经验性架构模式(五种核心、五种辅助)用于技能中介,并综合成包含供应链、中介、执行控制、证据与反馈四层的参考架构,通过跨实例化评估提供分析框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20629 2026-06-23 cs.MA cs.AI cs.LG 新提交 88%

Specialize Roles, Mix Deployments: Pushing the Cost-Accuracy Frontier of LLM Agent Teams

专业化角色,混合部署:推动LLM代理团队的成本-精度前沿

Yinsicheng Jiang, Liang Cheng, Yeqi Huang, Yufan Zhao, Zhan Lu, Li Dong, Wenda Li, Edoardo Ponti, Luo Mai

机构 * University of Edinburgh(爱丁堡大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出AgentCARD基准,通过角色感知评估和帕累托前沿分析,发现异构团队在成本-精度前沿上优于同构团队,混合部署可降低12倍成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12764 2026-06-12 cs.LG cs.CL cs.CR 新提交 88%

Detecting Functional Memorization in Code Language Models

检测代码语言模型中的功能记忆

Matthieu Meeus, Anil Ramakrishna, Matthew Grange, Zheng Xu, Luca Melis

机构 * Meta Imperial College London(伦敦帝国学院)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.LG

AI总结 研究代码语言模型的功能记忆现象,通过反事实设置对比暴露目标代码的模型与未暴露的参考模型,使用文本和功能相似性度量,发现功能记忆超出文本重叠的检测范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08036 2026-06-09 cs.IR cs.AI cs.CL 新提交 88%

GIScholarBench: Benchmarking LLM Overconfidence in GIS Research

GIScholarBench: 在GIS研究中评估大语言模型的过度自信

Zongrng Li, Mingzheng Yang, Lei Zou, Hongxu Ma, Hao Tian, Siqi Zhou, Wenjing Gong, Kaili Zhang, Bingqian Chen, Mitch Zhang, Yifan Yang

机构 * Texas A&M University(德克萨斯理工大学) Google(谷歌) Department of Geography(地理系) Department of Landscape Architecture and Urban Planning(景观建筑与城市规划系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在学术研究中的过度自信问题,构建了包含10865篇论文的GIScholarBench基准,通过元数据检索、文献链接和研究方向生成三项任务评估模型表现,发现所有模型均存在任务不变的过度自信现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17577 2026-06-17 cs.AI 新提交 88%

Surrogate Assisted Pedestrian Protection Design via a Foundation Model Orchestrated Workflow

基于基础模型编排工作流的代理辅助行人保护设计

Osamu Ito, Akihiko Katagiri, Yoshikazu Nakagawa, Shin Saeki, Jun Shiraishi, Masato Sasaki

机构 * Honda Motor Co., Ltd.(本田汽车有限公司)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出首个基础模型编排的碰撞安全设计工作流,集成代理模型、多目标进化搜索、几何生成器和自然语言接口,将行人保护评估时间从数小时降至秒级。

Journal ref ICLR 2026 Workshop The 2nd Workshop on Foundation Models for Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11149 2026-08-12 cs.CV 新提交 88%

PRMU: A Corpus-Free Benchmark for Person-Centric Knowledge Unlearning in Multimodal Large Language Models

PRMU:面向多模态大语言模型中以人为中心的知识遗忘的无语料基准

Huafeng Chen, Yueming Lyu, Ziyuan Chen, Wenda Tan, Chenyang Si, Liucheng Guo, Caifeng Shan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 针对现有多模态大语言模型(MLLMs)遗忘方法依赖语料的局限,提出无语料基准PRMU及基线SGPE,实验显示SGPE在目标遗忘、局部性保留等方面权衡更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06769 2026-08-10 cs.CV 新提交 88%

GraphVerse: A Comprehensive Visual Graph Reasoning Benchmark for Multimodal Large Language Models

GraphVerse:面向多模态大语言模型的综合性视觉图推理基准

Yuanfu Sun, Yuanhang Ren, Kang Li, Chuanhao Ji, Jiaxi Li, Jiajin Liu, Ninghao Liu, Qiaoyu Tan

机构 * New York University(纽约大学) Sensetime Research(商汤科技研究院) Tsinghua University(清华大学) New York University Shanghai(上海纽约大学) University of Georgia(佐治亚大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 针对现有多模态大语言模型(MLLMs)评估缺乏结构化视觉推理测试的问题,提出GraphVerse基准,通过以图为中心的图像编辑(GIE)策略和VGR-Score指标,评估MLLMs在单/配对图像场景下的视觉图推理能力,揭示其相关局限并验证方法有效性。

Comments 33 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05561 2026-08-07 cs.SE 新提交 88%

Exploring Dependence, Overreliance, and Addiction Related Behaviors Associated with Large Language Model Use Among Software Engineers

探索软件工程师使用大语言模型(LLMs)相关的依赖、过度依赖及成瘾相关行为

Ronnie de Souza Santos, Italo Santos, Matheus de Moraes Leça, Cleyton Magalhaes, Mairieli Wessel

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究通过对119名软件从业者的调查,分析了工程师使用LLMs时的依赖、过度依赖及成瘾相关行为,发现LLMs已成为软件工程的习惯性工具,多数使用具功能性,需促进适当依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00357 2026-08-04 cs.HC 新提交 88%

Dynamic Surveys: Using LLMs to Blend Qualitative Depth,Quantitative Structure, and Collaborative Interaction

动态调查:利用大语言模型(LLM)融合质性深度、定量结构与协作互动

Kehua Lei, Aidan Ladenburg, Zahra Petiwala, Zili Wang, Dishita Jhawar, Ipsita Bisht, Ansh Kumar, David T. Lee

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究提出动态调查平台,利用LLM实时聚类质性回答并引出定量内容,经93名参与者的两项实地研究验证,其能提供更丰富见解并提升参与度。

Comments 27 pages, 6 figures

Journal ref Proc. ACM Hum.-Comput. Interact., Vol. 9, No. CSCW, Article 405 (November 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29085 2026-08-03 cs.CY 新提交 88%

IyawoBench v2.0: Extended Diagnostic Evaluation of Large Language Model Clinical Triage in Nigerian Primary Care

IyawoBench v2.0:尼日利亚基层医疗中大型语言模型临床分诊的扩展诊断评估

Anthonio Oladimeji Gabriel, Dimeji Olawuyi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 IyawoBench v2.0评估尼日利亚基层医疗的大型语言模型临床分诊,提出含三类失效模式的框架及新指标,发现前沿模型存缺陷,最优模型随部署场景变化,为中低收入国家临床AI选择提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19910 2026-07-23 cs.CV cs.HC 新提交 88%

MV-Bench: Benchmarking Multimodal Large Language Models for Coordinated Multi-View Interface Construction

MV-Bench:用于协同多视图界面构建的多模态大语言模型基准测试

Yue Zhao, Hongxu Liu, Feiyu Wang, Xiaoyu Yang, Tong Ge, Zhen Yang, Chao Wang, Qiong Zeng

机构 * Shandong Second Medical University(山东第二医科大学) Shandong University(山东大学) Bairong Inc.(百融云创科技股份有限公司) Ke Holdings Inc.(贝壳控股有限公司) School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) Shandong Provincial Key Laboratory of Computing-Network Integration, Shandong University(山东大学计算网络融合技术山东省重点实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究针对多模态大语言模型在协同多视图界面构建评估不足的问题,引入MV-Bench基准,通过多阶段管道转换规范为界面,评估五个模型,发现当前MLLMs虽能再现视觉外观,但在数据语义和交互逻辑生成上有限,迭代改进效果不佳。

Comments Submitted to IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16648 2026-07-21 cs.CR cs.IT math.IT 新提交 88%

Synchronization-Free Algebraic Fingerprints for Large Language Models: From Autoregressive to Diffusion Models

大语言模型的无同步代数指纹:从自回归模型到扩散模型

Jaroslaw Janas, Josef Pieprzyk, Pawel Morawiecki

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 针对大语言模型水印需求,提出无同步水印方案,由相邻令牌生成二元同余作水印,从代数角度分析恢复问题,讨论解码算法,该方法能抗多种操作,避免同步问题,为嵌入不同长度秘密身份提供灵活框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13934 2026-07-16 cs.MA 新提交 88%

Pezego-HITL: A policy-grounded large language model architecture for agricultural extension in Ghana

Pezego-HITL:一种用于加纳农业推广的基于政策的大语言模型架构

Shunbao Li, Zhipeng Yuan, Amoako Ofori, Benedicta Y. Fosu-Mensah, Yang Li, Manu Kenchappa Junjanna, Qing Xue, Po Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究针对加纳农业推广中大语言模型应用问题,提出基于政策的结构化检索增强生成与验证内存路由方法,通过P-EVAL框架评估,提升了模型政策对齐率、农艺利用率,降低延迟,还验证了通用性,为小农户农业提供可扩展模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06012 2026-07-08 cs.CV 新提交 88%

Structured Data Extraction from Real Estate Documents using Clustering, Classification, and Large Language Models

使用聚类、分类和大语言模型从房地产文档中提取结构化数据

Muhammad Assad Shehbaz, Carlos Francisco Moreno-García

机构 * Robert Gordon University(罗伯特·戈登大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究如何从房地产问卷文档中提取结构化数据,提出端到端管道,先分类文档,再用大语言模型提取属性,应用于3965份文档,成功处理2781份,得到2766条记录,验证了数据质量,证明该提取方法可行可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02325 2026-07-03 cs.HC 新提交 88%

Personality Without Persons? A Psychometric Critique of Big Five Testing in Large Language Models

无人格的人格?大语言模型中大五人格测试的心理测量学批判

Kim Zierahn, Cristina Cachero, Anna Korhonen, Nuria Oliver

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 通过心理测量学评估大语言模型的大五人格测试,发现其不适用于LLMs,无法捕捉模型间差异且因子结构失效,建议开发针对LLMs的评估框架。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏