Relation Extraction with Fine-Tuned Large Language Models in Retrieval Augmented Generation Frameworks
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments preprint
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments preprint
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);prompting(abstract)
Comments 21 pages, 9 figures
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
Comments 37 pages
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
Comments 51 pages
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
专题命中 评测与基准 :LLM(title,abstract);instruction tuning(title,abstract);large language model(abstract);language model(abstract)
Comments Accepted by ICLR 2024
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)
Comments 9 pages, 5 figures
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments 10 pages, 10 figures, accepted to the 30th Asia-Pacific Software Engineering Conference (APSEC 2023)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments 28 pages, 5 figures, 2 tables, 175 references
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
Comments Accepted to the Computers in Biology and Medicine journal
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)
Comments 28 pages, 3 figures, 16 tables
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);pretraining(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments To be published in SEMANTICS 2023 poster track proceedings. SEMANTICS 2023 EU: 19th International Conference on Semantic Systems, September 20-22, 2023, Leipzig, Germany
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments ACL 2023 (Findings)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)
Comments 12 pages, 1 figures
CASS-RTL:面向LLM的RTL生成的正确性感知子空间引导
机构 * Department of Electrical and Computer Engineering (ECE), University of Central Florida, Orlando, FL 32816, USA(电子与计算机工程系,中央佛罗里达大学,奥兰多,佛罗里达州32816,美国)
专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 提出CASS-RTL框架,通过识别LLM中与RTL正确性相关的注意力头并构建低维子空间进行轻量级干预,在无需额外监督或重训练的情况下提升RTL代码生成的功能准确性。
Comments Accepted to the IEEE International Conference on LLM-Aided Design (LAD '26)
在LGPD背景下简化需求工程:一项基于大语言模型(LLM)的研究
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本研究针对隐私法规合规转化为软件需求的挑战,探究LLM在LGPD框架下简化需求工程的可行性,提出利用法规自动生成用户故事和验收测试场景的方法,验证其能从软件初期确保合规。
Comments The document consists of 12 pages and includes 2 figures
安全测试作为LLM代码生成的可执行规范:益处、权衡与覆盖范围限制
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 该研究提出将安全测试作为LLM代码生成的可执行规范,开发SecTDD框架,通过多维度评估发现预先展示可见测试可提升联合成功率,结构化反馈修复效果更优但益处受多因素影响。
伪造的同行判断会误导多模态大语言模型(LLM)评判小组:无来源锚定与小组共识验证
机构 * Zhejiang University(浙江大学)
专题命中 评测与基准 :LLM(title,title_cn);language model(abstract)
AI总结 研究发现多模态LLM评判小组存在无来源锚定的文本攻击面,伪造同行判断可误导判决,提出的小组共识验证方法能有效阻断此类攻击并降低损害。
GRACE:用于可扩展混合数据聚类的大语言模型(LLM)基础语义度量空间
机构 * Guangdong University of Technology(广东工业大学) ; Tsinghua University(清华大学) ; Peking University(北京大学) ; Shenzhen University(深圳大学) ; Xiamen University(厦门大学)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 针对混合数据聚类中语义丰富度与可扩展性的矛盾,提出GRACE框架,通过多视角LLM查询实现一次性语义嵌入,兼顾可扩展性与聚类性能,优于11种对比方法。
Comments 13 pages
技能不是文档:面向LLM智能体技能路由的查询条件基准与两阶段检索器
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 针对LLM智能体技能路由中技能兼容性被忽视的问题,提出Reject-as-Resource Retriever (R3)框架,构建双语基准R3-Skill,并设计两阶段检索系统(R3-Embedding + R3-Reranker)显式建模技能兼容性,显著提升检索效果。
Comments 24 pages, 8 figures
RoguePrompt: 双层加密用于自我重建以规避LLM审核
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 RoguePrompt通过双层加密技术实现自我重建,有效规避LLM审核并诱导模型执行禁止指令。
Comments This submission has been withdrawn because it has been superseded by a substantially revised and expanded version, available as arXiv:2607.27373. Please refer to and cite the newer version
从谁说了什么到他们是谁:用于说话人 diarization 的无训练模块化身份感知大语言模型优化
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 针对现有 SD+ASR 框架缺乏灵活性与真实说话人身份的问题,提出无训练模块化流水线,结合 SD、ASR 与 LLM 优化低置信度标签,在患者-临床医生数据集上实现 29.7% 相对误差降低,提供完整身份检测流水线。
筛选噪声:LLM代理在漏洞假阳性过滤中的比较研究
专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract)
AI总结 本文比较了三种先进的LLM代理框架在漏洞假阳性过滤中的性能,展示了LLM代理在减少SAST噪声方面的有效性,但指出其效果依赖于模型和漏洞类型,且存在计算成本差异。
Comments To appear in Proceedings of the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026)
从幻觉到谋略:一种统一的分类法和基准分析用于LLM欺骗
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出统一的LLM欺骗分类法,揭示现有基准在欺骗机制覆盖不足的问题,并为开发者和监管者提供改进建议。
Comments Accepted to ICLR Agents in the Wild: Safety, Security, and Beyond Workshop
当无人注视时LLM智能体在说什么:多智能体辩论中的社会结构与潜在目标涌现
机构 * Independent Researcher(独立研究员) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出双通道辩论框架,研究社会结构(角色、受众、关系)如何导致LLM智能体在公开与私下(OTR)表达中产生系统性分歧,揭示潜在目标的涌现。
从知道到行动:基准测试LLM代理的自我意识能力
机构 * The Chinese University of Hong Kong(香港中文大学) ; Fudan University(复旦大学) ; University of Edinburgh(爱丁堡大学) ; Tencent(腾讯) ; University of Bristol(布里斯托大学)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出KAPRO框架和KAware数据集,通过解耦元认知判断与自主执行,评估LLM代理的自我意识能力,发现其与任务成功强相关但在内部能力场景中下降,开源模型易过度使用工具。