arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-17 至 2026-08-17 共收录 252 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 68 篇

2510.10119 2026-08-17 cs.SE 版本更新 78%

IntrinTrans: LLM-based Intrinsic Code Translator for RISC-V Vector

IntrinTrans: 基于大语言模型的RISC-V向量内在函数翻译器

Liutong Han, Zhiyuan Tan, Hongbin Zhang, Pengcheng Wang, Chu Kang, Mingjie Xing, Yanjun Wu

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出IntrinTrans,利用大语言模型和编译反馈自动翻译跨架构内在函数,并通过寄存器使用信息优化生成代码,实验证明其性能接近原生实现。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18785 2026-08-17 cs.AI 版本更新 77%

SkillSight: Calibrating Generic Content Bias for Skill Retrieval

SkillSight:通过共享描述实现准确技能检索

Jinying Xiao, Bin Li, Xiaopeng Li, Jianling Li, Jiacheng Jie, Xiaodong Liu, Ma Jun, Chao Wang, Nyima Tashi, Jie Yu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型智能体技能检索问题,提出SkillSight框架,通过语义和词汇空间校准共享背景,减少偏差,实验证明该方法能提升检索指标,在端到端评估中表现出色且速度快,实现准确高效的技能选择。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14089 2026-08-17 cs.AI cs.CL cs.CR cs.LG 新提交 75%

Regime-Conditional Verification: Correctness Estimation for Adapting and Monitoring Safety Classifiers

条件 regime 验证:安全分类器适配与监控的正确性估计

Thiago Sandoval, Ufuk Topcu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出 Regime-Conditional Verification(RCV),通过轻量级封装器适配安全分类器,在不重新训练的情况下提升策略遵守度,可检测分布偏移并仅在必要时微调,在多分类器、数据集及部署场景中表现优异。

Comments 16 pages including technical appendix, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13608 2026-08-17 cs.AI cs.CR cs.LG 新提交 73%

Evaluating Agentic Learning Harness Capabilities Without Labels via the Scaling Hypothesis

基于缩放假设的无标签智能体学习控制器能力评估

Aryan Luthra, Kshitij Jain, Siddharth Arya, Bobby Filar, Anna Bertiger

机构 * Georgian

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究提出基于缩放假设的无标签智能体学习控制器评估框架,以教师模型与学生模型的收敛度为评分指标,验证其可作为标签缺失时控制器真实增益的有效代理。

Comments 18 pages, 6 figures. Accepted at CAMLIS 2025 (Conference on Applied Machine Learning for Information Security)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13566 2026-08-17 cs.LG cs.AI cs.SE 新提交 73%

Don't Claim Benchmark-Oriented Optimization Improves General Coding Capability -- Diverse Evaluation Is Required

勿宣称面向基准的优化可提升通用编码能力——需要多样化评估

Egor Shibaev, Vera Kudrevskaia, Timur Galimzyanov, Mikhail Evtikhiev, Ana Terna, Rastislav Rabatin, Timur Kudashev, Timofey Bryksin, Arina Puchkova, Patrik Bartak, Egor Bogomolov, Sergey Titov

专题命中 评测与基准 :foundation model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 该研究指出少量编码基准的优化无法提升通用编码能力,通过案例研究验证了基准排名难泛化、跨任务迁移差等问题,呼吁采用差异化评估与持续基准维护。

Comments Accepted to the DL4Code workshop @ ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14457 2026-08-17 cs.CL 新提交 70%

Information Satisfaction: A Reader-Centered Axis for Summarization Evaluation

信息满意度:面向读者的摘要评估轴

Isabel Cachola, William Walden, Reno Kriz, Mark Dredze

机构 * St. Edward’s University(圣爱德华大学) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究提出以读者的信息满意度作为摘要评估的面向读者的轴,发现主流摘要指标无法衡量该满意度,且与人工判断一致性差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14377 2026-08-17 cs.CL cs.CV 新提交 70%

A Survey of Large Models in Sports

体育领域的大模型综述

Yichen Xu, Jianzhe Ma, Chuhan Wang, Zhonghao Cao, Liangyu Chen, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学) Sichuan University(四川大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该文综述体育领域大模型的任务应用、数据集基准,分析挑战与未来方向,为大模型驱动的体育智能研究与发展提供基础。

Comments 36 pages, 4 figures, 6 tables. Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14132 2026-08-17 cs.HC cs.AI 新提交 70%

Act2Intention: A Benchmark For Developing Active Mobile Agents Through Inferring User Intention from GUI Actions

Act2Intention:通过从GUI操作推断用户意图开发主动移动智能体的基准

Xiaokai Yan, Jingtao Ding, Yong Li, Zhiwen Yu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Act2Intention框架及基准数据集,构建主动移动智能体,经实验验证该基准可显著提升智能体意图理解、预测与执行性能,为主动智能体研究提供标准化平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13565 2026-08-17 cs.AI 新提交 70%

Depth-Aware Sensitivity Analysis of Mixture-of-Experts Models via Magnitude-Based Expert Masking

基于幅值型专家掩码的混合专家模型的深度感知敏感性分析

Pradeep Kumar Sharma, Shantanu Godbole, Hritvik Shrivastava

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过在XLCoST基准上对Qwen3.6-35B-A3B模型的逐层敏感性分析,发现MoE层敏感性具深度依赖性,提出聚焦晚期层的掩码策略,可在保留输出质量的同时减少专家数量,为MoE模型压缩提供了实证基础与实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14704 2026-08-17 cs.AI 版本更新 70%

The Metacognitive Bottleneck: Japanese Riddles Reveal Fundamental Limits of Machine Insight and Self-Evaluation in Reasoning AI

日式儿童谜语作为机器洞察与元认知的基准

Masaharu Mizumoto, Dat Nguyen, Zhiheng Han, Xingfu Li, Yo Nakawake, Le Minh Nguyen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究通过日本儿童谜语构建基准,揭示机器在洞察推理和元认知控制方面的不足,为提升AI的自我评估能力提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14418 2026-08-17 cs.CR 新提交 67%

STINER: Automated Extraction of Strategic Cyber Threat Intelligence from X

STINER:从X平台自动提取战略网络威胁情报

Yasir Ech-Chammakhy, Oussama Azrara, Jaafar Chbili, Anas Motii

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对社交媒体CTI提取难题,提出STINER分类体系与语料库,经测试DarkBERT等领域适配编码器表现最优,还利用STINER-DarkBERT完成了2025年上半年欧洲威胁态势分析。

Comments Accepted at RAID 2026 (29th International Symposium on Research in Attacks, Intrusions and Defenses)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14315 2026-08-17 cs.SE 新提交 67%

Breaking Models to Test the Judge: A Mutation Testing Approach for Semantic Evaluators of Domain Class Diagrams

破坏模型以测试评判器:面向领域类图语义评估器的变异测试方法

Kevin Delcourt, Meriem Ben Chaaben, Abdelhamid Rouatbi, Luciano Marchezan, Houari Sahraoui

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究针对领域类图语义评估器,提出一种变异测试方法,通过注入语义缺陷生成变体并评估评判器检测缺陷的能力,其结果与人工评估基本一致,可作为语义评判器分析的可扩展替代方案。

Comments Paper accepted at the ACM/IEEE 29th International Conference on Model Driven Engineering Languages and Systems (MODELS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14131 2026-08-17 cs.SE 新提交 67%

LegacyWorld: Atomicity-Aware Evaluation of GUI Agents for Legacy Workflows

LegacyWorld:面向遗留工作流的GUI智能体的原子性感知评估

Thilo Reintjes, Sivajeet Chand, Derui Zhu, Sushant Kumar Pandey, Alexander Pretschner

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究开发LegacyUse框架以自动化遗留工作流,构建含28个Windows GUI工作流的基准,采用原子性评估6款计算机使用智能体,发现不同操作特征并提出相关首要要求。

Comments Accepted for publication in the Industry Track of the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), 14-18 September 2026, Benevento, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13783 2026-08-17 cs.CV 新提交 67%

Doomed to Re-Annotate, Forever: The ImageNet Story

注定要反复标注:ImageNet的故事

Illia Volkov, Nikita Kisel, Tetiana Mishkina, Klara Janouskova, Jiri Matas

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文针对ImageNet-1k数据集的标签噪声问题,构建ReImageNet数据集,采用人机协作反复优化的标注流程,使模型准确率显著提升,相关资源已公开。

Comments 25 pages, 16 figures, 8 tables. Project page: this https URL (https://vrg.fel.cvut.cz/reimagenet)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13583 2026-08-17 cs.HC cs.MA 新提交 67%

Beyond Simplification: DFT-GEN for Fidelity-Preserving Visual Accessibility in Dyslexia-Friendly Educational Texts

超越简化:用于阅读障碍友好型教育文本中保真视觉可访问性的DFT-GEN

Jiaqian Yu, Chen Jason Zhang, Haoyang Li, Guoqiong Ivanka Huang

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本研究针对阅读障碍人群的教育文本,提出DFT-GEN框架,通过专属可访问性层兼顾信息保真与视觉可访问性,在双语考试条目上取得显著效果。

Comments Preprint. Code available at this https URL (https://github.com/MorrisYUJQ/DFT-GEN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08705 2026-08-17 cs.CV 版本更新 67%

HumanForge: A Human-Centric Deepfake Video Benchmark with Multi-Agent Forgery Rationales

HumanForge:一个具有多智能体伪造原理的以人类为中心的深度伪造视频基准

Wenbo Xu, Zhimin Chen, Xiaojie Liang, Hengrui Liu, Ziqi Sheng, Wei Lu

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 针对视频伪造给数字内容取证带来的挑战,引入HumanForge数据集,提出基于LangGraph的Gen2Anno多智能体管道构建并注释数据集,经测试展现了零样本泛化和细粒度推理的重大挑战,代码和数据集将公开。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06226 2026-08-17 cs.CR 版本更新 67%

No Data? No Problem: Synthesizing Security Graphs for Better Intrusion Detection

无数据?不问题:为更好的入侵检测合成安全图

Yi Huang, Shaofei Li, Yao Guo, Xiangqun Chen, Wajih Ul Hassan, Ding Li

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出PROVSYN框架,通过合成异构图结构和文本属性,提升入侵检测的鲁棒性,实验显示其在五维评估中表现优于基线模型,有效缓解数据不平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21114 2026-08-17 cs.CV 版本更新 67%

CVT-Bench: Probing Spatial-State Integrity through Counterfactual Viewpoint Transformations

CVT-Bench:反事实视角变换揭示多模态大语言模型中不稳定的空间表征

Shanmukha Vellamcheti, Uday Kiran Kothapalli, Disharee Bhowmick, Sathyanarayanan N. Aakur

机构 * CSSE Department, Auburn University(计算机科学与工程系,阿伯杜大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 CVT-Bench通过控制诊断基准评估多模态大语言模型在反事实视角变换下的关系一致性,发现尽管单视角准确率高,但系统在反事实视角变换下存在系统性退化,揭示了表征结构对反事实空间推理的重要性。

Comments Reframed CVT-Bench around spatial-state integrity, added real-world benchmark derived from 3dSGG, context controls and other minor changes. 21 pages, 10 figures, 15 tables. Project page: this https URL (https://shanmukha-here.github.io/CVT-Bench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21956 2026-08-17 cs.CV 版本更新 67%

Global-Local Dual Perception for MLLMs in High-Resolution Text-Rich Image Translation

全局-局部双感知用于高分辨率文本密集图像翻译的MLLMs

Junxin Lu, Tengfei Song, Zhanglin Wu, Pengfei Li, Xiaowei Liang, Hui Yang, Kun Chen, Ning Xie, Yunfei Lu, Jing Zhao, Shiliang Sun, Daimeng Wei

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Labs, Huawei Technologies Co., LTD(华为技术有限公司2012实验室) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出GLoTran框架,通过全局-局部双感知方法提升高分辨率文本密集图像翻译的准确性和完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13741 2026-08-17 cs.CL cs.LG 新提交 62%

GALA: Generation-Aware Cross-Modal Alignment for Text-to-Time-Series Synthesis

GALA:面向文本到时间序列合成的生成感知跨模态对齐

Haochen Zhang, Gengwei Zhang, Laura Yao, Nicholas Knoz, Tianlong Chen

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL、cs.LG

AI总结 本研究针对文本到时间序列合成中条件表示与信号模态不匹配的问题,提出GALA两阶段跨模态对齐方法,在TSFragment-600K数据集上实现SOTA,打破了生成器内部文本编码器的保真度与贴合度权衡。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14228 2026-08-17 cs.LG 新提交 57%

AutoSchema: Live Schema Grounding for Agentic Text-to-Sparql over Heterogeneous Knowledge Graphs

AutoSchema:面向异构知识图谱的智能体文本转SPARQL的实时模式接地

Yiming Zhang, Koji Tsuda

机构 * The University of Tokyo(东京大学) National Institute for Materials Science(国立材料科学研究所) RIKEN Center for Advanced Intelligence Project(理化学研究所高级智能项目中心)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 提出无需训练的AutoSchema框架,用于异构知识图谱的智能体文本转SPARQL的实时模式接地,在多项生物医学KGQA等任务中优于TogoMCP,可支持未记录RDF图谱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14130 2026-08-17 cs.MM cs.AI cs.CV cs.HC 新提交 57%

AlignFace: Human-Aligned Face Similarity Metric with Interpretable Concept Relations

AlignFace:具有可解释概念关系的人类对齐人脸相似度度量

Ying Huang, Wencan Zhang, Brian Y. Lim

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本研究针对人脸生成模型评估中现有度量未实现认知对齐的问题,提出AlignFace度量,结合VLM、CA、CBM、GAM等技术,利用FACETS数据集,提升了与人类亚群感知的对齐度。

Comments 10 pages, 10 figures, 2 tables, ACM MM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14054 2026-08-17 cs.LG 新提交 57%

Model-agnostic Retrieval-Augmented Extended Forecasting for time series

模型无关的检索增强扩展预测用于时间序列

Juan Pablo Villa Serna, Rohan Asthana, Vasileios Belagiannis

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 该研究提出模型无关的RAEF方法,通过改进检索与聚合机制提升时间序列预测性能,其效果优于RAF,兼具高效性与竞争力,可替代微调用于时间序列预测的领域适配。

Comments 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13940 2026-08-17 cs.AI 新提交 57%

AI Research Preference Models

AI研究偏好模型

Thomas Simon Foster, Bassel Al Omari, Tingchen Fu, Thomas Mann, Carl Domond, Lucia Cipolina-Kun, Bhavul Gauri, Muna Aghamelu, Alexander D. Goldie, Eryk Helenowski, Jean-Christophe Gagnon-Audet, Alberto Pepe, Saba Nazir, Daniel Izcovich, Noam Levi, Rishi Hazra, Karen Hambardzumyan, Nicolas Baldwin, Xian Li, Martin Josifoski, Paris Giampouras, Masoud Jalili Sabet, Anya Sims, Hela Momand, Tatiana Shavrina, Despoina Magka, Jason Weston, Yulin Wang, Anirudh Goyal, João Henriques, Yoram Bachrach, Emily McMilin, Jakob Nicolaus Foerster

机构 * FAIR at Meta University of Oxford(牛津大学) University College London(伦敦大学学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究针对AI研究智能体的候选方案评估成本过高问题,提出AI研究偏好模型,将其集成到AIRA-dojo智能体后提升了基准任务性能,且达到目标性能的时间更短、预算更少。

Comments 34 pages, 17 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13564 2026-08-17 cs.AI 新提交 57%

Inducing Reward-Free Judging Rubrics that Reduce Over-Crediting in Agent Evaluation

生成无奖励的评判标准以减少智能体评估中的过度打分

Darragh Quinn, David Dylan, Roisin Healy, Fionn Carroll, Maeve Donnelly, Cormac Sheehan

机构 * Trinity College Dublin(都柏林三一学院) University College Dublin(都柏林大学学院) Dublin City University(都柏林城市大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究提出 RubricForge 方法,从带标签轨迹生成无奖励的智能体评判标准,可减少智能体评估中的过度打分,在 tau-bench 和 WebShop 上的表现优于通用 G-Eval 评判器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07852 2026-08-17 cs.CL 版本更新 57%

"Many Are My Names": The Anatomy of the Assistant and Its Personas via Sparse Autoencoders

“我的名字有很多”:通过稀疏自编码器剖析助手及其角色设定

Adelaide Danilov, Aria Nourbakhsh, Oleksandr Marchenko Breneur, Salima Lamsiyah

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本研究借助稀疏自编码器剖析语言模型对说话者的内部表征,发现助手与角色扮演角色特征核心相关,故事角色则无,且可通过沉浸式模拟模式区分三者,助手有时会漂移至该模式。

Comments 38 pages, 9 tables, 4 figures, 2 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14616 2026-08-17 cs.AI cs.CV 版本更新 57%

SportD: How do VLMs physically strategize?

SportD:视觉语言模型能进行物理策略制定吗?

Jasin Cekinmez, Addison J. Wu, Haotian Xia, Kyumin Andrew Shim, Anay Putty, Jinglin Xiao, Zhuohan Liu, Leo Liu, Weining Shen

机构 * Princeton University(普林斯顿大学) Rice University(莱斯大学) UC Irvine(加州大学欧文分校) POSTECH(浦项科技大学) NYU Shanghai(纽约大学上海分校) UC Santa Barbara(加州大学圣塔芭芭拉分校) Zhejiang University(浙江大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究视觉语言模型在足球场景中能否进行物理策略制定,引入SportD基准,通过控球价值模型评估模型决策,发现模型表现低于职业球员,有偏好低方差低回报动作等问题,为衡量模型物理策略推理提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05740 2026-08-17 cs.CV cs.AI 版本更新 57%

Redefining Generalization in Visual Domains: A Two-Axis Framework for Fake Image Detection with FusionDetect

重新定义视觉域中的泛化:基于FusionDetect的假图像检测双轴框架

Amirtaha Amanzadi, Zahra Dehghanian, Hamid Beigy, Hamid R. Rabiee

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 该研究针对假图像检测的跨生成器与跨视觉域泛化挑战,推出OmniGen基准,提出基于CLIP和Dinov2的FusionDetect方法,其在多基准上实现最优性能并提升了OmniGen上的准确率。

Comments Project code: this http URL (http://github.com/amir-aman/FusionDetect)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13766 2026-08-17 cs.CV 新提交 50%

ChartProbe: A Diagnostic Study on Visual Reasoning through Perception, Grounding, and Simple Reasoning

ChartProbe:通过感知、定位与简单推理开展视觉推理的诊断研究

Mahsa Khoshnoodi, Sarah Adel Bargal

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出诊断框架ChartProbe,发现视觉-语言模型可通过单独监督感知、定位等简单技能,在无需复杂推理数据的情况下提升复杂图表推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 44 篇

2608.14094 2026-08-17 cs.CR cs.AI 新提交 93%

P2Skill: Privacy Preserving Skill Distillation for Cloud-Local LLM Inference Systems

P2Skill:面向云-本地大语言模型推理系统的隐私保护技能蒸馏

Myunghoon Ryu, Geunpyo Park, Sungjoon Lee, XinYu Piao, Jong-Kook Kim

专题命中 效率与部署 :LLM(title,summary_cn);SLM(summary_cn,abstract);language model(abstract);small language model(abstract)

AI总结 针对云-本地LLM推理系统的P2Skill,通过技能提示实现本地SLM自主处理PII相关操作,无需隐私微调,在四领域基准上的隐私保护推理质量较基线提升1.69倍、3.66倍。

详情

展开后加载摘要…

URL PDF HTML 收藏