From Registry to Repository: How AI Agent Skills Are Written, Adapted, and Maintained
从注册表到仓库:AI代理技能如何编写、适配和维护
专题命中 领域大模型 :LLM(abstract,abstract_cn)
AI总结 本研究首次对AI代理技能作为工程制品进行实证分析,通过挖掘公共注册表和GitHub仓库中的技能,发现技能重用多为一次性复制,定制化主要适配本地环境,而行为契约几乎不变。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
从注册表到仓库:AI代理技能如何编写、适配和维护
专题命中 领域大模型 :LLM(abstract,abstract_cn)
AI总结 本研究首次对AI代理技能作为工程制品进行实证分析,通过挖掘公共注册表和GitHub仓库中的技能,发现技能重用多为一次性复制,定制化主要适配本地环境,而行为契约几乎不变。
协同感知-推理治理:用可验证解剖证据为医学多模态大语言模型提供基础
机构 * Huazhong University of Science and Technology(华中科技大学) ; Imperial Global Singapore, Imperial College London(帝国理工学院新加坡全球中心) ; Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; Anhui University(安徽大学)
专题命中 领域大模型 :large language model(abstract);language model(abstract)
AI总结 提出一种无需训练的证据注入框架,通过ROI引导的视觉激活调制和解剖坐标语义标记,协同校准视觉感知与文本推理,动态路由任务特定干预,有效减少医学MLLM的幻觉。
Comments Accepted by MICCAI 2026 (Early Accept, Top 9%)
CRAwLeR -- 交叉引用感知的法律检索
专题命中 领域大模型 :LLM(abstract,abstract_cn)
AI总结 针对法律文档中的交叉引用,提出CRAwLeR流水线,生成需要上下文的查询并构建数据集,实验表明约80%的查询真正需要上下文,最佳Recall@10为55%-59%。
Comments 26 pages, 18 figures
人工智能作为网络安全游戏规则改变者:2025-2026年我们学到的,以及这对非洲的意义
专题命中 领域大模型 :large language model(abstract);language model(abstract)
AI总结 本文通过2025-2026年两个事件论证前沿语言模型已成为网络作战决定性工具,而非洲在模型构建、运营和获取上被完全排除,面临技能、算力和投资三重赤字,并遭受AI欺诈攻击,建议在6-12个月内通过威胁情报共享、治理采纳和伙伴关系应对。
Comments International Conference on Cybersecurity in the Era of Digital Transformation and Artificial Intelligence
PhantomSkill: 代理技能生态系统中的恶意代码注入
专题命中 领域大模型 :LLM(abstract,abstract_cn)
AI总结 提出PhantomSkill攻击框架,通过VulMask技术将恶意行为隐藏在技能的辅助资源中,利用漏洞形状的实现绕过检测,在保持良性功能的同时降低警告和恶意软件检测率。
IndustryBench-MIPU:面向工业产品的多图像属性值提取基准
机构 * Multimodal and Industrial AI Team(多模态与工业AI团队) ; Taobao&Tmall, Alibaba Group(淘宝&天猫,阿里巴巴集团)
专题命中 领域大模型 :large language model(abstract);language model(abstract)
AI总结 提出首个多图像工业产品理解基准IndustryBench-MIPU,通过结构化属性提取任务评估多模态大模型在规格表、铭牌、技术图纸上的文本识别、视觉推理、领域知识和跨图像证据整合能力,发现多图像完整性是核心瓶颈。
LabVLA:在科学实验室中落地视觉-语言-动作模型
机构 * Zhejiang University(浙江大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 领域大模型 :pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对科学实验室中机器人执行协议面临的数据和实体瓶颈,提出模拟数据引擎RoboGenesis和两阶段训练策略LabVLA,在LabUtopia基准上取得最高平均成功率。
Comments Work in progress. Project website at https://zjunlp.github.io/LabVLA/
自我感知的身体:以用户为中心的设计治疗性声音交互框架
专题命中 领域大模型 :large language model(abstract);language model(abstract)
AI总结 提出一个用于设计运动声音化治疗交互技术的框架,包括概念重构、设计平台和以用户为中心的方法,以促进临床采用。
面向搜索与推荐系统的可验证用户模拟
专题命中 领域大模型 :LLM(abstract,abstract_cn)
AI总结 提出一个七组件可审计框架,将用户模拟器视为可验证工程制品,通过动手实验检查模拟器行为、诊断差异并检测人口偏差。
Comments Presented as a half-day tutorial at SIGIR 2026, 4 pages
Journal ref In Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)
AI委托的社会后果
专题命中 领域大模型 :large language model(abstract);language model(abstract)
AI总结 研究探讨人类是否及在何种条件下将大型语言模型作为自身决策的替代品,提出将LLMs视为功能性社会行为者的研究议程。
Comments 10 pages, 1 figure
InquiTree: 在论文衍生研究树中评估科学探究循环中的AI智能体
专题命中 领域大模型 :LLM(abstract,abstract_cn)
AI总结 提出InquiTree诊断环境,将科学探究形式化为交互式研究树,揭示AI智能体在长周期交互中关键判断退化(认知隧道)及对训练数据外论文性能下降的局限性。
Comments 17 pages, 4 figures, 5 tables
EduMirror:基于价值驱动的多智能体模拟建模教育社会动态
专题命中 领域大模型 :LLM(abstract,abstract_cn)
AI总结 提出EduMirror多智能体模拟器,通过价值驱动代理和双轨测量协议,生成真实、理论一致的教育社会动态,支持假设检验和反事实干预分析。
Comments ICML 2026
Hearsay:无需图像的视觉-语言医学诊断
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Amazon Web Services AI Native(亚马逊网络服务AI原生部门)
专题命中 领域大模型 :language model(abstract,comments);分类 cs.CL、cs.AI
AI总结 该研究发现前沿视觉-语言模型在无图像时会基于人口统计学特征编造医学诊断,存在不同失败模式,提出需直接审计其结构化输出通道并将探针词敏感性作为核心评估维度。
Comments Peer-reviewed and presented at the 1st Workshop on Toward Trustworthy Vision-Language Models in the Wild (TrustVLM), co-located with ACM ICMR 2026, Amsterdam. Non-archival workshop. Reviews public on OpenReview. 5 pages, 2 figures
Foresight-England:面向COVID-19大流行期间医疗事件预测的全国规模电子健康记录生成式AI模型的开发
机构 * University College London(伦敦大学学院) ; King’s College London(伦敦国王学院) ; University College London Hospitals National Institute for Health Research Biomedical Research Centre(伦敦大学学院医院国家卫生研究院生物医学研究中心) ; Interdisciplinary Transformation University(跨学科转型大学) ; British Heart Foundation Data Science Centre(英国心脏基金会数据科学中心) ; Health Data Research UK(英国健康数据研究中心) ; The University of Edinburgh(爱丁堡大学) ; University of Cambridge(剑桥大学) ; Victor Phillip Dahdaleh Heart and Lung Research Institute, University of Cambridge(剑桥大学维克多·菲利普·达德赫心肺研究所) ; British Heart Foundation Centre of Research Excellence, University of Cambridge(剑桥大学英国心脏基金会卓越研究中心)
专题命中 领域大模型 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 本研究开发了首个全国规模的电子健康记录生成式基础模型Foresight-E,在6100万患者数据上训练,可零样本预测医疗事件,为大流行期间的医疗事件预测提供了方法模板。
Comments Methodology and evaluation framework for Foresight-England. As detailed in the Project Status section, NHS England has paused access to data for the Foresight-E project, meaning quantitative results are not currently available. On behalf of the CVD-COVID-UK/COVID-IMPACT Consortium
基于上下文词级语义图表示的领域无关神经主题模型
机构 * TelePIX AI Center(TelePIX人工智能中心) ; Samsung Electronics(三星电子) ; School of Computing & Frontier AI Research Centre Macquarie University(麦考瑞大学计算与前沿人工智能研究中心)
专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.LG
AI总结 该研究提出领域无关框架DARTopic,通过构建词级语义图并联合训练GNN编码器与主题推理模块,在多领域基准测试中优于基线且效率更优。
EndoVLM:一种通过解剖学引导的稀疏性与渐进式对齐实现的内窥镜视觉-语言预训练模型
机构 * DAMO Academy, Alibaba Group(阿里巴巴达摩院) ; The First Affiliated Hospital of Zhejiang Chinese Medical University(浙江中医药大学附属第一医院) ; Shanghai Jiao Tong University(上海交通大学) ; Hupan Lab(湖畔实验室) ; Zhejiang University(浙江大学)
专题命中 领域大模型 :foundation model(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出了EndoVLM这一内窥镜视觉-语言预训练模型,通过解剖学引导的稀疏池化、渐进式语义感知对齐等技术,在34.8万例内窥镜检查数据上预训练,其性能优于现有基础模型且具备零样本泛化能力。
Patients-like-me:用于可解释临床预测的变分LM-GNN框架
机构 * McGill University(麦吉尔大学) ; Université de Montréal(蒙特利尔大学) ; Georgia State University(佐治亚州立大学) ; Ohio University(俄亥俄大学)
专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出Patients-like-me(PLM)这一LM-GNN统一框架,结合局部患者语义与全局队列结构,在MIMIC-III、MIMIC-IV上优于现有方法,可提供可解释的参考患者归因,且计算开销适度。
知晓形式,而非功能:自动审计法律基准中答案与权威的脱钩问题
机构 * Ministry of Justice, Taiwan(台湾法务部)
专题命中 领域大模型 :prompting(abstract);分类 cs.CL、cs.AI
AI总结 本文针对法律基准中答案与权威脱钩问题,联合审计四款LLMs在台湾律师考试题上的表现,发现答案与引用行为可独立变化,提出答案与权威联合评估的方法。
Comments 9 pages, 11 tables
十六种模型,不足两种声音:在无唯一正确答案的场景中测量集成模型的离散度
专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对无唯一正确答案的心理治疗案例,以十六种语言模型为对象,定义模型异议贡献,发现集成模型离散度由临床内容组织,模型身份为异议的可检测结构因素。
Comments 34 pages (25 article + 9 supplementary), 3 figures. Supplementary material (S1-S11) included. Preregistered at OSF (osf.io/c5qk7), sealed 21 July 2026. Analysis code and data: https://doi.org/10.5281/zenodo.21718657
实践中的提示词链:学术报告自动生成的案例研究
专题命中 领域大模型 :prompting(abstract);分类 cs.CL、cs.AI
AI总结 本文针对学术报告自动生成任务,提出多阶段提示词链方法,在教育领域实验中,该方法成功率100%、ROUGE-L F1达0.507,优于单次提示基线,可降低生成失败与不一致风险。
Comments This is the version of the article accepted for publication in SUMMA 2025 after peer review. The final, published version is available at IEEE Xplore: https://doi.org/10.1109/SUMMA68668.2025.11302303
Journal ref 2025 7th International Conference on Control Systems, Mathematical Modeling, Automation and Energy Efficiency (SUMMA), Lipetsk, Russian Federation, 2025, pp. 704-710
MODUS:仅解码器的多模态任意到任意建模
专题命中 领域大模型 :language model(abstract);分类 cs.AI、cs.LG
AI总结 研究任意到任意多模态建模,提出仅解码器的对称多模态建模方法Modus,无需特定模态组件,支持多种应用,在各基准测试中用单模型展现强大性能且与基线竞争,材料开源。
Comments Accepted at ICML 2026. Project page: https://modus-multimodal.epfl.ch
关于大语言模型在专业术语方面的应用:语料库的良好替代品?
专题命中 领域大模型 :prompting(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨大语言模型在专业翻译中找英语到法语对应词的作用,评估四个模型在两个领域的表现,比较两种提示策略,发现模型等存在差异,大语言模型对专业译者有用但不能取代语料库,为后续研究铺了路。
Journal ref 26th Annual Conference of the European Association for Machine Translation, Jun 2026, Tilburg, Netherlands
用基于树图解析支持的加权班扎夫交互解释生物医学CLIP
机构 * University of Warsaw(华沙大学) ; Centre for Credible AI, Warsaw University of Technology(华沙理工大学可信人工智能中心)
专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.AI
AI总结 研究针对视觉语言模型在医学任务中解释难的问题,引入ParseFIxLIP方法,将树图解析融入班扎夫交互博弈,通过smart_depth分组策略减轻概念碎片化,提升跨模态交互可解释性,为VLM决策提供医学领域相关见解。
Comments 12 pages, 13 figures. Accepted at EXPLIMED 2026 (Third Workshop on Explainable Artificial Intelligence for the medical domain), IJCAI-ECAI 2026
结构跨越尺度:用于检索增强生成的模式约束因果图
机构 * Boston Consulting Group(波士顿咨询集团)
专题命中 领域大模型 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 研究针对GraphRAG问题,提出HCG-RAG,用模式约束因果图取代开放式提取,构建紧凑两层图。该方法成本低,答案质量优,在医学等基准测试中表现出色,对比实验显示因果图作为检索过滤器有优势,表明图内容比节点数量更重要。
Comments 26 pages, 6 figures
知识注入存在于混合专家模型中吗?探索混合专家模型中基于专家感知的对比解码以减轻大语言模型的幻觉
机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院)
专题命中 领域大模型 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 研究探索混合专家模型中基于专家感知的对比解码以减轻大语言模型幻觉问题。提出EAACD方法,利用MoE高层专家差异,将专家分组对比校准预测,放大低可靠性专家幻觉提供负面参考,在四个数据集上优于所有基线。
Comments Accepted by ACL2
ToolSciVer:基于视觉工具增强强化学习的多模态科学声明验证
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; University of Waterloo(滑铁卢大学)
专题命中 领域大模型 :prompting(abstract);分类 cs.CL、cs.AI
AI总结 研究多模态科学声明验证问题,提出ToolSciVer框架,为视觉语言模型配备三种类型感知视觉工具,用组相对策略优化训练策略,实验证明该方法在多模型上性能优于竞争基线。
CoWeaver:用于混合人机科学协作的双向、可学习且可解释的匹配引擎
专题命中 领域大模型 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 研究针对基于大语言模型的智能体在科学协作中存在的问题,提出CoWeaver算法,通过填补能力差距匹配人员,经两阶段排名筛选,结合探索与贪婪策略,在匹配质量和效率上优于基线,能促进人机科学协作。
多域检索的认证域一致性:具有共形风险保证的无标签逐域污染控制
机构 * Electric Power Research Institute (EPRI)(电力研究协会)
专题命中 领域大模型 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 针对多域检索中错误域证据及污染控制问题,提出C3R控制层。基于风险控制预测集构建双分割方案,认证污染预算。通过实验验证其稳定性及有效性,能减少错误权威基础,且与冻结堆栈和重排器无关。
Comments Submitted to ACM TOI
用于动态系统零样本重建的最小可解释架构
机构 * Central Institute of Mental Health, Mannheim, Germany(德国曼海姆中央精神卫生研究所) ; Interdisciplinary Center for Scientific Computing (IWR), Heidelberg, Germany(德国海德堡跨学科科学计算中心 (IWR)) ; Faculty of Physics and Astronomy, Heidelberg University, Heidelberg, Germany(德国海德堡大学物理与天文学系)
专题命中 领域大模型 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 研究针对动态系统零样本重建基础模型缺乏预测机制洞察的问题,将DynaMix简化为DynaBase,其通过简单线性混合预测,参数负载低,表现出色,还得出映射族及不同训练策略效果,揭示最小机制并协调文献观察。
异构医学视觉问答持续学习的实证分析
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Alexandria University(亚历山大大学)
专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.AI
AI总结 研究异构医学视觉问答持续学习,通过系统评估多种临床目标任务,探究现有CL方法减轻灾难性遗忘能力、对任务排序敏感性及低秩适应参数演变,发现交错不同任务时现有方法难维持稳定性 - 可塑性平衡。