EvoRec: Self Evolving Agentic Recommender Systems
EvoRec: 自我进化的智能推荐系统
专题命中 领域大模型 :LLM(abstract,abstract_cn)
AI总结 提出EvoRec多智能体框架,通过研究智能体和代码智能体迭代模型,技能进化器从历史经验中提炼可复用方法,实现推荐模型与优化方法共同进化,在离线指标上提升高达5.54%,在线A/B测试带来1.85%收入增长和1.02%点击率提升。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
EvoRec: 自我进化的智能推荐系统
专题命中 领域大模型 :LLM(abstract,abstract_cn)
AI总结 提出EvoRec多智能体框架,通过研究智能体和代码智能体迭代模型,技能进化器从历史经验中提炼可复用方法,实现推荐模型与优化方法共同进化,在离线指标上提升高达5.54%,在线A/B测试带来1.85%收入增长和1.02%点击率提升。
VulKey:基于领域特定修复模式的自动漏洞修复
专题命中 领域大模型 :LLM(abstract,abstract_cn)
AI总结 VulKey通过层级化抽象专家知识指导补丁生成,实现更高泛化性和语义丰富性,其在PrimeVul数据集上达到31.5%的修复准确率,超越现有方法。
Comments Accepted by FSE 26
GUICrafter: 利用海量无标注截图的弱监督GUI智能体
机构 * Tsinghua University(清华大学) ; Tencent Hunyuan(腾讯文脉)
专题命中 领域大模型 :foundation model(abstract);分类 cs.CL、cs.AI
AI总结 提出GUICrafter,一种利用海量无标注截图通过课程学习框架训练GUI智能体的弱监督方法,显著降低对人工标注的依赖,在极少量标注数据下性能超越UI-TARS等先进系统。
基于证据的文本条件3D CT合成用于卵巢癌
机构 * AIRLab, Politecnico di Milano(米兰理工学院AIR实验室) ; Politecnico di Milano(米兰理工学院) ; NEARLab, Politecnico di Milano(米兰理工学院NEAR实验室) ; Istituto Europeo di Oncologia(欧洲肿瘤研究所) ; Università degli Studi dell’Insubria(意大利北部大学) ; Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)
专题命中 领域大模型 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 提出OvESyn框架,利用CT衍生描述符和临床元数据构建标准文本,无需原始放射学报告,通过潜在扩散模型生成腹部盆腔3D CT,首次实现文本条件合成在卵巢癌中的应用。
CaresAI at CT-DEB26: 使用领域特定Transformer嵌入和分类模型检测临床试验中的剂量错误
专题命中 领域大模型 :language model(abstract);分类 cs.CL
AI总结 本研究利用基于生物医学语料训练的Transformer模型(如BioBERT)编码临床试验文本,结合结构化元数据,通过机器学习模型检测剂量错误,最高ROC-AUC达0.853。
Comments 18 pages, published in CL4Health 2026 proceedings (3rd Workshop on Patient-oriented language processing) @ LREC 2026 http://lrec-conf.org/proceedings/lrec2026/workshops/cl4health/2026.cl4health-1.0.pdf
Journal ref Proceedings of the Third Workshop on Patient-Oriented Language Processing, CL4Health 2026, 12 May 2026
揭示自然语言处理的技术发展:一种以科学实体为中心的视角
机构 * Department of Information Management, Nanjing University of Science and Technology(南京理工大学信息管理学院) ; Department of Management Science and Engineering, School of Management, Anhui University(安徽大学管理科学与工程学院)
专题命中 领域大模型 :language model(abstract);分类 cs.CL
AI总结 本文从实体视角分析NLP技术发展,通过提取方法、数据集等实体并计算z-score,发现预训练语言模型成为主流,新技术的接受速度加快。
Journal ref IPM, 2024
现代BERT模型的法律领域自适应
机构 * Princeton University(普林斯顿大学) ; Princeton, New Jersey, USA(新泽西州普林斯顿, 美国)
专题命中 领域大模型 :language model(abstract);分类 cs.CL
AI总结 研究现代BERT模型在法律领域的领域自适应,通过在美国法院意见上进一步预训练ModernBERT,显著提升其性能,并支持长序列处理。
Comments To appear in Proceedings of the 21st International Conference on Artificial Intelligence and Law (ICAIL 2026), June 9-12, 2026, Singapore
通过反事实视觉基础不确定性检测LVLM中的临床幻觉
机构 * School of Intelligent Science and Technology, Nanjing University(南京大学智能科学与技术学院) ; National Institute of Healthcare Data Science at Nanjing University(南京大学医疗数据科学国家研究院) ; School of Biomedical Engineering, Nanjing University(南京大学生物医学工程学院)
专题命中 领域大模型 :language model(abstract);分类 cs.CL
AI总结 提出一种基于反事实视觉基础不确定性的框架,通过提取实体并对比正反事实定位结果计算不确定性分数,无需修改模型即可检测LVLM在临床图像中的幻觉。
Comments 10 pages, 4 figures
SafeGEO:理解推荐代理中的生成引擎优化风险
机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) ; Department of Mechanical & Industrial Engineering, University of Toronto(多伦多大学机械与工业工程系) ; Faculty of Information, University of Toronto(多伦多大学信息学院) ; University of California, San Diego(圣地亚哥大学) ; ZBot Technology(ZBot技术) ; Coolwei AI Lab(Coolwei人工智能实验室)
专题命中 领域大模型 :prompting(abstract);分类 cs.AI
AI总结 研究GEO攻击如何使推荐代理推广有缺陷产品,提出SafeGEO评估套件,发现攻击使缺陷产品入选率提升83.2%,简单防御可降低39.2%但无法完全消除风险。
Comments 41 pages,23 figures
如我们可能搜索
专题命中 领域大模型 :language model(abstract)
AI总结 针对个人文档等敏感信息搜索中的隐私问题,提出本地优先信息检索(local-first IR)设计理念,通过将索引、模型和推理置于用户设备上,在消费级硬件上实现与云端相当的性能,并指出真正的权衡在于搜索范围而非质量。
Journal ref Proceedings of the 2026 International ACM SIGIR Conference on Innovative Concepts and Theories in Information Retrieval (ICTIR'26), July 25, 2026, Melbourne, VIC, Australia
足够好吗?对大规模医学数据集标签质量影响的调查
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; HIDSS4Health - Helmholtz Information and Data Science School for Health(HIDSS4Health - 亥姆霍兹信息与数据科学健康学院) ; Diagnostic and Interventional Radiology, Heidelberg University Hospital(海德堡大学医院诊断与介入放射科) ; Institute for AI in Medicine, University Hospital Essen(埃森大学医院医学人工智能研究所)
专题命中 领域大模型 :pretraining(abstract)
AI总结 研究探讨标签质量对医学图像分割模型性能的影响,发现预训练阶段无需严格标签质量,建议将专家资源投入下游任务数据集。
Comments Accepted to MICCAI 2026
多轮LLM对话中吸引子状态的出现
机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; ELLIS Institute Tübingen(图宾根ELLIS研究所) ; Tübingen AI Center(图宾根人工智能中心)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 研究多轮LLM对话中是否出现吸引子行为,通过自对弈和混合对弈辩论发现模型特定的吸引子不对称地影响对话伙伴的风格和立场。
AURORA:用于大型语言模型中鲁棒幻觉检测的不对称性与更新诱导旋转
机构 * School of Artificial Intelligence, Beihang University, China(北京航空航天大学人工智能学院) ; Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University, China(北京航空航天大学未来区块链与隐私计算先进创新中心)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL
AI总结 提出AURORA框架,利用权重梯度动态(不对称性和旋转比)检测LLM幻觉,跨模型和数据集表现鲁棒。
5ting在SemEval-2026任务8中:基于LLM重排序和忠实性控制的强端到端多轮RAG
机构 * University of Information Technology, Ho Chi Minh City, Vietnam(信息技术大学,胡志明市,越南) ; Vietnam National University Ho Chi Minh City, Ho Chi Minh City, Vietnam(越南胡志明市国家大学,胡志明市,越南)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 提出5ting系统,结合BGE-M3稠密检索、FAISS索引、双查询合并检索和LLM重排序,通过角色分离生成约束于检索证据,解决多轮RAG中的上下文漂移和幻觉问题。
基于LLM探针的主要ICD类别预测
机构 * Department of Statistics, Pennsylvania State University(宾夕法尼亚州立大学统计学系) ; Department of Biostatistics, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校生物统计学系) ; Department of Statistics and Operations Research, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校统计学与运筹学系)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究利用冻结的医学大语言模型表示作为共享嵌入空间,通过线性探针融合结构化变量和临床叙述,实现多模态主要诊断类别预测,在MIMIC-IV上达到87.69%的严格准确率。
Comments 9 pages, 2 figures. Supplementary materials provided as an ancillary file
压缩感知在大语言模型能力定位中的应用
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
AI总结 研究通过压缩感知方法识别大语言模型中特定能力依赖的稀疏注意力头,发现关闭少量头可显著降低特定能力表现,揭示了模型模块化组织原则。
LLM如何引用?检索增强生成中归因的机制解释
机构 * University of Amsterdam(阿姆斯特丹大学)
专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 通过激活修补方法,发现LLM的引用机制并非单一组件,而是由注意力头和MLP层组成的分布式“归因集成”,调控这些组件可修复大部分错误引用。
Comments This preprint has not undergone peer review or any post-submission improvements or corrections. The Version of Record of this contribution is published in Advances in Information Retrieval, ECIR 2026, Lecture Notes in Computer Science, vol. 16485, pp. 458-473, and is available online at https://doi.org/10.1007/978-3-032-21324-2_35
Journal ref Advances in Information Retrieval, ECIR 2026. Lecture Notes in Computer Science, vol. 16485, pp. 458-473. Springer, Cham (2026)
面向大语言模型的推理时保形推理与有效事实性控制
机构 * Machine Learning, ICML(机器学习,国际机器学习大会)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 提出推理时保形推理框架,将保形预测集成到推理图生成中,通过图级不确定性校准生成停止阈值,实现有效事实性控制。
Comments Accepted at ICML 2026
LLM中的报告置信度追踪承诺而非正确性
机构 * Google DeepMind(谷歌DeepMind)
专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本研究通过两阶段弃权范式,发现LLM的言语置信度预测弃权决策远优于预测答案正确性,而令牌对数概率则相反,表明言语置信度是内部承诺准备状态的行为输出。
稀疏自编码器是LLM劫持攻击缓解器
专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文提出基于SAE的CC-Delta方法,通过比较带有和无劫持上下文的有害请求的token级表示,识别劫持相关的稀疏特征,从而在稀疏SAE特征空间中实现更优的安全-效用权衡。
Comments Accepted at the Mechanistic Interpretability Workshop, ICML 2026. 31 pages, 20 figures, 7 tables
一场景,两深度:探究单目基础模型中的几何歧义性
机构 * University of Michigan(密歇根大学) ; Carnegie Mellon University(卡内基梅隆大学) ; New York University(纽约大学) ; Vanderbilt University(范德比大学)
专题命中 知识编辑与模型理解 :foundation model(title,abstract);prompting(abstract);分类 cs.AI
AI总结 本文提出稀疏双层序数基准MD-3k,用于测量单目深度基础模型的深度层偏好和多层空间关系准确性,发现不同模型对同一分层几何结构有不同解析,且拉普拉斯视觉提示可改变冻结模型的输出层。
Comments 49 pages, 25 figures; Accepted by European Conference on Computer Vision (ECCV) 2026
模糊性下的不确定性感知生成与决策
机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, Technical University of Darmstadt(普遍知识处理实验室(UKP实验室),计算机科学系,达姆施塔特技术大学) ; National Research Center for Applied Cybersecurity ATHENE, Germany(应用网络安全国家研究中心ATHENE,德国)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 基于贝叶斯决策理论和风险规避决策,提出不确定性感知算法用于辅导和同行评审任务,通过共形预测提供策略和分数的保证,实验表明贝叶斯方法优于风险规避规则。
Comments Code available under https://github.com/UKPLab/arXiv2026-uncertainty-aware
对齐路由:在语言模型中本地化、扩展和控制策略电路
机构 * Independent Researcher(独立研究者)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过本地化策略路由机制,探讨在语言模型中扩展和控制策略电路的方法,发现路由机制在安全性和性能上的关键作用。
Comments Code and data: https://github.com/gregfrank/how-alignment-routes. Accepted at the Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning (ICML), 2026
MOSAIC: 通过层次语义对齐编排协作知识追踪
机构 * Columbia University(哥伦比亚大学) ; University of California, Berkeley(加州大学伯克利分校) ; School of Information Systems and Management, Carnegie Mellon University(信息系统与管理学院,卡内基梅隆大学) ; Department of Mathematics, University of Southern California(数学系,南加州大学) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Computer Science Department, UC San Diego(计算机科学系,UCSD)
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);分类 cs.LG
AI总结 提出MOSAIC框架,利用冻结LLM生成动态嵌入和层次预测提示,结合跨粒度一致性目标,在协作知识追踪中实现多粒度掌握估计,在多个数据集上取得SOTA。
LLMs人格的机械论分析:通过潜在特征干预引导人格
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出一种机械可解释性方法,通过稀疏自编码器和对比激活分析识别残差流中的潜在方向,并施加加法干预向量来增强目标OCEAN人格特质,同时保持语言建模性能。
Comments Written in 2024; submitted to arXiv 2026
Transformer训练动态的机制研究
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)
AI总结 本文通过可控实验研究Transformer训练动态,发现梯度下降可实现聚类头解决稀疏模块加法任务,并揭示训练过程中两阶段学习及归一化层高曲率导致的损失尖峰现象。
Comments Accepted at ICML 2026 Mechanistic Interpretability workshop
SOTAlign:通过最优传输实现半监督的单模态视觉与语言模型对齐
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出SOTAlign框架,通过少量配对数据和大量未配对数据实现视觉与语言模型的半监督对齐,利用最优传输理论提升对齐效果,优于传统监督和半监督方法。
Comments ICML 2026
关于奇异三元组幺半群及其虚拟扩展的结构
专题命中 知识编辑与模型理解 :SLM(summary_cn,abstract)
AI总结 本文引入与n股三元组群L_n相关的奇异三元组幺半群SLM_n及其虚拟扩展VSLM_n,通过生成元和关系定义,并开发了k-局部型和Φ-型两种表示扩展方法,证明所有2-局部表示均可扩展,并应用于具体表示μ。
不确定性下的自适应AI授权:序贯决策权限的贝叶斯治理策略
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 针对组织在不确定性下动态分配AI决策权限的问题,提出基于贝叶斯推断的治理感知POMDP框架,通过序贯优化实现自适应授权,实验表明该方法在异构AI质量场景下优于五种基准策略。
Comments 48 manuscript pages, 17 figures, and 10 tables
检索增强生成中的证据图一致性:基于模型的幻觉检测分析
机构 * University of Montana(蒙大拿大学)
专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出证据图一致性(EGC)框架,通过构建局部证据图并计算五种结构一致性指标检测幻觉,发现不同模型族间一致性特征方向相反,表明嵌入图一致性不能作为模型无关的检测信号。
Comments Accepted at the International Conference on Advanced Machine Learning and Data Science; to appear in the IEEE Xplore proceedings