MINT: A Universal Zero-Shot Predictor for Transaction Data
MINT:一种用于交易数据的通用零样本预测器
机构 * Visa Inc.(维萨公司)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 该研究提出通用零样本预测框架MINT,通过轻量级嵌入注入等技术连接交易序列编码器与LLM,在交易预测问答任务中性能领先且资源消耗更低,证实紧凑交易嵌入更具优势。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
MINT:一种用于交易数据的通用零样本预测器
机构 * Visa Inc.(维萨公司)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 该研究提出通用零样本预测框架MINT,通过轻量级嵌入注入等技术连接交易序列编码器与LLM,在交易预测问答任务中性能领先且资源消耗更低,证实紧凑交易嵌入更具优势。
联邦提示学习:统一框架、实证分析与未来方向
机构 * Cyberspace Institute of Advanced Technology, Guangzhou University(广州大学先进技术网络空间研究院) ; Huangpu Research School of Guangzhou University(广州大学黄埔研究院) ; Iwate Biotechnology Research Center(岩手生物技术研究中心) ; Nanjing University of Posts and Telecommunications(南京邮电大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文为联邦提示学习(FPL)的全面综述,明确其与传统联邦学习及全模型联邦微调的差异,分析其多维度权衡与现存挑战,梳理全生命周期方法及防御机制,为该领域研究提供方向。
ARC:开放式真实世界交互中的公平相对优势比较
机构 * Ant International(蚂蚁国际)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对开放式真实世界交互中基于组的RL轨迹行为不可比导致的奖励公平问题,提出ARC训练方案,结合\textit{inter}范式与\textit{inter-86K}语料库,提升工具使用基准并缩短首次token时间。
通过激活引导剪枝实现跨模型规模的无训练知识迁移
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出激活剪枝融合框架APM,通过激活引导选择源模型的显著组件并注入目标模型,无需训练和显式语义对齐,在16个基准上将3B目标模型平均准确率从55.5%提升至60.6%。
Comments 9 pages, 3 figures, and 7 tables
从预测到干预:基于大语言模型智能体的个性化餐级血糖调节
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 针对精准营养中个性化血糖调节的挑战,提出融合生理学习与LLM智能体的系统,通过生理感知预测器和预测驱动优化智能体提升血糖预测准确率并降低血糖波动。
Comments Accepted in ACL 2026 Findings, 17 pages, 4 figures
Journal ref Findings of the Association for Computational Linguistics ACL 2026, pages 21629 to 21645
Intern-S2-Preview:科学智能体基础模型
机构 * Shanghai AI Laboratory(上海人工智能实验室)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本研究提出Intern-S2-Preview系列科学智能体基础模型,通过多阶段训练与架构优化,在多类基准上取得领先结果,相关模块可提升科学任务表现且无需修改主干模型。
Comments 35 pages, 12 figures
宪法性在策略安全蒸馏
机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究院) ; Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学) ; City University of Hong Kong(香港城市大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 针对在策略自蒸馏在安全对齐中因宪法条件导致教师分布收缩、表达能力下降的问题,提出宪法性在策略安全蒸馏(COPSD),通过交叉SFT冷启动校准教师分布,再进行宪法条件在策略蒸馏,在12个基准上实现了更优的安全-有用性权衡并降低安全税。
类人工作记忆干扰在大语言模型中
机构 * School of Psychological and Brain Sciences, Georgia Tech(佐治亚理工学院心理与脑科学学院) ; Department of Psychology, New York University(纽约大学心理学系) ; Department of Cognitive Science, Indiana University Bloomington(印第安纳大学布卢明顿分校认知科学系) ; Honda Research Institute(本田研究所) ; Center of Excellence for Computational Cognition, Georgia Tech(佐治亚理工学院计算认知卓越中心) ; Departments of Neuroscience and Psychology, The University of Texas at Austin(德克萨斯大学奥斯汀分校神经科学和心理学系)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究发现大语言模型在工作记忆任务中存在干扰限制,其表现与人类相似,且通过抑制无关信息实现有效记忆检索。
Comments Published as a conference paper at COLM 2026
Unicode文本水印方法对抗大语言模型的安全性与可检测性分析
机构 * Fraunhofer ISST(弗劳恩霍夫研究所)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文分析了Unicode文本水印方法在大语言模型下的安全性和可检测性,发现最新模型能检测水印但无法提取。
Comments Author's version of a paper, accepted and presented at the ICISSP 2026 conference
大语言模型中的社会意义:结构、规模与语用提示
机构 * Leibniz-Centre General Linguistics, Berlin, Germany(莱布尼茨普通语言学中心,柏林,德国)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文研究大语言模型在社会意义上的表现,提出两种校准指标并探讨语用理论指导的提示策略对模型校准的影响,发现提示策略能有效减少模型在规模校准上的偏差。
Journal ref Proceedings of the 15th Workshop on Cognitive Modeling and Computational Linguistics (CMCL) @ LREC 2026, pages 162-171
InSight-doc:面向长文档理解的智能体视觉感知框架
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Huawei(华为)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本研究提出智能体视觉感知框架InSight-doc,通过自适应选择放大高分辨率区域处理长文档,经SFT+RL训练后在文档VQA任务中显著提升准确率、降低幻觉与推理延迟,相关资源已公开。
检测到效应不等同于学习基于该效应行动:LLM获取智能体的奖励信噪比下限
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 该研究指出检测信号平均效应与学习基于该效应行动存在差异,提出奖励信噪比下限,引入SHE模型,在三个推荐数据集上发现学习获取策略失效,因数据集SNR低于下限。
利用大语言模型进行预测:通过特征引导改进泛化能力
机构 * University of Chicago(芝加哥大学) ; University of Chicago, Illinois, United States(芝加哥大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文利用稀疏自编码器分析LLM内部状态,识别时间感知和前瞻偏差特征,并通过增强时间感知特征减少预测中的前瞻偏差,提升泛化能力。
大型语言模型是否受益于自身话语?
机构 * Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电子工程与计算机科学系) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) ; IBM Research(IBM研究院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究发现,省略大型语言模型自身历史上下文可提高响应质量并减少内存消耗。
面向专家级的实时视频问诊医疗AI
机构 * Google Research(谷歌研究院) ; Google DeepMind(谷歌DeepMind)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究开发了基于Gemini的多智能体系统AMIE(视频版),在随机OSCE研究中其临床问诊表现与初级保健医生相当或更优,为专家级实时视频问诊医疗AI的发展奠定了重要基础。
TEMPER:用于表达性残差路由的张量化高效流形约束参数化
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 该研究针对残差路由方法参数随流增长过快的问题,提出TEMPER方法,用张量网络参数化生成器,在语言建模等任务上性能相当或更优,参数效率显著提升。
基于多层组合融合的上下文价值对齐
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出MCF-CVA框架,通过多层组合融合及EAR算法,结合多道德智能体的认知多样性缓解冲突冗余,在标准指标上优于单智能体等基线,提升LLM的上下文价值对齐能力。
Comments 12 pages, 5 figures, 5 tables
多模态大语言模型的演进安全态势:新兴威胁与防护措施综述
机构 * University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; NVIDIA(英伟达公司) ; Penn State University(宾夕法尼亚州立大学) ; Columbia University(哥伦比亚大学) ; University of Missouri-Kansas City(密苏里大学堪萨斯分校) ; Florida State University(佛罗里达州立大学) ; Auburn University(奥本大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本综述针对多模态大语言模型(MLLMs)的新型安全威胁,提出多模态安全威胁分类法,梳理安全策略进展,探讨未来安全机制的研究方向。
Comments Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI
了解你就是一切:LLM智能体在社交媒体模拟中实现近乎完美的个人资料一致反应预测
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本研究通过基准测试12种LLM配置,发现其在社交媒体反应预测中表现优异,可用于推荐系统压力测试,同时也揭示了大规模合成智能体群对公众意见的潜在威胁。
Comments 28 pages, 6 figures
通过溯源分析保护LLM智能体免受失调影响
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出基于溯源分析的ProvenanceGuard框架,通过多阶段流水线检测工具调用前的三种失调类型,在Agent-SafetyBench和WorkBench上显著降低失调错误率并减少不必要的干预。
通过局部化架构增强AI可解释性与安全性
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 针对大型生成式AI模型可解释性差、计算成本高的问题,提出局部化机器学习架构,通过降低带宽、提高节点表达能力来提升可解释性和效率,并评估了多种硬件实现方案的适用性。
不只是RLHF:为何仅对齐不足以解决多智能体趋同
机构 * California Institute of Technology(加州理工学院) ; Evergreen Valley College(艾弗绿谷学院)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了多智能体系统在模拟同伴分歧下的错误率问题,发现预训练基础模型与指令模型存在相似的替换模式,且错误率较高。通过激活修补发现错误集中在中间层,修复后可恢复大部分正确率差距。研究还指出压力抑制了清洁推理特征,而非激活新的趋同回路。
Routesplain:面向软件相关任务的可信赖且可干预的路由方法
机构 * Columbia University(哥伦比亚大学) ; Oracle AI
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 Routesplain是首个面向软件相关任务的LLM路由工具,通过提取可解释概念路由,在8项软件任务上的16种LLM中,其性能优于单个模型且不逊于黑盒基线,可提升响应质量并降低成本。
Comments Accepted to COLM 2026
ToolUniverse:一个让AI科学家开发民主化的开放平台
机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) ; Harvard College, Harvard University(哈佛大学哈佛学院) ; Massachusetts Institute of Technology(麻省理工学院) ; MIT Lincoln Laboratory(MIT林肯实验室) ; Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院) ; Broad Institute of MIT and Harvard(MIT与哈佛联合广谱研究所) ; Harvard Data Science Initiative(哈佛数据科学计划)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 ToolUniverse是支持从各类模型构建AI科学家的开放平台,通过AI-工具交互标准规范工具调用,已应用于大量科学工具,案例中可完成多领域端到端分析。
Comments https://aiscientist.tools
Transformer电路可实现聚类算法
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究表明Transformer电路可实现Lloyd算法等精确聚类算法,提出的k均值Transformer聚类算法泛化性强且质量优于Lloyd算法,改动后可衍生多种新型聚类算法。
通过意图意识提升带有属性的长形式问答
机构 * Allen Institute for AI(艾伦人工智能研究所) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Washington(华盛顿大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出通过增强模型意图意识来提升长报告生成质量,通过结构化标签方案提取隐含意图,改进零样本生成能力并生成高质量合成数据,实验显示在科学报告生成任务中模型性能平均提升2.9和12.3个百分点。
Comments 39 pages, 7 figures
Journal ref ICLR 2026
SFT冲突,RL共存:大语言模型多任务学习的理论与实证分析
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 该研究针对大语言模型多任务学习,通过理论与实证分析揭示SFT存在任务冲突而RL可稳定共存的机制,进而提出Parallel-RL范式以解耦多任务训练,提升效率与灵活性。
Comments Code: https://github.com/GaryStack/Parallel-RL
面向INT2 KV缓存量化的输出感知旋转
机构 * University of Southern California(南加州大学) ; Seoul National University(首尔大学) ; Inha University(仁荷大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 针对长上下文大模型KV缓存的INT2量化瓶颈,提出OptR输出感知旋转方法,通过分解误差、学习正交修正等,提升QuaRot等性能并增强长上下文检索能力,且开销可忽略。
SafeCommit:验证基于记忆的智能体何时可以安全行动
机构 * Florida International University(佛罗里达国际大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对长程智能体过早承诺的问题,提出SafeCommit风险控制层,通过构建合理潜在世界、共形动作证书等实现安全行动决策,还展示了安全-效用权衡。
Comments 14 pages, 6 tables, and 1 figure, target NeurIPS
注意力对字母大小写敏感
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 该研究发现LLMs和VLMs存在大小写效应,即文本中目标信息采用特定大小写格式会调节注意力分配,但该效应不一定提升任务准确率,推理模型的思考阶段可缓解此效应,且该效应可部分迁移至VLMs。
Comments Accepted at ECCV 2026