A Three-Phase Foundation Model for Tax-Aware Personalized Portfolio Management
面向税务感知的个性化投资组合管理的三阶段基础模型
专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI
AI总结 提出三阶段深度强化学习系统,通过自监督跨资产编码器、MoE策略网络和LoRA个性化层,解决金融RL中标的锁定、单目标优化和静态用户模型三大局限。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
面向税务感知的个性化投资组合管理的三阶段基础模型
专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI
AI总结 提出三阶段深度强化学习系统,通过自监督跨资产编码器、MoE策略网络和LoRA个性化层,解决金融RL中标的锁定、单目标优化和静态用户模型三大局限。
受扰动越狱提示的几何配置
专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 研究Qwen和Llama系列小权重模型中受扰动越狱输入的内部表示,选两个表示空间,在拒绝主导答案集中两空间均无行为超平面,仅特定模型的个别token与合规答案有关联。
Comments 21 pages, 9 figures, 7 tables, 2nd Workshop on Safe AI (SafeAI)
鲁棒评论家:防御大语言模型免受多轮攻击
专题命中 指令微调 :LLM(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对大语言模型在多轮攻击下的安全问题,提出对话评论家引导采样(DCGS)框架,通过推断用户意图、建模为马尔可夫决策过程并学习价值和遗憾评论家来生成回复,在多个数据集上评估优于基线和前沿模型,还能迁移提升模型鲁棒性。
S-Agent:空间工具使用激发空间智能推理
机构 * NTU(南洋理工大学) ; THU(清华大学) ; ByteDance(字节跳动) ; NWPU(西北工业大学)
专题命中 指令微调 :SFT(abstract,abstract_cn)
AI总结 提出S-Agent空间工具使用智能体范式,通过时空证据积累和层次化工具集,将VLM作为语义规划器,实现连续多视图图像和视频的空间推理,在无训练下提升开源和闭源VLM性能,并基于S-300K轨迹微调得到紧凑空间智能体S-Agent-8B。
Comments Project Page : https://Ropedia.github.io/S-Agent
具有隐式和显式几何的3D感知视觉语言模型
机构 * Nanyang Technological University(南洋理工大学) ; DAMO Academy, Alibaba Group(阿里巴巴达摩院) ; HuPan Lab(湖畔实验室)
专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG
AI总结 研究针对多数2D视觉输入的VLM处理3D任务困难的问题,提出VLM-IE3D框架,通过引入隐式和显式几何令牌及3D感知适配器,融合几何表示与视觉线索,在多种3D任务中表现优异。
Comments Accepted by ECCV 2026, Open Sourced
Instruct-FD:你的全双工语音系统能遵循轮流发言指令吗?
机构 * Boson AI(玻色子人工智能公司)
专题命中 指令微调 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 研究全双工语音系统在明确指令下的轮流发言行为,引入Instruct-FD基准,开发相关工具,通过对六个先进系统测试发现遵循指令的轮流管理有差距,为构建适应性全双工对话系统指明关键方向。
新兴的不一致性招募了预先存在的角色子空间
机构 * Qwen Team(通义团队)
专题命中 指令微调 :language model(abstract);分类 cs.LG
AI总结 研究新兴不一致现象,通过从冻结模型提取角色子空间发现其在微调前就存在,微调第一步提升不一致幅度,投影子空间可防广泛不一致,注入子空间会致模型不一致,多种编辑无效,传播不良数据增加不一致。
Comments 108 pages (19 pages main text, 13 appendices), 13 figures
面向数据异构性下的隐私保护联邦提示调优:一种子空间分解专家方法
机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; Center for the Applied Statistics, School of Statistics, Renmin University of China(中国人民大学统计学院应用统计中心) ; School of Computer Science & Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) ; School of Software, Beihang University(北京航空航天大学软件学院) ; School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)
专题命中 指令微调 :language model(abstract)
AI总结 研究针对数据异构性下的隐私保护联邦提示调优问题,提出FedSEPT方法,采用子空间分解专家建模及实例感知专家融合技术,在11个异构基准实验中,于相同隐私约束下,该方法在局部适配和全局泛化间实现更好权衡。
Comments Accepted by ACM MM 2026
DINO-VPT:用于联合物理-数字人脸反欺骗的分层视觉提示调整
机构 * Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院)
专题命中 指令微调 :language model(abstract)
AI总结 研究针对人脸反欺骗需求,提出DINO-VPT轻量级仅视觉框架,利用分层视觉提示调整,通过提示路由网络动态注入提示,无需多模态融合,在基准测试中比现有方法准确率更高,证明合理架构能达最优性能。
Comments accepted to IJCB2026
从不一致的人类反馈中实现可靠性感知的大语言模型对齐
专题命中 后训练与偏好优化 :LLM(title,abstract);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 研究如何解决人类反馈强化学习中人类注释不一致问题,提出可靠性引导的偏好优化框架RGPO,通过估计注释者可靠性、推断潜在真实标签及动态调整训练目标,有效减少训练数据不一致性和噪声,性能优于现有基线。
Domyn-Small:一个欧洲的100亿参数推理语言模型
机构 * CINECA(意大利国家计算应用研究所)
专题命中 后训练与偏好优化 :language model(title,abstract);SFT(abstract,abstract_cn);LLM(abstract);post-training(abstract)
AI总结 介绍了基于9万亿令牌多语言数据预训练的100亿参数推理语言模型Domyn-Small,经持续预训练、监督微调、强化学习等训练后管道,实现双模式推理,在与对等模型对比中平衡了准确性与效率,还发布了相关权重及开源框架。
Comments 27 pages, 5 figure
作为频谱更新重组的偏好调整
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);post-training(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过频谱结构研究RLHF及偏好优化,将偏好诱导更新转化为可干预对象,发现更新呈现头-尾组织,头部主导端点偏移,揭示了偏好训练后是结构化更新重组,以及对齐增益和覆盖损失与更新组织方式的关系。
通过动态评分标准共同进化大语言模型评估器和策略
机构 * Tsinghua University(清华大学) ; Tencent(腾讯)
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 研究基于评估器反馈优化大语言模型时因策略改进导致的优化瓶颈问题,提出DynamicRubric框架,通过生成加权评分标准项实现评估器与策略共同进化,实验证明该框架提升了评估器性能及策略效果,并已成功应用于微信搜索。
Comments add online model info (approved)
朝着解耦偏好优化动态:压制失败者,保留胜利者
机构 * South China University of Technology(南方科技大学) ; Columbia University(哥伦比亚大学) ; University of Waterloo(滑铁卢大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出奖励校准方法,通过解耦带宽条件实现压制失败者并保留胜利者的优化动态,提升了下游性能。
Journal ref International Conference on Machine Learning(ICML) 2026
FORGE-plus:使用冻结的语言模型监督器进行力预算的富接触装配恢复
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究在规定力上限下实现紧间隙装配及从插入失败中恢复的问题,提出含冻结大语言模型的两层框架,该模型分配力上限并选恢复策略,通过实验评估,此框架表现良好,解决了部分夹具故障问题,也有负面结果。
使开源文本语言模型水印在合并后仍具耐久性
机构 * ETH Zurich(苏黎世联邦理工学院)
专题命中 后训练与偏好优化 :LLM(title);post-training(abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 研究如何让开源文本语言模型水印在模型合并后仍具耐久性,提出合并对抗训练算法,该算法能将水印融入模型权重,在保留下游能力的同时优于所有基线,还评估了针对现实合并场景的水印,表明对抗训练可提高水印耐久性。
TeaRAG:一种令牌高效的智能检索增强生成框架
机构 * University of Science and Technology of China(中国科学技术大学) ; City University of Hong Kong(香港城市大学) ; Xiaohongshu Inc.(小红书公司)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI
AI总结 研究提出TeaRAG框架解决智能RAG令牌开销大问题,通过基于简洁三元组的图检索压缩检索内容,用IP-DPO减少推理步骤,在多个数据集上实验,提高了平均精确匹配,减少了输出令牌。
Comments 34 pages
PISmith: 基于强化学习的提示注入防御红队测试
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 本文提出PISmith框架,通过强化学习评估现有提示注入防御的鲁棒性,发现标准GRPO在攻击强防御时表现不佳,引入自适应熵正则化和动态优势加权以提升探索能力,实验表明最新防御仍易受适应性攻击影响。
Comments To appear in COLM 2026
TOPReward: 令牌概率作为机器人学中的隐式零样本奖励
机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(人工智能研究所) ; Amazon(亚马逊) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG
AI总结 TOPReward通过利用预训练视频视觉-语言模型的令牌概率,提供高效的零样本奖励估计,显著提升机器人任务进度评估的性能和泛化能力。
随心所欲驾驶:基于强化学习的多头部扩散个性化驾驶
机构 * School of Information Technology, Monash University Malaysia(墨尔本大学马来西亚分校信息科技学院) ; Southwest University, China(西南大学)
专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI
AI总结 研究旨在解决自动驾驶规划器忽视人类驾驶行为多样性及难以理解用户意图的问题。提出基于强化学习的多策略框架,集成多头部扩散规划器与语义理解,采用两阶段训练范式。实验表明该方法在nuPlan基准测试中性能良好,能满足实时规划并对齐用户意图。
Comments Has been submitted to AAAI 2026
代理记忆:为大语言模型代理学习统一的长期和短期记忆管理
机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) ; Alibaba Group(阿里巴巴集团)
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL
AI总结 本文提出Agentic Memory框架,统一管理大语言模型的长期和短期记忆,通过分步GRPO和三阶段强化学习提升记忆效率与任务表现。
Comments ACL'26 SAC Highlight. The code is available at https://github.com/y1y5/AgeMem
SafeHarbor:用于LLM智能体安全的分层记忆增强防护栏
机构 * School of Cyber Science and Technology, Beihang University, Beijing, China(北京航空航天大学网络安全学院) ; Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) ; AI Security Lab, Beijing, China(360人工智能安全实验室)
专题命中 长上下文与记忆 :LLM(title,title_cn);foundation model(abstract);分类 cs.AI
AI总结 提出SafeHarbor框架,通过分层记忆系统和信息熵自进化机制,在保持高安全拒绝率的同时提升对良性请求的响应能力。
Comments Accepted by ICML 2026
PRO-LONG:程序化内存实现长程推理
机构 * Duke University(杜克大学)
专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对长程任务中LLM智能体的挑战,提出PRO-LONG框架,通过程序化内存管理上下文,保留交互日志并利用编码智能体进展高效搜索历史,在ARC-AGI-3上有显著提升,减少令牌使用并达到高准确率。
谁被引用最多?在科学文章上基准测试长上下文数值推理
机构 * School of Informatics, The University of Edinburgh(信息学院,爱丁堡大学)
专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 SciTrek基准测试通过长上下文科学文章问题探索LLM的数值推理能力,发现即使最佳模型在长上下文下也面临显著挑战,尤其在处理引用和复合逻辑问题时表现不佳。
Comments 26 pages
CAMeR:用于大语言模型智能体中自适应记忆保留的关键词门控混合激活
专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型智能体记忆问题,提出CAMeR框架,结合关键词门控混合激活与自适应权重动态。通过CAMeR-Bench测试,表明其关键词门控效果好,能有效节省令牌并提高检索精度,证明混合符号-神经门控可实现自适应记忆保留。
审计大语言模型智能体动作选择中的溯源敏感性
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI
AI总结 研究大语言模型智能体动作选择中的溯源敏感性,引入针对特定目标的授权审计,通过改变命题源权威等测试行为,发现可信和不可信变体在部分案例中产生不同动作,模型对线索有反应但不可信证据仍影响行动。
WebCoach:具有跨会话记忆引导的自我进化网络代理
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Amazon(亚马逊)
专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 研究针对网页代理跨会话学习不足问题,提出WebCoach框架,通过三个关键组件赋予代理跨会话记忆,可长期规划与自我进化,在WebVoyager基准测试中提升了不同LLM backbone的代理性能。
Comments 18 pages
EvoSQL:用于文本到SQL的内存增强型评论家-生成器协同进化
机构 * Shanghai Jiao Tong University(上海交通大学) ; University of New South Wales(新南威尔士大学) ; Fudan University(复旦大学) ; Wuhan University of Technology(武汉理工大学)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究文本到SQL问题,提出EvoSQL协同进化框架,通过生成器与评论家迭代交互、维护内存、验证候选及自蒸馏策略优化微调等,在Spider和BIRD实验中持续改进开源模型,证明该方法是有效途径。
FedAgentKE:异构智能体的联邦语义知识演化
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 研究异构智能体孤立运行问题,提出 FedAgentKE 框架,通过语义知识蒸馏、聚合和Adapt实现联邦语义知识演化,实验验证其在跨框架和跨任务设置下能改进智能体协作,为未来协作智能体生态系统发展提供潜力。
Comments 9 pages (including appendix)
NVIDIA实验室的OO智能体:原生Python面向对象智能体
机构 * NVIDIA-labs(英伟达实验室)
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 研究提出NOOA这一Python框架构建可靠AI智能体,采用智能体即Python对象的编程模型,结合六个面向模型的理念,证明当前模型能有效使用此接口并在相关测试中表现良好,为智能体开发提供新途径。