arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Xiaohongshu(小红书)

共收录 161
2605.06110 2026-05-11 cs.AI cs.CL

On Time, Within Budget: Constraint-Driven Online Resource Allocation for Agentic Workflows

按时、在预算内:面向代理工作流的约束驱动在线资源分配

Xinglin Wang, Zishen Liu, Shaoxiong Feng, Peiwen Yuan, Yiwei Li, Jiayi Shi, Yueqi Zhang, Chuyi Tan, Ji Zhang, Boyuan Pan, Yao Hu, Kan Li

机构 * School of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学学院) Xiaohongshu Inc(小红书公司)

AI总结 本文研究了在预算和截止时间约束下,如何通过约束驱动的在线资源分配提高代理工作流的成功概率,提出MCPP算法并在CodeFlow和ProofFlow上验证其有效性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10693 2026-05-11 cs.LG cs.AI

VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training

VESPO:变分序列级软策略优化用于稳定的反政策LLM训练

Guobin Shen, Chenxiao Zhao, Xiang Cheng, Lei Huang, Xing Yu

机构 * Xiaohongshu Inc(小红书公司)

AI总结 本文提出VESPO,通过变分方法减少反政策更新中的方差,提升大语言模型在严重反政策条件下的稳定性,实验显示其在数学推理和代码生成任务中优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02805 2026-05-11 cs.CL cs.AI

MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning

MemSearcher:通过端到端强化学习训练LLM进行推理、搜索和管理内存

Qianhao Yuan, Jie Lou, Zichao Li, Jiawei Chen, Yaojie Lu, Hongyu Lin, Le Sun, Debing Zhang, Xianpei Han

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所信息处理实验室,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Xiaohongshu Inc(小红书公司)

AI总结 MemSearcher通过端到端强化学习训练LLM进行推理、搜索和内存管理,通过维护紧凑的记忆在多轮交互中保持上下文长度稳定,优于基于历史拼接的基线方法。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06207 2026-05-08 cs.CV cs.AI cs.LG

Taming the Entropy Cliff: Variable Codebook Size Quantization for Autoregressive Visual Generation

平抑熵崖:用于自回归视觉生成的变量码本大小量化

Bowen Zheng, Weijian Luo, Guang Yang, Colin Zhang, Tianyang Hu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) hi-Lab, Xiaohongshu Inc(小红书实验室)

AI总结 本文提出变量码本大小量化(VCQ),通过动态增加码本大小以解决固定码本设计导致的熵崖问题,提升自回归视觉生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05702 2026-05-08 cs.AI

Knowledge-Graph Paths as Intermediate Supervision for Self-Evolving Search Agents

知识图谱路径作为自演化搜索代理的中间监督

Huyu Wu, Jun Liu, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu

机构 * Xiaohongshu Inc.(小红书公司)

AI总结 本文通过利用知识图谱路径作为中间监督,改进自演化搜索代理的提问生成和奖励塑造,解决传统方法中提问孤立和奖励信息不足的问题,提升多跳问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01373 2026-05-05 cs.CL cs.AI

Focus on the Core: Empowering Diffusion Large Language Models by Self-Contrast

聚焦核心:通过自对比增强扩散大语言模型

Jinyuan Feng, Xin Yu, Yiqun Chen, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Zhiqiang Pu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司)

AI总结 本文通过研究高信息密度token,提出FoCore解码策略,利用自对比提升生成质量与效率,实验表明在数学、代码和逻辑推理任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23763 2026-05-01 cs.CV

Edit Where You Mean: Region-Aware Adapter Injection for Mask-Free Local Image Editing

在需要的地方编辑:区域感知的适配器注入用于无掩码的局部图像编辑

Honghao Cai, Xiangyuan Wang, Yunhao Bai, Haohua Chen, Tianze Zhou, Runqi Wang, Wei Zhu, Yibo Chen, Xu Tang, Yao Hu, Zhen Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Tsinghua University(清华大学) Peking University(北京大学) Xiaohongshu Inc.(小红书公司)

AI总结 本文提出AdaptEdit框架,通过区域感知适配器实现无掩码的局部图像编辑,结合轻量级Block Adapter和SpatialGate提升编辑精度,同时通过Region-Aware Loss优化训练目标,实现无需用户掩码的高质量编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26247 2026-04-30 cs.IR cs.AI

TimeMM: Time-as-Operator Spectral Filtering for Dynamic Multimodal Recommendation

TimeMM: 时域作为算子的动态多模态推荐谱过滤

Wei Yang, Rui Zhong, Zihan Lin, Xiaodan Wang, Cheng Chen, Huan Ren, Yao Hu

机构 * Xiaohongshu Inc.(小红书公司)

AI总结 TimeMM通过时域算子谱过滤框架,解决动态多模态推荐中用户兴趣非平稳性问题,引入自适应谱过滤和模态感知路由,提升推荐性能与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00557 2026-04-30 cs.CL cs.AI cs.SE

Learning to Ask: When LLM Agents Meet Unclear Instruction

学习提问:当LLM代理遇见模糊指令

Wenxuan Wang, Juluan Shi, Zixuan Ling, Yuk-Kit Chan, Chaozheng Wang, Cheryl Lee, Youliang Yuan, Jen-tse Huang, Wenxiang Jiao, Michael R. Lyu

机构 * Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区) Johns Hopkins University(约翰霍普金斯大学) Xiaohongshu Inc.(小红书公司)

AI总结 本文提出AwN框架,通过让LLM在遇到模糊指令时主动提问以提升工具使用性能,并设计自动化评估工具ToolEvaluator,验证了在NoisyToolBench基准下的优越性。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00761 2026-04-30 cs.SE cs.AI cs.CL

Identifying the Achilles' Heel: An Iterative Method for Dynamically Uncovering Factual Errors in Large Language Models

找出阿基里斯之踵:一种用于动态揭示大语言模型事实错误的迭代方法

Wenxuan Wang, Yuk-Kit Chan, Zixuan Ling, Juluan Shi, Youliang Yuan, Jen-tse Huang, Yifei Zhang, Wenxiang Jiao, Zhaopeng Tu, Michael R. Lyu

机构 * Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区) Johns Hopkins University(约翰霍普金斯大学) Nanyang Technological University(南洋理工大学) Xiaohongshu Inc.(小红书公司) Tencent Inc.(腾讯公司)

AI总结 本文提出HalluHunter框架,通过知识图谱和规则基NLP技术,系统揭示大语言模型的事实错误,测试表明可触发55%的问题错误。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19656 2026-04-22 cs.CL

Pause or Fabricate? Training Language Models for Grounded Reasoning

暂停或虚构?为基于事实的推理训练语言模型

Yiwen Qiu, Linjuan Wu, Yizhou Liu, Yuchen Yan, Jin Ma, Xu Tan, Yao Hu, Daoxin Zhang, Wenqi Zhang, Weiming Lu, Jun Xiao, Yongliang Shen

机构 * Zhejiang University(浙江大学) Tencent(腾讯) Xiaohongshu Inc.(小红书公司)

AI总结 本文提出GRIL框架,通过交互强化学习提升语言模型在不完整信息下的推理能力,显著提高前提检测并提升任务成功率。

Comments Code:https://github.com/ZJU-REAL/GRIL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15625 2026-04-21 cs.LG cs.AI

Robust Tool Use via Fission-GRPO: Learning to Recover from Execution Errors

通过Fission-GRPO实现鲁棒的工具使用:学习从执行错误中恢复

Zhiwei Zhang, Fei Zhao, Rui Wang, Zezhong Wang, Bin Liang, Jiakang Wang, Yao Hu, Shaosheng Cao, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Xiaohongshu Inc.(小红书公司) MoE Key Laboratory of High Confidence Software Technologies(可信软件技术国家重点实验室)

AI总结 本文提出Fission-GRPO框架,通过将执行错误转化为在线纠正监督,提升模型在多轮执行中的错误恢复能力,实验显示其在BFCL v4 Multi-Turn上提升了Qwen3-8B的错误恢复率和整体准确率。

Comments 9 pages, 4 figures, 4 tables. Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02506 2026-04-21 cs.IR cs.AI

R3A: Reinforced Reasoning for Relevance Assessment for RAG in User-Generated Content Platforms

R3A:强化推理用于用户生成内容平台中的RAG相关性评估

Xiaowei Yuan, Lei Jin, Haoxin Zhang, Ziyang Huang, Yan Gao, Yi Wu, Yao Hu, Jun Zhao, Kang Liu

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(复杂系统认知与决策智能重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Xiaohongshu Inc.(小红书公司)

AI总结 R3A通过意图推理和证据定位解决UGC平台中相关性评估的挑战,提升模型在稀疏反馈和非对称相关性中的表现。

Comments Accepted by ACL Industry 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07774 2026-04-20 cs.CL

Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards

用评分奖励模型治愈大语言模型数学推理中的奇迹步骤

Youliang Yuan, Qiuyang Mang, Jingbang Chen, Hong Wan, Xiaoyuan Liu, Junjielong Xu, Jen-tse Huang, Wenxuan Wang, Wenxiang Jiao, Pinjia He

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(数据科学学院,香港中文大学(深圳)) UC Berkeley(加州大学伯克利分校) Zhejiang University(浙江大学) Johns Hopkins University(约翰霍普金斯大学) Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司)

AI总结 本文通过评分奖励模型解决大语言模型数学推理中的奇迹步骤问题,通过系统分析和人类验证建立失败模式分类,提升推理准确性和可靠性。

Comments Accepted by ACL 2026 Main, 22 pages, 10 figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11554 2026-04-15 cs.CL

Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale

Relax:一种用于大规模多模态后训练的异步强化学习引擎

Liujie Zhang, Benzhe Ning, Rui Yang, Xiaoyan Yu, Jiaxing Li, Lumeng Wu, Jia Liu, Minghao Li, Weihang Chen, Weiqi Hu, Lei Zhang

机构 * AI Platform, Xiaohongshu Inc(小红书AI平台) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

AI总结 Relax通过三个协同设计的架构层解决多模态数据流、大规模鲁棒性和延迟-吞吐量平衡问题,实现比veRL快1.20倍的端到端加速,并在多模态强化学习中表现出稳定收敛性。

Comments 17 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00748 2026-04-14 cs.CV

Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning

通过强化学习提升多图像接地在MLLMs中的推理能力

Bob Zhang, Haoran Li, Tao Zhang, Jianan Li, Cilin Yan, Xikai Liu, Jiayin Cai, Yanbin Hao

机构 * Xiaohongshu Inc.(小红书公司) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Technical University of Munich(慕尼黑工业大学) Hefei University of Technology(合肥工业大学)

AI总结 本文通过强化学习策略提升多图像接地任务中MLLMs的推理能力,采用合成CoT数据、LoRA微调和规则引导的RL方法,实验表明在MIG-Bench和多个领域外基准上效果显著。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24574 2026-04-14 cs.LG cs.AI

DistDF: Time-Series Forecasting Needs Joint-Distribution Wasserstein Alignment

DistDF:时间序列预测需要联合分布Wasserstein对齐

Hao Wang, Licheng Pan, Yuan Lu, Zhixuan Chu, Xiaoxi Li, Shuting He, Zhichao Chen, Haoxuan Li, Qingsong Wen, Zhouchen Lin

机构 * Xiaohongshu Inc.(小红书公司) College of Control Science and Technology, Zhejiang University(浙江大学控制科学与工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Computing and Artificial Intelligence, Shanghai University of Finance and Economics(上海财经大学计算与人工智能学院) State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) Squirrel AI(松鼠AI) Center for Data Science, Peking University(北京大学数据科学中心) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

AI总结 DistDF通过最小化预测序列与标签序列条件分布之间的分布差异,解决传统直接预测方法在标签序列自相关时的偏差问题,提升多种预测模型性能。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07837 2026-04-10 cs.AI

SPARD: Self-Paced Curriculum for RL Alignment via Integrating Reward Dynamics and Data Utility

SPARD:通过整合奖励动态和数据效用实现强化学习对齐的自适应课程

Xuyang Zhi, Peilun zhou, Chengqiang Lu, Hang Lv, Yiwei Liang, Rongyang Zhang, Yan Gao, YI WU, Yao Hu, Hongchao Gu, Defu Lian, Hao Wang, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书)

AI总结 SPARD通过动态调整多目标奖励权重和数据重要性,提升强化学习对齐效果,实验显示在多个基准上显著增强模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29423 2026-04-01 cs.CV

A2BFR: Attribute-Aware Blind Face Restoration

A2BFR:属性感知的盲脸修复

Chenxin Zhu, Yushun Fang, Lu Liu, Shibo Yin, Xiaohong Liu, Xiaoyun Zhang, Qiang Hu, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司)

AI总结 本文提出A2BFR框架,结合高保真重建与提示可控生成,通过属性感知学习和语义双训练提升修复精度与可控性,实验显示在恢复保真度和指令遵循上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27813 2026-03-31 cs.CV

MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences

MuSEAgent:一种具有状态化经验的多模态推理代理

Shijian Wang, Jiarui Jin, Runhao Fu, Zexuan Yan, Xingjian Wang, Mengkang Hu, Eric Wang, Xiaoxi Li, Kangning Zhang, Li Yao, Wenxiang Jiao, Xuelian Cheng, Yuan Lu, Zongyuan Ge

机构 * Southeast University(东南大学) Monash University(莫纳什大学) Xiaohongshu Inc.(小红书) Shanghai Jiao Tong University(上海交通大学) University of Hong Kong(香港大学) Zhejiang University(浙江大学) Renmin University of China(中国人民大学)

AI总结 MuSEAgent通过引入状态化经验学习范式,提升多模态推理代理的决策能力,其通过 hindsight reasoning 抽象交互数据为原子决策经验,并在推理时进行质量过滤的经验检索,实验表明其在细粒度视觉感知和复杂多模态推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13773 2026-03-31 cs.LG cs.AI

PENGUIN: Enhancing Transformer with Periodic-Nested Group Attention for Long-term Time Series Forecasting

PENGUIN:通过周期-嵌套组注意力增强Transformer以进行长期时间序列预测

Tian Sun, Yuqi Chen, Weiwei Sun

机构 * School of Computer Science, Fudan University(复旦大学计算机科学技术学院) Shanghai Key Laboratory of Data Science, Fudan University(复旦大学上海市数据科学重点实验室) Xiaohongshu Inc.(小红书公司)

AI总结 本文提出PENGUIN,一种周期-嵌套组注意力机制,用于提升Transformer在长期时间序列预测中的性能,通过捕捉周期结构和处理多重周期性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12200 2026-03-27 cs.CV

CompBench: Benchmarking Complex Instruction-guided Image Editing

CompBench:复杂指令引导图像编辑的基准测试

Bohan Jia, Wenxuan Huang, Yuntian Tang, Junbo Qiao, Jincheng Liao, Shaosheng Cao, Fei Zhao, Zhaopeng Feng, Zhouhong Gu, Zhenfei Yin, Lei Bai, Wanli Ouyang, Lin Chen, Fei Zhao, Yao Hu, Zihan Wang, Yuan Xie, Shaohui Lin

机构 * East China Normal University(华东师范大学) Xiaohongshu Inc.(小红书) KLATASDS, MOE, China(中国教育部统计与数据科学重点实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Fudan University(复旦大学) University of Oxford(牛津大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

AI总结 CompBench旨在解决现有图像编辑基准测试对任务复杂度简化的问题,通过引入复杂指令引导的图像编辑基准,评估模型在精细操控能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23184 2026-03-25 cs.CL cs.AI stat.AP

ImplicitRM: Unbiased Reward Modeling from Implicit Preference Data for LLM alignment

ImplicitRM: 从隐式偏好数据中无偏奖励建模以实现语言模型对齐

Hao Wang, Haocheng Yang, Licheng Pan, Lei Shen, Xiaoxi Li, Yinuo Wang, Zhichao Chen, Yuan Lu, Haoxuan Li, Zhouchen Lin

机构 * Peking University(北京大学) Xiaohongshu Inc.(小红书公司) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

AI总结 本文提出ImplicitRM,通过隐式反馈数据学习无偏奖励模型,解决隐式偏好数据中缺乏明确负样本和用户偏好偏差的问题,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21862 2026-03-24 cs.LG

Holistic Scaling Laws for Optimal Mixture-of-Experts Architecture Optimization

整体缩放定律用于最优专家混合架构优化

Weilin Wan, Jingtao Han, Weizhong Zhang, Cheng Jin

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Hi Lab, Xiaohongshu Inc.(小红书公司Hi实验室) Project Numina(项目Numina) School of Data Science, Fudan University(复旦大学数据科学学院)

AI总结 本文提出一种框架,通过联合约束三元组和代数约束,优化专家混合架构,实现鲁棒的缩放定律,为大规模计算预算提供完整最优架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11026 2026-03-24 cs.CV

GIR-Bench: Versatile Benchmark for Generating Images with Reasoning

GIR-Bench:用于生成图像的多功能基准

Hongxiang Li, Yaowei Li, Bin Lin, Yuwei Niu, Yuhang Yang, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书公司)

AI总结 本文提出GIR-Bench,从理解-生成一致性、文本到图像生成和多步骤编辑三个角度评估统一模型,揭示其在复杂视觉任务中的表现与不足。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18736 2026-03-20 cs.LG cs.AI cs.CL stat.ML

CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks

CausalRM:基于观察性用户反馈的因果理论奖励建模用于RLHF

Hao Wang, Licheng Pan, Zhichao Chen, Chunyuan Zheng, Zhixuan Chu, Xiaoxi Li, Yuan Lu, Xinggao Liu, Haoxuan Li, Zhouchen Lin

机构 * Peking University(北京大学) Xiaohongshu Inc.(小红书公司) Zhejiang University(浙江大学)

AI总结 本文提出CausalRM框架,通过因果理论处理观察性用户反馈中的噪声和偏见问题,提升RLHF任务性能,实验显示在WildGuardMix和HarmBench上分别提升49.2%和32.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13032 2026-03-20 cs.CV

Multimodal OCR: Parse Anything from Documents

多模态OCR:从文档中解析一切

Handong Zheng, Yumeng Li, Kaile Zhang, Liang Xin, Guangwei Zhao, Hao Liu, Jiayu Chen, Jie Lou, Qi Fu, Rui Yang, Shuo Jiang, Weijian Luo, Weijie Su, Weijun Zhang, Xingyu Zhu, Yabin Li, Yiwei ma, Yu Chen, Yuqiu Ji, Zhaohui Yu, Guang Yang, Colin Zhang, Lei Zhang, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) hi lab, Xiaohongshu Inc(小红书实验室,小红书公司)

AI总结 本文提出多模态OCR(MOCR),通过联合解析文本和图形,生成统一的文本表示。方法将图表、表格等视觉元素作为解析目标,提升文档重建的准确性,并通过端到端训练实现跨模态监督,最终在文档和结构化图形解析任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17847 2026-03-20 cs.LG cs.AI cs.SY eess.SY

Time-o1: Time-Series Forecasting Needs Transformed Label Alignment

Time-o1: 时间序列预测需要转换标签对齐

Hao Wang, Licheng Pan, Zhichao Chen, Xu Chen, Qingyang Dai, Lei Wang, Haoxuan Li, Zhouchen Lin

机构 * Xiaohongshu Inc(小红书公司) Zhejiang University(浙江大学) Renmin University of China(中国人民大学) Peking University(北京大学) State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学通用人工智能国家重点实验室,智能科学与技术学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Department of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Center for Data Science, Peking University(北京大学数据科学中心) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Pazhou Laboratory (Huangpu), Guangzhou, Guangdong, China(广州黄埔实验室(华南))

AI总结 本文提出Time-o1,通过转换标签对齐缓解时间序列预测中的标签自相关和任务过多问题,提升模型性能。

Comments Accepted as poster in NeurIPS 2025

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00053 2026-03-20 cs.LG cs.AI stat.ML

Quadratic Direct Forecast for Training Multi-Step Time-Series Forecast Models

二次直接预报用于训练多步时间序列预测模型

Hao Wang, Licheng Pan, Yuan Lu, Zhichao Chen, Tianqiao Liu, Shuting He, Zhixuan Chu, Qingsong Wen, Haoxuan Li, Zhouchen Lin

机构 * Xiaohongshu Inc.(小红书公司) State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能国家重点实验室,北京大学智能科学与技术学院) College of Engineering, Purdue University(普渡大学工程学院) School of Computing and Artificial Intelligence, Shanghai University of Finance and Economics(上海财经大学计算机与人工智能学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Squirrel AI Center for Data Science, Peking University(北京大学数据科学中心) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Pazhou Laboratory (Huangpu), Guangzhou, Guangdong, China(琶洲实验室(黄埔),广州,广东,中国)

AI总结 本文提出二次加权训练目标,解决多步时间序列预测中标签自相关和任务权重不均的问题,通过Quadratic Direct Forecast算法提升模型性能。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15190 2026-03-18 cs.LG cs.AI

Masked Auto-Regressive Variational Acceleration: Fast Inference Makes Practical Reinforcement Learning

遮蔽自回归变分加速:快速推理使强化学习实用

Yuxuan Gu, Weimin Bai, Yifei Wang, Weijian Luo, He Sun

机构 * Peking University(北京大学) Rice University(Rice大学) hi-lab, Xiaohongshu Inc(小红书实验室,小红书公司)

AI总结 本文提出MARVAL框架,通过压缩扩散链为单步自回归生成,提升推理效率并使强化学习实用化,实现了生成模型的快速采样和偏好对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏