arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Xiaohongshu(小红书)

共收录 161
2605.29948 2026-06-02 cs.SD cs.AI eess.AS

HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding

HoliTok: 一种具有鲁棒的双重语音生成与理解能力的连续整体式分词

Bohan Li, Shi Lian, Hankun Wang, Yiwei Guo, Yu Xi, Zhihan Li, Da Zheng, Colin Zhang, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, China(X-LANCE实验室,计算机科学学院,上海交通大学,中国) hi lab, Xiaohongshu Inc, China(hi实验室,小红书公司,中国)

AI总结 提出HoliTok连续整体式语音分词模型,通过渐进训练策略联合保持信号保真度、融入语义信息并维持潜在可学习性,基于该分词构建统一AR+DiT模型实现语音合成与识别,实验证明其在统一生成-理解架构中无需额外优化即可鲁棒运行。

Comments 14 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29287 2026-06-02 cs.IR cs.CV

UniNote: A Unified Embedding Model for Multimodal Representation and Ranking

UniNote: 一种用于多模态表示和排序的统一嵌入模型

Jinghan Zhao, Wenwei Jin, Anqi Li, Jintao Tong, Luya Mo, Jiawei Li, Bin Li, Yao Hu

机构 * Xiaohongshu Beijing China(小红书北京中国) Shanghai Jiao Tong University(上海交通大学) Huazhong University of Science and Technology(华中科技大学) Beijing Institute of Technology(北京理工大学)

AI总结 提出UniNote统一嵌入模型,通过两阶段训练(对比SFT和强化学习)解决工业级Item-to-Item检索中全局表示与局部检索的平衡、解耦流水线效率及精度-延迟权衡问题,在小红书部署后显著提升检索质量和成本效率。

Comments Accepted by KDD Ads Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13527 2026-06-02 cs.AI

MMSkills: Towards Multimodal Skills for General Visual Agents

MMSkills: 面向通用视觉智能体的多模态技能

Kangning Zhang, Shuai Shao, Qingyao Li, Jianghao Lin, Lingyue Fu, Shijian Wang, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司) Southeast University(东南大学)

AI总结 提出MMSkills框架,通过将多模态程序知识编码为紧凑的状态条件包(包含文本程序、运行时状态卡和多视角关键帧),并利用轨迹到技能生成器和分支加载多模态技能智能体,显著提升GUI和游戏场景下视觉智能体的决策能力。

Comments 25 pages, 8 figures, 8 tables. Project page: https://zkangning.github.io/MMSkills_for_Visual_Agents/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31545 2026-06-01 cs.CL

Preference-Aware Rubric Learning for Personalized Evaluation

偏好感知的评分标准学习用于个性化评估

Yilun Qiu, Xiaoyan Zhao, Yang Zhang, Yuxin Chen, Cilin Yan, Jiayin Cai, Xiaolong Jiang, Yao Hu, Yoko Yamakata, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Xiaohongshu Inc.(小红书公司) The University of Tokyo(东京大学)

AI总结 提出PARL框架,通过从用户历史中学习偏好感知的评估标准并采用自验证机制,实现个性化评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27255 2026-06-01 cs.CL cs.AI

Pair-In, Pair-Out: Latent Multi-Token Prediction for Efficient LLMs

Pair-In, Pair-Out: 面向高效LLM的潜在多令牌预测

Wenhui Tan, Minghao Li, Xiaoqian Ma, Siqi Fan, Xiusheng Huang, Liujie Zhang, Ruihua Song, Weihang Chen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院) AI Platform, Xiaohongshu Inc.(小红书人工智能平台) University of Electronic Science and Technology of China(电子科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 提出Pair-In, Pair-Out (PIPO)方法,通过统一潜在压缩和多令牌预测,并训练轻量级置信度头消除验证器开销,在保持可靠性的同时实现推理加速。

Comments Project Page: GitHub.com/RedAI-Infra/PIPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00747 2026-06-01 cs.CL cs.AI

Decouple Searching from Training: Scaling Data Mixing via Model Merging for Large Language Model Pre-training

将搜索与训练解耦:通过模型合并实现大规模语言模型预训练的数据混合缩放

Shengrui Li, Fei Zhao, Kaiyan Zhao, Jieying Ye, Haifeng Liu, Fangcheng Shi, Zheyong Xie, Yao Hu, Shaosheng Cao

机构 * NLP Team, Xiaohongshu Inc., Shanghai, China(小红书自然语言处理团队,小红书公司,上海,中国) Tsinghua University, Beijing, China(清华大学,北京,中国) The University of Tokyo, Tokyo, Japan(东京大学,东京,日本)

AI总结 提出DeMix框架,通过模型合并预测最优数据配比,在降低搜索成本的同时提升基准性能。

Comments 18 pages, 5 figures, accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06137 2026-06-01 cs.CV cs.AI cs.LG

Autoregressive Visual Generation Needs a Prologue

自回归视觉生成需要一个序幕

Bowen Zheng, Weijian Luo, Guang Yang, Colin Zhang, Tianyang Hu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) hi-Lab, Xiaohongshu Inc(小红书实验室)

AI总结 提出Prologue方法,通过生成前置的序幕令牌来弥合自回归图像生成中的重建-生成差距,在不影响重建质量的前提下显著提升生成性能。

Comments Code: https://github.com/Zyriix/prologue Demo: https://huggingface.co/spaces/Zyriix/prologue-demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29643 2026-05-29 cs.CV cs.MA

AgentCVR: Active Multi-Agent Cross-Video Reasoning via Script-Simulated Reinforcement Learning

AgentCVR:通过脚本模拟强化学习的主动多智能体跨视频推理

Yilun Qiu, Jiahe Wang, Cilin Yan, Jiayin Cai, Xiaolong Jiang, Yao Hu, Chun Yuan

机构 * Xiaohongshu Inc.(小红书公司) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院,清华大学)

AI总结 提出AgentCVR多智能体框架,将跨视频推理视为主动证据获取任务,通过主智能体协调视觉和音频智能体进行定向证据提取,并引入脚本模拟强化学习优化策略,在跨视频对齐和定位任务上超越单次基线,达到与闭源系统相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28721 2026-05-28 cs.AI

LiveBrowseComp: Are Search Agents Searching, or Just Verifying What They Already Know?

LiveBrowseComp: 搜索智能体是在搜索,还是仅仅在验证它们已知的信息?

HuiMing Fan, Xiao Wang, Zheng Chu, Qianyu Wang, Zhuoyao Wang, Ming Liu, Bing Qin, XingYu

机构 * Harbin Institute of Technology(哈尔滨理工大学) Xiaohongshu(小红书)

AI总结 本文通过诊断方法发现基于LLM的搜索智能体存在内在知识依赖(IKD),即依赖模型内部知识而非外部证据,并引入LiveBrowseComp基准来评估超越内在知识覆盖的深度搜索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28258 2026-05-28 cs.SE cs.AI cs.CV cs.HC

GUI Agents for Continual Game Generation

面向持续游戏生成的GUI智能体

Yixu Huang, Bo Li, Na Li, Zhe Wang, Kaijie Chen, Haonan Ge, Qingyi Si, Yuanzhe Shen, Ruihan Yang, Guangjing Wang, Hongcheng Guo

机构 * Fudan University(复旦大学) Xiaohongshu Inc.(小红书公司) Tongji University(同济大学) University of California, Santa Barbara(加州大学圣芭芭拉分校)

AI总结 提出利用GUI智能体作为客观评估者和主观测试者,通过PlaytestArena和Play2Code框架实现持续游戏生成,显著提升可玩性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27030 2026-05-27 cs.CL

Share More, Search Less: Collaborative Parallel Thinking for Efficient Test-Time Scaling

分享更多,搜索更少:面向高效测试时间扩展的协作并行思考

Xinglin Wang, Hao Lin, Shaoxiong Feng, Peiwen Yuan, Yiwei Li, Jiayi Shi, Yueqi Zhang, Chuyi Tan, Ji Zhang, Boyuan Pan, Yao Hu, Kan Li

机构 * School of Computer Science, Beijing Institute of Technology(北京理工大学计算机学院) Xiaohongshu Inc(小红书公司)

AI总结 提出一种无需训练的协作并行思考框架,通过在并行分支间共享搜索信息来减少冗余探索,从而在测试时间扩展中实现更优的准确率-延迟帕累托边界。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26958 2026-05-27 cs.CL cs.AI

Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation

Tournament-GRPO:面向开放式长文本生成强化学习的群组锦标赛奖励

Zixuan Yang, Yiqun Chen, Wei Yang, Erhan Zhang, Zihan Shen, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao

机构 * Renmin University of China(中国人民大学) University of Southern California(南加州大学) Zhejiang University(浙江大学) Xiaohongshu Inc.(小红书公司)

AI总结 针对开放式长文本生成中缺乏可靠参考答案和自动评估指标的问题,提出Tournament-GRPO框架,通过同一查询生成结果间的多轮锦标赛比较将基于规则的LLM评判转化为相对奖励,在Deep Research Bench上取得4.52分提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26646 2026-05-27 cs.AI cs.CL cs.MA

UnityMAS-O: A General RL Optimization Framework for LLM-Based Multi-Agent Systems

UnityMAS-O: 基于LLM的多智能体系统的通用强化学习优化框架

Yiqun Chen, Wei Yang, Erhan Zhang, Shijie Wang, Qi Liu, Zechun Niu, Bin Zhang, Haitao Li, Rui Li, Lingyong Yan, Jinyuan Feng, Biqing Qi, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao

机构 * Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司)

AI总结 提出UnityMAS-O框架,将多智能体工作流作为优化单元,通过逻辑角色、图轨迹、用户定义奖励和智能体-模型映射四个核心对象解耦逻辑与物理参数,支持灵活的参数共享和奖励分配,在检索增强问答、迭代搜索和反思代码生成任务上验证了多智能体RL对手动工作流的提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24001 2026-05-27 cs.CV cs.AI cs.LG

Diff-Instruct with Diffused Reward: Towards Principled One-step Generator RL

Diff-Instruct with Diffused Reward: 迈向有原则的一步生成器强化学习

Junyi Wu, Weijian Luo, Haoyang Zheng, Ruizhe Zhang, Guang Lin

机构 * Purdue University(普渡大学) hi-lab, Xiaohongshu Inc.(小红书实验室,小红书公司)

AI总结 针对一步生成器强化学习中奖励优化与生成动力学不匹配的问题,提出基于积分KL最小化的无数据轨迹级对齐框架DIDR,通过扩散奖励分数和代理估计器实现奖励驱动的校正,在一步SDXL和6B DiT骨干网络上取得帕累托优势。

Comments author list correction

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25626 2026-05-26 cs.CL

Beyond Literal Translation: Evaluating Cultural Effectiveness in Social Media UGC

超越字面翻译:评估社交媒体用户生成内容中的文化有效性

Linjuan Wu, Ruiqi Zhang, Xinze Lyu, Ye Guo, Daoxin Zhang, Zhe Xu, Yao Hu, Yixin Cao, Yongliang Shen, Weiming Lu

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Xiaohongshu Inc.(小红书公司)

AI总结 针对社交媒体用户生成内容翻译中文化传递与情感共鸣不足的问题,提出CULTURE-MT基准,通过构建涵盖14个领域、4种文化负载类型的1002条UGC笔记,并引入文化有效性评估标准,实验表明传统指标无法捕捉文化有效性,且基础LLM的文化有效性与模型规模相关。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08213 2026-05-26 cs.CV cs.AI

EditCaption: Human-Refined SFT and HAE-DPO for Image Editing Instruction Synthesis

EditCaption: 用于图像编辑指令合成的人工精炼SFT与HAE-DPO

Xiangyuan Wang, Honghao Cai, Yunhao Bai, Chao Hui, Tianze Zhou, Haohua Chen, Hao Shi, Yuling Wu, Yao Hu, Xu Tang, Yibo Chen, Wei Zhu

机构 * Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学) Beihang University(北京航空航天大学) Xiaohongshu Inc.(小红书公司)

AI总结 提出EditCaption两阶段后训练流程,通过人工精炼SFT和基于难度自适应错误感知DPO(HAE-DPO)提升图像编辑指令合成质量,显著降低关键错误率并超越现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08063 2026-05-26 cs.CV cs.AI

Flow-OPD: On-Policy Distillation for Flow Matching Models

Flow-OPD:面向流匹配模型的在线策略蒸馏

Zhen Fang, Wenxuan Huang, Yu Zeng, Yiming Zhao, Shuang Chen, Kaituo Feng, Yunlong Lin, Lin Chen, Zehui Chen, Shaosheng Cao, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) University of California, Los Angeles(加州大学洛杉矶分校) The Chinese University of Hong Kong(香港中文大学) Xiaohongshu Inc.(小红书公司)

AI总结 提出Flow-OPD框架,通过两阶段对齐策略(单奖励GRPO微调专家+流式冷启动与在线策略蒸馏)解决流匹配模型在多任务对齐中的奖励稀疏和梯度干扰问题,并引入流形锚点正则化抑制美学退化,在GenEval和OCR指标上显著提升。

Comments Project Page: https://costaliya.github.io/Flow-OPD/ , Code: https://github.com/CostaliyA/Flow-OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03675 2026-05-26 cs.AI cs.CL cs.IR

OASES: Outcome-Aligned Search-Evaluation Co-Training for Agentic Search

OASES:面向智能搜索的结果对齐搜索-评估协同训练

Erhan Zhang, Yiqun Chen, Zechun Niu, Wei Yang, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao

机构 * Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司) University of Southern California(南加州大学)

AI总结 提出OASES框架,通过结果对齐的过程奖励和搜索-评估协同训练,解决智能搜索中奖励稀疏和过程监督不可靠的问题,在多跳问答基准上优于强强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00607 2026-05-19 cs.CV cs.AI

IdGlow: Dynamic Identity Modulation for Multi-Subject Generation

IdGlow: 多主体生成中的动态身份调节

Honghao Cai, Xiangyuan Wang, Jing Li, Yunhao Bai, Tianze Zhou, Haohua Chen, Chao Hui, Changhao Qiao, Runqi Wang, Sijie Xu, Yuyang Hao, Zezhou Cui, Yuyuan Yang, Wei Zhu, Yibo Chen, Xu Tang, Yao Hu, Zhen Li

机构 * Xiaohongshu Inc.(小红书公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文提出IdGlow框架,通过任务自适应的时间步调度和视觉语言模型解决多主体生成中的稳定性与可塑性矛盾,提升面部真实感与商业级美学质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16079 2026-05-18 cs.CV cs.AI cs.HC

VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation

VideoSeeker:通过原生代理工具调用激励实例级视频理解

Yiming Zhao, Yu Zeng, Wenxuan Huang, Zhen Fang, Qing Miao, Qisheng Su, Jiawei Zhao, Jiayin Cai, Lin Chen, Zehui Chen, Yukun Qi, Yao Hu, Xiaolong Jiang, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书公司) East China Normal University(华东师范大学) Xi’an Jiaotong University(西安交通大学)

AI总结 VideoSeeker通过整合代理推理与实例级视频理解任务,提升视频理解精度,实验表明其在实例级任务中比基线模型提升13.7%,超越GPT-4o和Gemini-2.5-Pro。

Comments Project Page: https://gaotiexinqu.github.io/VideoSeeker/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15676 2026-05-18 cs.CL

Dynamic Chunking for Diffusion Language Models

扩散语言模型的动态分块

Yichen Zhu, Xiaoming Shi, Peng Zhao, Weiyu Chen, Debing Zhang, James Kwok

机构 * CSE, HKUST(香港科技大学计算机科学与工程系) Xiaohongshu Inc.(小红书公司) Alibaba group(阿里巴巴集团) CityUHK(城市大学香港校区)

AI总结 本文提出动态分块扩散模型,通过内容定义语义分块替代固定位置分块,提升序列结构利用效率,在参数规模达1.5B的下游任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15621 2026-05-18 cs.CV

LRCP: Low-Rank Compressibility Guided Visual Token Pruning for Efficient LVLMs

LRCP: 低秩压缩性引导的视觉标记修剪用于高效的LVLMs

Hongyu Lu, Feng Zhang, Wenwei Jin, Huanling Hu, Tianjun Shi, Shikai Jiang, Yao Hu, Jiawei Li

机构 * Xiaohongshu(小红书) Harbin Institute of Technology(哈尔滨工业大学) Fudan University(复旦大学)

AI总结 本文提出LRCP,通过低秩压缩性引导视觉标记修剪,有效减少视觉语言模型的推理成本,实现94.7%的图像理解性能保留和88.9%的标记减少。

Comments The paper includes 11 figures, multiple tables, comprehensive experimental results on 11 image understanding benchmarks and 3 video benchmarks, with extensive ablation studies and qualitative visualizations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14539 2026-05-15 cs.CL

Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards

从失败中学习:具有可验证奖励的纠正导向策略优化

Mengjie Ren, Jie Lou, Boxi Cao, Xueru Wen, Hongyu Lin, Xianpei Han, Le Sun, Xing Yu, Yaojie Lu

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Xiaohongshu Inc(小红书公司)

AI总结 本文提出CIPO方法,通过将失败轨迹转化为纠正监督,提升大语言模型的推理和纠错能力,在11个基准测试中优于基线方法。

Comments Work on progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03969 2026-05-15 cs.AI cs.CL

Anti-Length Shift: Dynamic Outlier Truncation for Training Efficient Reasoning Models

反长度偏移:动态异常截断用于训练高效的推理模型

Wei Wu, Liyi Chen, Congxi Xiao, Tianfu Wang, Qimeng Wang, Chengqiang Lu, Yan Gao, Yi Wu, Yao Hu, Hui Xiong

机构 * University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书公司) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出动态异常截断方法,通过在训练时抑制冗余token,提升推理模型的效率与性能,实验显示在AIME-24上推理token使用减少78%且准确率提升。

Comments Accepted by ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11613 2026-05-13 cs.LG cs.AI

From Generic Correlation to Input-Specific Credit in On-Policy Self Distillation

从通用相关性到输入特定的信用在在线自我蒸馏中

Guobin Shen, Lei Huang, Xiang Cheng, Chenxiao Zhao, Jindong Li, Dongcheng Zhao, Xing Yu

机构 * Xiaohongshu Inc.(小红书公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本文研究在线自我蒸馏中奖励的测量与信用分配,提出CREDIT方法通过对比学习分离输入特定成分,提升模型在多个基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11609 2026-05-13 cs.LG cs.AI cs.CL

Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information

反自我蒸馏用于通过点互信息的推理强化学习

Guobin Shen, Xiang Cheng, Chenxiao Zhao, Lei Huang, Jindong Li, Dongcheng Zhao, Xing Yu

机构 * Xiaohongshu Inc.(小红书公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本文提出反自我蒸馏方法,通过分析点互信息解决自我蒸馏在数学推理中的不一致问题,提升模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10663 2026-05-12 cs.AI

Evolving-RL: End-to-End Optimization of Experience-Driven Self-Evolving Capability within Agents

Evolving-RL: 端到端优化经验驱动的自我进化能力

Zhiyuan Fan, Wenwei Jin, Feng Zhang, Bin Li, Yihong Dong, Yao Hu, Jiawei Li

机构 * Xiaohongshu Inc.(小红书公司) School of Computer Science, Peking University(北京大学计算机学院)

AI总结 本文提出Evolving-RL框架,通过联合优化经验提取与利用能力,提升大模型在新型任务中的适应能力,实验显示在ALFWorld和Mind2Web任务中取得显著性能提升。

Comments 17pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07177 2026-05-12 cs.LG cs.AI

HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents

HyperEyes: 双粒度效率感知强化学习用于并行多模态搜索代理

Guankai Li, Jiabin Chen, Yi Xu, Xichen Zhang, Yuan Lu

机构 * Xiaohongshu Inc.(小红书公司) University of Cambridge(剑桥大学)

AI总结 HyperEyes通过双粒度效率感知强化学习,实现并行多模态搜索代理,提升搜索效率与准确性,其在六个基准测试中超越现有开源代理。

Comments Code & Data: https://github.com/DeepExperience/HyperEyes

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13710 2026-05-12 cs.CV

SLQ: Bridging Modalities via Shared Latent Queries for Retrieval with Frozen MLLMs

SLQ:通过共享潜在查询桥接模态以实现冻结MLLMs的检索

Haoran Lou, Ziyan Liu, Chunxiao Fan, Yuexin Wu, Yue Ming, Hao Wu, Kai Zuo, Yibo Chen, Xu Tang

机构 * School of Electronic Engineering, Beijing University of Posts(北京邮电大学电子工程学院) Xiaohongshu Inc., China(小红书公司)

AI总结 SLQ通过冻结MLLMs的主干,引入共享潜在查询提升多模态检索性能,实验显示其在多个基准上表现优异。

Comments Accepted to ICML-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08283 2026-05-12 cs.LG cs.AI cs.CL

HTPO: Towards Exploration-Exploitation Balanced Policy Optimization via Hierarchical Token-level Objective Control

HTPO: 通过分层令牌级目标控制实现探索-利用平衡的策略优化

Xincheng Yao, Ruoqi Li, Cheng Chen, Daoxin Zhang, Yi Wu, Yao Hu, Chongyang Zhang

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) Xiaohongshu Inc.(小红书公司) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院)

AI总结 本文提出HTPO算法,通过分层划分响应令牌为功能组,设计专用优化目标以平衡探索与利用,实验验证其在推理基准上的优越性。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏