arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3038
2603.00655 2026-04-15 cs.CV

Mema: Memory-Augmented Adapter for Enhanced Vision-Language Understanding

Mema:增强视觉-语言理解的内存增强适配器

Ying Liu, Yudong Han, Kean Shi, Liyuan Pan

机构 * Beijing Institute of Technology(北京理工大学) Peking University(北京大学) Yangtze Delta Region Academy of Beijing Institude of Technology(北京理工大学长江三角洲地区研究院)

AI总结 本文提出Mema适配器,通过维护状态记忆积累层次视觉表示,提升多模态理解性能,实验验证其在复杂任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06794 2026-04-15 cs.AI

No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning

不再有陈旧的反馈:为开放世界智能体学习的共进化批评者

Zhicong Li, Lingjie Jiang, Yulan Hu, Xingchen Zeng, Yixia Li, Xiangwen Zhang, Guanhua Chen, Zheng Pan, Xin Li, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 赛洛岭人工智能学院) Amap, Alibaba Group(阿里巴巴集团 阿里地图) Peking University(北京大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Southern University of Science and Technology(南方科技大学)

AI总结 本文提出ECHO框架,通过同步共进化循环联合优化策略和批评者,解决开放世界环境中策略演变导致的反馈过时问题,提升长周期任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04282 2026-04-15 cs.AI

Synthetic POMDPs to Challenge Memory-Augmented RL: Memory Demand Structure Modeling

合成POMDPs挑战记忆增强型RL:内存需求结构建模

Yongyi Wang, Lingfeng Li, Bozhou Chen, Ang Li, Hanyu Liu, Qirui Zheng, Xionghui Yang, Wenxin Li

机构 * School of Computer Science, Peking University, Beijing 100871, China(北京大学计算机学院,北京100871,中国)

AI总结 本文提出定制化的POMDP环境设计,通过理论框架、线性动力学和奖励再分配方法,构建具有预定义内存需求结构的环境,以评估记忆增强型RL的挑战与性能。

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-52148-y}

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04227 2026-04-15 cs.CR cs.AI

Mobile GUI Agents under Real-world Threats: Are We There Yet?

移动GUI代理在现实威胁下的表现:我们已经到达了吗?

Guohong Liu, Jialei Ye, Jiacheng Liu, Yuanchun Li, Wei Liu, Pengzhi Gao, Jian Luan, Yunxin Liu

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) University of Electronic Science and Technology of China(电子科学与技术大学) Peking University(北京大学) MiLM Plus, Xiaomi Inc.(MiLM Plus,小米公司)

AI总结 研究探讨了移动GUI代理在现实威胁下的性能问题,提出了一种可扩展的应用内容仪器化框架,通过动态任务环境和静态数据集验证代理在第三方内容干扰下的表现,发现代理性能显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17384 2026-04-15 cs.LG cs.CV stat.ML

Variational Autoencoding Discrete Diffusion with Enhanced Dimensional Correlations Modeling

变分自编码离散扩散与增强的维度相关性建模

Tianyu Xie, Shuchen Xue, Zijin Feng, Tianyang Hu, Jiacheng Sun, Zhenguo Li, Cheng Zhang

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Center for Statistical Science, Peking University(北京大学统计科学中心) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Huawei Foundation Model Dept(华为基金会模型部门) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出VADD框架,通过潜在变量建模增强离散扩散,提升样本质量,尤其在少量去噪步骤时表现优异。

Comments ICLR 2026 Poster; 24 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12537 2026-04-15 cs.CV cs.AI

MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models

MODIX:一种无需训练的多模态信息驱动的位置索引缩放

Ruoxiang Huang, Zhen Yuan

机构 * Peking University(北京大学)

AI总结 MODIX通过动态调整位置步长,基于模态特定贡献优化多模态模型的位置编码,提升多模态推理能力。

Comments Accepted by CVPR 2026 (Highlight). 10 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12506 2026-04-15 cs.CL cs.SD

Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs

超越转录:面向感知意识的统一音频架构

Linhao Zhang, Yuhan Song, Aiwei Liu, Chuhan Wu, Sijun Zhang, Wei Jia, Yuan Liu, Houfeng Wang, Xiao Zhou

机构 * Basic Model Technology Center, WeChat AI, Tencent Inc.(腾讯基本模型技术中心、微信AI、腾讯公司) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室、计算机学院、北京大学)

AI总结 本文提出统一音频架构(UAS),通过将音频信息划分为转录、语调和非语言事件三个组件,提升音频细粒度感知性能,同时保持推理能力。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12322 2026-04-15 cs.CV

Self-Adversarial One Step Generation via Condition Shifting

通过条件位移实现自对抗一步生成

Deyuan Liu, Peng Sun, Yansen Han, Zhenglin Cheng, Chuyan Chen, Tao Lin

机构 * Westlake University(西拉丘学院) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Peking University(北京大学)

AI总结 本文提出APEX框架,通过条件位移内生提取对抗信号,实现无需外部判别器的一步生成,提升生成质量与推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07285 2026-04-15 cs.LG cs.AI

GTCN-G: A Residual Graph-Temporal Fusion Network for Imbalanced Intrusion Detection

GTCN-G:一种用于不平衡入侵检测的残差图-时间融合网络

Tianxiang Xu, Zhichao Wen, Xinyu Zhao, Qi Hu, Yan Li, Chang Liu

机构 * Peking University(北京大学) RWTH Aachen University(亚琛工业大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Northeastern University(东北大学) Thales Group(泰雷兹集团) Chinese Medical Information and Big Data Association(中国医学信息与大数据协会)

AI总结 本文提出GTCN-G模型,结合图卷积网络和门控时间卷积网络,通过残差学习机制解决数据不平衡问题,实验表明在二分类和多分类任务中性能优越。

Comments This preprint was submitted to IEEE TrustCom 2025. The accepted version will be published under copyright 2025 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22220 2026-04-15 cs.CL cs.SD

StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs

StableToken:一种抗噪声的语义语音分词器用于鲁棒的语音大语言模型

Yuhan Song, Linhao Zhang, Chuhan Wu, Aiwei Liu, Wei Jia, Houfeng Wang, Xiao Zhou

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Basic Model Technology Center, WeChat AI, Tencent Inc.(微信AI基础模型技术中心,腾讯公司)

AI总结 本文提出StableToken,通过共识机制提升语音分词器的稳定性,减少噪声下的单位编辑距离,提升语音大语言模型的鲁棒性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11749 2026-04-14 cs.CL

HistLens: Mapping Idea Change across Concepts and Corpora

HistLens:跨概念和语料库的思想变化映射

Yi Jing, Weiyun Qiu, Yihang Peng, Zhifang Sui

机构 * Department of Computer Science and Technology, Tsinghua University, China(清华大学计算机科学与技术系) School of History, Nanjing University, China(南京大学历史学院) Department of Chinese Language and Literature, Tsinghua University, China(清华大学中国语言文学系) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, China(北京大学计算机学院多媒体信息处理国家重点实验室)

AI总结 HistLens提出一种基于SAE的统一框架,用于多概念、多语料库的概念史分析,通过分解概念表示并追踪其激活动态,实现跨概念和语料库的思想演变模式计算。

Comments Accepted by ACL 2026 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11522 2026-04-14 cs.CL

Triviality Corrected Endogenous Reward

修正的内生奖励

Xinda Wang, Zhengxu Hou, Yangshijie Zhang, Bingren Yan, Jialin Liu, Chenzhuo Zhao, Zhibo Yang, Bin-Bin Yang, Feng Xiao

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Lanzhou University(兰州大学)

AI总结 本文提出TCER,通过相对信息增益和概率修正机制解决开放性写作中内生奖励的平凡偏差问题,提升生成多样性与内容质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11365 2026-04-14 cs.AI cs.CL

Learning from Contrasts: Synthesizing Reasoning Paths from Diverse Search Trajectories

从对比中学习:从多样的搜索轨迹中合成推理路径

Peiyang Liu, Zhirui Chen, Xi Wang, Di Liang, Youru Li, Zhi Cai, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学UCAS-Terminus人工智能实验室) Tencent Technology(腾讯科技) College of Computer Science, Beijing University of Technology(北京工业大学计算机学院)

AI总结 本文提出CRPS框架,通过对比高质与低质搜索轨迹合成推理路径,减少数据集规模并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11351 2026-04-14 cs.RO

WM-DAgger: Enabling Efficient Data Aggregation for Imitation Learning with World Models

WM-DAgger: 通过世界模型实现模仿学习中的高效数据聚合

Anlan Yu, Zaishu Chen, Peili Song, Zhiqing Hong, Haotian Wang, Desheng Zhang, Tian He, Yi Ding, Daqing Zhang

机构 * Peking University(北京大学) JD Logistics(京东物流) Nankai University(南开大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Rutgers University(罗格斯大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Institut Polytechnique de Paris(巴黎综合理工学院)

AI总结 本文提出WM-DAgger框架,利用世界模型合成OOD恢复数据,无需人工干预,提升机器人模仿学习效率,实验表明在少样本下显著提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11309 2026-04-14 cs.CR cs.AI cs.CL cs.CV cs.LG

The Salami Slicing Threat: Exploiting Cumulative Risks in LLM Systems

切肉威胁:在LLM系统中利用累积风险

Yihao Zhang, Kai Wang, Jiangrong Wu, Haolin Wu, Yuxuan Zhou, Zeming Wei, Dongxian Wu, Xun Chen, Jun Sun, Meng Sun

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Sun Yat-sen University(中山大学) Wuhan University(武汉大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ByteDance(字节跳动) Singapore Management University(新加坡管理大学)

AI总结 本文提出Salami Slicing Risk,通过链式低风险输入累积有害意图,以触发高风险行为,提出Salami Attack框架并验证其有效性,同时提出防御策略以缓解多轮 jailbreak 风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11094 2026-04-14 cs.SE cs.AI

E2E-REME: Towards End-to-End Microservices Auto-Remediation via Experience-Simulation Reinforcement Fine-Tuning

E2E-REME:通过经验-模拟强化微服务自动修复

Lingzhe Zhang, Yunpeng Zhai, Tong Jia, Minghua He, Chiming Duan, Zhaoyang Liu, Bolin Ding, Ying Li

机构 * Peking University(北京大学) Key Laboratory of Data Intelligence and Security(数据智能与安全重点实验室) Alibaba Group(阿里巴巴集团) Key Laboratory of Data Space Technology and System(数据空间技术与系统重点实验室)

AI总结 本文提出E2E-MR任务,通过经验-模拟强化训练构建E2E-REME模型,实现从诊断报告自动生成可执行playbook,提升微服务系统修复的准确性和效率。

Comments accepted by FSE'26. arXiv admin note: text overlap with arXiv:2511.01166

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06939 2026-04-14 cs.CV

Grounded Forcing: Bridging Time-Independent Semantics and Proximal Dynamics in Autoregressive Video Synthesis

基于语义的强制:在自回归视频合成中连接时间无关语义与近端动态

Jintao Chen, Chengyu Bai, Junjun Hu, Xinda Xue, Mu Xu

机构 * Peking University(北京大学) Alibaba(阿里巴巴)

AI总结 本文提出Grounded Forcing框架,通过三种机制解决自回归视频合成中的语义遗忘、视觉漂移和可控性丢失问题,提升长程一致性和视觉稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11217 2026-04-14 cs.CL cs.AI

Domain-Specific Data Generation Framework for RAG Adaptation

面向RAG适应的领域特定数据生成框架

Chris Xing Tian, Weihao Xie, Zhen Chen, Zhengyuan Yi, Hui Liu, Haoliang Li, Shiqi Wang, Siwei Ma

机构 * Peng Cheng Laboratory(鹏城实验室) City University of Hong Kong(香港城市大学) Peking University(北京大学)

AI总结 本文提出RAGen框架,通过识别文档中的关键概念生成领域相关的问答对,支持多种RAG适应策略,提升领域适应效果。

Comments To appear in ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23514 2026-04-14 cs.CL cs.AI

If an LLM Were a Character, Would It Know Its Own Story? Evaluating Lifelong Learning in LLMs

如果一个大语言模型是一个角色,它会知道自己故事吗?评估大语言模型的终身学习

Siqi Fan, Xiusheng Huang, Yiqun Yao, Xuezhi Fang, Kang Liu, Peng Han, Shuo Shang, Aixin Sun, Yequan Wang

机构 * University of Electronic Science and Technology of China(电子科技大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) Nanyang Technological University(南洋理工大学) Peking University(北京大学) Spin Matrix, China(中国Spin Matrix公司)

AI总结 本文提出LIFESTATE-BENCH基准,评估LLM的终身学习能力,通过Hamlet和合成剧本数据集,发现非参数方法在管理状态学习上表现更优,但所有模型在交互延长时均面临灾难性遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11006 2026-04-14 cs.CV

Towards Realistic 3D Emission Materials: Dataset, Baseline, and Evaluation for Emission Texture Generation

迈向逼真3D发射材料:数据集、基线和评估用于发射纹理生成

Zhiyuan Zhang, Zijian Zhou, Linjun Li, Long Chen, Hao Tang, Yichen Gong

机构 * Peking University(北京大学) King’s College London(伦敦国王学院) XG Tech

AI总结 本文提出发射纹理生成任务,构建首个包含40k高质量发射材料的Objaverse-Emission数据集,并提出EmissionGen基线模型及详细评估指标,展示了在工业应用中的潜力。

Comments Dataset will be available at https://github.com/yx345kw/EmissionGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10701 2026-04-14 cs.LG cs.AI cs.CL

Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning

带回价值模型:生成式批评者在大语言模型强化学习中的价值建模

Zikang Shan, Han Zhong, Liwei Wang, Li Zhao

机构 * Peking University(北京大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出生成式批评者GenAC,通过链式推理改进价值建模,提升RL性能。

Comments 16 pages including appendix, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10678 2026-04-14 cs.AI cs.LG

FedRio: Personalized Federated Social Bot Detection via Cooperative Reinforced Contrastive Adversarial Distillation

FedRio:通过协作强化对比对抗蒸馏实现个性化联邦社交机器人检测

Yingguang Yang, Hao Liu, Xin Zhang, Yunhui Liu, Yutong Xia, Qi Wu, Hao Peng, Taoran Liang, Bin Chong, Tieke He, Philip S. Yu

机构 * National Engineering Laboratory for Big Data Analysis and Applications, Peking University(北京大学大数据分析与应用技术国家工程实验室)

AI总结 本文提出FedRio框架,通过自适应消息传递模块、联邦知识提取机制和多阶段对抗对比学习策略,提升跨平台社交机器人检测的准确性和一致性,同时在隐私保护下优于现有联邦学习基线。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10456 2026-04-14 cs.CV

A Benchmark and Multi-Agent System for Instruction-driven Cinematic Video Compilation

一个用于指令驱动电影视频编译的基准和多智能体系统

Peixuan Zhang, Chang Zhou, Ziyuan Zhang, Hualuo Liu, Chunjie Zhang, Jingqi Liu, Xiaohui Zhou, Xi Chen, Shuchen Weng, Si Li, Boxin Shi

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) AI Technology Center, Online Video Business Unit, Tencent PCG(腾讯PCG在线视频事业部AI技术中心) Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) State Key Lab of Multimedia Info. Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Nat’l Eng. Research Ctr. of Visual Technology, School of Computer Science, Peking University(北京大学计算机学院国家视觉技术工程研究中心) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)

AI总结 本文提出CineBench基准和CineAgents系统,解决电影视频编译中的上下文崩溃和时间碎片化问题,通过脚本逆向工程和迭代叙事规划生成更连贯的编译结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10442 2026-04-14 cs.CV

ReContraster: Making Your Posters Stand Out with Regional Contrast

ReContraster:利用区域对比让海报脱颖而出

Peixuan Zhang, Zijian Jia, Ziqi Cai, Shuchen Weng, Si Li, Boxin Shi

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(北京大学计算机学院国家视觉技术工程研究中心) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 ReContraster通过区域对比和多智能体系统生成视觉吸引人的海报,结合去噪策略和新基准数据集,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05549 2026-04-14 cs.CL

Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM Agents

不要执着于提示:针对LLM代理的推理劫持与约束紧缩

Yanxu Mao, Peipei Liu, Tiehan Cui, Congying Liu, Mingzhe Xing, Datao You

机构 * School of Software, Henan University(河南大学软件学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学)

AI总结 本文提出JailAgent框架,通过触发提取、推理劫持和约束紧缩三个阶段,避免修改用户提示,提升跨模型和跨场景的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23516 2026-04-14 cs.CL cs.AI cs.IR

MSA: Memory Sparse Attention for Efficient End-to-End Memory Model Scaling to 100M Tokens

MSA:内存稀疏注意力用于高效端到端内存模型扩展至100M标记

Yu Chen, Runkai Chen, Sheng Yi, Xinda Zhao, Xiaohong Li, Jianjin Zhang, Jun Sun, Chuanrui Hu, Yunyun Han, Lidong Bing, Yafeng Deng, Tianqiao Chen

机构 * Evermind Shanda Group(盛大集团) Peking University(北京大学)

AI总结 本文提出MSA,一种高效的端到端可训练内存模型框架,通过可扩展稀疏注意力和文档级RoPE实现线性复杂度,支持从16K到100M标记的扩展,同时保持稳定性,且在100M标记推理中实现2xA800 GPU的高效处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14410 2026-04-14 cs.CL

BiT-MCTS: A Theme-based Bidirectional MCTS Approach to Chinese Fiction Generation

BiT-MCTS:一种基于主题的双向MCTS方法用于中文小说生成

Zhaoyi Li, Xu Zhang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) School of Foreign Languages, Peking University(北京大学外国语学院)

AI总结 本文提出BiT-MCTS方法,通过主题驱动策略生成结构化小说,提升叙事连贯性和主题深度。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01692 2026-04-14 cs.LG cs.AI

Reasoning as Gradient: Scaling MLE Agents Beyond Tree Search

推理作为梯度:超越树搜索的MLE代理扩展

Yifei Zhang, Xu Yang, Xiao Yang, Bowen Xian, Qizheng Li, Shikai Fang, Jingyuan Li, Jian Wang, Mingrui Xu, Weiqing Liu, Jiang Bian

机构 * Nanjing University(南京大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) Zhejiang University(浙江大学) Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出Gome,一种基于梯度优化的MLE代理,通过将结构化诊断推理映射到梯度计算,实现更高效的优化。实验显示,随着模型能力增强,梯度优化在前沿模型中表现更优,且在受限预算下达到35.1%的任何奖牌率。

Comments 36 pages, 6 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14671 2026-04-14 cs.CV

Mirai: Autoregressive Visual Generation Needs Foresight

Mirai: 自回归视觉生成需要前瞻性

Yonghao Yu, Lang Huang, Zerun Wang, Runyi Li, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国立信息学研究所) Peking University(北京大学)

AI总结 研究探讨前瞻性训练信号对自回归视觉生成的影响,提出Mirai框架通过注入未来信息提升生成质量与收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11931 2026-04-14 cs.CV

Dark-EvGS: Event Camera as an Eye for Radiance Field in the Dark

暗光环境下的辐射场重建:事件相机作为视觉的眼睛

Jingqian Wu, Peiqi Duan, Zongqiang Wang, Changwei Wang, Boxin Shi, Edmund Y. Lam

机构 * Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电机电子工程系) State Key Laboratory of Multimedia Information Processing and National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室及视觉技术国家工程研究中心) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center, Qilu University of Technology(齐鲁工业大学(山东省科学院)山东省计算中心(国家超级计算济南中心)计算力网络与信息安全教育部重点实验室)

AI总结 本文提出Dark-EvGS框架,利用事件相机和3D高斯点绘制技术,在暗光环境中实现高质量辐射场重建,通过三重监督和颜色匹配模块提升合成图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏