arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Peking University(北京大学)

2026-03-23 至 2026-03-23 共收录 8
2603.20194 2026-03-23 cs.CV

MME-CoF-Pro: Evaluating Reasoning Coherence in Video Generative Models with Text and Visual Hints

MME-CoF-Pro:基于文本和视觉提示评估视频生成模型中的推理一致性

Yu Qi, Xinyi Xu, Ziyu Guo, Siyuan Ma, Renrui Zhang, Xinyan Chen, Ruichuan An, Ruofan Xing, Jiayi Zhang, Haojie Huang, Pheng-Ann Heng, Jonathan Tremblay, Lawson L. S. Wong

机构 * Northeastern University(东北大学) The Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学) ByteDance Seed(字节跳动种子) Peking University(北京大学) NVIDIA(英伟达)

AI总结 本文提出MME-CoF-Pro视频推理基准,评估视频模型的推理一致性,发现生成模型推理一致性弱,文本提示提升正确性但导致不一致,视觉提示在结构化任务中表现较好但难以处理细粒度感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19765 2026-03-23 cs.CV

FREAK: A Fine-grained Hallucination Evaluation Benchmark for Advanced MLLMs

FREAK:一种用于高级MLLMs细粒度幻觉评估的基准测试

Zhihan Yin, Jianxin Liang, Yueqian Wang, Yifeng Yao, Huishuai Zhang, Dongyan Zhao

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王学苑计算机技术研究所) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

AI总结 本文提出FREAK基准测试,通过高质量图像评估MLLMs在细粒度视觉感知中的幻觉问题,揭示了现有模型在详细视觉感知上的严重幻觉问题。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19678 2026-03-23 cs.CV

Vision-Language Attribute Disentanglement and Reinforcement for Lifelong Person Re-Identification

视觉-语言属性解耦与强化用于终身人物重识别

Kunlun Xu, Haotong Cheng, Jiangmeng Li, Xu Zou, Jiahuan Zhou

机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(北京大学王轩计算机技术研究院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology, Wuhan, China(华中科技大学人工智能与自动化学院,武汉,中国)

AI总结 本文提出VLADR方法,通过视觉-语言属性解耦与强化提升跨域知识迁移,增强抗遗忘与泛化能力,实验表明在抗遗忘和泛化能力上优于现有方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19598 2026-03-23 cs.CV

FlowScene: Style-Consistent Indoor Scene Generation with Multimodal Graph Rectified Flow

FlowScene: 多模态图校正流驱动的风格一致室内场景生成

Zhifei Yang, Guangyao Zhai, Keyang Lu, YuYang Yin, Chao Zhang, Zhen Xiao, Jieyi Long, Nassir Navab, Yikai Wang

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Technical University of Munich(慕尼黑技术大学) Beijing Jiaotong University(北京交通大学) Beijing Digital Native Digital City Research Center(北京数字原生数字城市研究院) Theta Labs, Inc.(Theta Labs公司) Beijing Normal University(北京师范大学)

AI总结 FlowScene通过多模态图校正流模型生成风格一致的室内场景,实现对布局、形状和纹理的精细控制,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07451 2026-03-23 cs.CL

DLLM Agent: See Farther, Run Faster

DLLM Agent: 看得更远,跑得更快

Huiling Zhen, Weizhe Lin, Renxi Liu, Kai Han, Yiming Li, Yuchuan Tian, Hanting Chen, Xiaoguang Li, Xiaosong Li, Chen Chen, Xianzhi Yu, Mingxuan Yuan, Youliang Yan, Peifeng Qin, Jun Wang, Yu Wang, Dacheng Tao, Yunhe Wang

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) UCL(伦敦大学学院) Tsinghua University(清华大学) NTU(国立新加坡大学) Peking University(北京大学)

AI总结 本文研究了扩散大语言模型(DLLM)在代理多步决策中的表现,发现其在准确率相当的情况下,整体效率比自回归模型(AR)高30%以上,并提出部署扩散骨架的两个实用考虑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21349 2026-03-23 cs.CV eess.IV

Electromagnetic Inverse Scattering from a Single Transmitter

单发射机的电磁反散射

Yizhe Cheng, Chunxun Tian, Haoru Wang, Wentao Zhu, Xiaoxuan Ma, Yizhou Wang

机构 * Center on Frontiers of Computing Studies, School of Computer Science, Peking University(前沿计算研究中心,计算机科学学院,北京大学) Institute of Digital Twin, Eastern Institute of Technology, Ningbo(数字孪生研究所,东部技术研究所,宁波) Robotics Institute, Carnegie Mellon University(机器人研究所,卡内基梅隆大学)

AI总结 本文提出了一种端到端的数据驱动框架,用于从单发射机测量数据中预测散射体的相对介电常数,提升了稀疏发射条件下的反散射精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10985 2026-03-23 cs.CL

Taking a Deep Breath: Enhancing Language Modeling of Large Language Models with Sentinel Tokens

深呼吸:通过哨兵令牌增强大语言模型的语言建模

Weiyao Luo, Suncong Zheng, Heming Xia, Weikang Wang, Yan Lei, Tianyu Liu, Shuang Chen, Zhifang Sui

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,北京大学计算机学院) School of Software & Microelectronics, Peking University(北京大学软件与微电子学院) Tencent Hunyuan(腾讯文言) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Alibaba Group(阿里巴巴集团)

AI总结 本文提出通过插入哨兵令牌使大语言模型能够总结离散文本块信息,提升长文本建模能力,实验验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19268 2026-03-23 cs.CL cs.AI

Full-Stack Domain Enhancement for Combustion LLMs: Construction and Optimization

面向燃烧科学的全栈领域增强:构建与优化

Quanjia Xiao, Weimin Ouyang, Zonglin Yang, Tianhao Wu, Qingguo Zhou, Runze Mao, Zhi X. Chen

机构 * Peking University(北京大学) AI for Science Institute, Beijing(AI for Science研究院,北京)

AI总结 本文提出首个针对燃烧科学的全栈领域增强LLM工作流程,整合自动领域语料构建、增量预训练、指令微调及可验证奖励强化学习,构建标准化评估基准FlameBench,显著提升燃烧科学推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏