arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

共收录 1226
2603.08035 2026-03-10 cs.AI cs.LG

CDRRM: Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling

CDRRM:基于对比的评分标准生成用于可靠和可解释的奖励建模

Dengcan Liu, Fengkai Yang, Xiaohan Wang, Shurui Yan, Jiajun Chai, Jiahao Li, Yikun Ban, Zhendong Mao, Wei Lin, Guojun Yin

机构 * University of Science and Technology of China(科学技术大学) Peking University(北京大学) BeiHang University(北航大学)

AI总结 CDRRM通过对比驱动的评分标准生成方法,实现可靠且可解释的奖励建模,有效缓解评估偏见并提升数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08007 2026-03-10 cs.CV cs.AI

ViSA-Enhanced Aerial VLN: A Visual-Spatial Reasoning Enhanced Framework for Aerial Vision-Language Navigation

ViSA增强的空中视觉语言导航:一种增强视觉空间推理能力的空中视觉语言导航框架

Haoyu Tong, Xiangyu Dong, Xiaoguang Ma, Haoran Zhao, Yaoming Zhou, Chenghao Lin

机构 * Tianmushan Laboratory, Beihang University(北航之梦实验室,北京航空航天大学) Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学) Foshan Graduate School of Innovation, Northeastern University(佛山创新研究生学院,东北大学) School of Aeronautic Science and Engineering, Beihang University(航空科学与工程学院,北京航空航天大学) Faculty of Robot Science and Engineering, Northeastern University(机器人科学与工程学院,东北大学)

AI总结 ViSA增强框架通过结构化视觉提示提升空中VLN的空间推理能力,显著提高成功率,为该领域提供有力支持。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07997 2026-03-10 cs.AI

CMMR-VLN: Vision-and-Language Navigation via Continual Multimodal Memory Retrieval

CMMR-VLN:通过持续多模态记忆检索实现视觉与语言导航

Haozhou Li, Xiangyu Dong, Huiyan Jiang, Yaoming Zhou, Xiaoguang Ma

机构 * Foshan Graduate School of Innovation at Northeastern University(东北大学创新研究生院) Faculty of Robot Science and Engineering at Northeastern University(东北大学机器人科学与工程学院) College of Software at Northeastern University(东北大学软件学院) School of Aeronautic Science and Engineering at Beihang University(北航航空科学与工程学院)

AI总结 CMMR-VLN通过引入持续多模态记忆检索机制,提升视觉与语言导航任务中对先前经验的选择性利用能力,显著提高导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07660 2026-03-10 cs.CV

Holi-Spatial: Evolving Video Streams into Holistic 3D Spatial Intelligence

Holi-Spatial: 将视频流转化为整体3D空间智能

Yuanyuan Gao, Hao Li, Yifei Liu, Xinhao Ji, Yuning Gong, Yuanjun Liao, Fangfu Liu, Manyuan Zhang, Yuchen Yang, Dan Xu, Xue Yang, Huaxi Huang, Hongjie Zhang, Ziwei Liu, Xiao Sun, Dingwen Zhang, Zhihang Zhong

机构 * Shanghai AI Lab(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学) Beihang University(北京航空航天大学) Sichuan University(四川大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 Holi-Spatial通过自动化方法构建大规模多模态3D空间数据集,提升空间推理任务的模型性能。

Comments project page: https://visionary-laboratory.github.io/holi-spatial/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07644 2026-03-10 cs.RO

PanoDP: Learning Collision-Free Navigation with Panoramic Depth and Differentiable Physics

PanoDP:利用全景深度与可微物理学习无碰撞导航

Hao Zhong, Pei Chi, Jiang Zhao, Shenghai Yuan, Xuyang Gao, Thien-Minh Nguyen, Lihua Xie

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院) Beihang University, Beijing, China(北京航空航天大学) The University of Queensland, Australia(昆士兰大学)

AI总结 PanoDP通过结合全景深度感知与可微物理训练信号,提升在杂乱环境中无碰撞导航的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07572 2026-03-10 cs.LG

TS-MLLM: A Multi-Modal Large Language Model-based Framework for Industrial Time-Series Big Data Analysis

TS-MLLM:一种基于多模态大语言模型的工业时间序列大数据分析框架

Haiteng Wang, Yikang Li, Yunfei Zhu, Jingheng Yan, Lei Ren, Laurence T. Yang

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) School of Software, Beihang University(北京航空航天大学软件学院) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) State Key Laboratory of Intelligent Manufacturing System Technology(智能制造系统技术国家重点实验室) School of Computer and Artificial Intelligence, Zhengzhou University(郑州大学计算机与人工智能学院) Department of Computer Science, St. Francis Xavier University(圣弗朗西斯科大学计算机科学系)

AI总结 TS-MLLM通过多模态大语言模型联合建模时序信号、频域图像和文本知识,提升工业时间序列预测的鲁棒性、效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07492 2026-03-10 cs.IT cs.ET cs.HC cs.LG math.IT

Pushing Bistatic Wireless Sensing toward High Accuracy at the Sub-Wavelength Scale

推动双工信无线传感在亚波长尺度上的高精度

Wenwei Li, Jiarun Zhou, Qinxiao Quan, Fusang Zhang, Daqing Zhang

机构 * School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院) School of Cyber Science and Technology, Beihang University, Beijing, China(北航信息科学与技术学院) Telecom SudParis, Institut Polytechnique de Paris, Paris, France(巴黎理工电信学院)

AI总结 本文提出了一种基于信道响应幅度恢复理想信道特征的方法,有效提升了亚波长尺度的无线传感精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10934 2026-03-10 cs.DB cs.LG

Towards Practical Benchmarking of Data Cleaning Techniques: On Generating Authentic Errors via Large Language Models

面向数据清洗技术实用基准测试的探索:通过大语言模型生成真实错误

Xinyuan Liu, Jiahui Chen, Bocheng Hu, Yu Sun, Xinyang Chen, Shaoxu Song, Yongxin Tong

机构 * Nankai University(南开大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua University(清华大学) Beihang University(北京航空航天大学)

AI总结 TableEG利用大语言模型生成真实错误,通过三元组表示和表格微调策略,提升数据清洗技术的基准测试效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18882 2026-03-10 cs.CV

Light of Normals: Unified Feature Representation for Universal Photometric Stereo

法线之光:面向通用光度立体的统一特征表示

Houyuan Chen, Hong Li, Chongjie Ye, Zhaoxi Chen, Bohan Li, Shaocong Xu, Xianda Guo, Xuhui Liu, Yikai Wang, Baochang Zhang, Satoshi Ikehata, Boxin Shi, Anyi Rao, Hao Zhao

机构 * BUAA(北京航空航天大学) HKUST(香港科技大学) BAAI(北京人工智能研究院) FNii, CUHKSZ(FNii,CUHKSZ) NTU(国立台湾大学) WHU(武汉大学) BNU(北京师范大学) NII(日本国立信息与通信技术研究所) PKU(北京大学) AIR, THU(AIR,清华大学)

AI总结 本文提出LINO UniPS,通过Light Register Tokens和交错注意力块实现光照与法线信息解耦,并结合小波双分支架构和法线梯度损失恢复高频细节,提升通用光度立体的性能。

Comments Home: https://houyuanchen111.github.io/lino.github.io Github: https://github.com/houyuanchen111/LINO_UniPS HuggingFace

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17252 2026-03-10 cs.LG cs.AI

Adaptive Batch-Wise Sample Scheduling for Direct Preference Optimization

适应性批级样本调度用于直接偏好优化

Zixuan Huang, Yikun Ban, Lean Fu, Xiaojie Li, Zhongxiang Dai, Jianxin Li, Deqing Wang

机构 * Beihang University(北京航空航天大学) Bytedance China(字节跳动中国) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出SamS算法,通过动态调度训练样本提升DPO性能,无需修改核心算法,有效提高LLM对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06683 2026-03-10 cs.RO cs.AI

RoboPARA: Dual-Arm Robot Planning with Parallel Allocation and Recomposition Across Tasks

RoboPARA: 双臂机器人任务并行规划的平行分配与重组

Shiying Duan, Pei Ren, Nanxiang Jiang, Zhengping Che, Jian Tang, Zhaoxin Fan, Yifan Sun, Wenjun Wu

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北航) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Center for Applied Statistics, School of Statistics, Renmin University of China(应用统计中心,统计学院,中国人民大学)

AI总结 RoboPARA通过双臂任务并行规划框架,提升复杂多任务场景下的效率和可靠性,引入首个评估双臂任务并行性的数据集。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07078 2026-03-10 cs.AI cs.CL

CoTJudger: A Graph-Driven Framework for Automatic Evaluation of Chain-of-Thought Efficiency and Redundancy in LRMs

CoTJudger: 一种基于图的框架,用于自动评估链式推理效率和冗余性在LRMs中

Siyi Li, Jiajun Shi, Shiwen Ni, Ge Zhang, Shuaimin Li, Shijian Wang, Zhoufutu Wen, Yizhi Li, Hamid Alinejad-Rokny, Jiaheng Liu, Min Yang, Wenhao Huang

机构 * University of Science and Technology of China(科学技术大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Shenzhen Institutes of Advanced Technology, CAS(深圳先进技术研究所,中国科学院) Southeast University(东南大学) Nanjing University(南京大学) Beihang University(北航) University of Manchester(曼彻斯特大学)

AI总结 CoTJudger通过构建依赖图提取最短有效路径,评估链式推理的效率与冗余,揭示模型中的冗余问题及失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07028 2026-03-10 cs.CR cs.CV

Two Frames Matter: A Temporal Attack for Text-to-Video Model Jailbreaking

两个框架至关重要:一种针对文本到视频模型劫持的时序攻击

Moyang Chen, Zonghao Ying, Wenzhuo Xu, Quancheng Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang

机构 * College of Science, Mathematics and Technology, Wenzhou-Kean University(科学、数学与技术学院,温州市凯恩大学) State Key Laboratory of Complex & Critical Software Environment, Beihang University(复杂与关键软件环境国家重点实验室,北航) AI Security Lab(360人工智能安全实验室)

AI总结 本文提出TFM攻击方法,通过碎片化提示和隐式替换,提高文本到视频模型的劫持效果,显著提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18734 2026-03-10 cs.CV cs.AI

Yo'City: Personalized and Boundless 3D Realistic City Scene Generation via Self-Critic Expansion

Yo'City:通过自批评扩展实现个性化和无边界的3D逼真城市场景生成

Keyang Lu, Sifan Zhou, Hongbin Xu, Gang Xu, Zhifei Yang, Yikai Wang, Zhen Xiao, Jieyi Long, Ming Li

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Beihang University(北航) Southeast University(东南大学) ByteDance Seed(字节跳动种子) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室) Beijing Normal University(北京师范大学) Theta Labs(Theta实验室)

AI总结 Yo'City通过自批评扩展实现个性化和无边界的3D城市生成,利用大模型的推理能力提升生成质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02123 2026-03-09 cs.CL

CMRAG: Co-modality-based visual document retrieval and question answering

CMRAG:基于共模的视觉文档检索与问答

Wang Chen, Wenhan Yu, Guanqiang Qi, Weikang Li, Yang Li, Lei Sha, Deguo Xia, Jizhou Huang

机构 * Baidu Inc(百度公司) The University of Hong Kong(香港大学) Beihang University(北京航空航天大学) Peking University(北京大学)

AI总结 CMRAG通过统一编码模型和共模信息检索方法,提升多模态视觉文档问答系统的性能。

Comments Published at ICLR 2026 Workshop on Multimodal Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06222 2026-03-09 cs.CL

SPOT: Span-level Pause-of-Thought for Efficient and Interpretable Latent Reasoning in Large Language Models

SPOT:基于跨度的思考暂停,用于大语言模型中高效且可解释的潜在推理

Yunlong Chu, Minglai Shao, Yuhang Liu, Bing Hao, Yumeng Lin, Jialu Wang, Ruijie Wang

机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北航大学)

AI总结 SPOT通过压缩显式推理步骤为紧凑的潜在暂停token,提升大语言模型的推理效率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06081 2026-03-09 cs.CV

Lyapunov Probes for Hallucination Detection in Large Foundation Models

Lyapunov探针用于大型基础模型中的幻觉检测

Bozhi Luan, Gen Li, Yalan Qin, Jifeng Guo, Yun Zhou, Faguo Wu, Hongwei Zheng, Wenjun Wu, Zhaoxin Fan

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北航) School of Electronic and Information Engineering, State Key Laboratory of CNS/ATM, Beihang University(电子与信息工程学院, CNS/ATM 国家重点实验室,北航) National Key Laboratory of Information Systems Engineering, National University of Defense Technology(信息系统工程国家重点实验室,国防科技大学) Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院) Shanghai University(上海大学)

AI总结 通过Lyapunov探针检测大型基础模型中的幻觉,利用动力系统稳定性理论分析知识过渡区域的边界特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06049 2026-03-09 cs.CV cs.RO

Devil is in Narrow Policy: Unleashing Exploration in Driving VLA Models

魔鬼在窄政策中:解锁驾驶VLA模型的探索

Canyu Chen, Yuguang Yang, Zhewen Tan, Yizhi Wang, Ruiyi Zhan, Haiyan Liu, Xuanyao Mao, Jason Bao, Xinyue Tang, Linlin Yang, Bingchuan Sun, Yan Wang, Baochang Zhang

机构 * National Superior College for Engineers, Beihang University(北京航空航天大学工程师学院) School of Electronic Information Engineering, Beihang University(北京航空航天大学电子信息工程学院) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) Lenovo Group Limited(联想集团有限公司) State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室)

AI总结 Curious-VLA通过双阶段设计缓解探索-利用困境,提升驾驶VLA模型的探索潜力,实现Navsim基准的最优性能。

Comments Accepted by CVPR2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05818 2026-03-09 cs.CL

RouteGoT: Node-Adaptive Routing for Cost-Efficient Graph of Thoughts Reasoning

RouteGoT: 用于图状思维推理的节点自适应路由

Yuhang Liu, Ruijie Wang, Yunlong Chu, Bing Hao, Yumeng Lin, Shengzhong Liu, Minglai Shao

机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北航) Shanghai Jiao Tong University(上海交通大学)

AI总结 RouteGoT通过节点自适应路由框架提升图状思维推理的效率与准确性,实现性能与成本的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13127 2026-03-09 cs.CV cs.CR

SPARK: Jailbreaking T2V Models by Synergistically Prompting Auditory and Recontextualized Knowledge

SPARK:通过协同提示音频与重新上下文化知识实现T2V模型的劫持

Zonghao Ying, Moyang Chen, Nizhang Li, Zhiqiang Wang, Wenxin Zhang, Quanchen Zou, Zonglei Jing, Aishan Liu, Xianglong Liu

机构 * State Key Laboratory of Complex \& Critical Software Environment, Beihang University College of Science, Mathematics Technology, Wenzhou-Kean University 360 AI Security Lab Faculty of Innovation Engineering, Macau University of Science Hong Kong University of Science University of Chinese Academy of Sciences

AI总结 SPARK通过模块化提示设计,利用音频与视觉关联模式,实现对T2V模型的高效劫持,提升攻击成功率23%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05283 2026-03-09 cs.SE cs.AI

Software Development Life Cycle Perspective: A Survey of Benchmarks for Code Large Language Models and Agents

软件开发生命周期视角:代码大语言模型和代理的基准测试调查

Kaixin Wang, Tianlin Li, Xiaoyu Zhang, Chong Wang, Weisong Sun, Yang Liu, Aishan Liu, Xianglong Liu, Chao Shen, Bin Shi

机构 * Xi’an Jiaotong University(西安交通大学) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学)

AI总结 本文从软件开发生命周期视角调查代码大语言模型和代理的基准测试,揭示当前基准测试在覆盖方面的不平衡,并提出未来研究方向以缩小理论能力与实际应用之间的差距。

Comments Significantly enhanced the tiered analysis framework for a more comprehensive evaluation of CodeLLMs and Agents throughout the SDLC

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.14007 2026-03-09 cs.RO cs.MA

OA-Bug: An Olfactory-Auditory Augmented Bug Algorithm for Swarm Robots in a Denied Environment

OA-Bug:一种用于在被拒绝环境中运作的嗅觉-听觉增强型虫群算法

Siqi Tan, Xiaoya Zhang, Jingyao Li, Ruitao Jing, Mufan Zhao, Yang Liu, Quan Quan

机构 * Beihang University(北航大学)

AI总结 本文提出OA-Bug算法,利用嗅觉和听觉信号提升群机器人在被拒绝环境中的搜索性能。

Comments 7 pages, 6 figures, accepted by 2023 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22571 2026-03-06 cs.AI

PerfGuard: A Performance-Aware Agent for Visual Content Generation

PerfGuard: 一种面向视觉内容生成的性能感知代理

Zhipeng Chen, Zhongrui Zhang, Chao Zhang, Yifan Xu, Lan Yang, Jun Liu, Ke Li, Yi-Zhe Song

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications, China(北京邮电大学人工智能学院) Beijing Digital Native Digital City Research Center, China(北京数字原生数字城市研究中心) School of Computer Science and Engineering, Beihang University, China(北航计算机科学与工程学院) SketchX, CVSSP, University of Surrey, United Kingdom(SketchX、CVSSP、英国萨里大学) Chenxi Shuzhi (Beijing) Technology Co., Ltd, China(北京晨曦智数科技有限公司)

AI总结 PerfGuard通过性能感知机制提升视觉内容生成任务中工具选择的准确性与执行可靠性。

Comments This paper has been accepted by ICLR 2026. The original paper link is: https://openreview.net/pdf?id=tdN42GTv4S The code repository link is: https://github.com/FelixChan9527/PerfGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03575 2026-03-06 cs.CV

UniComp: Rethinking Video Compression Through Informational Uniqueness

UniComp:通过信息唯一性重新思考视频压缩

Chao Yuan, Shimin Chen, Minliang Lin, Limeng Qiao, Guanglu Wan, Lin Ma

机构 * Meituan Inc.(美团公司) Beihang University(北京航空航天大学)

AI总结 UniComp通过信息唯一性驱动的框架,在有限计算资源下提升视频压缩的信息保真度,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04307 2026-03-05 cs.CV

Dual Diffusion Models for Multi-modal Guided 3D Avatar Generation

多模态引导的3D人像生成双扩散模型

Hong Li, Yutang Feng, Minqi Meng, Yichen Yang, Xuhui Liu, Baochang Zhang

机构 * Beihang University(北航大学) KAUST(卡塔尔科技大学)

AI总结 本文提出PromptAvatar,通过双扩散模型实现多模态引导的3D人像生成,提升生成质量与效率。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04302 2026-03-05 cs.CV

Motion Manipulation via Unsupervised Keypoint Positioning in Face Animation

通过无监督关键点定位实现面部动画中的运动操控

Hong Li, Boyu Liu, Xuhui Liu, Baochang Zhang

机构 * BUAA(北京航空航天大学) KAUST(卡塔尔大学)

AI总结 本文提出MMFA方法,通过无监督关键点定位解耦身份语义与运动信息,实现可控的面部动画生成与表达操控。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04135 2026-03-05 cs.LG cs.AI

Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization

无偏动态剪枝用于高效基于群体的策略优化

Haodong Zhu, Yangyang Ren, Yanjing Li, Mingbao Lin, Linlin Yang, Xuhui Liu, Xiantong Zhen, Haiguang Liu, Baochang Zhang

机构 * Beihang University(北航大学) Zhongguancun Academy(中关村学院) Communication University of China(中国通信大学)

AI总结 DPPO通过动态剪枝和重要性采样修正,实现高效基于群体的策略优化,提升训练速度并提高准确率。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08269 2026-03-05 cs.CV

Re-coding for Uncertainties: Edge-awareness Semantic Concordance for Resilient Event-RGB Segmentation

不确定性重编码:面向鲁棒事件-RGB分割的边缘感知语义一致性

Nan Bao, Yifan Zhao, Lin Zhu, Jia Li

机构 * State Key Laboratory of Virtual Reality Technology and Systems, SCSE & QRI, Beihang University(虚拟现实技术与系统国家重点实验室,SCSE与QRI,北京航空航天大学) School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)

AI总结 本文提出边缘感知语义一致性框架,通过重编码和不确定性优化实现鲁棒的事件-RGB分割,提升极端条件下的分割性能。

Comments Accepted to NeurIPS 2025; code and datasets available at https://github.com/iCVTEAM/ESC

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07181 2026-03-05 cs.RO cs.AI cs.CV

TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics

TIGeR: 视觉-语言模型中集成工具的几何推理

Yi Han, Enshen Zhou, Shanyu Rong, Jingkun An, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Lu Sheng, Shanghang Zhang

机构 * Beihang University(北洋大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室)

AI总结 TIGeR通过集成工具实现视觉-语言模型的几何推理,提升机器人操作的精确度。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05091 2026-03-05 cs.CV

Factuality Matters: When Image Generation and Editing Meet Structured Visuals

事实性至关重要:当图像生成与编辑遇见结构化视觉

Le Zhuo, Songhao Han, Yuandong Pu, Boxiang Qiu, Sayak Paul, Yue Liao, Yihao Liu, Jie Shao, Xi Chen, Si Liu, Hongsheng Li

机构 * CUHK MMLab(香港大学多模态实验室) Beihang University(北京航空航天大学) Krea AI(Krea人工智能) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) Hugging Face National University of Singapore(新加坡国立大学) ByteDance(字节跳动) The University of Hong Kong(香港大学)

AI总结 本文提出了一种统一模型,通过整合视觉语言模型和FLUX.1 Kontext,提升结构化视觉生成与编辑的多模态理解与事实准确性。

Comments Accepted by ICLR 2026, Project page: https://structvisuals.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏