arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

共收录 180
2607.28496 2026-07-31 cs.CL 新提交

Beyond Sentiment: Structured Information Extraction from Financial News

超越情感:从金融新闻中进行结构化信息提取

Daohan Zhu, Sitong Ge, Ruofei Wang, Honggu Chen, Yubo Hou, Tao Wan, Zengchang Qin

机构 * School of ASEE, Beihang University(北京航空航天大学ASEE学院) School of BME, Beihang University(北京航空航天大学生物医学工程学院) CAIR and CECS, VinUniversity(VinUniversity CAIR与CECS机构)

AI总结 该研究针对金融情感分析仅压缩新闻为单一极性评分的局限,提出用LLaMA-3.1-70B提取金融新闻的结构化语义特征,结合情感与结构化特征可提升股票预测性能,为多维金融NLP开辟新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28330 2026-07-31 cs.AI 新提交

Paying for Honesty Without Knowing the Truth: Reputation-Penalty Design for LLM Marketplace Agents

在未知真相的情况下为诚实付费:LLM市场智能体的声誉惩罚机制设计

Mingdai Yang, Shicheng Fan, Kejing Yu, Duohao Wang, Li Sun, Hao Peng, Philip S. Yu, Zhiwei Liu

机构 * Univ. of Illinois Chicago(伊利诺伊大学芝加哥分校) Springbrand Inc.(春品牌公司) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北京航空航天大学) Hangzhou Innovation Institute of BUAA(北京航空航天大学杭州创新研究院) Microsoft(微软公司)

AI总结 针对LLM智能体商家伪造属性的问题,设计无需真实情况的CARP声誉惩罚机制,搭配SPARC机制可保护消费者、提升福利,且在多模型中具有约束力。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28182 2026-07-31 cs.LG 新提交

Multi-channel Uplift Policy Learning

多渠道提升策略学习

Changjian Liu, Tianyu Wang, Xiaoxuan Deng, WenTao Zhu, Yuwei Xu, Jungqi Jin, Yong Gao, Chuan Yu, Jian Xu, Bo Zheng

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Beihang University(北京航空航天大学) CUHK-shenzhen(香港中文大学(深圳))

AI总结 针对电商多渠道营销预算分配的预测后优化范式失效问题,提出快慢因果框架ReAlloc,经淘宝模拟与A/B测试验证可同时提升支付订单量和收入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27969 2026-07-31 cs.CV 新提交

FootprintNet: State-Transition-Guided Dynamic Footprint Learning for Multi-temporal Remote Sensing Change Detection

FootprintNet:面向多时相遥感变化检测的状态转换引导动态 footprint 学习

Haotian Zhang, Hao Chen, Han Guo, Zhengxia Zou, Zhenwei Shi

机构 * Beihang University(北京航空航天大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 针对现有多时相遥感变化检测方法难以表征反复变化区域的局限,提出UBDD并构建FootprintNet,结合状态转换约束与边界线索学习动态变化轨迹,引入BCDS评估,在多数据集上优于SOTA方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27747 2026-07-31 cs.CL cs.AI 新提交

Can LVLMs Uncover the Truth Behind Visual Illusions? An Analysis of Perceptual and Reasoning Capabilities

大型视觉语言模型(LVLMs)能否揭示视觉错觉背后的真相?感知与推理能力分析

Liangjie Zhao, Jiaqing Lyu, Kexin Tang, Zecheng Fang, Rong Yin, Yulan Hu, Da Li, Jianing Li

机构 * Adelaide University(阿德莱德大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Amap, Alibaba Group(阿里巴巴集团高德地图) Beihang University(北京航空航天大学)

AI总结 本文利用IllusionReasoning基准,以视觉错觉为诊断工具评估LVLMs,发现多款LVLMs的推理能力不及宣称水平,为其优化提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27610 2026-07-31 cs.LG 新提交

Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning

卡尔曼与课程学习结合:面向自适应RL微调的高效动态提示选择

Haodong Zhu, Yangyang Ren, Yanjing Li, Sheng Xu, Haiguang Liu, Linlin Yang, Baochang Zhang

机构 * Beihang University(北京航空航天大学) Zhongguancun Academy(中关村学院) Nanyang Technological University(南洋理工大学) Communication University of China(中国传媒大学)

AI总结 本文提出KGPS方法,将提示选择转化为动态状态估计问题,适配RL训练动态,在多推理基准和RL算法上较基线提升准确率与rollout效率,在在线提示选择中达最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26599 2026-07-30 cs.LG 新提交

Uncertainty-Guided LLM Semantic Augmentation for Heterogeneous Treatment Effect Estimation

面向异质处理效应估计的不确定性引导大语言模型语义增强

Jialu Xu, Mengkun Liang, Guannan Liu, Xiaojie Mao, Junjie Wu

机构 * Beihang University(北京航空航天大学) School of Economics and Management, Tsinghua University(清华大学经济管理学院)

AI总结 本研究针对异质处理效应估计的局部不稳定性,提出CURL方法,通过LLM生成分离的分配与异质性导向表示,在四个基准上提升了10种主学习者的性能。

Comments 17 pages, 12 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26536 2026-07-30 cs.CV 新提交

TPCD: Tone-Pressure Contrastive Decoding and the Label-Free Gating Bottleneck in Vision-Language Models

TPCD:音调-压力对比解码与视觉语言模型中的无标签门控瓶颈

Jinkun Zhao, Kui Zhang, Wenjun Wu

机构 * Beihang University(北京航空航天大学)

AI总结 本文提出TPCD方法,利用压力诱导分布作为对比解码负分支,结合门控缓解视觉语言模型受高压提示时的不合理承诺问题,在多个基准测试中显著降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25912 2026-07-29 cs.RO cs.AI 新提交

SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models

用于视觉-语言-动作模型的SAM3D引导的以对象为中心的表示对齐

Zonghe Liu, Shanyuan Jie, Xiaoquan Sun, Chen Cao, Zetian Xu, Zongsheng Liu, Jiayu Chen

机构 * University of Hong Kong(香港大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Huazhong University of Science and Technology(华中科技大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Infiforce(英飞拓)

AI总结 针对视觉-语言-动作模型缺乏目标对象细粒度3D理解的问题,提出以对象为中心的3D表示对齐框架,利用SAM3D提供3D先验,经定位、生成掩码、提取表示等步骤与视觉特征对齐,实验证明其可提升模型性能,尤其在长时操纵场景有效。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25275 2026-07-29 cs.CV cs.AI 新提交

ScaleResfusion: Residual Rectified Flow based on Residual Vector Field

ScaleResfusion:基于残差向量场的残差整流流

Zhenning Shi, Chen Xu, Junhao Zhang, Kefei Zhang, Linjie Liu, Zhedong Zheng, Tao Li

机构 * Nankai University(南开大学) University of Macau(澳门大学) Csiro Data 61(联邦科学与工业研究组织数据61部) Beihang University(北京航空航天大学)

AI总结 研究旨在解决现实世界图像恢复问题,提出ScaleResfusion框架,核心是残差整流流,从低质量图像出发学习残差向量场,结合知识蒸馏降低采样成本,实验证明其高效且性能优,为图像恢复提供实用可扩展方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24495 2026-07-28 cs.CV 新提交

NSL-SLAM: High-Fidelity Neural Structured-Light Depth for Practical SLAM and Reconstruction

NSL-SLAM:用于实际SLAM和重建的高保真神经结构光深度

Jiaheng Li, Binsheng Zhang, Xinhai Chang, Wenzheng Chen

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) School of Computer Science and Technology, Beihang University(北京航空航天大学计算机科学与技术学院) Yuanpei College, Peking University(北京大学元培学院)

AI总结 研究针对高保真结构光深度定制实用SLAM系统,核心方法是强化深度感知并构建以深度为中心的管道,主要贡献是提升跟踪精度、降低轨迹偏差,实现实用稳健的SLAM且运行速度达20.9 FPS。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24419 2026-07-28 cs.AI 新提交

Failures Reveal What Metrics Miss: An Evidence-Driven Agent for Recursive Refinement of ECG Classifiers

失败揭示指标遗漏之处:用于心电图分类器递归优化的证据驱动智能体

Jinliang Deng, Yiming Niu, Yibo Pan, Zhiqi Shao, Qin Luo, Yongxin Tong

机构 * Beihang University(北京航空航天大学) Chongqing University(重庆大学) Fuwai Hospital(阜外医院)

AI总结 研究聚焦心电图分类器优化依赖人工的问题,提出RecursiveECG框架,利用LLM基于具体失败情况和心电图证据优化分类器,经特殊转换和审查分析制定修订,在多数据集上表现出色,验证了基于证据优化过程的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23981 2026-07-28 cs.CV cs.AI 新提交

Multimodal Semantic-Probabilistic Objectness for Open World Object Detection

用于开放世界目标检测的多模态语义概率目标性

Weijun Tian, Rui Liu

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

AI总结 研究开放世界目标检测问题,提出MSPO轻量级语义校准框架,通过融合已知类别语言语义与视觉目标性来校准预测,在实验中改进了PROB基线,提升了主要指标及PASCAL VOC最终mAP,证明已知类别语义可有效校准概率目标性。

Comments 16 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23563 2026-07-28 cs.LG 新提交

Random Forest-Based Prediction of Bone Volume Fraction and Fracture Position from S-Parameters

基于随机森林的从 S 参数预测骨体积分数和骨折位置

Jianhe Li, Jinsui Meng, Yida Zhao, Zihe Wang, Liaoran Sun, Tao Shan

机构 * School of Electronics and Information Engineering, Beihang University(北京航空航天大学电子信息工程学院)

AI总结 该研究提出基于多通道 S 参数构建随机森林模型来预测骨体积分数和骨折位置,设计九天线微波扫描系统获取数据,开发仿骨体模实验验证,结果表明此方法有效。

Comments 5 pages,6 figures,This is a summary report prepared by undergraduate students I supervised, formatted as a letter

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21417 2026-07-24 cs.CV 新提交

Towards Privacy-Preserving Federated Prompt Tuning under Data Heterogeneity: A Subspace-Decomposed Expert Approach

面向数据异构性下的隐私保护联邦提示调优:一种子空间分解专家方法

Yuhua Wang, Xiaodong Li, Yihao Guo, Yuxiang Jia, Qinnan Zhang, Yifan Sun, Hainan Zhang, Yongxin Tong, Zhiming Zheng

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Center for the Applied Statistics, School of Statistics, Renmin University of China(中国人民大学统计学院应用统计中心) School of Computer Science & Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) School of Software, Beihang University(北京航空航天大学软件学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

AI总结 研究针对数据异构性下的隐私保护联邦提示调优问题,提出FedSEPT方法,采用子空间分解专家建模及实例感知专家融合技术,在11个异构基准实验中,于相同隐私约束下,该方法在局部适配和全局泛化间实现更好权衡。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21400 2026-07-24 cs.RO cs.AI 新提交

VoLN: Vision-Only Long-Horizon Navigation---Paradigm, Benchmark, and Method

VoLN:仅视觉的长距离导航——范式、基准和方法

Jiabin Lou, Haopeng Wang, Yuanshuai Wang, Xinyu Liu, Xuxin Lv, Yuxin Guo, Lei Huang, Rongye Shi, Wenjun Wu

机构 * Beihang University(北京航空航天大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

AI总结 研究提出仅视觉的长距离导航(VoLN)范式,通过VoLN-UAV基准及VoLN-MLLM基线进行实例化。在五个环境测试未见分割中评估,揭示了长距离导航在证据整合、目标匹配和闭环稳定性方面的挑战。

Comments 10 pages, 7 figures, 2 tables. Project page: https://admire-ljb.github.io/VoLN-UAV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21243 2026-07-24 cs.CV 新提交

Detectors Learn the Wrong Thing: Shortcut-Resistant Adversarial Training Against Physically Realizable Attacks

检测器学习到错误的东西:针对物理可实现攻击的抗捷径对抗训练

Yuanhao Huang, Yilong Ren, Jinlei Wang, Xuesong Bai, Zheng Zhang, Haiyang Yu

机构 * School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院) State Key Lab of Intelligent Transportation System(智能交通系统国家重点实验室) Zhongguancun Laboratory(中关村实验室) School of Systems Science and Engineering, Sun Yat-Sen University(中山大学系统科学与工程学院) Shandong Sino-Aisa Tire Proving Ground Co.,Ltd.(山东中亚洲轮胎试验场有限公司)

AI总结 研究针对物理可实现攻击,提出实例级对比对抗训练框架InsCAT,通过SICA、ROPO和Guard等方法防止检测器将对抗纹理用作独立决策线索,经实验验证其在多场景和检测器上效果良好,提升检测可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20922 2026-07-24 cs.CV 新提交

FA-LAM: Focus-Aware Large Avatar Model for One-Shot 4D Animatable Gaussian Head

FA-LAM:用于一次性4D可动画化高斯头部的焦点感知大型头像模型

Yingdong Hu, Yisheng He, Yiming Jiang, Zehong Lin, Steven Hoi, Jun Zhang

机构 * HKUST(香港科技大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Beihang University(北京航空航天大学) Lingnan University(岭南大学)

AI总结 提出FA-LAM模型用于一次性创建可动画化高斯头部及实现3D、4D全头部恢复。通过分析注意力机制等确定影响因素,采用对称语义注意力正则化等方法解决问题,增强模型支持多视图和流式4D重建,提升了头部重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20868 2026-07-24 cs.CV 新提交

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?

ViSTR-Bench:多模态大语言模型能否从动态场景中的连续视觉线索进行推理?

Han Li, Si Liu, Zehao Huang, Dongxin Lyu, Longfei Xu, Jiahui Fu, Daxin Tian, Yuliang Xiu, Naiyan Wang

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Zhongguancun Academy(中关村科学城) School of Engineering, Westlake University(西湖大学工学院) School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院)

AI总结 研究聚焦多模态大语言模型在动态场景中从连续视觉线索推理的能力,提出ViSTR-Bench评估套件,基于相关原则建立四维评估,含15个子任务和1340个问答对,经评估发现当前模型在复杂时空推理上有瓶颈,远不及人类。

Comments 37 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19986 2026-07-23 cs.CV 新提交

STEREOFLOW: Progressive Stereo Matching with StereoDiT and Transition Flow Matching

STEREOFLOW:基于StereoDiT和过渡流匹配的渐进式立体匹配

Hao Wang, Haoran Geng, Xiaotong Yang, Jing Tang, Songlin Wei, Linlong Lang, Yeying Jin, Zheng Zhu, Zhaoxin Fan, Biao Leng

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) University of California, Berkeley(加州大学伯克利分校) University of Southern California(南加州大学) Google(谷歌公司) State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(华中科技大学智能制造装备与技术国家重点实验室) Tencent(腾讯公司) GigaAI(未知(可能是公司或组织,由于未找到确切对应中文名,按原文保留))

AI总结 研究针对立体匹配问题,提出先验引导的生成框架StereoFlow,通过两阶段渐进级联匹配网络、像素扩散变压器StereoDiT和过渡流匹配实现高效优化,在多基准测试中取得多个最新结果,提升了立体匹配效果。

Comments 10 pages, 6 figures, submitted to TVCG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19830 2026-07-23 cs.CL 新提交

VizRAG: Enhancing Retrieval-Augmented Generation with Hypergraph Visualization

VizRAG:通过超图可视化增强检索增强生成

Yanbin Wei, Yang Chen, Renling Gan, Ziru Liu, Xinyu Fu, Chun Kang, Ning Lu, Rui Liu, Yu Zhang, James Kwok

机构 * Southern University of Science and Technology(南方科技大学) Hong Kong University of Science and Technology(香港科技大学) Huawei Research(华为研究院) Beihang University(北京航空航天大学)

AI总结 研究旨在增强检索增强生成,核心方法是通过视觉线索将超图感知整合到RAG系统中,引入VizRAG支持视觉超图结构感知,实验证明该方法显著优于基线,验证了超图可视化用于RAG系统的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19701 2026-07-23 cs.CV 新提交

SafeGen: Goal-Conditioned Video Diffusion of Safety-Critical Scenarios for VLM-Based Autonomous Driving

SafeGen:基于视觉语言模型的自动驾驶安全关键场景的目标条件视频扩散

Jiangfan Liu, Zexuan Cui, Tianyuan Zhang, Zonglei Jing, Zonghao Ying, Yaoyuan Zhang, Jiakai Wang, Xiaoqi Jiang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北京航空航天大学) Zhongguancun Laboratory(中关村实验室) Chery Automobile Co., Ltd.(奇瑞汽车股份有限公司)

AI总结 研究针对VLM在自动驾驶系统中的应用,提出SafeGen框架,将场景生成设为目标条件扩散过程,引入上下文接地最终状态推理和最终状态条件下的视频演化,实验表明该框架能提升评判得分,微调后可提高真实驾驶场景性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19351 2026-07-23 cs.AI 新提交

OpenEvoShield: Dual Non-Stationary Continual Defense for Open-World Multi-Agent System Attacks

OpenEvoShield:面向开放世界多智能体系统攻击的双重非平稳持续防御

Litian Zhang, Chaozhuo Li, Yuting Zhang, Zejian Chen, Bingyu Yan, Qiwei Ye

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北京航空航天大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 针对LLM-MAS中对手通过通信注入恶意指令的双重动态攻击,提出OpenEvoShield持续防御框架,含不对称速率控制器等组件,实验表明其在多基准和拓扑上优于基线,能检测多数未见攻击且误报率低。

Comments 29 pages, 5 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19171 2026-07-22 cs.CV 新提交

Point Ladder Tuning: Parameter-Efficient Hierarchical Adaptation for 3D Point Cloud Understanding

点阶梯调优:用于3D点云理解的参数高效分层适配

Junlin Chang, Longhao Zou, Rui Li

机构 * Beihang University(北京航空航天大学) Pengcheng Laboratory(鹏城实验室)

AI总结 研究针对3D点云理解中微调预训练主干参数效率低的问题,提出点阶梯调优框架PLT,通过构建分层网络、融合局部与全局特征、生成动态提示等进行参数高效分层适配,实验表明其以极少参数达最优性能。

Comments Accepted to ECCV 2026. Code: https://github.com/JunLinChang/ECCV2026-PLT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18924 2026-07-22 cs.CV 新提交

Learning Explicit Physical Parameter Control and Benchmarking for Video Generation

学习用于视频生成的显式物理参数控制和基准测试

Yanxun Li, Hao Wen, Bingze Song, Jiashu Zhu, Aiming Hao, Chubin Chen, Jintao Chen, Jiahong Wu, Xiangxiang Chu, Miao Wang

机构 * Beihang University(北京航空航天大学) Alibaba Group(阿里巴巴集团)

AI总结 研究针对图像到视频生成中物理参数控制问题,引入含密集物理参数化的数据集PhyParam-Dataset,提出物理引导的扩散模型PhyParam,建立基准PhyParam-Bench,通过实验证明该模型能在保持视觉保真度时提升物理一致性。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18637 2026-07-22 cs.RO cs.LG 新提交

End-to-end Conditional Diffusion for Realistic and Controllable Visual Traffic Scenario Generation

用于逼真且可控的视觉交通场景生成的端到端条件扩散

Jingzheng Li, Yufei Ge, Zhijun Chen, Qianren Mao, Zizhe Wang, Binhang Qi, Bing Li, Keyu Chen, Baochang Zhang, Xianglong Liu, Philip S Yu

机构 * Zhongguancun Laboratory(中关村实验室) Tianjin University(天津大学) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) State Key Laboratory of Software Development Environment(软件开发环境国家重点实验室) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

AI总结 研究如何生成逼真且可控的视觉交通场景,提出端到端条件扩散框架E2E-CDiff,基于前视图视觉观察联合去噪未来运动状态等,减轻规划控制不匹配,实验表明其在可控性与逼真性权衡上表现良好,还能引发挑战性交互,作为自我规划器有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17768 2026-07-21 cs.CV 新提交

To Blend In, First Decouple: Rethinking Camouflage Image Generation via Context-Decoupled Representations

为了融入,首先解耦:通过上下文解耦表示重新思考伪装图像生成

Wenzhuang Wang, Yifan Zhao, Mingcan Ma, Yunlong Che, Haoran Chen, Ming Liu, Jia Li

机构 * Beihang University(北京航空航天大学) Geely Automobile Research Institute (Ningbo) Co., Ltd(吉利汽车研究院(宁波)有限公司)

AI总结 研究伪装图像生成问题,提出上下文解耦生成范式CamoDreamer,通过设计对比感知上下文桥等方法,将潜在伪装特征解耦为物体和背景控制流,实验证明其显著优于现有方法且设计轻量。

Comments 14 pages, 11 figures, ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17069 2026-07-21 cs.CV 新提交

AdvSerial: Physical Adversarial Attacks on Infrastructure-mounted Pedestrian Detectors via Semantic Feature Suppression

AdvSerial:通过语义特征抑制对基于基础设施的行人检测器进行物理对抗攻击

Yuanhao Huang, Yilong Ren, Jinlei Wang, Xuesong Bai, Jinchuan Zhang, Haiyang Yu

机构 * School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院) State Key Lab of Intelligent Transportation System(智能交通系统国家重点实验室) Zhongguancun Laboratory(中关村实验室)

AI总结 针对基础设施行人检测器安全漏洞,提出AdvSerial框架,通过2D-3D联合优化、语义特征抑制等方法生成对抗补丁,在多检测器实验中成功率高、可转移性强,揭示故障模式,为相关防御设计提供思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16828 2026-07-21 cs.CV 新提交

UniNDM: A Unified Noise-driven Detection and Mitigation Framework Against Sexual Content in Text-to-Image Generation

UniNDM:文本到图像生成中针对性内容的统一噪声驱动检测与缓解框架

Yao Huang, Yitong Sun, Huanran Chen, Ruochen Zhang, Shouwei Ruan, Ranjie Duan, Maoxun Yuan, Yinpeng Dong, Hui Xue, Xiaochun Cao, Xingxing Wei

机构 * Institute of Artificial Intelligence, State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室人工智能研究院) College of Artificial Intelligence, Tsinghua University(清华大学人工智能学院) Security Department, Alibaba Group(阿里巴巴集团安全部) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区网络科学与技术学院)

AI总结 针对文本到图像生成易受隐式性提示影响的问题,提出UniNDM统一噪声驱动框架。利用早期预测噪声的可分离性开发轻量级检测器,引入噪声增强自适应负引导缓解问题,扩展到扩散变压器架构,实验显示比现有方法有显著改进。

Comments 18 pages, 10 figures, accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16074 2026-07-20 cs.DC cs.AI cs.SE 新提交

JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models

JoyNexus:面向服务的视觉语言动作模型多租户训练后处理

Haoran Sun, Wentao Zhang, Junyang Hua, Hedan Yang, Yongjian Guo, Yifei Zhang, Xiaolong Xiang, Mingxi Luo, Jing Long, Chen Zhao, Chen Zhou, Wanting Xu, Qiming Yang, Hui Zhang, Song Wang, Xiaodong Bai, Shuai Di, Xu Chu, Xiaotie Deng, Yicheng Gong, Junwu Xiong

机构 * Peking University(北京大学) Beihang University(北航) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学)

AI总结 针对VLA模型训练后处理问题,提出JoyNexus统一服务,解耦相关服务,多租户可通过API调用,引入组批处理提高效率,经评估能减少GPU时间,提升服务利用率。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏