arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Xi'an Jiaotong University(西安交通大学)

共收录 765
2603.26052 2026-03-30 cs.CV cs.AI

Bridging Pixels and Words: Mask-Aware Local Semantic Fusion for Multimodal Media Verification

像素与词语之间的桥梁:面向多模态媒体验证的掩码感知局部语义融合

Zizhao Chen, Ping Wei, Ziyang Ren, Huan Li, Xiangru Yin

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能全国重点实验室)

AI总结 本文提出MaLSF框架,通过主动双向验证和层次语义聚合模块,解决多模态虚假信息检测中的局部语义不一致问题,实现像素与词语的语义连接。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25732 2026-03-27 cs.CV

BizGenEval: A Systematic Benchmark for Commercial Visual Content Generation

BizGenEval:一个系统化的商业视觉内容生成基准测试

Yan Li, Zezi Zeng, Ziwei Zhou, Xin Gao, Muzhao Tian, Yifan Yang, Mingxi Cheng, Qi Dai, Yuqing Yang, Lili Qiu, Zhendong Wang, Zhengyuan Yang, Xue Yang, Lijuan Wang, Ji Li, Chong Luo

机构 * Microsoft Corporation(微软公司) Shanghai Jiao Tong University(上海交通大学) Xi'an Jiaotong University(西安交通大学) Fudan University(复旦大学)

AI总结 本文提出BizGenEval基准测试,系统评估商业视觉内容生成模型在文档类型和多约束下的能力,包含20个任务和8000个检查问题,揭示现有模型与专业需求间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25423 2026-03-27 cs.SI cs.AI

From Manipulation to Mistrust: Explaining Diverse Micro-Video Misinformation for Robust Debunking in the Wild

从操控到怀疑:为野外鲁棒驳斥解释多样化的微视频虚假信息

Zhi Zeng, Yifei Yang, Jiaying Wu, Xulang Zhang, Xiangzheng Kong, Herun Wan, Zihan Ma, Minnan Luo

机构 * School of Computer Science and Technology, MOEKLINNS Lab, Xi'an Jiaotong University(西安交通大学计算机科学与技术学院、教育部机器学习与智能决策网络实验室) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Xi'an Jiaotong University(西安交通大学)

AI总结 本文提出WildFakeBench基准和FakeAgent框架,通过多模态理解和外部证据分析,提升微视频虚假信息检测的可解释性和鲁棒性。

Comments Accepted at WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25411 2026-03-27 cs.CV

HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models

HiSpatial:在视觉-语言模型中驯服层次化3D空间理解

Huizhi Liang, Yichao Shen, Yu Deng, Sicheng Xu, Zhiyuan Feng, Tong Zhang, Yaobo Liang, Jiaolong Yang

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院) Xi’an Jiaotong University(西安交通大学) University of the Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出一种层次化框架,通过分解VLM中3D空间理解的学习过程,从几何感知到抽象空间推理,生成多样化任务和场景的3D空间VQA对,提升视觉-语言模型的空间理解能力。

Comments Accepted by CVPR 2026. Project page: https://microsoft.github.io/HiSpatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25188 2026-03-27 cs.CV

AnyID: Ultra-Fidelity Universal Identity-Preserving Video Generation from Any Visual References

AnyID: 从任意视觉参考生成超保真度的通用身份保持视频

Jiahao Wang, Hualian Sheng, Sijia Cai, Yuxiao Yang, Weizhan Zhang, Caixia Yan, Bing Deng, Jieping Ye

机构 * School of Computer Science and Technology, MOEKLINNS, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院、MOEKLINNS) Alibaba Cloud Computing(阿里云计算有限公司) Tsinghua University(清华大学)

AI总结 AnyID通过引入可扩展的多参考架构和主参考生成范式,实现从多种异构身份输入生成高保真的视频,通过大规模数据集训练和强化学习微调提升身份保真度和属性可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25118 2026-03-27 cs.CV

AnyDoc: Enhancing Document Generation via Large-Scale HTML/CSS Data Synthesis and Height-Aware Reinforcement Optimization

AnyDoc:通过大规模HTML/CSS数据合成和高度感知强化优化提升文档生成

Jiawei Lin, Wanrong Zhu, Vlad I Morariu, Christopher Tensmeyer

机构 * Xi’an Jiaotong University(西安交通大学) Adobe Research(Adobe研究院)

AI总结 AnyDoc通过大规模HTML/CSS数据合成和高度感知强化优化,实现多文档生成任务,包含265206个样本,覆盖111类和32种风格,提升文档生成性能。

Comments CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05042 2026-03-27 cs.CV cs.RO

CoIn3D: Revisiting Configuration-Invariant Multi-Camera 3D Object Detection

CoIn3D:重新审视配置不变的多摄像头3D目标检测

Zhaonian Kuang, Rui Ding, Haotian Wang, Xinhu Zheng, Meng Yang, Gang Hua

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能全国重点实验室) Intelligent Transportation Thrust of the Systems Hub, HKUST(GZ)(香港科技大学(广州)系统枢纽智能交通学域) Amazon Alexa AI(亚马逊Alexa人工智能)

AI总结 本文提出CoIn3D框架,通过空间先验整合和摄像头感知数据增强,提升多摄像头3D目标检测在不同配置下的泛化能力。

Comments Accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05629 2026-03-26 cs.SE cs.CV

ROMAN: Reward-Orchestrated Multi-Head Attention Network for Autonomous Driving System Testing

ROMAN:基于奖励协调的多头注意力网络用于自动驾驶系统测试

Jianlei Chi, Yuzhen Wu, Jiaxuan Hou, Xiaodong Zhang, Ming Fan, Suhui Sun, Weijun Dai, Bo Li, Jianguo Sun, Jun Sun

机构 * IEEE Publication Technology Group(IEEE出版技术组) Hangzhou Institute of Technology, Xidian University(杭州科技学院,西安电子科技大学) Qingdao Port International Co., Ltd.(青岛港口国际有限公司) Shandong Port Qingdao Port Group Co., Ltd.(山东港口青岛港集团有限公司) University of Science and Technology of China(中国科学技术大学) Xi’an Jiaotong University(西安交通大学) Singapore Management University(新加坡管理大学)

AI总结 ROMAN通过结合多头注意力网络与交通法规加权机制,生成高风险违规场景,提升自动驾驶系统测试的全面性与针对性。

Comments The manuscript includes 13 pages, 8 tables, and 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24079 2026-03-26 cs.CV cs.AI cs.CR

When Understanding Becomes a Risk: Authenticity and Safety Risks in the Emerging Image Generation Paradigm

当理解成为风险:新兴图像生成范式中的真实性与安全性风险

Ye Leng, Junjie Chu, Mingjie Li, Chenhao Lin, Chao Shen, Michael Backes, Yun Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) Xi’an Jiaotong University(西安交通大学) Flexera(Flexera公司)

AI总结 本文研究了多模态大语言模型在图像生成中的安全性风险,发现其在语义理解能力上强于扩散模型,但生成不安全内容和伪造图像的风险更高,挑战现有检测方法。

Comments Accepted by CVPR 2026. 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23957 2026-03-26 cs.CV

PointRFT: Explicit Reinforcement Fine-tuning for Point Cloud Few-shot Learning

PointRFT:针对点云少样本学习的显式强化微调

Yankai Wang, Yiding Sun, Qirui Wang, Pengbo Li, Chaoyi Lu, Dongxu Zhang

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) International School, Beijing University of Posts and Telecommunications(北京邮电大学国际学院)

AI总结 本文提出PointRFT,一种专为点云表示学习设计的强化微调方法,通过定制奖励函数提升训练稳定性,实验表明其在多种基准上优于传统监督微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22965 2026-03-26 cs.CV

Few-Shot Generative Model Adaption via Identity Injection and Preservation

通过身份注入与保留实现少样本生成模型适应

Yeqi He, Liang Li, Jiehua Zhang, Yaoqi Sun, Xichun Sheng, Zhidong Zhao, Chenggang Yan

机构 * School of Cyberspace Security, Hangzhou Dianzi University(杭州电子科技大学网络安全学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) Lishui University and Lishui Institute of Hangzhou Dianzi University(丽水大学和杭州电子科技大学丽水研究所) School of Faculty of Applied Science, Macao Polytechnic University(澳门理工学院应用科学学院) School of Communication Engineering, Hangzhou Dianzi University(杭州电子科技大学通信工程学院)

AI总结 本文提出I²P方法,通过身份注入和一致性对齐保留源域知识,提升少样本生成模型在目标域的图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22943 2026-03-25 cs.AI

PersonalQ: Select, Quantize, and Serve Personalized Diffusion Models for Efficient Inference

PersonalQ: 选择、量化并服务个性化扩散模型以实现高效推理

Qirui Wang, Qi Guo, Yiding Sun, Junkai Yang, Dongxu Zhang, Shanmin Pang, Qing Guo

机构 * School of Software Engineering, Xi'an Jiaotong University(西安交通大学软件工程学院) Nankai University(南开大学)

AI总结 PersonalQ通过触发令牌连接检查点选择与量化,提升意图对齐并优化压缩质量,实现高效个性化扩散模型服务。

Comments Accepted in ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22826 2026-03-25 cs.CV

MVRD-Bench: Multi-View Learning and Benchmarking for Dynamic Remote Photoplethysmography under Occlusion

MVRD-Bench: 多视角学习与基准测试用于遮挡下的动态远程光体积脉描摄影

Zuxian He, Xu Cheng, Zhaodong Sun, Haoyu Chen, Jingang Shi, Xiaobai Li, Guoying Zhao

机构 * Nanjing University of Information Science and Technology(南京信息工程大学) University of Oulu(奥卢大学) Xi’an Jiaotong University(西安交通大学) Zhejiang University(浙江大学)

AI总结 本文提出MVRD-Bench,通过多视角学习框架MVRD-rPPG解决动态远程光体积脉描摄影在遮挡下的性能问题,引入高精度基准数据集和对抗学习策略,实验表明其在MAE和相关系数上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22362 2026-03-25 cs.LG cs.AI physics.geo-ph

Unveiling the Mechanism of Continuous Representation Full-Waveform Inversion: A Wave Based Neural Tangent Kernel Framework

揭示连续表示全波形反演的机制:一种基于波的神经切线核框架

Ruihua Chen, Yisi Luo, Bangyu Wu, Deyu Meng

机构 * School of Mathematics and Statistics, Xi’an Jiaotong University, Xi’an, Shaanxi, China(西安交通大学数学与统计学学院) Macao Institute of Systems Engineering, Macau University of Science and Technology, Taipa, Macao(澳门系统工程研究院,澳门科技大学,路环,澳门)

AI总结 本文提出基于波的神经切线核框架,揭示连续表示全波形反演的机制,通过分析神经切线核的特征,改进了全波形反演的鲁棒性和高频收敛性。

Comments Published as a conference paper at ICLR 2026 (poster)

Journal ref In Proceedings of the 14th International Conference on Learning Representations (ICLR 2026), Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22036 2026-03-24 cs.CV

GTSR: Subsurface Scattering Awared 3D Gaussians for Translucent Surface Reconstruction

GTSR:基于3D高斯的透明表面重建

Youwen Yuan, Xi Zhao

机构 * Xi'an Jiaotong University(西安交通大学)

AI总结 本文提出GTSR方法,通过结合表面和内部高斯分布,利用Fresnel项融合高斯分布并引入Disney BSDF模型,实现透明物体的高效重建,实验表明其在NeuralTO Syn数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21719 2026-03-24 cs.CL

Probing How Scalable Table Data Enhances General Long-Context Reasoning

探究表格数据如何提升长上下文推理的可扩展性

Huaibing Xie, Guoliang Zhao, Yang Liu, Shihan Dou, Siming Huang, Yanling Xiao, Shaolei Wang, Yiting Liu, Cheng Zhang, Shaofan Liu, Pluto Zhou

机构 * Large Language Model Department, Tencent(腾讯大语言模型部门) Xi'an Jiaotong University, Xi'an, China(西安交通大学) Fudan University, Shanghai, China(复旦大学)

AI总结 本文研究表格数据对长上下文推理的增强作用,通过分析表格依赖结构揭示周期性非消失依赖,并提出TableLong框架提升推理能力,实验显示在多个基准上提升8.24%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00462 2026-03-24 cs.CV

Unleashing the Potential of All Test Samples: Mean-Shift Guided Test-Time Adaptation

释放所有测试样本的潜力:基于均值偏移的测试时适应

Jizhou Han, Chenhao Ding, SongLin Dong, Yuhang He, Xinyuan Gao, Yihong Gong

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学) Faculty of Computility Microelectronics, Shenzhen University of Advanced Technology and the Guangdong Provincial Key Laboratory of Computility Microelectronics(计算微电子学系,深圳先进技术大学及广东省计算微电子重点实验室) College of Software Engineering, Xi’an Jiaotong University(软件工程学院,西安交通大学)

AI总结 本文提出MS-TTA方法,通过单步kNN均值偏移提升特征表示,增强特征紧凑性和类别分离性,实现更稳定的测试时适应,并在OOD和跨数据集基准上优于现有方法。

Comments Accepted by IEEE TCSVT. This is the author's version which has not been fully edited and content may change prior to final publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21436 2026-03-24 cs.CV

PAS3R: Pose-Adaptive Streaming 3D Reconstruction for Long Video Sequences

PAS3R:面向长视频序列的姿态自适应流式3D重建

Lanbo Xu, Liang Guo, Caigui Jiang, Cheng Wang

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi'an Jiaotong University, China(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学,中国) University of East Anglia, Norwich, NR47TJ, United Kingdom(东安格利亚大学,诺里奇,英国)

AI总结 PAS3R通过动态调节状态更新机制,解决流式3D重建中视角变化与结构稳定性矛盾,提升长视频序列的轨迹精度和点云重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21176 2026-03-24 cs.CV

GIDE: Unlocking Diffusion LLMs for Precise Training-Free Image Editing

GIDE: 解锁扩散大语言模型用于精确无训练图像编辑

Zifeng Zhu, Jiaming Han, Jiaxiang Zhao, Minnan Luo, Xiangyu Yue

机构 * Xi'an Jiaotong University MMLab, The Chinese University of Hong Kong(西安交通大学MMLab,香港中文大学)

AI总结 本文提出GIDE框架,通过离散噪声逆向机制实现无训练图像编辑,支持多种指令并保持背景不变,实验表明其在语义正确性和感知质量上显著优于现有方法。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21129 2026-03-24 cs.CV

ReDiffuse: Rotation Equivariant Diffusion Model for Multi-focus Image Fusion

ReDiffuse:用于多焦点图像融合的旋转等价扩散模型

Bo Li, Tingting Bao, Lingling Zhang, Weiping Fu, Yaxian Wang, Jun Liu

机构 * School of Computer Science and Technology, Xi'an Jiaotong University(西安交通大学计算机科学与技术学院) School of Information Engineering, Chang'an University(长安大学信息工程学院)

AI总结 本文提出ReDiffuse模型,通过在扩散网络中嵌入旋转等价性,解决多焦点图像融合中因模糊导致的结构失真问题,提升融合图像的结构一致性。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20702 2026-03-24 cs.NE cs.AI

Decoupling Numerical and Structural Parameters: An Empirical Study on Adaptive Genetic Algorithms via Deep Reinforcement Learning for the Large-Scale TSP

分离数值参数与结构参数:通过深度强化学习对适应性遗传算法进行大规模TSP的实证研究

Hongyu Wang, Yuhan Jing, Yibing Shi, Enjin Zhou, Haotian Zhang, Jialong Shi

机构 * School of Mathematics(数学学院) Statistics(统计学) Xi'an Jiaotong University(西安交通大学) School of Mechanical Engineering(机械工程学院) Frontier Institute of Science(前沿科学研究院) Technology(技术) Xi'an, China(中国西安)

AI总结 本文通过双重深度强化学习框架研究适应性遗传算法中数值参数与结构参数对TSP的影响,发现结构参数在防止停滞和逃离局部最优中起关键作用。

Comments 6 pages, 8 figures, Accepted by WCCI-CEC Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20267 2026-03-24 cs.AI

Domain-Specialized Tree of Thought through Plug-and-Play Predictors

通过即插即用预测器实现领域专用的树状思维

Xuanqi Gao, Haoyu Wang, Jun Sun, Shiqing Ma, Chao Shen

机构 * Xi'an Jiaotong University, China(西安交通大学) Singapore Management University, Singapore(新加坡管理学院) University of Massachusetts at Amherst, United States(马萨诸塞大学阿默斯特分校)

AI总结 本文提出DST,一种轻量级监督启发式预测器,用于指导树状思维搜索过程,实现动态剪枝和适应性扩展,提升复杂推理的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19918 2026-03-23 cs.CV cs.AI

Learning Like Humans: Analogical Concept Learning for Generalized Category Discovery

像人类一样学习:用于通用类别发现的类比概念学习

Jizhou Han, Chenhao Ding, Yuhang He, Qiang Wang, Shaokun Wang, SongLin Dong, Yihong Gong

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学) School of Software Engineering, Xi’an Jiaotong University(软件工程学院,西安交通大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen University of Advanced Technology(深圳大学)

AI总结 本文提出ATCG模块,通过类比已知知识生成文本概念,结合视觉特征提升类别发现性能,在六个基准测试中均取得显著提升,尤其在细粒度数据上表现突出。

Comments Accept by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19608 2026-03-23 cs.CV cs.AI

FB-CLIP: Fine-Grained Zero-Shot Anomaly Detection with Foreground-Background Disentanglement

FB-CLIP:基于前景-背景解耦的细粒度零样本异常检测

Ming Hu, Yongsheng Huo, Mingyu Dou, Jianfu Yin, Peng Zhao, Yao Wang, Cong Hu, Bingliang Hu, Quan Wang

机构 * Xi’an Institute of Optics and Precision Mechanics, Chinese Academy of Sciences(西安光学精密机械研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Xi’an Jiaotong University(西安交通大学) Zhongnan Hospital of Wuhan University(武汉大学中南医院)

AI总结 本文提出FB-CLIP框架,通过多策略文本表示和前景-背景分离,提升细粒度零样本异常检测的准确性和定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19582 2026-03-23 cs.RO cs.AI

Evolving Embodied Intelligence: Graph Neural Network--Driven Co-Design of Morphology and Control in Soft Robotics

进化具身智能:基于图神经网络的软机器人形态与控制协同设计

Jianqiang Wang, Shuaiqun Pan, Alvaro Serra-Gomez, Xiaohan Wei, Yue Xie

机构 * LIACS, Leiden University(莱顿大学LIACS) School of Mechanical Engineering, Xi’an Jiaotong University(西安交通大学机械工程学院) Department of Computer Science, Loughborough University(洛桑大学计算机科学系)

AI总结 本文提出基于图神经网络的软机器人形态与控制协同设计方法,通过图结构建模实现形态演化与控制策略的动态适应,实验表明该方法在最终适应度和形态变化适应性上优于传统MLP方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19252 2026-03-23 cs.CL cs.AI

GeoChallenge: A Multi-Answer Multiple-Choice Benchmark for Geometric Reasoning with Diagrams

GeoChallenge: 一个用于基于图表的几何推理的多答案多选基准

Yushun Zhang, Weiping Fu, Zesheng Yang, Bo Zhao, Lingling Zhang, Jian Zhang, Yumeng Fu, Jiaxing Huang, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室)

AI总结 GeoChallenge通过9万个多步骤几何证明问题,评估大语言模型的符号推理能力,揭示模型在多选设置下的精确匹配失败、视觉依赖弱和推理扩展不足等问题。

Comments 18 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19077 2026-03-20 cs.CV

Multi-Modal Building Change Detection for Large-Scale Small Changes: Benchmark and Baseline

多模态大规模小变化建筑物变化检测:基准与基线

Ye Wang, Wei Lu, Zhihui You, Keyan Chen, Tongfei Liu, Kaiyu Li, Hongruixuan Chen, Qingling Shu, Sibao Chen

机构 * MOE Key Lab of ICSP, Anhui Provincial Key Lab of Multimodal Cognitive Computation, IMIS Lab of Anhui Province, School of Computer Science and Technology, Anhui University, Hefei, China(教育部信息与通信领域重点实验室、安徽省多模态认知计算重点实验室、安徽省IMIS实验室、计算机科学与技术学院、安徽大学、合肥,中国) School of Public Safety and Emergency Management, Anhui University of Science and Technology, Hefei 231131, China(公共安全与应急管理学院、安徽理工大学、合肥231131,中国) College of Computing and Data Science, Nanyang Technological University, Singapore 639798(计算与数据科学学院、南洋理工大学、新加坡639798) Shaanxi Joint Laboratory of Artificial Intelligence, Shaanxi University of Science and Technology, Xi’an 710021, China(人工智能联合实验室、陕西科技大学、西安710021,中国) School of Software Engineering, Xi’an Jiaotong University, Xi’an 710049, China(软件工程学院、西安交通大学、西安710049,中国) Graduate School of Frontier Sciences, The University of Tokyo, Chiba, 277-8561, Japan(前沿科学研究生院、东京大学、千叶,日本)

AI总结 本文提出LSMD多模态数据集和MSCNet网络,通过融合RGB和NIR信息提升小变化检测精度,验证了多模态特征融合的有效性。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18429 2026-03-20 cs.CV

AndroTMem: From Interaction Trajectories to Anchored Memory in Long-Horizon GUI Agents

AndroTMem: 从交互轨迹到长周期GUI代理的锚定记忆

Yibo Shi, Jungang Li, Linghao Zhang, Zihao Dongfang, Biao Wu, Sicheng Tao, Yibo Yan, Chenxi Qin, Weiting Liu, Zhixin Lin, Hanqian Li, Yu Huang, Song Dai, Yonghua Hei, Yue Ding, Xiang Li, Shikang Wang, Chengdong Xu, Jingqi Liu, Xueying Ma, Zhiwen Zheng, Xiaofei Zhang, Bincheng Wang, Nichen Yang, Jie Wu, Lihua Tian, Chen Li, Xuming Hu

机构 * XJTU(西安交通大学) HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) CityU(城市大学) UTS(新南威尔士大学) TJU(天津大学) FDU(福建师范大学) SDU(山东大学) CASIA(中国科学院自动化所) SYSU(南方科技大学) NWPU(西北工业大学)

AI总结 本文提出AndroTMem框架,通过锚定状态记忆提升长周期GUI代理性能,实验显示其在任务完成率和动作成功率上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18103 2026-03-20 cs.CR cs.LG cs.SD

STEP: Detecting Audio Backdoor Attacks via Stability-based Trigger Exposure Profiling

STEP:通过基于稳定性的触发暴露分析检测音频后门攻击

Kun Wang, Meng Chen, Junhao Wang, Yuli Wu, Li Lu, Chong Zhang, Peng Cheng, Jiaheng Zhang, Kui Ren

机构 * Zhejiang University(浙江大学) Xi’an Jiaotong University(西安交通大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出STEP方法,通过分析触发器在语义破坏扰动下的异常稳定性与语义保持扰动下的异常脆弱性,实现无训练的音频后门检测,实验显示其在多个攻击场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17055 2026-03-19 cs.CV

PaAgent: Portrait-Aware Image Restoration Agent via Subjective-Objective Reinforcement Learning

PaAgent:通过主观-客观强化学习实现的面向人物图像修复代理

Yijian Wang, Qingsen Yan, Jiantao Zhou, Duwei Dai, Wei Dong

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院) State Key Laboratory of Internet of Things for Smart City, University of Macau(澳门大学智慧城市物联网国家重点实验室) National-Local Joint Engineering Research Center of Biodiagnosis and Biotherapy, the Second Affiliated Hospital of Xi’an Jiaotong University(西安交通大学生物诊断与生物治疗国家地方联合工程研究中心) College of Information and Control Engineering, Xi’an University of Architecture and Technology(西安建筑科技大学信息与控制工程学院)

AI总结 PaAgent通过结合自进化的人物银行和检索增强生成技术,提升图像修复任务中对复杂场景的感知能力,通过主观-客观强化学习策略优化修复工具选择,实验验证其在多种修复基准上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏