arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Xi'an Jiaotong University(西安交通大学)

共收录 765
2604.17749 2026-04-21 cs.CV

Ego-InBetween: Generating Object State Transitions in Ego-Centric Videos

Ego-InBetween: 生成以自我为中心视频中的物体状态转换

Mengmeng Ge, Takashi Isobe, Xu Jia, Yanan Sun, Zetong Yang, Weinong Wang, Dong Zhou, Dong Li, Huchuan Lu, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微器件公司) Dalian University of Technology(大连理工大学) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Xi’an Jiaotong University(西安交通大学)

AI总结 本文提出EgoIn框架,通过TransitionVLM和Object-aware Auxiliary Supervision生成物体状态转换序列,实现以自我为中心视角下的视觉状态迁移。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17721 2026-04-21 cs.CV cs.AI

GeGS-PCR: Effective and Robust 3D Point Cloud Registration with Two-Stage Color-Enhanced Geometric-3DGS Fusion

GeGS-PCR: 有效且鲁棒的3D点云配准:两阶段颜色增强几何-3DGS融合

Jiayi Tian, Haiduo Huang, Tian Xia, Wenzhe Zhao, Pengju Ren

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家级重点实验室) National Engineering Research Center of Visual Information and Applications(视觉信息与应用国家工程研究中心) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学)

AI总结 本文提出GeGS-PCR,通过结合几何、颜色和高斯信息,解决点云配准中颜色信息利用的挑战,采用颜色编码器和Geometric-3DGS模块提升鲁棒性,结合LORA优化和可微渲染改进收敛性,实现高精度配准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17407 2026-04-21 cs.RO

Think before Go: Hierarchical Reasoning for Image-goal Navigation

先思后行:面向图像目标导航的层次推理

Pengna Li, Kangyi Wu, Shaoqing Xu, Fang Li, Lin Zhao, Long Chen, Zhi-Xin Yang, Nanning Zheng

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, National Engineering Research Center for Visual Information and Applications, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家实验室、视觉信息与应用国家工程研究中心、人工智能与机器人研究所、西安交通大学) University of Macau(澳门大学) Xiaomi EV(小米电动车) School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学)

AI总结 本文提出HRNav框架,通过分层规划与执行解决图像目标导航问题,利用视觉语言模型生成短期计划并结合在线强化学习策略,引入Wandering Suppression Penalty降低漂移问题,实验验证其有效性。

Comments Accepted by ACL2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17024 2026-04-21 cs.CV

CAM3DNet: Comprehensively mining the multi-scale features for 3D Object Detection with Multi-View Cameras

CAM3DNet:基于多视图摄像头的3D目标检测中多尺度特征的全面挖掘

Mingxi Pang, Dingheng Wang, Zekun Li, Zhenping Sun, Bo Wang, Zhihang Wang, Zhao-Xu Yang

机构 * College of Intelligent Science Technology, National University of Defense Technology, Changsha, 410073, China Northwest Institute of Mechanical \& Electrical Engineering, Xianyang, 712099, China. School of Aerospace Engineering, Xi’an Jiaotong University, Xi’an, 710049, China

AI总结 CAM3DNet通过引入复合查询、自适应自注意力和多尺度混合采样模块,解决多视图3D目标检测中多尺度信息利用效率低的问题,实验表明其在nuScenes、Waymo和Argoverse数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16540 2026-04-21 cs.CV cs.AI

PoInit-of-View: Poisoning Initialization of Views Transfers Across Multiple 3D Reconstruction Systems

视角污染:跨多种3D重建系统的视角初始化污染

Weijie Wang, Songlong Xing, Zhengyu Zhao, Nicu Sebe, Bruno Lepri

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·科斯勒基金会) Xi’an Jiaotong University(西安交通大学)

AI总结 本文提出PoInit-of-View方法,通过优化对抗扰动在不同3D重建系统中引发视角污染,破坏关键点检测和特征匹配,从而降低重建质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16420 2026-04-21 cs.NE cs.AI

Breaking Validity-Induced Boundaries to Expand Algorithm Search Space: A Two-Stage AST-Based Operator for LLM-Driven Automated Heuristic Evolution

突破有效性诱导边界以扩展算法搜索空间:一种基于AST的双阶段算子用于LLM驱动的自动启发式进化

Sun Shengming, Shi Jialong

机构 * School of Mathematics and Statistics, Xi'an Jiaotong University(西安交通大学数学与统计学学院)

AI总结 本文提出一种双阶段基于AST的算子,通过生成无效结构并利用LLM修复,提升LLM驱动自动启发式进化算法的搜索能力,在TSP和OBP上验证了其优化性能和收敛速度的提升。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15777 2026-04-20 cs.CV cs.AI

SegMix:Shuffle-based Feedback Learning for Semantic Segmentation of Pathology Images

SegMix:基于洗牌的反馈学习用于病理图像的语义分割

Zhiling Yan, Sicheng Chen, Tianyi Zhang, Nan Ying, Yanli Lei, Guanglei Zhang

机构 * JD AI Research(京东人工智能研究院) School of Microelectronics, Xi’an Jiaotong University(西安交通大学微电子学院) Beijing Advanced Innovation Center for Biomedical Engineering, School of Biological Science and Medical Engineering, Beihang University(北京生物医学工程先进创新中心,北京航空航天大学生物科学与医学工程学院)

AI总结 本文提出SegMix,一种基于洗牌的反馈学习方法,利用课程学习思想生成高质量伪分割掩码,提升病理图像语义分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07520 2026-04-20 cs.CV cs.IR

From Limited Labels to Open Domains:An Efficient Learning Method for Drone-view Geo-Localization

从有限标签到开放领域:一种用于无人机视角地理定位的高效学习方法

Zhongwei Chen, Zhao-Xu Yang, Hai-Jun Rong, Jiawei Lang, Guoqi Li

机构 * State Key Laboratory for Strength and Vibration of Mechanical Structures(强度与振动机械结构国家重点实验室) Shaanxi Key Laboratory of Environment and Control for Flight Vehicle(飞行器环境与控制陕西省重点实验室) School of Aerospace Engineering(航空工程学院) Xi’an Jiaotong University(西安交通大学) Institute of Automation(自动化研究所) Chinese Academy of Sciences(中国科学院) School of Artificial Intelligence(人工智能学院) University of Chinese Academy of Sciences(中国科学院大学) Peng Cheng Laboratory(鹏城实验室)

AI总结 本文提出CDIKTNet,通过有限监督实现无人机视角地理定位的跨域不变知识迁移,解决传统方法依赖配对数据和跨视图相关性学习难题,提升少样本和跨域初始化性能。

Comments Accepted by IEEE Transactions on Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15309 2026-04-17 cs.CV cs.AI cs.CL

MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation

MM-WebAgent:一种用于网页生成的分层多模态网络代理

Yan Li, Zezi Zeng, Yifan Yang, Yuqing Yang, Ning Liao, Weiwei Guo, Lili Qiu, Mingxi Cheng, Qi Dai, Zhendong Wang, Zhengyuan Yang, Xue Yang, Ji Li, Lijuan Wang, Chong Luo

机构 * Shanghai Jiao Tong University(上海交通大学) Xi'an Jiaotong University(西安交通大学) Tongji University(同济大学) Microsoft Corporation(微软公司)

AI总结 本文提出MM-WebAgent,一种分层多模态网页生成框架,通过分层规划和迭代自反思协调AIGC元素生成,提升网页全局布局与视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15093 2026-04-17 cs.AI cs.CL cs.CV cs.HC

OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis

OpenMobile: 通过任务和轨迹合成构建开放移动代理

Kanzhi Cheng, Zehao Li, Zheng Ma, Nuo Chen, Jialin Cao, Qiushi Sun, Zichen Ding, Fangzhi Xu, Hang Yan, Jiajun Chen, Anh Tuan Luu, Jianbing Zhang, Lewei Lu, Dahua Lin

机构 * Nanjing University(南京大学) SenseTime(秒速) Nanyang Technological University(南洋理工大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Xi’an Jiaotong University(西安交通大学)

AI总结 本文提出OpenMobile框架,通过可扩展的任务合成管道和策略切换策略生成高质量任务指令和轨迹,实现移动代理在AndroidWorld等基准测试中取得显著成绩。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14782 2026-04-17 cs.CV

One-shot Compositional 3D Head Avatars with Deformable Hair

单张图像生成可组合的3D头部化身与可变形头发

Yuan Sun, Xuan Wang, WeiLi Zhang, Wenxuan Zhang, Yu Guo, Fei Wang

机构 * Xi'an Jiaotong University(西安交通大学)

AI总结 本文提出一种单张图像生成完整3D头部化身的方法,通过分离头发与面部区域,结合图像到3D提升技术,实现更逼真的头发动态和面部细节。

Comments project page: https://yuansun-xjtu.github.io/CompHairHead.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14184 2026-04-17 eess.SY cs.AI cs.SY

End-to-End Learning-based Operation of Integrated Energy Systems for Buildings and Data Centers

建筑与数据中心一体化能源系统的端到端学习操作

Zhenyu Pu, Yu Yang, Liang Yu, Xiaohong Guan

机构 * School of Automation Science and Engineering, Xi’an Jiaotong University(西安交通大学自动化科学与工程学院) College of Automation, Nanjing University of Posts and Telecommunications(南京邮电大学自动化学院) Center for Intelligent and Networked Systems, Department of Automation, Tsinghua University(清华大学自动化系智能与网络化系统中心)

AI总结 本文提出端到端学习方法优化建筑与数据中心一体化能源系统,通过回收数据中心废热提升能效,并在不确定性下实现运营优化。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12210 2026-04-17 cs.AI cs.CL

Beyond Prompt: Fine-grained Simulation of Cognitively Impaired Standardized Patients via Stochastic Steering

超越提示:通过随机引导实现认知障碍标准化患者细粒度模拟

Weikang Zhang, Zimo Zhu, Zhichuan Yang, Chen Huang, Wenqiang Lei, See-Kiong Ng

机构 * School of Software, Xi’an Jiaotong University(西安交通大学软件学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) College of Computer Science, Sichuan University(四川大学计算机学院) Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education, China(教育部机器学习与工业智能工程研究中心,中国)

AI总结 本文提出StsPatient方法,通过提取对比指令与响应的引导向量,实现对认知障碍患者细粒度模拟,提升临床真实性与严重程度可控性。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11176 2026-04-17 cs.CV

Precision Synthesis of Multi-Tracer PET via VLM-Modulated Rectified Flow for Stratifying Mild Cognitive Impairment

多示踪PET的高精度合成通过VLM调制的校正流用于区分轻度认知障碍

Tuo Liu, Shuijin Lin, Shaozhen Yan, Haifeng Wang, Jie Lu, Jianhua Ma, Chunfeng Lian

机构 * School of Mathematics and Statistics, Xi'an Jiaotong University(西安交通大学数学与统计学学院) Key Laboratory of Biomedical Information Engineering of Ministry of Education, School of Life Science and Technology, Xi'an Jiaotong University(教育部生物医学信息工程重点实验室,西安交通大学生命科学与技术学院) Department of Radiology and Nuclear Medicine, Xuanwu Hospital, Capital Medical University(首都医科大学宣武医院放射科与核医学科) Research Center for Intelligent Medical Equipment and Devices (IMED), Xi'an Jiaotong University(智能医疗设备与器件研究中心(IMED),西安交通大学)

AI总结 本文提出DIReCT$++$模型,结合MRI和临床信息,通过校正流和视觉语言模型生成高保真多示踪PET图像,实现轻度认知障碍的精准分层。

Comments Added supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07222 2026-04-17 cs.LG cs.CL

Pay Less Attention to Function Words for Free Robustness of Vision-Language Models

减少对功能词的关注以实现视觉语言模型的自由鲁棒性

Qiwei Tian, Chenhao Lin, Zhengyu Zhao, Chao Shen

机构 * School of Cyber Science and Engineering, Xi’an Jiaotong University, Xi’an 710049, China(西安交通大学计算机科学与工程学院,西安 710049,中国)

AI总结 本文提出FDA方法,通过减少功能词的注意力影响,提升视觉语言模型在跨模态对抗攻击下的鲁棒性,实验显示在检索任务中ASR下降18%/13%/53%,性能损失极小。

Comments The paper has been accepted by ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13830 2026-04-16 math.NA cs.LG cs.NA

Randomized Neural Networks for Integro-Differential Equations with Application to Neutron Transport

随机神经网络用于积分-微分方程及其在中子输运中的应用

Haoning Dang, Fei Wang, Yifan Chen, Zhouyu Liu, Dong Liu, Hongchun Wu

机构 * School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院) School of Mathematics and Statistics & State Key Laboratory of Multiphase Flow in Power Engineering, Xi’an Jiaotong University(西安交通大学数学与统计学院及电力工程多相流国家重点实验室) School of Energy and Power Engineering, Xi’an Jiaotong University(西安交通大学能源与动力工程学院) Nuclear Power Institute of China, State Key Laboratory of Advanced Nuclear Energy Technology(中国核工业集团核电院,先进核能技术国家重点实验室)

AI总结 本文提出随机神经网络RaNNs,用于求解线性积分-微分方程,通过全局支持的随机特征实现内在密集性,减少计算成本并提高稳定性,应用于中子输运方程展示其高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23640 2026-04-16 cs.NI cs.LG

Geminet: Learning the Duality-based Iterative Process for Lightweight Traffic Engineering in Changing Topologies

Geminet:基于对偶性的迭代过程学习轻量级交通工程在拓扑变化中的应用

Ximeng Liu, Zhuoran Liu, Yingming Mao, Yatao Li, Shizhen Zhao, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Zhonggancun Academy(中关村学院) Xi’an Jiaotong University(西安交通大学) Shanghai Innovation Institute(上海创新研究院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

AI总结 Geminet通过学习基于梯度下降的迭代过程,实现轻量级交通工程在拓扑变化中的高效处理,显著提升可扩展性并降低内存消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12805 2026-04-15 cs.CV

Image-to-Image Translation Framework Embedded with Rotation Symmetry Priors

具有旋转对称先验的图像到图像翻译框架

Feiyu Tan, Heran Yang, Qihong Duan, Kai Ye, Qi Xie, Deyu Meng

机构 * School of Mathematics and Statistics, Xi’an Jiaotong University, Shaanxi, P.R.China(西安交通大学数学与统计学学院,陕西省,中华人民共和国)

AI总结 本文提出基于旋转对称先验的图像到图像翻译框架,通过引入旋转群等价卷积实现旋转等价翻译网络,理论分析TL-Conv的等价误差,并在多种I2I任务中验证其有效性。

Comments 17 pages, 8 figures, submiting to TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09121 2026-04-15 cs.CL cs.AI cs.SD

Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition

交互式语音识别:迈向人样交互和语义连贯性评估的代理语音识别

Peng Wang, Yanqiao Zhu, Zixuan Jiang, Qinyuan Chen, Xingjian Zhao, Xipeng Qiu, Wupeng Wang, Zhifu Gao, Xiangang Li, Kai Yu, Xie Chen

机构 * X-LANCE Lab, Shanghai Jiao Tong University(上海交通大学X-LANCE实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Xi'an Jiaotong University(西安交通大学) Fudan University(复旦大学) Tongyi Fun Team, Alibaba Group(阿里巴巴集团 Tongyi 团队)

AI总结 本文提出基于LLM的代理框架,通过语义反馈提升语音识别的语义准确性和交互修正能力,实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00890 2026-04-15 stat.ML cs.LG

Privacy-Preserving Transfer Learning for Community Detection using Locally Distributed Multiple Networks

基于局部分布式多网络的隐私保护迁移学习用于社区检测

Xiao Guo, Xuming He, Xiangyu Chang, Shujie Ma

机构 * School of Mathematics, Northwest University, China(西北大学数学学院,中国) Department of Statistics and Data Science, Washington University in St. Louis, U.S.A.(圣路易斯华盛顿大学统计与数据科学系,美国) School of Management, Xi’an Jiaotong University, China(西安交通大学管理学院,中国)

AI总结 本文提出TransNet框架,利用本地存储的隐私保护辅助网络提升目标网络的社区检测性能,通过自适应加权方案平衡隐私与异质性,并理论证明其误差界优于仅使用目标网络或单一源网络的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11757 2026-04-14 cs.RO cs.AI cs.CV

StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems

StarVLA-$α$:降低视觉-语言-动作系统复杂度

Jinhui Ye, Ning Gao, Senqiao Yang, Jinliang Zheng, Zixuan Wang, Yuxin Chen, Pengguang Chen, Yilun Chen, Shu Liu, Jiaya Jia

机构 * HKUST(香港科技大学) XJTU(西安交通大学) CUHK(香港中文大学) THU(清华大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) SmartMore Ltd.(SmartMore有限公司)

AI总结 本文提出StarVLA-$α$,通过简化架构与流程降低实验干扰,系统分析VLA设计关键因素,在多个基准测试中表现优异,优于现有模型20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11576 2026-04-14 cs.CV

Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models

微调如你预训练:提升视觉语言模型零样本对抗鲁棒性

Songlong Xing, Weijie Wang, Zhengyu Zhao, Jindong Gu, Philip Torr, Nicu Sebe

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) Xi’an Jiaotong University(西安交通大学) University of Oxford(牛津大学)

AI总结 本文提出AdvFLYP方法,通过遵循CLIP预训练过程的训练配方,利用网络上收集的图像-文本对生成对抗样本,并通过对比损失匹配文本,提升视觉语言模型的零样本对抗鲁棒性。

Comments Accepted to CVPR Findings Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11328 2026-04-14 cs.AI cs.LG

Select Smarter, Not More: Prompt-Aware Evaluation Scheduling with Submodular Guarantees

选择更聪明,而非更多:基于提示的评估调度与子模保证

Xiaoyu Ma, Yiwen Li, Haoyue Liu, Zhichao Wang, Ye Chen, Yongxin Guo, Xiaoying Tang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Xi’an Jiaotong University(西安交通大学) Taobao and Tmall Group(淘宝天猫集团)

AI总结 本文提出POES方法,通过整合信息论评分、设施覆盖和切换成本,实现子模保证的评估调度,提升提示优化效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11259 2026-04-14 cs.AI cs.CR

Mobile GUI Agent Privacy Personalization with Trajectory Induced Preference Optimization

基于轨迹诱导的偏好优化的移动GUI代理隐私个性化

Zhixin Lin, Jungang Li, Dongliang Xu, Shidong Pan, Yibo Shi, Yuchi Liu, Yuecong Min, Yue Yao

机构 * Shandong University(山东大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) New York University(纽约大学) Xi'an Jiaotong University(西安交通大学) Australian National University(澳大利亚国立大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

AI总结 本文研究移动GUI代理的隐私个性化问题,提出轨迹诱导偏好优化方法,通过偏好强度加权和填充门机制提升隐私保护与任务执行效率。

Comments 10 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11231 2026-04-14 cs.CV

Seg2Change: Adapting Open-Vocabulary Semantic Segmentation Model for Remote Sensing Change Detection

Seg2Change: 为遥感变化检测适应开放词汇语义分割模型

You Su, Yonghong Song, Jingqi Chen, Zehan Wen

机构 * Xi'an Jiaotong University(西安交通大学)

AI总结 本文提出Seg2Change框架,通过构建类别无关变化检测数据集和设计类别无关变化头,实现开放词汇变化检测任务,提升遥感图像变化检测性能。

Comments 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11209 2026-04-14 cs.CL cs.AI

Exploring Knowledge Conflicts for Faithful LLM Reasoning: Benchmark and Method

探索知识冲突以实现忠实的LLM推理:基准与方法

Tianzhe Zhao, Jiaoyan Chen, Shuxiu Zhang, Haiping Zhu, Qika Lin, Jun Liu

机构 * School of Computer Science and Technology, Xi'an Jiaotong University(西安交通大学计算机科学与技术学院) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) Hunan University(湖南大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出ConflictQA基准,揭示LLM在处理跨源知识冲突时的不足,并提出XoT框架以提升异构冲突证据推理的可靠性。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10182 2026-04-14 cs.CL cs.AI

A Survey of Inductive Reasoning for Large Language Models

大型语言模型归纳推理的综述

Kedi Chen, Dezhao Ruan, Yuhao Dan, Yaoting Wang, Siyu Yan, Xuecheng Wu, Yinqi Zhang, Qin Chen, Jie Zhou, Liang He, Biqing Qi, Linyang Li, Qipeng Guo, Xiaoming Shi, Wei Zhang

机构 * East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Xi’an Jiaotong University(西安交通大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 本文综述了大型语言模型中归纳推理的方法与评估,分为训练后改进、测试时扩展和数据增强三大类,并提出统一的评估方法,为未来研究奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10454 2026-04-14 cs.CV

AIM-Bench: Benchmarking and Improving Affective Image Manipulation via Fine-Grained Hierarchical Control

AIM-Bench:通过细粒度分层控制进行情感图像操纵的基准测试与改进

Shi Chen, Xuecheng Wu, Heli Sun, Yunyun Shi, Xinyi Yin, Fengjian Xue, Jinheng Xie, Dingkang Yang, Hao Wang, Junxiao Xue, Liang He

机构 * Xi'an Jiaotong University(西安交通大学) Zhengzhou University(郑州大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Zhejiang Lab(之江实验室)

AI总结 本文提出AIM-Bench,通过细粒度分层控制进行情感图像操纵的基准测试,改进了现有图像编辑基准的不足,提出了AIM-40k数据集并提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05467 2026-04-14 cs.CV cs.CL cs.RO

MerNav: A Highly Generalizable Memory-Execute-Review Framework for Zero-Shot Object Goal Navigation

MerNav:一种高度可泛化的记忆-执行-审查框架用于零样本物体目标导航

Dekang Qi, Shuang Zeng, Xinyuan Chang, Feng Xiong, Shichao Xie, Xiaolong Wu, Mu Xu

机构 * Amap, Alibaba Group(高德,阿里巴巴集团) Xi’an Jiaotong University(西安交通大学)

AI总结 本文提出MerNav框架,通过记忆、执行和审查模块提升视觉语言导航任务中的成功率和泛化能力,在多个数据集上均取得显著提升。

Comments 9 pages, 2 figures, 5 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06964 2026-04-14 cs.CV

Adversarial Video Promotion Against Text-to-Video Retrieval

对抗性视频推广对抗文本到视频检索

Qiwei Tian, Chenhao Lin, Zhengyu Zhao, Qian Li, Shuai Liu, Chao Shen

机构 * Xi'an Jiaotong University(西安交通大学)

AI总结 本文提出首个对抗性视频推广攻击,通过改进的模态细化方法提升黑盒转移能力,实验显示在多种场景下攻击效果显著,揭示了文本到视频检索的潜在漏洞。

Comments This paper has been accepted by TIFS

详情

展开后加载摘要…

URL PDF HTML 收藏