arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Xi'an Jiaotong University(西安交通大学)

共收录 60
2504.15650 2026-07-13 cs.CV 版本更新

AffordanceSAM: Segment Anything Once More in Affordance Grounding

可负担性语义分割模型:在可负担性基础上再次分割任何事物

Dengyang Jiang, Zanyi Wang, Hengzhuang Li, Sizhe Dang, Teli Ma, Wei Wei, Guang Dai, Lei Zhang, Harry Yang, Mengmeng Wang

机构 * SGIT AI Lab(SGIT人工智能实验室) NWPU(西北工业大学) HKUST(香港科技大学) XJTU(西安交通大学) HUST(华中科技大学) ZJUT(浙江工业大学)

AI总结 研究聚焦全监督可负担性基础,提出AffordanceSAM,通过设计适应模块和标注数据集,以三阶段训练方式扩展SAM泛化能力,在AGD20K基准上达最优性能,展现强大泛化能力。

Comments [ACM MM 2026] SAM Meets Affordance Grounding

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20805 2026-07-10 cs.RO cs.CV 版本更新

FunHOI: Annotation-Free 3D Hand-Object Interaction Generation via Functional Text Guidance

FunHOI:通过功能文本引导实现无注释的3D手-物体交互生成

Yongqi Tian, Xueyu Sun, Haoyuan He, jianlei Wang, Caigui Jiang

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学)

AI总结 研究针对手-物体交互中功能抓取语义捕捉难的问题,提出两阶段框架FGS-Net,通过文本引导3D模型生成器FGG和姿态优化策略FGR,无需额外3D注释数据即可实现精确高质量的3D手-物体交互生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05693 2026-07-09 cs.RO cs.AI 版本更新

HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies

HiMoE-VLA:用于通用视觉-语言-动作策略的分层专家混合模型

Zhiying Du, Bei Liu, Yaobo Liang, Yichao Shen, Haidong Cao, Xiangyu Zheng, Zhiyuan Feng, Zuxuan Wu, Jiaolong Yang, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Xi’an Jiaotong University(西安交通大学) Tsinghua University(清华大学)

AI总结 研究通用视觉-语言-动作策略训练中异构性引发的负迁移问题,提出HiMoE-VLA框架,通过分层专家混合动作模块及两个辅助目标来解决,在多项任务上取得较好结果,还能将负迁移转化为正迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08435 2026-07-08 cs.CV cs.AI 版本更新

HST-HGN: Heterogeneous Spatial-Temporal Hypergraph Networks with Bidirectional State Space Models for Global Fatigue Assessment

HST-HGN:基于双向状态空间模型的异构空间-时间超图网络用于全局疲劳评估

Changdao Chen, Qinqiuhong Ye, Hao Chen, Jinyu Wang

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

AI总结 本文提出HST-HGN,通过双向状态空间模型和异构空间-时间超图网络,有效建模长程时序依赖,实现对驾驶员疲劳的高效评估,兼顾判别力与计算效率,适用于实时车载边缘部署。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.02353 2026-07-08 cs.CV cs.LG 版本更新

Label Hierarchy Transition: Delving into Class Hierarchies to Enhance Deep Classifiers

标签层次转换:深入研究类层次结构以增强深度分类器

Renzhen Wang, De cai, Kaiwen Xiao, Xixi Jia, Xiao Han, Deyu Meng

机构 * School of Mathematics and Statistics and Ministry of Education Key Lab of Intelligent Networks and Network Security, Xi’an Jiaotong University(数学与统计学学院和教育部智能网络与网络安全重点实验室,西安交通大学) Tencent AI Lab(腾讯AI实验室) ByteDance(字节跳动) SINGPATH AI Lab, SingPath Medical Technology Pte. Ltd.(SingPath AI实验室,SingPath医疗科技私人有限公司) School of Mathematics and Statistics, Xidian University(数学与统计学学院,西安电子科技大学) College of Biomedical Engineering, Sichuan University(生物医学工程学院,四川大学) School of Mathematics and Statistics, Ministry of Education Key Lab of Intelligent Networks and Network Security, Xi’an Jiaotong University(数学与统计学学院和教育部智能网络与网络安全重点实验室,西安交通大学) Macao Institute of Systems Engineering, Macau University of Science and Technology(澳门系统工程研究院,澳门科技大学)

AI总结 研究针对层次分类中现有方法未充分利用类别相关性的问题,提出基于深度学习的LHT统一概率框架,由转换网络和混淆损失构成,实验证明其优于现有方法,还扩展到皮肤病变诊断任务展现潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19543 2026-07-07 cs.CL cs.IR 版本更新

Hyper-KGGen: A Skill-Driven Knowledge Extractor for High-Quality Knowledge Hypergraph Generation

Hyper-KGGen:一种用于高质量知识超图生成的技能驱动知识提取器

Rizhuo Huang, Yifan Feng, Rundong Xue, Shihui Ying, Jun-Hai Yong, Chuan Shi, Shaoyi Du, Yue Gao

机构 * Xi’an Jiaotong University(西安交通大学) State Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Tsinghua University(清华大学) Shanghai University(上海大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 针对高质量知识超图构建难题,提出Hyper-KGGen框架,用粗到细机制分解文档,含自适应技能获取模块,经反馈回路提炼领域专长,还给出标注基准,实验验证其性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30217 2026-07-03 cs.CL 版本更新

Before Thinking, Learn to Decide: Proactive Routing for Efficient Visual Reasoning

在思考之前,先学会决策:面向高效视觉推理的主动路由

Yinan Zhou, Haokun Lin, Yichen Wu, Yuxin Chen, Teng Wang, Caifeng Shan, Zhenan Sun, Chen Ma, Li Zhu, Ying Shan

机构 * Xi’an Jiaotong University(西安交通大学) ARC Lab, Tencent IEG(腾讯IEG ARC实验室) City University of Hong Kong(香港城市大学) Institute of Automation, CAS(中国科学院自动化研究所) Harvard University(哈佛大学) Nanjing University(南京大学)

AI总结 提出主动路由范式PRP,通过联合评估草稿模型和目标模型的能力,实现早期决策,加速多模态推理而不牺牲性能。

Comments 36 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13581 2026-07-02 cs.CV 版本更新

HIR-ALIGN: Enhancing Hyperspectral Image Restoration via Diffusion-Based Data Generation

HIR-ALIGN:通过基于扩散的数据生成增强超光谱图像恢复

Li Pang, Heng Zhao, Yijia Zhang, Deyu Meng, Xiangyong Cao

机构 * School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Mathematics and Statistics and the Ministry of Education Key Laboratory for Intelligent Networks and Network Security, Xi’an Jiaotong University(西安交通大学数学与统计学学院和教育部智能网络与网络安全重点实验室) Pazhou Laboratory (Huangpu), Guangzhou(广州黄埔 Pazhou 实验室)

AI总结 本文提出HIR-ALIGN框架,通过生成与目标分布匹配的合成数据提升超光谱图像恢复性能,包含代理生成、分布自适应合成和对齐监督微调三个阶段,理论分析表明增强细调可降低目标域恢复风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19036 2026-07-02 cs.CV 版本更新

FUMO: Prior-Modulated Diffusion for Single Image Reflection Removal

FUMO:先验调制扩散模型用于单图像反射去除

Telang Xu, Chaoyang Zhang, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Xi’an Jiaotong University(西安交通大学)

AI总结 提出FUMO扩散模型,通过从混合图像提取强度和高频先验,结合粗到细训练范式,实现空间自适应和结构保真的单图像反射去除。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04057 2026-07-01 cs.LG cs.AI 版本更新

Structured Progressive Knowledge Activation for LLM-Driven Neural Architecture Search

结构化渐进知识激活用于LLM驱动的神经架构搜索

Zhen Liu, Yuhan Liu, Jinjun Wang, Wei Song, Jianyi Liu, Jingwen Fu

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi'an Jiaotong University.(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学) MiLM Plus, Xiaomi Inc.(小米MiLM Plus) North China University of Technology, Beijing.(华北电力大学(北京)) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

AI总结 本文提出SPARK方法,通过显式选择功能因素并条件化编辑,减少功能耦合影响,提升神经架构搜索的样本效率和OOD准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16436 2026-07-01 cs.LG 版本更新

DISCOVER: A Solver for Distributional Counterfactual Explanations

DISCOVER: 一种用于分布反事实解释的求解器

Yikai Gu, Lele Cao, Bo Zhao, Lei Lei, Lei You

机构 * Technical University of Denmark(丹麦技术大学) Aalto University(阿尔托大学) Xi'an Jiaotong University(西安交通大学)

AI总结 提出DISCOVER,一种模型无关的分布反事实解释求解器,通过预算化提议-选择搜索范式替代梯度优化,利用最优传输几何指导采样,实现非可微模型下的分布对齐。

Comments 22 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10388 2026-06-26 cs.IR cs.AI 版本更新

The Best of the Two Worlds: Harmonizing Semantic and Hash IDs for Sequential Recommendation

两全其美:为序列推荐协调语义ID和哈希ID

Ziwei Liu, Yejing Wang, Wanyu Wang, Wang Zejian, Qidong Liu, Zijian Zhang, Chong Chen, Wei Huang, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Xi'an Jiaotong University(西安交通大学) Jilin University(吉林大学) Independent Researcher(独立研究者) Tsinghua University(清华大学)

AI总结 针对序列推荐中头部和尾部物品性能权衡问题,提出H2Rec框架,通过双分支架构协调语义ID和哈希ID,并采用双级对齐策略实现知识迁移,在公开基准和商业平台上取得更好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16932 2026-06-26 cs.RO 版本更新

BAT-Nav: Budget-Aware Arbitration and Termination for Long-Horizon Semantic Navigation

MORN: 为资源理性长周期导航的元认知目标-目标调节

Xi Lin, Kangyi Wu, Jiayi Li, Jiaqiao Tang, Qingrong He, Lin Zhao

机构 * LCSR Lab, Johns Hopkins University(约翰霍普金斯大学LCSR实验室) Xi’an Jiaotong University(西安交通大学) JD Explore Academy, Beijing, China(京东探索研究院,北京,中国)

AI总结 本文提出MORN,一种基于双过程理论的元认知导航架构,通过引入资源理性机制,解决传统导航系统在长周期任务中因缺乏全局资源意识导致的资源浪费问题,提升了目标完成率和任务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23866 2026-06-25 cs.LG cs.AI 版本更新

Towards Understanding The Calibration Benefits of Sharpness-Aware Minimization

理解锐度感知最小化的校准优势

Chengli Tan, Yubo Zhou, Haishan Ye, Guang Dai, Junmin Liu, Zengjie Song, Jiangshe Zhang, Zixiang Zhao, Yunda Hao, Yong Xu

机构 * Northwestern Polytechnical University(西北工业大学) SGIT AI Lab, State Grid Corporation of China(国网SGIT人工智能实验室) Xi’an Jiaotong University(西安交通大学) ETH Zürich(苏黎世联邦理工学院) Chinese University of Hong Kong(香港中文大学)

AI总结 本文通过理论分析揭示锐度感知最小化(SAM)通过隐式最大化预测分布熵来改善模型校准,并提出变体CSAM进一步降低校准误差。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.04359 2026-06-25 cs.LG cs.AI 版本更新

Learning Non-Vacuous Generalization Bounds from Optimization

从优化中学习非平凡泛化界

Chengli Tan, Jiangshe Zhang, Junmin Liu, Yihong Gong

机构 * Northwestern Polytechnical University(北华科技大学) Xi’an Jiaotong University(西安交通大学) SGIT AI Lab(SGIT人工智能实验室) State Grid Corporation of China(国家电网公司)

AI总结 针对深度神经网络泛化界过松或仅适用于压缩网络的问题,提出基于优化视角的非平凡泛化界,利用随机梯度算法访问的假设集具有分形特性,通过分数布朗运动驱动的随机微分方程推导出更紧的算法依赖Rademacher复杂度界。

Comments made some important revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17473 2026-06-24 cs.CV cs.AI 版本更新

Dual-Anchoring: Addressing State Drift in Vision-Language Navigation

双锚定:解决视觉语言导航中的状态漂移问题

Kangyi Wu, Pengna Li, Kailin Lyu, Xi Lin, Lin Zhao, Qingrong He, Jinjun Wang, Jianyi Liu

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) National Engineering Research Center for Visual Information and Applications(视觉信息与应用国家工程研究中心) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Johns Hopkins University(约翰霍普金斯大学) Joy Future Academy, JD(京东探索研究院)

AI总结 提出双锚定框架,通过指令进度锚定和记忆地标锚定分别解决进度漂移和记忆漂移,显著提升长场景导航成功率。

Comments Accepted by ECCV26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29245 2026-06-23 cs.CR cs.CL cs.LG 版本更新

Implicit Identity Technologies for LLMs: Fingerprinting and Watermarking across Datasets, Models, and Generated Content

LLM的隐式身份技术:跨数据集、模型和生成内容的指纹识别与水印

Bing Liu, Shunping Wang, Yufan Zhu, Xinyi Yu, Jing Huang, Linkang Du, Hongbin Pei, Wei Luo

机构 * School of Cyber Science and Engineering, Xi’an Jiaotong University, Xi’an, China(西安交通大学计算机科学与工程学院) State Grid Henan Marketing Service Center, Henan, China(国网河南营销服务中心) Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院) School of Information Technology, Deakin University, Geelong, Australia(迪金大学信息技术学院)

AI总结 本文综述了LLM指纹识别和水印技术,提出隐式身份统一抽象,并基于生命周期分类法组织数据集、模型和生成内容的技术,建立评估框架。

Comments Accepted by IJCAI-ECAI 2026. 11 pages, 1 figure. Survey and taxonomy of LLM fingerprinting and watermarking for identity, provenance, generated-content attribution, and asset protection

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15967 2026-06-23 cs.CR cs.CV 版本更新

When Safe Concepts Become Unsafe: Multi-Concept Compositional Vulnerabilities in Text-to-Image Models

TwoHamsters:文本到图像模型中多概念组合不安全性的基准测试

Chaoshuo Zhang, Yibo Liang, Mengke Tian, Chenhao Lin, Zhengyu Zhao, Le Yang, Chong Zhang, Yang Zhang, Qian Wang, Chao Shen

机构 * School of Cyber Science and Engineering, Xi'an Jiaotong University(西安交通大学计算机科学与工程学院) CISPA Helmholtz Center for Information Security(信息安全研究中心) School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院)

AI总结 本文提出TwoHamsters基准,通过17500个提示测试文本到图像模型在多概念组合不安全性的表现,揭示现有模型和防御机制在处理危险组合生成时的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13864 2026-06-23 cs.CR cs.AI 版本更新

HardSecBench: Benchmarking the Security Awareness of LLMs for Hardware Code Generation

HardSecBench: 对大型语言模型在硬件代码生成中的安全意识的基准测试

Qirui Chen, Jingxian Shuai, Shuangwu Chen, Shenghao Ye, Zijian Wen, Xufei Su, Jie Jin, Jiangming Li, Jun Chen, Xiaobin Tan, Jian Yang

机构 * University of Science and Technology of China(中国科学技术大学) Xi’an Jiaotong University(西安交通大学) Nanjing University(南京大学) ZTE Corporation(中兴通讯)

AI总结 提出HardSecBench基准,包含924个任务覆盖Verilog RTL和固件C代码,评估LLM在硬件代码生成中的安全性,发现模型常满足功能需求但存在安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12252 2026-06-19 cs.CV cs.CL 版本更新

EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Models

EndoCoT:扩散模型中的内生思维链推理扩展

Xuanlang Dai, Yujie Zhou, Long Xing, Jiazi Bu, Xilin Wei, Yuhong Liu, Beichen Zhang, Kai Chen, Yuhang Zang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出EndoCoT框架,通过迭代思维引导模块激活MLLM的推理潜力,并利用终端思维接地模块确保推理轨迹与文本监督对齐,使DiT逐步执行复杂任务,在多个基准上平均准确率达92.1%。

Comments 23 pages, 18 figures, The code and dataset are publicly available at https://internlm.github.io/EndoCoT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09344 2026-06-18 cs.AI stat.ML 版本更新

Robust Regularized Policy Iteration under Transition Uncertainty

鲁棒正则化策略迭代在转移不确定性下

Hongqiang Lin, Zhenghui Fu, Weihao Tang, Pengfei Wang, Yiding Sun, Qixian Huang, Dongxu Zhang

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院) School of Artificial Intelligence, Optics and Electronics (iOPEN), Northwestern Polytechnical University, Xi'an, China(西北工业大学人工智能、光学与电子学院(iOPEN)) School of Software Technology, Zhejiang University, Hangzhou, China(浙江大学软件技术学院) School of Software Engineering, Xi'an Jiaotong University, Xi'an, China(西安交通大学软件工程学院) School of Systems Science and Engineering, Sun Yat-sen University, Guangzhou, China(中山大学系统科学与工程学院)

AI总结 提出鲁棒正则化策略迭代(RRPI),通过将离线强化学习建模为鲁棒策略优化,使用KL正则化替代难解的双层目标,并基于鲁棒正则化贝尔曼算子实现高效策略迭代,理论保证收敛性,实验在D4RL基准上表现优异。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01762 2026-06-17 cs.RO cs.CV 版本更新

AlignDrive: Aligned Lateral-Longitudinal Planning for End-to-End Autonomous Driving

AlignDrive: 用于端到端自动驾驶的对齐横向-纵向规划

Yanhao Wu, Haoyang Zhang, Fei He, Rui Wu, Yanhu Shan, Congpei Qiu, Liang Gao, Wei Ke, Tong Zhang

机构 * School of Software Engineering, XJTU(软件工程学院,西安交通大学) Horizon Robotics Shenzhen Loop Area Institute(深圳河套学院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出一种 cascaded 框架,通过将纵向规划转化为路径条件推理过程,提升自动驾驶的协调性和安全性。方法引入锚点回归设计和规划导向的数据增强策略,实现在 Bench2Drive 上达到 SOTA 性能。

Comments underreview

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04438 2026-06-17 eess.IV cs.AI cs.LG 版本更新

CogGen: Cognitive-Load-Inspired Fully Unsupervised Deep Generative Modeling for Compressively Sampled MRI Reconstruction

CogGen: 认知负荷启发的全无监督深度生成模型用于压缩感知MRI重建

Qingyong Zhu, Yumin Tan, Xiang Gu, Dong Liang

机构 * Medical AI Research Centre, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院医学人工智能研究中心) School of Biomedical Engineering, Southern Medical University(南方医科大学生物医学工程学院) School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院) Paul C. Lauterbur Research Centre for Biomedical Imaging, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院Paul C. Lauterbur生物医学成像研究中心)

AI总结 提出CogGen框架,基于认知易到难原则,通过自定进度课程学习和MRI感知双阈值加权策略,将CS-MRI重建分解为分阶段反演问题,理论证明降低局部充分迭代界和累积噪声放大界,实验优于现有无监督和有监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21179 2026-06-15 cs.CV 版本更新

Enhancing Underwater Light Field Images via Global Geometry-aware Diffusion Process

通过全局几何感知扩散过程增强水下光场图像

Yuji Lin, Qian Zhao, Zongsheng Yue, Junhui Hou, Deyu Meng

机构 * School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学学院) School of Mathematics and Statistics and the Ministry of Education Key Lab of Intelligent Networks and Network Security, Xi’an Jiaotong University(西安交通大学数学与统计学学院和教育部智能网络与网络安全重点实验室) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Macao Institute of Systems Engineering, Macau University of Science and Technology(澳门系统工程研究院,澳门科学大学)

AI总结 提出基于扩散的GeoDiff-LF框架,利用空间-角度结构增强水下4D光场成像,通过改进U-Net、几何引导损失和优化采样策略,有效缓解颜色失真,在视觉保真度和定量性能上超越现有方法。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11863 2026-06-12 cs.AI cs.CL 版本更新

CreativeBench: Benchmarking and Enhancing Machine Creativity via Self-Evolving Challenges

CreativeBench: 通过自我进化挑战基准测试和增强机器创造力

Zi-Han Wang, Lam Nguyen, Zhengyang Zhao, Mengyue Yang, Chengwei Qin, Yujiu Yang, Linyi Yang

机构 * Southern University of Science and Technology(南方科技大学) Tsinghua University(清华大学) Peking University(北京大学) University of Bristol(布里斯托大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Xi’an Jiaotong University(西安交通大学)

AI总结 提出CreativeBench基准,基于认知框架通过代码生成评估机器创造力,包含组合与探索两个子集,利用逆向工程和自我博弈自动生成挑战,并通过质量与新颖性乘积的指标区分创造与幻觉。

Comments ACL 2026. Project page: https://zethwang.github.io/creativebench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11074 2026-06-11 cs.CL cs.AI 版本更新

Modeling Complex Behaviors: Multi-Personality Composition and Dynamic Switching in Vision-Language Models

建模复杂行为:视觉语言模型中的多人格组合与动态切换

Peiqi Jia, Haonan Jia, Ziqi Miao, Linkang Du, Yuntao Wang, Zhou Su

机构 * Xi'an Jiaotong University(西安交通大学) Beihang University(北京航空航天大学)

AI总结 本研究在视觉语言模型中引入显式人格条件,建立包括单人格、多人格和人格切换的系统评估框架,发现人格提示可提升图像描述但损害精确推理任务,并观察到多特质组合与动态切换中的平衡与残留效应。

Comments 16 pages, 4 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00461 2026-06-11 cs.CV 版本更新

ReMoT: Reinforcement Learning with Motion Contrast Triplets

ReMoT: 基于运动对比三元组的强化学习

Cong Wan, Zeyu Guo, Jiangyang Li, SongLin Dong, Yifan Bai, Lin Peng, Zhiheng Ma, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) Shenzhen University of Advanced Technology(深圳先进技术大学) DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院)

AI总结 提出ReMoT统一训练范式,通过规则生成大规模运动对比数据集和组相对策略优化,解决VLM时空一致性问题,在时空推理任务上提升25.1%。

Comments CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07088 2026-06-10 cs.LG math.OC 版本更新

Residual-Controlled Multiplier Learning for Stochastic Constrained Decision-Making

残差控制乘子学习用于随机约束决策

Kang Liu, Jianchen Hu, Ziyu Qu, Edward Hengzhou Yan, Lun Yang, Meng Zhang

机构 * Xi’an Jiaotong University(西安交通大学) Tencent(腾讯) China University of Geosciences(中国地质大学)

AI总结 提出残差控制乘子学习(RCML),通过将乘子更新重构为投影压力反馈,并引入模块化随机稳定组件,解决随机约束决策中原始-对偶方法因小批量噪声导致乘子更新不稳定的问题,实现有限增益收敛和局部KKT残差解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02056 2026-06-09 cs.CV 版本更新

COMPASS: Complete Multimodal Fusion via Proxy Tokens and Shared Spaces for Ubiquitous Sensing

COMPASS:通过代理令牌和共享空间实现完整的多模态融合以实现无处不在的感知

Hao Wang, Yanyu Qian, Pengcheng Weng, Zixuan Xia, William Dan, Yangxin Xu, Fei Wang

机构 * Universität Bern(伯恩大学) Xi’an Jiaotong University(西安交通大学) Nanyang Technological University(南洋理工大学)

AI总结 COMPASS通过代理令牌和共享空间实现多模态融合,解决缺失模态导致的信息丢失和融合接口不匹配问题,提升多模态感知的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01613 2026-06-09 cs.CV 版本更新

Uncertainty-Aware Hierarchical Re-Localization in OpenStreetMap via Semantic Alignment

基于语义对齐的OpenStreetMap中不确定性感知分层重定位

Yuchen Zou, Xiao Hu, Lihuang Fang, Yuqing Tang

机构 * International Digital Economy Academy(国际数字经济学院) School of Automation Science and Engineering, Xi’an Jiaotong University(西安交通大学自动化科学与工程学院) Department of Electronic and Electrical Engineering, Southern University of Science and Technology(南方科技大学电子与电气工程系)

AI总结 提出不确定性感知分层搜索框架,利用目标级DINO-ViT令牌减少跨模态差异,通过粗FFT相关和不确定性控制的局部细化实现高效定位,在精度和速度上显著优于现有方法。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏