arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Xi'an Jiaotong University(西安交通大学)

共收录 60
2607.23496 2026-08-14 cs.AI cs.CR 版本更新

Do LLMs Know Their Vulnerable Scenarios?

大语言模型知道它们的脆弱场景吗?

Ziheng Peng, Huiqi Deng, Haoran Jing, Xuankun Rong, Jiahui Han, Xiting Wang, Na Zou, Xia Hu

机构 * Renmin University of China(中国人民大学) Xi’an Jiaotong University(西安交通大学) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 研究大语言模型在特定场景下的脆弱性,提出Concept2Scenario框架,通过实例化概念空间、归因拒绝抑制等步骤发现脆弱场景,在多模型和基准测试中验证,能提高攻击成功率、可迁移且组合效果优。

Comments 19 pages, 11 Figures, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03181 2026-08-14 cs.RO cs.CV 版本更新

SpatialVAM:Spatial-Aware Multi-View Video Diffusion as a Data-Efficient Robot Policy

多视角视频扩散策略:一种3D空间-时间感知的视频动作模型

Peiyan Li, Yixiang Chen, Yuan Xu, Jiabing Yang, Xiangnan Wu, Jun Guo, Nan Sun, Long Qian, Xinghang Li, Xin Xiao, Jing Liu, Nianfeng Liu, Tao Kong, Yan Huang, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges(五时代) Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) Wuhan University(武汉大学) Nanjing University(南京大学)

AI总结 本文提出MV-VDP,通过联合建模环境的3D空间-时间状态,解决机器人操控中对3D空间结构和时间演变理解不足的问题,实现高效、鲁棒且可解释的动作执行。

Comments Updated Version; Project Website: https://spatialvam.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15577 2026-08-14 cs.CV 版本更新

Shortest-Path Decomposition for Foliage-Robust 3D Tree Modeling and Above-Ground Biomass Estimation from Point Clouds

适用于点云的抗 foliage 三维树木建模与地上生物量估算的最短路径分解方法

Di Wang, Shi Li

机构 * School of Software Engineering, Xi'an Jiaotong University, Xi'an 710049, China(软件工程学院,西安交通大学,西安710049,中国) Shaanxi Joint (Key) Laboratory for Artificial Intelligence (Xi’an Jiaotong University), Xi'an 710049, China(陕西省人工智能联合(重点)实验室(西安交通大学),西安710049,中国)

AI总结 该研究提出拓扑驱动的 foliage 抑制最短路径分解方法,从单一点云恢复树木分支层次,在有叶条件下的AGB估算精度优于传统QSM方法,为相关森林清查业务应用消除了障碍。

Comments 14 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04923 2026-08-13 cs.LG cs.AI cs.CL 版本更新

Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning

基于评分标准的强化学习中的奖励黑客行为的复现、分析与检测

Xuekang Wang, Zhuoyuan Hao, Shuo Hou, Hao Peng, Juanzi Li, Xiaozhi Wang

机构 * Tsinghua University(清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Xi’an Jiaotong University(西安交通大学)

AI总结 本文提出可控黑客环境CHERRL,通过注入已知偏见复现奖励黑客行为,分析其可发现性与可利用性,并探索基于智能体的自动检测方法。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19436 2026-08-12 cs.CV cs.AI cs.LG cs.MM 版本更新

VDC-Agent: When Video Detailed Captioners Evolve Themselves via Agentic Self-Reflection

VDC-Agent:当视频详细描述器通过代理自我反思而自我进化

Qiang Wang, Xinyuan Gao, Yuhang He, Jizhou Han, Jiangyang Li, SongLin Dong, Zhiheng Ma, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) Kuaishou Technology(快手科技) Shenzhen University of Advanced Technology(深圳先进技术大学)

AI总结 VDC-Agent通过自我反思机制实现视频详细描述的自我进化,利用自动生成的(描述,评分)对提升描述准确性与评分表现。

Comments Accepted to ECCV 2026. Project Page: https://vdcagent.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23413 2026-08-12 cs.LG 版本更新

URS: A Unified Neural Routing Solver for Cross-Problem Zero-Shot Generalization

URS:一种面向跨问题零样本泛化的统一神经路由求解器

Changliang Zhou, Canhong Yu, Shunyu Yao, Xi Lin, Zhenkun Wang, Yu Zhou, Qingfu Zhang

机构 * School of Automation and Intelligent Manufacturing, Southern University of Science and Technology, Shenzhen, China(自动化与智能制造学院,南方科技大学,深圳,中国) Guangdong Provincial Key Laboratory of Fully Actuated System Control Theory and Technology, Southern University of Science and Technology, Shenzhen, China(广东省全驱动系统控制理论与技术重点实验室,南方科技大学,深圳,中国) College of Computer Science and Software Engineering, Shenzhen University, Shenzhen, China(计算机科学与软件工程学院,深圳大学,深圳,中国) Department of Computer Science, City University of Hong Kong, Hong Kong SAR, China(计算机科学系,香港城市大学,香港特别行政区,中国) School of Mathematics and Statistics, Xi'an Jiaotong University, Xi'an, China(数学与统计学学院,西安交通大学,西安,中国)

AI总结 提出URS,一种统一神经路由求解器,通过统一数据表示和混合偏置模块,实现单个模型在110种车辆路径问题变体(含99种未见变体)上的零样本泛化,并支持高达7000节点的规模。

Comments accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22077 2026-08-11 eess.IV cs.CV physics.optics 版本更新

The Lift Spectrum: How Measurement-to-Space Adaptivity Shapes Robustness in Image-Free Single-Pixel Sensing

提升频谱:测量到空间的适应性如何塑造无图像单像素传感的鲁棒性

Yuyuan Han, Jingwei Li, Xiaoxia Zhang, Long Qiu, Chong Wang, Wenxuan Hao, Jiangyu Han, Xinyu Yao, Yuchen He, Hui Chen, Jianbin Liu, Huaibin Zheng

机构 * Electronic Materials Research Laboratory, Key Laboratory of the Ministry of Education and International Center for Dielectric Research, School of Electronic Science and Engineering, Xi’an Jiaotong University(电子材料研究中心、教育部重点实验室和国际介电研究中心、电子科学与工程学院,西安交通大学) Micius Laboratory, Henan Academy of Sciences(墨子实验室、河南省科学院)

AI总结 研究无图像单像素传感中提升频谱对鲁棒性的影响,提出基于适应程度排序的方法,介绍时空软融合网络及训练方式,通过模拟和实际验证其性能,绘制提升频谱可指导设计,提升了该领域的方法效果。

Comments 25 pages (13 main text + 12 supplementary material), 8 figures, 3 tables. Submitted to IEEE Transactions on Computational Imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25465 2026-08-11 cs.CV cs.AI 版本更新

EchoStyle: Unlocking High-Fidelity Video Stylization with Reverse Data Synthesis

EchoStyle: 通过反向数据合成解锁高保真视频风格化

Huaqiu Li, Jiahao Wang, Sijia Cai, Hualian Sheng, Bing Deng, Jieping Ye, Wenhan Luo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Alibaba Group(阿里巴巴集团) Xi’an Jiaotong University(西安交通大学)

AI总结 提出EchoStyle框架,通过构建视频到视频架构、自动反向合成数据集V-Style20k和初始跟随模式机制,解决视频风格化中的内容泄露、数据稀缺和长视频适应性问题,实现高质量任意长度视频风格化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05695 2026-08-11 cs.CV 版本更新

Let Geometry GUIDE: Layer-wise Unrolling of Geometric Priors in Multimodal LLMs

让几何引导:在多模态大语言模型中逐层展开几何先验

Chongyu Wang, Ting Huang, Chunyu Sun, Xinyu Ning, Di Wang, Hao Tang

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) InspireOmni

AI总结 本文提出GUIDE框架,通过多级采样和逐步融合几何先验,提升多模态大语言模型在空间推理任务中的性能。

Comments Revised manuscript with updated experiments, figures, and presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19491 2026-08-10 cs.CV 版本更新

Thinking in Scales: Accelerating Gigapixel Pathology Image Analysis via Adaptive Continuous Reasoning

尺度思考:通过自适应连续推理加速千兆像素病理图像分析

Jiusong Ge, Yingkang Zhan, Wenjie Zhao, Di Zhang, Ke Wang, Jiashuai Liu, Chunze Yang, Chengzu Li, Jian Zhang, Yuxin Dong, Ni Zhang, Qidong Liu, Mireia Crispin-Ortuzar, Huazhu Fu, Chen Li, Zeyu Gao

机构 * School of Computer Science(计算机科学学院) Technology, Xi’an Jiaotong University, Xi’an, China(技术学院,西安交通大学,西安,中国) Department of Transmedia Art, Xi’an Academy of Fine Arts, Xi’an, China(多媒体艺术系,西安美术学院,西安,中国) Department of Oncology, University of Cambridge, Cambridge, U.K.(肿瘤学系,剑桥大学,剑桥,英国) Language Technology Lab, University of Cambridge, Cambridge, U.K.(语言技术实验室,剑桥大学,剑桥,英国) Institute of High Performance Computing, Agency for Science, Technology(高性能计算研究所,科技研究局)

AI总结 提出PathCTM模型,通过动态尺度切换和注意力引导的区域剪枝实现高效连续推理,大幅减少计算开销并保持诊断性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29025 2026-08-06 cs.CV 版本更新

Evaluation-Verification Reward for Consistent Multi-Reference Image Editing

用于一致多参考图像编辑的评估-验证奖励

Yingmao Miao, Pengfei Zhang, Xiaochen Lv, Meng Yu, Lei Sun, Xiangxiang Chu, Chao Shen, Chenhao Lin

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba(高德,阿里巴巴) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对多参考图像编辑的视觉一致性与奖励模型缺失问题,提出多维度评估-验证奖励EVR,实现无需架构改动的现成编辑器RL微调,性能优于Qwen-Image-Edit并达到或超NanoBanana。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08514 2026-08-05 cs.CV 版本更新

OmniTryOn: Video Try-On Anything at Once!

OmniTryOn: 一次性视频试穿任意物品!

Changliang Xia, Chengyou Jia, Minnan Luo, Zhuohang Dang, Xin Shen, Bowen Ping

机构 * Xi’an Jiaotong University(西安交通大学)

AI总结 提出OmniTryOn框架,通过首帧可穿戴缓存和时空一致RoPE,实现无外部先验的一次性视频多物品试穿,在TryAny-Bench上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25459 2026-08-05 cs.RO 版本更新

GS-Playground: A High-Throughput Photorealistic Simulator for Vision-Informed Robot Learning

GS-Playground:一种高吞吐量的视觉真实模拟器用于基于视觉的机器人学习

Yufei Jia, Heng Zhang, Ziheng Zhang, Junzhe Wu, Mingrui Yu, Zifan Wang, Dixuan Jiang, Zheng Li, Chenyu Cao, Zhuoyuan Yu, Xun Yang, Haizhou Ge, Yuchi Zhang, Jiayuan Zhang, Zhenbiao Huang, Tianle Liu, Shenyu Chen, Jiacheng Wang, Bin Xie, Xuran Yao, Xiwa Deng, Guangyu Wang, Jinzhi Zhang, Lei Hao, Zhixing Chen, Yuxiang Chen, Anqi Wang, Hongyun Tian, Yiyi Yan, Zhanxiang Cao, Yizhou Jiang, Hanyang Shao, Yue Li, Lu Shi, Bokui Chen, Wei Sui, Hanqing Cui, Yusen Qin, Ruqi Huang, Lei Han, Tiancai Wang, Guyue Zhou

机构 * THU(清华大学) Motphys Dexmal DISCOVER Robotics HKUST(GZ)(香港科技大学(广州)) BIT(北京理工大学) NUS(新加坡国立大学) HITSZ(哈尔滨工业大学) XJTU(西安交通大学) NJU(南京大学) SJTU(上海交通大学) D-Robotics

AI总结 GS-Playground通过高吞吐量的多模态模拟框架,结合高效物理引擎和3DGS渲染管道,提升视觉强化学习的效率,降低大规模视觉RL的门槛,实现感知与物理的无缝衔接。

Comments Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25498 2026-08-04 cs.SD cs.AI 版本更新

SymphonyGen: 3D Hierarchical Orchestral Generation with Controllable Harmony Skeleton

SymphonyGen:具有可控和声骨架的3D分层交响乐生成

Xuzheng He, Nan Nan, Zhilin Wang, Ziyue Kang, Zhuoru Mo, Ao Li, Yu Pan, Xiaobing Li, Feng Yu, Xiaohong Guan

机构 * Department of AI Music and Music Information Technology, Central Conservatory of Music(中央音乐学院人工智能音乐与音乐信息科技系) Frontier Institute of Science and Technology, and Interdisciplinary Research Center of Frontier Science and Technology, Xi’an Jiaotong University(西安交通大学前沿科学与技术研究院及交叉科学与技术 interdisciplinary research center) University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学)

AI总结 SymphonyGen通过3D分层框架实现当代电影交响乐生成,采用分层解码器架构提升效率,引入短谱条件和GRPO优化,增强和声纯净度与音乐表现力。

Comments Accepted at ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00500 2026-08-04 cs.AI cs.SE 版本更新

ProbGuard: Proactive Runtime Monitoring for LLM Agent Safety via Probabilistic Prediction

ProbGuard:基于概率的运行时监控用于LLM代理安全

Haoyu Wang, Christopher M. Poskitt, Jiali Wei, Jun Sun

机构 * Singapore Management University(新加坡管理大学) Xi'an Jiaotong University(西安交通大学)

AI总结 ProbGuard通过概率风险预测主动监控LLM代理安全,利用离散时间马尔可夫链建模行为动态,提前预警潜在危险,提升安全性和任务完成率。

Comments Accepted by the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15100 2026-08-03 cs.AI 版本更新

Dual-Dimensional Consistency: Balancing Budget and Quality in Adaptive Inference-Time Scaling

双维度一致性:在适应性推理时间扩展中平衡预算与质量

Rongman Xu, Yifei Li, Tianzhe Zhao, Yanrui Wu, Bo Li, Hang Yan

机构 * Xi’an Jiaotong University(西安交通大学)

AI总结 本文提出双维度一致性框架,通过结合置信度加权贝叶斯协议与趋势感知分层剪枝,平衡推理预算与质量,减少10倍以上token消耗并保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19566 2026-08-03 cs.CV 版本更新

PhyUnfold-Net: Advancing Remote Sensing Change Detection with Physics-Guided Deep Unfolding

PhyUnfold-Net: 通过物理引导的深度展开推进遥感变化检测

Zelin Lei, Yaoxing Ren, Jiaming Chang

机构 * Xi’an Jiaotong University(西安交通大学) Anhui University(安徽大学)

AI总结 本文提出PhyUnfold-Net,通过物理先验提升遥感变化检测的鲁棒性,利用迭代变化分解模块和小波谱抑制模块,有效分离混叠特征,减少假警报。

Comments 18 pages, 8 figures, 9 tables. Appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08825 2026-07-31 cs.CV 版本更新

Rethinking Event-Based Object Detection through Representation-Level Temporal Aggregation and Model-Level Hypergraph Reasoning

重新思考基于事件的对象检测:通过表示层面的时间聚合和模型层面的超图推理

Meisen Wang, Hao Deng, Wei Bao, Chengjie Wang, Zhiqiang Tian, Shaoyi Du, Siqi Li, Yue Gao

机构 * Xi’an Jiaotong University(西安交通大学) Tsinghua University(清华大学) China Mobile System Integration(中国移动系统集成) Inner Mongolia Agricultural University(内蒙古农业大学)

AI总结 本文提出Ev-DTAD框架,结合表示层面的时间编码与模型层面的时间超图推理,提升事件基于对象检测的准确率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06276 2026-07-29 cs.CV cs.AI 版本更新

RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension

RefBench-PRO:面向感知与推理的指称表达理解基准

Tianyi Gao, Hao Li, Han Fang, Xin Wei, Xiaodong Dong, Hongbo Sun, Ye Yuan, Zhongjiang He, Jinglin Xu, Jingmin Xin, Hao Sun

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(国家人机混合增强智能重点实验室) National Engineering Research Center for Visual Information and Applications(国家视觉信息与应用工程技术研究中心) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI)) China Telecom(中国电信) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology Beijing(北京科技大学)

AI总结 RefBench-PRO提出一个面向感知与推理的指称表达理解基准,通过分解指称表达为感知和推理两个维度,设计六个逐步递增的挑战任务,并引入Ref-R1强化学习方案提升定位精度,实现对多模态大语言模型的可解释评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22135 2026-07-28 cs.CV 版本更新

GLI-AL: A Multi-Modal Glioma MRI Label Resource with Unified Anatomy-Lesion Labels

GLI-AL:一个具有统一解剖-病变标签的多模态胶质瘤MRI标签资源

Xingyu Xiang, Shuang Hao, Fan Wang, Jianhua Ma, Chunfeng Lian

机构 * Key Laboratory of Biomedical Information Engineering of Ministry of Education, School of Life Science and Technology, Xi’an Jiaotong University(教育部生物医学信息工程重点实验室,西安交通大学生命科学与技术学院) School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院) Research Center for Intelligent Medical Equipment and Devices (IMED), Xi’an Jiaotong University(西安交通大学智能医疗设备与器械研究中心)

AI总结 研究针对现有BraTS-GLI数据集不足,引入BraTS-GLI Anatomy-Lesion资源,提供统一解剖-病变标签集及元数据。通过WMH感知监督,提升对共存病变敏感性,保持健康组织分割性能,支持多方面研究,数据和代码可获取。

Comments Minor revision: Figure 1 was repositioned. The scientific content remains unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21013 2026-07-28 cs.AI cs.CV 版本更新

EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization

EmoAgent-R1:基于强化学习的动态智能体专业化实现多模态情感理解

Lihuang Fang, Yuchen Zou, kebing Jin, Jinghui Qin

机构 * Guangdong University of Technology(广东工业大学) Southern University of Science and Technology(南方科技大学) Xi’an Jiaotong University(西安交通大学) Guizhou Provincial Laboratory of Big Data, State Key Laboratory of Public Big Data, Guizhou University(贵州大学大数据省级重点实验室、公共大数据国家重点实验室)

AI总结 研究针对现有多模态情感识别方法忽视情感源动态性和复杂性的问题,提出基于强化学习的动态智能体专业化框架EmoAgent-R1,采用冷启动策略和两步智能体工作流程训练,并用P-GRPO优化,实验证明其在情感推理性能和优化稳定性上更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21271 2026-07-27 cs.CV 版本更新

Flash EQ-Linear: Accelerating Equivariant Linear Layers via Group-wise Discrete Fourier Transform

Flash EQ-Linear:通过分组离散傅里叶变换加速等变线性层

Zhongchen Zhao, Jixin Wang, Qi Xie, Hui Lin, Lei Zhang, Deyu Meng, Zongben Xu

机构 * Xi’an Jiaotong University(西安交通大学) The Hong Kong Polytechnic University(香港理工大学) OPPO Research(OPPO研究院)

AI总结 研究针对等变网络计算效率低的问题,提出Flash EQ-Linear算法,结合傅里叶卷积定理等降低复杂度,提供CUDA内核,在算子和网络层面均实现加速,使等变网络在多方面首次严格优于非等变网络。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05611 2026-07-24 cs.CV 版本更新

Focus on What Matters: Constraining Spatial-Temporal Attention via Action-Units for Noise-Resilient AQA

关注重要因素:通过动作单元约束时空注意力以实现抗噪声动作质量评估

Shuaikang Zhu, Yiding Sun, Zihao Guo, Yang Yang, Chen Sun

机构 * School of Electronic and Information Engineering, Xi’an Jiaotong University(电子工程学院,西安交通大学) Shanghai University of Sport(上海体育大学)

AI总结 该研究针对动作质量评估中从复杂背景提取细粒度运动特征的难题,提出姿态引导的内在运动蒸馏框架,通过动作单元解析器、双流解耦机制和自适应权重模块,实现抗噪声评估,在多数据集实验中取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11557 2026-07-23 cs.CV 版本更新

Single-Teacher View Augmentation: Enhancing Knowledge Distillation with Student-Guided Perturbations

单教师视图增强:通过学生引导的扰动增强知识蒸馏

Xuyi Yu, Yaohua Liu, Chengjun Li, Qiang Tang, Shuzhe Tang, Kuizhi Mei

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能技术国家重点实验室) Guangdong Institute of Intelligence Science and Technology(广东省智能科学与技术研究院) Institute of Collaborative Innovation, University of Macau(澳门大学协同创新研究院) Beijing Huahang Institute of Radio Measurement(北京华航无线电测量研究所)

AI总结 研究针对知识蒸馏中单一教师视角限制监督信号多样性的问题,提出SAKD框架,利用学生演变特征动态生成扰动视图,实现单阶段训练,实验证明该方法在减少参数和无需预训练的情况下,准确率优于随机扰动方法且与两阶段方法相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09796 2026-07-21 cs.LG 版本更新

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels

噪声偏好标签下无元数据的元重加权直接偏好优化

Hua Qu, Yifan Li, Xiaodong Yuan

机构 * Xi’an Jiaotong University(西安交通大学)

AI总结 研究针对DPO性能依赖偏好数据质量问题,提出双层优化框架、无任务元知识驱动方法及结合中心差分近似与LoRA微调的可扩展训练方案,经实验验证该方法能在不同噪声率下提升训练性能。

Comments 36 pages, including appendices. Revised version with updated theoretical analysis, supplementary material, figures and improved table formatting

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01700 2026-07-21 cs.CV cs.MM 版本更新

Can Video Diffusion Models Predict Past Frames? Bidirectional Cycle Consistency for Reversible Interpolation

视频扩散模型能否预测过去帧?双向循环一致性用于可逆插值

Lingyu Liu, Yaxiong Wang, Li Zhu, Zhedong Zheng

机构 * School of Software Engineering, Xi'an Jiaotong University(西安交通大学软件工程学院) School of Computer and Information Science, Hefei University of Technology(合肥工业大学计算机与信息科学学院) Faculty of Science and Technology, University of Macau(澳门大学科技学院)

AI总结 本文提出双向循环一致性框架,通过双向生成轨迹对称性提升视频插值的时序一致性,实验表明在37帧和73帧任务中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12273 2026-07-20 cs.SE cs.AI cs.CL 版本更新

Code-MUE: Measuring Code LLMs' Uncertainty through Execution-based Semantic Interaction Graphs

Code-MUE:通过基于执行的语义交互图测量代码语言模型的不确定性

Xiaoning Ren, Yinxing Xue, Lei Ma, Yuheng Huang

机构 * Xi’an Jiaotong University(西安交通大学) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院人工智能产业研究院) The University of Tokyo(东京大学) University of Alberta(阿尔伯塔大学)

AI总结 研究针对代码语言模型内在随机性带来的风险,引入纯黑盒框架Code-MUE,通过基于执行的语义交互图测量不确定性,经大规模实证研究验证其与功能正确性强负相关,优于基线,可实现风险检测和选择性预测。

Comments To appear at The ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12222 2026-07-20 cs.SD cs.MM eess.AS 版本更新

Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling

基于多茎注意力和分层不确定性建模的歌曲美学评估

Yishan Lv, Jing Luo, Boyuan Ju, Yang Zhang, Xinda Wu, Bo Yuan, Xinyu Yang

机构 * School of Computer Science and Technology, Xi’an Jiaotong University, Xi’an, China(计算机科学与技术学院,西安交通大学,西安,中国) Central Media Technology Institute, Huawei(中央媒体技术研究院,华为)

AI总结 针对音乐生成人工智能带来的歌曲美学评估需求,提出含多茎注意力融合与分层粒度感知区间聚合模块的评估框架,在两个数据集上评估并与两个SOTA模型比较,该方法在多维歌曲美学评估中性能更强。

Comments Accepted to the 27th International Society for Music Information Retrieval Conference (ISMIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11637 2026-07-14 cs.AI 版本更新

TouchThinker: Scaling Tactile Commonsense Reasoning to the Open World with Large-scale Data and Action-aware Representation

TouchThinker: 通过大规模数据和动作感知表示将触觉常识推理扩展到开放世界

Kailin Lyu, Di Wu, Pengwei Zhang, Yuhang Zheng, Yingxin Lai, Long Xiao, Kangyi Wu, Pengna Li, Chen Gao, Lianyu Hu, Xiaobin Hu, Jie Hao, Ce Hao, Weihao Yuan, Shuicheng Yan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) National University of Singapore(新加坡国立大学) Zhongguancun Academy(中关村学院) Xiamen University(厦门大学) Xi’an Jiaotong University(西安交通大学) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学)

AI总结 提出TouchThinker框架,通过构建百万级多源触觉数据集TouchThinker-1M和动作感知建模,将触觉常识推理扩展到开放世界,在多个数据集上取得竞争性表现。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17889 2026-07-14 cs.CV 版本更新

AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning

AeroRAG:结构化多模态检索增强型LLM用于细粒度航空视觉推理

Junxiao Xue, Quan Deng, Tingqi Hu, Meicong Si, Xinyi Yin, Yunyun Shi, Xuecheng Wu

机构 * Research Center for Space Computing System, Zhejiang Lab, Hangzhou(杭州浙大实验室空间计算系统研究中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou(中国科学院大学杭州高等研究院) School of Cyber Science and Engineering, Zhengzhou University(郑州大学计算机科学与工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

AI总结 本文提出AeroRAG,通过结构化场景图引导的多模态检索增强生成框架,解决航空场景中视觉问答的挑战,提升对小物体、数量、位置及物体关系的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏