arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Xi'an Jiaotong University(西安交通大学)

共收录 71
2607.06871 2026-07-09 cs.CV 新提交

Geometric Collapse: When Vision Models Fail to Verify Physical Causality

几何崩溃:视觉模型何时无法验证物理因果关系

Wentao Zhang, Jinhu Qi, Weiqiang Jin, Yifei Zhang, Chan-Tong Lam, Irwin King

机构 * Faculty of Applied Sciences, Macao Polytechnic University(澳门理工学院应用科学学院) The Chinese University of Hong Kong(香港中文大学) AgentecFusion Limited(AgentecFusion有限公司) School of Information and Communications Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)

AI总结 研究视觉模型在验证物理因果关系时的问题,提出“Scrambled Edges”方法,通过特定控制分离无支撑边缘证据影响,实验表明该方法使预测偏差增大,几何崩溃全局传播,为改进模型物理合理性提供依据。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06151 2026-07-08 cs.LG math.PR 新提交

Leveraging Extragradient for Effective Sharpness-Aware Minimization in Deep Learning

利用外梯度实现深度学习中有效的锐度感知最小化

Yao Fu, Chunxia Zhang, Junmin Liu, Yihang Jin, Haishan Ye, Yuanao Yang

机构 * SGIT AI Lab, State Grid Corporation of China(国网SGIT人工智能实验室) School of Management, Xi’an Jiaotong University(西安交通大学管理学院) School of Software, Xi’an Jiaotong University(西安交通大学软件学院)

AI总结 研究针对深度学习泛化难题,基于SAM提出EISAM优化器,通过两步更新过程提升泛化性能,对扰动半径敏感度降低。实验表明其在测试准确率和训练效率上优于多种优化器,理论分析证实其收紧泛化边界,还提供实用调优指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02845 2026-07-07 cs.RO cs.AI cs.CV 新提交

Differential Amplifier-Inspired AmpAttention for Multi-View Robotic Manipulation

受差分放大器启发的AmpAttention用于多视图机器人操作

Jin Yang, Ping Wei, Nanning Zheng

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, and Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人机混合增强智能技术国家级重点实验室、人工智能与机器人研究所)

AI总结 针对机器人视图图像问题,提出受模拟电路差分放大器启发的AmpAttention机制,抑制注意力噪声。基于此引入RVAF模型,提升训练效率与任务性能,还扩展为RVAF++,在高精度任务上成果显著。

Comments Accepted by IROS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01901 2026-07-03 cs.LG cs.AI cs.MM 新提交

SABER: A Semantic-Aligned Brain Network Analysis Framework via Multi-scale Hypergraphs

SABER: 一种基于多尺度超图的语义对齐脑网络分析框架

Yidan Xu, Xiangmin Han, Rundong Xue, Huihui Ye

机构 * Hangzhou Dianzi University(杭州电子科技大学) Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学)

AI总结 提出SABER框架,通过多尺度超图建模功能子网络与高阶依赖,并引入决策级语义对齐机制,将大语言模型语义直接融入预测,在ABIDE和ADHD-200数据集上取得最优性能,尤其在小样本场景下。

Comments Accepted to IEEE International Conference on Multimedia and Expo (ICME) 2026;

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00920 2026-07-03 cs.CV 新提交

GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images

GMO-E$^2$DIT:面向电商图像的接地多操作编辑

Zipeng Guo, Xiaoan Liu, Lichen Ma, Cheng Wang, Yu He, Xiaolong Fu, Jingling Fu, Xinyuan Shan, Shaojie Guo, Luohang Liu, Junshi Huang, Yan Li

机构 * Wuhan University(武汉大学) Xi’an Jiaotong University(西安交通大学) Sun Yat-sen University(中山大学)

AI总结 提出GMO-E$^2$DIT框架,通过VLM代理构建区域接地编辑议程,结合掩码条件图像编辑器和反思循环,实现多操作、可审计的电商图像编辑,在指令准确性和编辑保真度上超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31342 2026-07-01 math.NA cs.LG cs.NA 新提交

Domain-Decomposed Randomized Neural Networks for Partial Differential Equations in Unbounded Domains

无界区域偏微分方程的域分解随机神经网络

Haixin Wang, Haoning Dang, Fei Wang, Shimin Guo

机构 * School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院) State Key Laboratory of Multiphase Flow in Power Engineering, Xi’an Jiaotong University(西安交通大学动力工程多相流国家重点实验室)

AI总结 提出域分解随机神经网络框架,通过近场和远场子网络分别捕获局部特征和外部衰减,利用Petrov-Galerkin或配点法求解线性最小二乘系统,适用于无界区域椭圆、穿孔和时间依赖问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22905 2026-07-01 cs.CV 新提交

InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars

InteractiveAvatar: 用于一致且意图感知的虚拟形象的实时流式视频生成

Quanyue Song, Yishan He, Yanfei Zhang, Shihao Cheng, Zhixiang He, Zhizhi Guo, Chi Zhang, Xuelong Li, Caigui Jiang

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi'an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能国家重点实验室) China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能科技(北京)有限公司) Wuhan University(武汉大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

AI总结 提出InteractiveAvatar框架,通过自回归蒸馏实现实时无限流式生成,利用长短视觉记忆机制保持视觉一致性,并设计推理反应模块实现意图感知交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11025 2026-06-30 cs.LG 新提交

Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models

Flow-DPPO:用于流匹配模型的散度近端策略优化

Bowen Ping, Xiangxin Zhou, Penghui Qi, Minnan Luo, Liefeng Bo, Tianyu Pang

机构 * Xi’an Jiaotong University(西安交通大学) Tencent Hunyuan(腾讯混元) National University of Singapore(新加坡国立大学)

AI总结 针对流匹配模型中PPO比率裁剪的结构性缺陷,提出Flow-DPPO方法,利用高斯策略的精确KL散度计算实现散度近端约束,提升奖励和训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28077 2026-06-29 cs.CV 新提交

TextDS: Parameter-Efficient Representation Alignment for Scene Text Detection under Distribution Shifts

TextDS: 分布偏移下场景文本检测的参数高效表示对齐

Boyuan Chen, Zichen Dang, Chuang Yang, Lap-Pui Chau, Yi Wang

机构 * School of Electrical Engineering, Xi’an Jiaotong University(西安交通大学电气工程学院) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系)

AI总结 提出TextDS框架,通过视觉基础模型、逐步LoRA适应和公共子空间融合,仅用4.9M参数实现跨域和退化条件下的鲁棒场景文本检测。

Comments Accepted by ECCV 2026. Project page: https://github.com/ZChenDang/TextDS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27760 2026-06-29 cs.CV 新提交

PixelU: A U-Shaped Transformer for Efficient End-to-End Pixel Diffusion

PixelU: 一种用于高效端到端像素扩散的U形Transformer

Zipeng Guo, Lichen Ma, Yu He, Xiaolong Fu, Jingling Fu, Junshi Huang, Yan Li

机构 * Xi’an Jiaotong University(西安交通大学)

AI总结 提出PixelU,一种极简单阶段U形扩散Transformer,通过零成本跳跃连接和恒通道空间下采样解耦高低频建模,在ImageNet上以约1/3计算成本超越强基线JiT-G。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26217 2026-06-26 cs.LG cs.CV cs.RO 新提交

Fast LeWorldModel

快速LeWorldModel

Yuntian Gao, Xiangyu Xu

机构 * Xi’an Jiaotong University(西安交通大学)

AI总结 提出Fast-LeWM,通过动作前缀并行预测未来潜在状态,替代LeWM的自回归滚动,降低规划时间并减少潜在误差累积。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18974 2026-06-26 cs.CV 新提交

Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning

Visual-OPSD:用于高效统一多模态推理的跨模态在策略自蒸馏

Pengyu Li, Zhitao Gao, Lingling Zhang, Muye Huang, Yuanming Li, Fangzhi Xu, Jun Liu

机构 * Xi’an Jiaotong University(西安交通大学) MOE KLINNS Lab(MOE KLINNS实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) Sun Yat-sen University(中山大学)

AI总结 提出Visual-OPSD方法,通过跨模态在策略自蒸馏,将多步扩散生成的可视化思维推理能力转移到纯文本学生模型,实现14.3倍加速且性能提升3.40个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24175 2026-06-24 cs.CV 新提交

Tri-Efficient Transfer Learning for Point Cloud Videos

点云视频的三效迁移学习

Yiding Sun, Dongxu Zhang, Jihua Zhu, Haozhe Cheng, Zhengqiao Li, Pengcheng Li, Chaowei Fang, Yonghao Dong, Lin Chen

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件学院) School of Information and Communication Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院) SIGS, Tsinghua University(清华大学深圳国际研究生院)

AI总结 提出PoinTriE框架,通过伪运动轨迹合成、几何-运动对偶网络和时空侧网络,实现数据、参数和内存三方面高效的点云视频迁移学习,在动作识别和语义分割任务上取得新最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22557 2026-06-23 cs.AI cs.CL cs.HC 新提交

MacAgentBench: Benchmarking AI Agents on Real-World macOS Desktop

MacAgentBench: 在真实macOS桌面上基准测试AI代理

Yikun Fu, Bowen Fu, Zhenyu Wu, Shuang Cheng, Xiaowei Sun, Bowen Yang, Zehao Li, Yibo Zhao, Zichen Ding, Zhoumianze Liu, Shijie Wang, Biqing Qi, Bowen Zhou

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学) Tsinghua University(清华大学)

AI总结 提出MacAgentBench,包含676个跨25个应用的任务,采用规则评估和细粒度多检查点评分,实验表明最佳配置(OpenClaw上的Claude Opus 4.6)达到73.7% Pass@1,优势主要来自技能库而非框架设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22476 2026-06-23 cs.CV 新提交

CVSBench: A Comprehensive Benchmark for Cross-view Spatial Reasoning and Dreaming

CVSBench:跨视角空间推理与想象的全面基准

Ruixun Liu, Lingyu Zhang, Lanxuan Xue, Kaiyu Li, Bowen Fu, Xiangyong Cao

机构 * Faculty of Electronic and Information Engineering, Xi’an Jiaotong University(西安交通大学电子与信息工程学院) Ministry of Education Key Laboratory of Intelligent Networks and Network Security(教育部智能网络与网络安全重点实验室)

AI总结 提出CVSBench基准,通过卫星-街景对评估视觉语言模型的跨视角空间推理能力,发现模型在视角剧变下难以保持物体与布局一致性,引入3D场景想象管道可显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21119 2026-06-23 cs.CV cs.AI 新提交

MammoExpert: Benchmarking Chain-of-Thought Reasoning in Mammography Diagnosis

MammoExpert:乳腺X线诊断中的思维链推理基准测试

Di Dai, Bo Liu, Youcheng Li, Haojun Yu, Zhouhang Bian, Quanlin Wu, Dong Wang, Sichen Meng, Hongye Xuan, Zijie Lan, Shenda Hong, Liwei Wang

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) School of Computer Science and Engineer, Beijing University of Aeronautics and Astronautics(北京航空航天大学计算机科学与工程学院) Center for Data Science, Peking University(北京大学数据科学中心) Yizhun co. ltd(医准有限公司) International School, Beijing University of Post and Telecommunications(北京邮电大学国际学院) School of Public Health, University of Michigan, Ann Arbor(密歇根大学安娜堡分校公共卫生学院) Future Technology College, Xi'an Jiaotong University(西安交通大学未来技术学院) Peking University(北京大学)

AI总结 提出首个包含思维链推理标注的乳腺X线数据集MammoExpert,覆盖2379张图像和67种病理亚型,通过三阶段推理提升病灶分类准确率,在多个数据集上验证了有效性。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18239 2026-06-23 cs.RO 新提交

EBench: Elemental Diagnosis of Generalist Mobile Manipulation Policies

EBench: 通用移动操作策略的要素诊断

Ning Gao, Jinliang Zheng, Xing Gao, Haoxiang Ma, Hanqing Wang, Yukai Wang, Jiantong Chen, Zanxin Chen, Shujie Zhang, Mingda Jia, Xuekun Jiang, Zihou Zhu, Xinyu Li, Shuai Wang, Hao Li, Wenzhe Cai, Yuqiang Yang, Xudong Xu, Zhaoyang Lyu, Yao Mu, Tai Wang, Jiangmiao Pang, Jia Zeng, Weinan Zhang, Chunhua Shen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学智能产业研究院) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 提出EBench基准,从5个能力和4个泛化维度诊断通用移动操作模型,揭示不同模型在成功率相近时能力差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20044 2026-06-19 cs.CV 新提交

FUSE: Frequency-domain Unification and Spectral Energy Alignment for Multi-modal Object Re-Identification

FUSE:面向多模态目标重识别的频域统一与频谱能量对齐

Xuanhao Qi, Tom H. Luan, Yukang Zhang, Jinkai Zheng, Zhou Su, Shuwei Li, Lei Tan

机构 * School of Cyber Science and Engineering, Xi'an Jiaotong University(西安交通大学网络空间安全学院) School of Informatics, Xiamen University(厦门大学信息学院) National University of Singapore(新加坡国立大学)

AI总结 提出频域框架FUSE,通过频谱解耦和能量对齐两阶段处理,解决多模态重识别中低频偏置问题,在三个数据集上mAP提升9.1%。

Comments Accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19888 2026-06-19 cs.LG cs.AI 新提交

SL-S4Wave: Self-Supervised Learning of Physiological Waveforms with Structured State Space Models

SL-S4Wave:基于结构化状态空间模型的生理波形自监督学习

Feng Wu, Harsh Deep, Eric Lehman, Sanyam Kapoor, Guoshuai Zhao, Rahul Krishnan, Gari Clifford, Li-wei H Lehman

机构 * Massachusetts Institute of Technology(麻省理工学院) OpenEvidence, USA(OpenEvidence(美国)) New York University(纽约大学) Xi’an Jiaotong University(西安交通大学) University of Toronto(多伦多大学) Emory University(埃默里大学)

AI总结 提出SL-S4Wave框架,结合对比学习与基于结构化状态空间模型的编码器,通过多尺度子核全局卷积捕获多通道生理波形的局部和长程依赖,在心律失常检测等任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19857 2026-06-19 cs.CL cs.AI 新提交

Large Language Models Do Not Always Need Readable Language

大型语言模型并不总是需要可读语言

Jiayi Zhu, Haoxuan Peng, Junxi Wang, Liang Ke, Chen Zhang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Sydney(悉尼大学) Hefei University of Technology(合肥工业大学) Xi’an Jiaotong University(西安交通大学) Nanjing University(南京大学)

AI总结 研究提出BabelTele表示法,将语义编码为紧凑、非标准文本,牺牲人类可读性但保持LLM可恢复性,实验表明可压缩至27.9%长度并保持99.5%语义保真度,降低上下文开销。

Comments 23 pages, 10 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19912 2026-06-19 math.NA cs.LG cs.NA physics.comp-ph 新提交

Structure-Oriented Randomized Neural Networks for Poisson-Nernst-Planck and Poisson-Nernst-Planck-Navier-Stokes Systems

面向结构的随机神经网络用于泊松-能斯特-普朗克和泊松-能斯特-普朗克-纳维-斯托克斯系统

Yunlong Li, Fei Wang

机构 * School of Mathematics and Statistics, Xi’an Jiaotong University, Xi’an, Shaanxi(西安交通大学数学与统计学院,西安,陕西)

AI总结 提出结构导向随机神经网络(SO-RaNN)框架,通过解耦线性化子问题、逐点截断保持浓度正性、离散质量缩放因子和SAV后处理修正,实现PNP和PNP-NS系统的高效求解,并理论推导残差估计和收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19019 2026-06-18 cs.CV 新提交

FlowObject: Flow Steering for Bridging Generative Priors and Reconstruction Fidelity

FlowObject: 流引导以桥接生成先验与重建保真度

Yuchen Rao, Xuqian Ren, Yinyu Nie, Sayan Deb Sarkar, Biao Zhang, Vincent Lepetit, Friedrich Fraundorfer

机构 * Graz University of Technology Austria(奥地利格拉茨理工大学) Tampere University Finland(芬兰塔尔库大学) Technical University of Munich Germany(德国慕尼黑技术大学) Stanford University The United States of America(美国斯坦福大学) Xi’an Jiaotong University China(中国西安交通大学) École des Ponts ParisTech France(法国巴黎综合理工学院)

AI总结 提出FlowObject框架,通过双空间引导策略驱动流匹配模型的ODE轨迹,在利用生成先验完成未观测区域的同时保持与真实观测的一致性,并集成3DGS细化阶段弥合生成输出与真实感重建的差距,显著提升几何完整性和视角相关外观保真度。

Comments Project page: https://yuchenrao.github.io/projects/flowObject/flowObject.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18235 2026-06-17 cs.AI 新提交

EvolveNav: Proactive Preflection and Self-Evolving Memory for Zero-Shot Object Goal Navigation

EvolveNav: 用于零样本目标导航的主动预反思与自进化记忆

Qi Chai, Wenhao Shen, Nanjie Yao, Yue Xia, Kaiyong Zhao, Jie Ma, Guosheng Lin, Hao Wang

机构 * HKUST(GZ)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Xi’an Jiaotong University(西安交通大学) XGRIDS(深圳格物智联)

AI总结 提出自进化零样本目标导航框架,通过从历史轨迹提取规则并基于置信上界检索,结合记忆引导预反思模块,减少无效探索,成功率提升10.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17989 2026-06-17 cs.CV cs.AI 新提交

Recover Semantics First, Generate Better: Improved Latent Modeling for 3D MRI Reconstruction and Cross-Contrast Synthesis

先恢复语义,再生成更好:改进的潜在建模用于3D MRI重建和跨对比合成

Yonghao Chen, Sicheng Yang, Rui Tang, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Xi’an Jiaotong University(西安交通大学)

AI总结 提出语义优先的潜在建模框架,通过潜在协调编码器、语义恢复块和解剖感知频率损失,解决3D MRI压缩中长程解剖一致性、语义退化和平滑重建问题,提升重建和跨对比合成质量。

Comments Code: https://github.com/script-Yang/RSF

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17950 2026-06-17 cs.CV cs.AI 新提交

Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model

即插即适应:基于预训练对齐模型的首眼多模态指代消解

Jinghan Wu, Jing Li, Ivor W. Tsang, Xuetao Zhang

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi'an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能全国重点实验室) Centre for Frontier AI Research and Institute of High-Performance Computing, Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局前沿人工智能研究中心与高性能计算研究所)

AI总结 提出即插即适应方法,利用预训练的细粒度对齐模型,通过证据理论融合视觉与类别线索,无需目标数据集训练或大型VLLM,在CIN基准上CoNLL F1比专用方法和流行VLLM分别提升5.31%和2.12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17871 2026-06-17 cs.AI 新提交

StepGuard: Guarding Web Navigation via Single-Step Calibration

StepGuard: 通过单步校准保护网页导航

Zhihao Cui, Yuchen Zhang, Xiyang Sun, Yaxiong Wang, Li Zhu, Jinpeng Hu, Liu Liu, Mengjia Li, Yujiao Wu

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) Xiamen University(厦门大学) Zhejiang Lab(之江实验室) CSIRO(澳大利亚联邦科学与工业研究组织)

AI总结 针对网页导航中单步脆弱性问题,提出StepGuard框架,通过动态双策略优化(DDPO)解决奖励冲突,并利用置信度引导的自适应导航反射(CANR)校准单步误差,显著提升导航与答案准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16208 2026-06-16 cs.RO 新提交

ATHENA: Accelerated Multi-Task Heterogeneous Influence Functions for Robot Data Curation

ATHENA: 加速的多任务异构影响函数用于机器人数据筛选

Tao Xu, Jiaxin Wang, Runhao Zhang, Jiayi Guan, Xianchao Zeng, Weixi Song, Xinyu Zhou, Zhetao Chen, Guang Chen, Yong-Lu Li

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Xi'an Jiaotong University(西安交通大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出ATHENA框架,利用Kronecker梯度结构和秩r随机截断近似加速影响函数计算,实现多任务VLA模型数据筛选,在模拟和真实机器人任务中以更少数据达到或超越全数据微调性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15207 2026-06-16 cs.LG cs.AI cs.NE 新提交

Controlled Dynamics Attractor Transformer

受控动力学吸引子Transformer

Cheng Zhang, Minnan Luo, Zesheng Yang, Ming Li, Yong-Jin Liu, Qinghua Zheng

机构 * Xi'an Jiaotong University(西安交通大学) Tsinghua University(清华大学)

AI总结 提出受控动力学吸引子Transformer(CDAT),通过耦合混合von Mises-Fisher注意力能量与Hopfield精炼能量,并引入CANN启发的兴奋-抑制调制,实现拓扑约束的动力学系统,在图异常检测和图分类任务上达到最优性能。

Comments 20pages,3 figures

Journal ref Forty-Third International Conference on Machine Learning(ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09669 2026-06-16 cs.AI cs.CL 新提交

SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks

SpatialWorld: 在多模态智能体真实世界任务中基准测试交互式空间推理

Hongcheng Gao, Hailong Qu, Jingyi Tang, Jiahao Wang, Zihao Huang, Hengkang Qiao, Shihong Huang, Junming Yang, Yi Li, Hongyixuan Yuan, Wenjie Li, Bohan Zeng, Wenbo Li, Bo Wang, Jianhui Liu, Olive Huang, Haoyang Huang, Wentao Zhang, Guoqing Huang, Nan Duan, Yinpeng Dong

机构 * Tsinghua University(清华大学) Chongqing University(重庆大学) Peking University(北京大学) ZenoMind AI Xi’an Jiaotong University(西安交通大学) Beijing Institute of Technology(北京理工大学) Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) Joy Future Academy(京东探索研究院) The University of Hong Kong(香港大学)

AI总结 提出SpatialWorld基准,集成8种异构模拟后端,通过760个人工标注任务评估多模态智能体在视觉部分可观测环境中的交互式空间理解,发现最强模型GPT-5任务成功率仅17.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12898 2026-06-12 cs.CV cs.CL 新提交

Magnifying What Matters: Attention-Guided Adaptive Rendering for Visual Text Comprehension

放大关键信息:面向视觉文本理解的注意力引导自适应渲染

Shenglai Zeng, Qirui Wang, Kai Guo, Xinnan Dai, Xianxuan Long, Hui Liu

机构 * Michigan State University(密歇根州立大学) Xi’an Jiaotong University(西安交通大学)

AI总结 针对视觉语言模型在视觉文本理解任务中存在的定位与利用脱节问题,提出无需训练、模型无关的注意力引导自适应渲染方法AGAR,通过放大关键文本跨度提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏