arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Xi'an Jiaotong University(西安交通大学)

共收录 765
2507.10614 2026-05-20 cs.LG cs.AI

Fine-tuning Large Language Model for Automated Algorithm Design

微调大语言模型用于自动化算法设计

Fei Liu, Rui Zhang, Xi Lin, Zhichao Lu, Qingfu Zhang

机构 * City University of Hong Kong(香港城市大学) Xi’an Jiaotong University(西安交通大学)

AI总结 本文探讨了微调大语言模型以提升其在自动化算法设计中的性能,提出了一种多样性感知的排名策略和直接偏好优化方法,通过实验验证了任务特定微调在不同算法设计任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18795 2026-05-20 cs.LG cs.AI

HELLoRA: Hot Experts Layer-Level Low-Rank Adaptation for Mixture-of-Experts Models

HELLoRA: Hot Experts Layer-Level Low-Rank Adaptation for Mixture-of-Experts Models

Jia Wei, Zhonghao Zhang, Ping Chen, Qianyang li, Yancheng Pan, Shaoxun Wang, Ziyi Qiu, Longxiang Wang

机构 * Department of Computer Science and Technlogy(计算机科学与技术系) Tsinghua University(清华大学) School of Computer Science and Technlogy(计算机科学与技术系) Xi’an Jiaotong University(西安交通大学) The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高科技区(滨江)区块链与数据安全研究院)

AI总结 本文提出HELLoRA,一种针对混合专家模型的层级低秩适应方法,通过仅对最活跃的专家添加LoRA模块,减少可训练参数和计算量,同时提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18693 2026-05-19 cs.AI

SkillGenBench: Benchmarking Skill Generation Pipelines for LLM Agents

SkillGenBench: 评估LLM代理技能生成流水线的基准测试

Yifan Zhou, Zhentao Zhang, Ziming Cheng, Shuo Zhang, Qizhen Lan, Zhangquan Chen, Zhi Yang, QianyuXu, Ronghao Chen, Huacan Wang, Sen Hu

机构 * SJTU(上海交通大学) XJTU(西安交通大学) NUS(新加坡国立大学) QuantaAlpha(量子Alpha) THU(清华大学) SUFE(上海财经大学) NTU(国立.ntu) PKU(北京大学) UCAS(中国科学技术大学)

AI总结 本文提出SkillGenBench,一个用于评估LLM代理技能生成流水线的基准测试,通过统一可控的协议评估技能生成过程,涵盖任务条件生成和任务无关生成两种模式,以及基于仓库和文档的两种程序来源,揭示技能生成在不同数据源中的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11391 2026-05-19 cs.CV cs.AI cs.CL

DocReward: A Document Reward Model for Structuring and Stylizing

DocReward: 一种用于文档结构化和风格化的文档奖励模型

Junpeng Liu, Yuzhong Zhao, Bowen Cao, Jiayu Ding, Yilin Jia, Tengchao Lv, Yupan Huang, Wenshan Wu, Shaohan Huang, Nan Yang, Li Dong, Lei Cui, Tao Ge, Xun Wang, Huitian Jiao, Sun Mao, FNU Kartik, Si-Qing Chen, Wai Lam, Furu Wei

机构 * CUHK(香港大学) UCAS(中国科学技术大学) XJTU(西安交通大学) UMich(密歇根大学) Microsoft(微软)

AI总结 本文提出DocReward,一种用于评估文档结构和风格的奖励模型,通过构建包含117,000对文档的DocPair数据集,采用Bradley-Terry损失训练,有效提升了文档生成的结构和风格专业性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18071 2026-05-19 cs.CL

KVDrive: A Holistic Multi-Tier KV Cache Management System for Long-Context LLM Inference

KVDrive: 一个面向长上下文LLM推理的多层级KV缓存管理系统

Jian Lin, Jiazhi Mi, Zicong Hong, Haodong Wang, Qianli Liu, Haodyue Zhang, Peng Li, Song Guo

机构 * Hong Kong University of Science and Technology China(香港科技大学中国) Xi’an Jiaotong University China(西安交通大学中国)

AI总结 本文提出KVDrive,一个面向长上下文LLM推理的多层级KV缓存管理系统,通过联合缓存放置、流水线调度和跨层级协调,实现了高吞吐量的推理,在有限的GPU预算下保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17822 2026-05-19 cs.CV

Unleashing the Representational Power of Fourier Shapes for Attacking Infrared Object Detection

释放傅里叶形状的表示能力以攻击红外目标检测

Yixing Yong, Jian Wang, Ming Lei, Lijun He, Fan Li

机构 * School of Information and Communications Engineering, Faculty of Electronic and Information Engineering, Xi'an Jiaotong University, Xi'an, China(信息与通信工程学院,电子与信息工程学院,西安交通大学,西安,中国) School of Physics, Xi'an Jiaotong University, Xi'an, China(物理学院,西安交通大学,西安,中国)

AI总结 本文提出了一种基于傅里叶形状的红外目标检测攻击方法,通过引入可学习的傅里叶形状,克服了传统形状方法在表示能力和优化能力之间的根本权衡问题,实现了高效的梯度优化生成具有欺骗性的形状,使人类目标逃避检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17746 2026-05-19 cs.AI cs.HC

Agents for Experiments, Experiments for Agents: A Design Grammar for AI-Enabled Experimental Science

实验中的代理,代理中的实验:一种面向人工智能增强型实验科学的设计语法

Yingjie Zhang, Chun Feng, Weizhang Zhu, Tianshu Sun

机构 * Guanghua School of Management, Peking University(北京大学光华管理学院) Xi'an Jiaotong University(西安交通大学) Cheung Kong Graduate School of Business(长江商学院)

AI总结 本文提出SEED框架,用于表示实验条件为类型化的代理-流程图,以支持实验设计的自动化生成和评估,通过在医疗分诊任务中的实验证明其有效性,并讨论了新颖性、可重复性等治理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17458 2026-05-19 cs.LG

ClaHF: A Human Feedback-inspired Reinforcement Learning Framework for Improving Classification Tasks

ClaHF:一种基于人类反馈的强化学习框架,用于改进分类任务

Tianxiang Xu, Xiaoyan Zhu, Xin Lai, Jiayin Wang

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

AI总结 本文提出ClaHF,一种基于人类反馈的强化学习框架,用于改进文本分类任务,通过整合偏好建模和强化学习优化,无需额外人工标注,在分类流程中提升分类性能和置信度校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17336 2026-05-19 cs.RO cs.CV eess.SP

Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms

基于触觉的多模态融合在具身智能中的应用:视觉、语言和接触驱动范式的综述

Zhixiang Cao, Di Tian, Runwei Guan, Yanzhou Mu, Xiaolou Sun, Shaofeng Liang, Daizong Liu, Tao Huang, Yutao Yue, Henghui Ding, Bin Fang, Alex Zhou, Qing-Long Han, Hui Xiong

机构 * School of Electronic Science and Engineering, Xi’an Jiaotong University, China(西安交通大学电子科学与技术学院) Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州)人工智能研究所) State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) Purple Mountain Laboratory, China(紫金山实验室) Institute for Math & AI, Wuhan University, China(武汉大学数学与人工智能学院) Centre for AI and Data Science Innovation and the School of Science and Engineering, James Cook University, Australia(詹姆斯库克大学人工智能与数据科学创新中心及科学与工程学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications, China(北京邮电大学人工智能学院) Institute of Big Data, Fudan University, China(复旦大学大数据研究院) Linkerbot (Beijing) Technology Co., Ltd, China(北京链动科技有限公司) School of Engineering, Swinburne University of Technology, Melbourne(斯威本技术大学工程学院)

AI总结 本文综述了多模态触觉融合在具身智能中的研究,探讨了如何通过整合视觉、语言和触觉信息来提升物理交互与语义推理的结合,提出了一种分层的分类体系,并总结了当前的研究挑战和未来方向。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01993 2026-05-19 cs.CV

Cultivating Forensic Reasoning for Generalizable Multimodal Manipulation Detection

培养可推广的多模态操纵检测的推理能力

Yuchen Zhang, Yaxiong Wang, Kecheng Han, Yujiao Wu, Lianwei Wu, Li Zhu, Zhedong Zheng

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) CSIRO(澳大利亚联邦科学与工业研究组织) Northwestern Polytechnical University(西北工业大学) University of Macau(澳门大学)

AI总结 本文提出REFORM框架,通过推理驱动的方法改进多模态操纵检测,提升泛化能力,在多个数据集上取得新高准确率。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13992 2026-05-19 cs.CL cs.AI

"The Whole Is Greater Than the Sum of Its Parts": A Compatibility-Aware Multi-Teacher CoT Distillation Framework

整体大于部分之和:一种兼容性感知的多教师CoT蒸馏框架

Jin Cui, Jiaqi Guo, Ruixuan Yang, Jiayi Lu, Jiepeng Zhou, Jiajun Xu, Jiangcheng Song, Boran Zhao, Pengju Ren

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学) Nankai University(南开大学) The Hong Kong University of Science and Technology(Guangzhou)(香港科技大学(广州)) School of Software Engineering, State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(软件学院,人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学)

AI总结 本文提出COMPACT框架,通过动态加权不同教师的梯度,结合多维指标提升学生模型的推理能力,有效整合多样化推理能力并减少灾难性遗忘。

Comments 11pages, 9figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16079 2026-05-18 cs.CV cs.AI cs.HC

VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation

VideoSeeker:通过原生代理工具调用激励实例级视频理解

Yiming Zhao, Yu Zeng, Wenxuan Huang, Zhen Fang, Qing Miao, Qisheng Su, Jiawei Zhao, Jiayin Cai, Lin Chen, Zehui Chen, Yukun Qi, Yao Hu, Xiaolong Jiang, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书公司) East China Normal University(华东师范大学) Xi’an Jiaotong University(西安交通大学)

AI总结 VideoSeeker通过整合代理推理与实例级视频理解任务,提升视频理解精度,实验表明其在实例级任务中比基线模型提升13.7%,超越GPT-4o和Gemini-2.5-Pro。

Comments Project Page: https://gaotiexinqu.github.io/VideoSeeker/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10813 2026-05-18 cs.AI

NanoResearch: Co-Evolving Skills, Memory, and Policy for Personalized Research Automation

NanoResearch: 为个性化研究自动化共进化技能、记忆与政策

Jinhang Xu, Qiyuan Zhu, Yujun Wu, Zirui Wang, Dongxu Zhang, Marcia Tian, Yiling Duan, Siyuan Li, Jingxuan Wei, Sirui Han, Yike Guo, Odin Zhang, Conghui He, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学) Zhejiang University(浙江大学) Xi'an Jiaotong University(西安交通大学) East China University of Science and Technology(东华大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出NanoResearch框架,通过三重共进化解决研究自动化中的个性化需求,提升研究效率与用户体验。

Comments 40 pages, 14 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19931 2026-05-18 cs.IR cs.AI

LLM-EDT: Large Language Model Enhanced Cross-domain Sequential Recommendation with Dual-phase Training

LLM-EDT: 基于大语言模型的跨领域序列推荐增强方法与双阶段训练

Ziwei Liu, Qidong Liu, Wanyu Wang, Yejing Wang, Pengyue Jia, Tong Xu, Wei Huang, Chong Chen, Xiangyu Zhao

机构 * City University of Hong Kong Hong Kong China Xi'an Jiaotong University \& City University of Hong Kong Xi'an China University of Science Independent Researcher Beijing China Tsinghua University Beijing China City University of Hong Kong Xi'an Jiaotong University \& City University of Hong Kong Independent Researcher Tsinghua University

AI总结 本文提出LLM-EDT,通过双阶段训练策略解决跨领域序列推荐中的领域不平衡和过渡问题,引入可转移物品增强器和领域感知配置模块,提升推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07331 2026-05-18 cs.LG

RSEA-MVGNN: Multi-View Graph Neural Network with Reliable Structural Enhancement and Aggregation

RSEA-MVGNN:具有可靠结构增强和聚合的多视图图神经网络

Junyu Chen, Long Shi, Badong Chen

机构 * Financial Intelligence and Financial Engineering Key Laboratory of Sichuan Province, School of Computing and Artificial Intelligence, Southwestern University of Finance and Economics(四川省金融智能与金融工程重点实验室,西南财经大学计算机与人工智能学院) Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究院)

AI总结 本文提出RSEA-MVGNN,通过主观逻辑估计视图不确定性,实现可靠结构增强和视图质量评估,提升多视图图神经网络的特征聚合效果。

Journal ref Information Fusion 121 (2025) 103143

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14587 2026-05-15 cs.LG cs.AI cs.CR

Angel or Demon: Investigating the Plasticity Interventions' Impact on Backdoor Threats in Deep Reinforcement Learning

天使或恶魔:探讨塑性干预对深度强化学习中后门威胁的影响

Oubo Ma, Ruixiao Lin, Yang Dai, Jiahao Chen, Chunyi Zhou, Linkang Du, Shouling Ji

机构 * Zhejiang University(浙江大学) National University of Defense Technology(国防科技大学) Xi'an Jiaotong University(西安交通大学)

AI总结 研究通过分析14664个案例,发现仅有一种干预(SAM)加剧了后门威胁,其他干预则缓解了威胁,提出新的稳健后门注入框架和异常损失景观尖锐度作为检测指标。

Comments To appear in the Forty-Third International Conference on Machine Learning (ICML 2026), July 6-11, 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14370 2026-05-15 physics.geo-ph cs.AI physics.comp-ph

Deciphering Neural Reparameterized Full-Waveform Inversion with Neural Sensitivity Kernel and Wave Tangent Kernel

解码神经重构全波形反演中的神经敏感核与波切线核

Ruihua Chen, Yisi Luo, Bangyu Wu, Xile Zhao, Deyu Meng

机构 * School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院) School of Mathematical Sciences, University of Electronic Science and Technology of China(电子科技大学数学科学学院)

AI总结 本文通过建立神经敏感核与波切线核,分析其收敛行为,揭示神经重构全波形反演的理论机制,并提出改进方法提升反演性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06226 2026-05-15 cs.AI

GeoLaux: A Benchmark for Evaluating MLLMs' Geometry Performance on Long-Step Problems Requiring Auxiliary Lines

GeoLaux:一个评估多模态大语言模型在需要辅助线的长步骤问题上几何性能的基准

Yumeng Fu, Jiayin Zhu, Lingling Zhang, Wenjun Wu, Bo Zhao, Shaoxuan Ma, Yushun Zhang, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Ministry of Education Key Laboratory of Intelligent Networks and Network Security, China(教育部智能网络与网络安全重点实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering, China(陕西省大数据知识工程重点实验室) School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院)

AI总结 GeoLaux通过2186道计算与证明题,评估23个领先MLLMs在长步骤推理和辅助线构造上的表现,揭示模型在长步骤问题上性能显著下降,强调提升辅助线理解的重要性,并发现有限答案提示能提高过程正确性。

Comments 26 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13382 2026-05-14 cs.RO

BlockVLA: Accelerating Autoregressive VLA via Block Diffusion Finetuning

BlockVLA: 通过块扩散微调加速自回归VLA

Ruiheng Wang, Shuanghao Bai, Haoran Zhang, Badong Chen, Xiangyu Xu

机构 * Xi'an Jiaotong University(西安交通大学)

AI总结 本文提出BlockVLA框架,通过块扩散方法将预训练自回归模型转化为高效离散扩散策略,减少推理延迟并提升训练效率,实验证明在复杂长周期任务中性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02521 2026-05-14 cs.CV

MooD: Perception-Enhanced Efficient Affective Image Editing via Continuous Valence-Arousal Modeling

MooD:通过连续的效价-唤醒建模提升的感知增强高效情感图像编辑

Xinyi Yin, Yiduo Wang, Tingqi Hu, Meicong Si, Yunyun Shi, Shi Chen, Hao Wang, Junxiao Xue, Xuecheng Wu

机构 * School of Cyber Science and Engineering, Zhengzhou University(郑州大学信息科学与工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Journalism and New Media, Xi’an Jiaotong University(西安交通大学新闻与传播学院) Research Center for Space Computing System, Zhejiang Lab(浙江实验室空间计算系统研究中心)

AI总结 MooD通过连续效价-唤醒建模实现高效情感图像编辑,结合视觉迁移与感知增强的语义引导,提升情感可控性和视觉保真度,同时保持高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13335 2026-05-14 cs.AI cs.CV

Ego2World: Compiling Egocentric Cooking Videos into Executable Worlds for Belief-State Planning

Ego2World:将第一人称视角烹饪视频编译为可执行世界以支持信念状态规划

Qinchuan Cheng, Zhantao Gong, Pengzhan Sun, Angela Yao, Xulei Yang, Shijie Li

机构 * Xi’an Jiaotong University(西安交通大学) Nankai University(南开大学) National University of Singapore(新加坡国立大学) A*STAR

AI总结 本文提出Ego2World基准,通过编译第一人称视角烹饪视频为可执行符号世界,支持信念状态规划。实验表明,信念维护对任务完成至关重要。

Comments Project page: https://sj-li.com/PROJ/Ego2World/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13148 2026-05-14 cs.LG cs.CV

Understanding Generalization through Decision Pattern Shift

通过决策模式偏移理解泛化

Huiqi Deng, Yibo Li, Quanshi Zhang, Peng Zhang, Hongbin Pei, Xia Hu

机构 * Xi’an Jiaotong University(西安交通大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文提出决策模式偏移(DPS)作为泛化的新视角,通过分析模型内部决策模式的稳定性评估泛化能力,揭示泛化是内部决策机制系统性偏移的过程,并展示DPS在不同泛化退化场景中的统一解释。

Comments 14pages, 12figures, computer vision and pattern recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12862 2026-05-14 cs.NI cs.LG

NeuroRisk: Physics-Informed Neural Optimization for Risk-Aware Traffic Engineering

NeuroRisk:基于物理的神经优化用于风险感知的交通工程

Yingming Mao, Ximeng Liu, Jingyi Cheng, Xiyuan Liu, Jiashuai Liu, Yike Liu, Zhen Yao, Yuzhou Zhou, Siyuan Feng, Qiaozhu Zhai, Shizhen Zhao

机构 * Xi’an Jiaotong University(西安交通大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Huawei(华为) Shanghai Innovation Institute(上海创新研究院)

AI总结 针对WAN中相关故障导致的可用性损失问题,NeuroRisk通过物理引导的深度展开优化器,在风险目标上实现高利用率,同时在运算尺度上实现显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11996 2026-05-13 cs.AI

BadSKP: Backdoor Attacks on Knowledge Graph-Enhanced LLMs with Soft Prompts

BadSKP: 针对增强知识图谱的大型语言模型的后门攻击

Xiaoting Lyu, Yufei Han, Hangwei Qian, Haoyuan Yu, Xiang Ao, Bin Wang, Chenxu Wang, Xiaobo Ma, Wei Wang

机构 * Ministry of Education Key Lab for Intelligent Networks and Network Security(教育部长智能网络与网络安全重点实验室) Xi’an Jiaotong University(西安交通大学) INRIA(法国国家信息与自动化技术研究院) CFAR, A*STAR(新加坡A*STAR机构) Beijing Key Laboratory of Security and Privacy in Intelligent Transportation(北京智能交通安全与隐私重点实验室) Beijing Jiaotong University(北京交通大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Cyber Engineering, Xi’an University of Electronic Science and Technology(西安电子科技大学网络安全工程学院) Ministry of Education Key Lab for Intelligent Networks and Network Security at Xi’an Jiaotong University(西安交通大学教育部长智能网络与网络安全重点实验室)

AI总结 本文研究了增强知识图谱的大型语言模型中软提示通道的后门攻击问题,提出BadSKP攻击方法,通过多阶段优化策略有效攻击图到提示接口,实验表明其在冻结和毒化设置下具有高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11927 2026-05-13 cs.CV

RealDiffusion: Physics-informed Attention for Multi-character Storybook Generation

RealDiffusion:用于多角色故事书生成的物理信息注意力

Qi Zhao, Jun Chen, Ivor Tsang, Guang Dai

机构 * Xi’an Jiaotong University(西安交通大学) Zhejiang Normal University(浙江师范大学) SGIT AI Lab, State Grid Corporation of China(国网SGIT人工智能实验室) Centre for Frontier AI Research (CFAR), A*STAR, Singapore(前沿人工智能研究中心(CFAR),A*STAR,新加坡)

AI总结 RealDiffusion通过引入物理信息注意力机制,解决多角色故事生成中叙事动态与角色一致性之间的平衡问题,提升角色连贯性并保持叙事活力。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10094 2026-05-13 cs.RO cs.AI

Retrieve-then-Steer: Online Success Memory for Test-Time Adaptation of Generative VLAs

检索后再引导:生成式视觉-语言-动作模型的在线成功记忆用于测试时适应

Jianchao Zhao, Huoren Yang, Yusong Hu, Yuyang Gao, Qiguan Ou, Cong Wan, SongLin Dong, Zhiheng Ma, Yihong Gong

机构 * College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) One Robotics Shenzhen University of Advanced Technology(深圳先进技术大学)

AI总结 本文提出一种在线成功记忆引导的测试时适应框架,用于生成式视觉-语言-动作模型,在重复或缓慢变化的环境中通过重用成功经验提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09271 2026-05-13 cs.AI

Shaping Schema via Language Representation as the Next Frontier for LLM Intelligence Expanding

通过语言表示塑造模式作为扩展LLM智能的下一个前沿

Zhiqin Yang, Yuhan Liu, Jingwen Fu, Pei Fu, Bo Han, Masashi Sugiyama, Nanning Zheng

机构 * The Hong Kong University of Science and Technology(香港理工大学) MiLM Plus, Xiaomi Inc(小米公司) Zhongguancun Academy(中关村学院) Hong Kong Baptist University(香港 Baptist大学) The University of Tokyo(东京大学) RIKEN Center for Advanced Intelligence Project(日本理化学研究院高级智能项目中心) Xi’an Jiaotong University(西安交通大学)

AI总结 本文探讨通过高级语言表示塑造模式作为扩展LLM智能的新方向,提出语言表示的结构和符号复杂性对知识激活和组织至关重要,并通过实验证明语言表示设计的有效性。

Comments 41 pages, 30 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11832 2026-05-13 cs.RO

Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation

基于多视图潜在先验的学习动作流形用于机器人操作

Junjin Xiao, Dongyang Li, Yandan Yang, Shuang Zeng, Tong Lin, Xinyuan Chang, Feng Xiong, Mu Xu, Xing Wei, Zhiheng Ma, Qing Zhang, Wei-Shi Zheng

机构 * Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(机器智能与先进计算国家重点实验室,教育部,中国) AMap, Alibaba Group(阿里的AMap) Xi’an Jiaotong University(西安交通大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

AI总结 本文提出利用多视图扩散模型合成潜在新视角,并引入几何引导门控变换器以提升机器人视觉-语言-动作模型的空间感知与操作性能,通过动作流形学习提高动作学习效率,实验证明优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11809 2026-05-13 cs.AI

Beyond World-Frame Action Heads: Motion-Centric Action Frames for Vision-Language-Action Models

超越世界坐标动作头:面向视觉-语言-动作模型的运动中心动作框架

Huoren Yang, Jianchao Zhao, Hu Yusong, Qiguan Ou, Yuyang Gao, Wei Ke, Yuhang He, SongLin Dong, Zhiheng Ma, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) One Robotics Shenzhen University of Advanced Technology(深圳大学先进技术学院)

AI总结 本文提出MCF-Proto,一种轻量级动作头,通过运动中心动作框架和原型基动作参数化,提升VLA模型对机器人操作行为的组织与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11807 2026-05-13 cs.AI

Why Users Go There: World Knowledge-Augmented Generative Next POI Recommendation

为何用户前往那里:世界知识增强的生成性下一个兴趣点推荐

Qiuyu Ding, Heng-Da Xu, Wei Zhang, Dongyi Lv, Changda Xia, Feng Xiong, Mu Xu

机构 * Amap, Alibaba Group(阿里巴巴集团阿地图) Xi’an Jiaotong University(西安交通大学)

AI总结 本文提出AWARE模型,通过LLM代理生成时空感知的上下文叙述,结合用户行为增强世界知识,提升POI推荐效果,实验证明其优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏