arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4728 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4728 篇

2605.29812 2026-05-29 cs.CV 57%

Not All Inputs Are Valid: Towards Open-Set Video Moment Retrieval Using Language

并非所有输入都有效:面向开放集视频时刻检索的语言方法

Xiang Fang, Wanlong Fang, Daizong Liu, Xiaoye Qu, Jianfeng Dong, Pan Zhou, Renfu Li, Zichuan Xu, Lixing Chen, Panpan Zheng, Yu Cheng

机构 * Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Zhejiang Gongshang University(浙江工商大学) Dalian University of Technology(大连理工大学) Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 针对开放集场景下视频时刻检索任务中无关查询导致错误检索的问题,提出基于归一化流的开放集视频时刻检索模型OpenVMR,实现分布内查询的精确检索与分布外查询的拒绝。

Comments Published in ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10566 2026-05-29 cs.CV 57%

HM-Talker: Hybrid Motion Modeling for High-Fidelity Talking Head Synthesis

HM-Talker:用于高保真说话头合成的混合运动建模

Shiyu Liu, Kui Jiang, Junjun Jiang, Xianming Liu, Xiaocheng Feng, Hongxun Yao, Qi Tian

机构 * Harbin Institute of Technology University(哈尔滨理工大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy(广东省人工智能与数字经济实验室)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 提出HM-Talker框架,通过混合显式发音线索与隐式韵律特征,结合交叉模态映射和随机特征配对策略,解决说话头生成中个性化与泛化的权衡问题,在视觉真实感和唇同步精度上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28544 2026-05-28 cs.CV 57%

DriveWAM: Video Generative Priors Enable Scalable World-Action Modeling for Autonomous Driving

DriveWAM: 视频生成先验实现自动驾驶的可扩展世界-动作建模

Chen Shi, Jinrui Xu, Shaoshuai Shi, Kehua Sheng, Bo Zhang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Voyager Research, Didi Chuxing(Voyager Research,滴滴出行)

专题命中 视频多模态 :image-text(abstract);分类 cs.CV

AI总结 提出DriveWAM,通过将预训练视频扩散Transformer适配为自回归视频-动作策略,并引入场景演化驾驶引导和选择性KV记忆,实现可扩展的世界-动作建模,在NAVSIM和PhysicalAI基准上取得强规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28397 2026-05-28 cs.CV 57%

Adaptive Temporal Gating of Longitudinal Magnetic Resonance Imaging for Alzheimer's Prediction

用于阿尔茨海默病预测的纵向磁共振成像自适应时间门控

Alireza Moayedikia, Sara Fin, Alicia Troncoso Lora, Uffe Kock Wiil

机构 * organization= School of Business Law Entrepreneurship, Swinburne University of Technology , city= Melbourne , state= VIC , country= Australia organization= Australian Regenerative Medicine Institute, Monash University , city= Melbourne , state= VIC , country= Australia organization= Data Science \& Big Data Lab, Universidad Pablo de Olavide , city= Seville , country= Spain organization= The Maersk Mc-Kinney M ller Institute, University of Southern Denmark , city= Odense , country= Denmark

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出TAF-Net混合CNN-Transformer架构,通过自适应时间门控融合纵向3D MRI的时空表示,在MCI-to-AD转化预测中仅用结构MRI即达到最优性能,接近需多模态数据的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27920 2026-05-28 cs.CV 57%

Rethinking Video-Language Model from the Language Input Perspective

从语言输入角度重新思考视频-语言模型

Xiang Fang, Wanlong Fang, Changshuo Wang, Xiaoye Qu, Daizong Liu

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Nanyang Technological University, Singapore(新加坡南洋理工大学) University College London(伦敦大学学院) Huazhong University of Science and Technology(华中科技大学) Wuhan University(武汉大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文从语言输入角度出发,提出一种即插即用的框架,通过生成正负文本、属性文本推理和自加权损失,提升视频-语言模型的性能。

Comments Published in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27800 2026-05-28 cs.CV 57%

CuriosAI Submission to the CASTLE Challenge at EgoVis 2026

CuriosAI 在 EgoVis 2026 CASTLE 挑战赛中的提交

Yuto Kanda, Hayato Tanoue, Takayuki Hori

机构 * SoftBank Corp(软银公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对600多小时多视角自我中心视频的185道选择题,提出SVA(搜索-验证-回答)三阶段流水线和TMKG(时间多模态知识图谱)两种方法,SVA达到0.50准确率并作为最终提交。

Comments The 4th place solution for the CASTLE Challenge at the CVPR EgoVis Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23137 2026-05-28 eess.IV cs.CV 57%

STAMBRIDGE: Spectral-Temporal Amplitude-aware Mid-Feature Bridge for EEG Visual Decoding

STAMBRIDGE:用于脑电视觉解码的谱时幅度感知中间特征桥

Jiahe Meng, Weiming Zeng, Yueyang Li, Bo Chai, Hongjie Yan, Zhiguo Zhang, Wai Ting Siok, Nizhuan Wang

机构 * Lab of Digital Image and Intelligent Computation, Shanghai Maritime University(数字图像与智能计算实验室,上海 Maritime 大学) Department of Language Science and Technology, The Hong Kong Polytechnic University(语言科学与技术系,香港理工大学) Department of Neurology, Affiliated Lianyungang Hospital of Xuzhou Medical University(神经内科,徐州医学院附属连云港医院) Institute of Computing and Intelligence, Harbin Institute of Technology Shenzhen(计算与智能研究所,哈尔滨工业大学深圳研究院)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 提出STAMBRIDGE两阶段框架,通过谱时幅度感知调制(STAM)提取稳健脑电特征,并利用中间特征语义桥(MFSB)实现稳定的跨模态对齐,在THINGS-EEG基准上取得34.50% Top-1和65.95% Top-5的200路零样本检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26584 2026-05-27 cs.CV 57%

O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding

O-MARC: 全记忆增强压缩蒸馏用于高效视频理解

Peiran Wu, Yunze Liu, Chi-Hao Wu, Chen Chen, Junxiao Shen

机构 * University of Bristol(布里斯托大学) Memories.ai Research(Memories.ai研究院) University of Central Florida(佛罗里达中央大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出O-MARC框架,通过无训练压缩方法OMAC保留视觉记忆和音频锚点,并利用压缩蒸馏使紧凑模型鲁棒,在多个基准上提升性能并降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12571 2026-05-27 cs.CY cs.MM 57%

Catching Dark Signals in Algorithms: Unveiling Audiovisual and Thematic Markers of Unsafe Content Recommended for Children and Teenagers

捕捉算法中的黑暗信号:揭示推荐给儿童和青少年的不安全内容的视听与主题标记

Haoning Xue, Brian Nishimine, Martin Hilbert, Drew Cingel, Samantha Vigil, Jane Shawcroft, Arti Thakur, Zubair Shafiq, Jingwen Zhang

专题命中 视频多模态 :multimodal(abstract);分类 cs.MM

AI总结 本研究通过对Instagram Reels、TikTok和YouTube Shorts上推荐给儿童和青少年的4492个短视频进行多模态特征分析和主题建模,发现不安全视频具有更暗的视觉特征,并包含显性有害内容和隐性焦虑诱导内容,提出了显性、隐性和意外伤害的在线伤害框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25979 2026-05-26 cs.CV 57%

LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

LLaVA-OneVision-2:迈向下一代感知智能

Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan, Didi Zhu, Changrui Chen, Xiuwei Zhao, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Kaichen Zhang, Wenkang Zhang, Zheng Cheng, Nansen Zhang, Chunsheng Wu, Chunjiang Ge, Zimin Ran, Dehua Song, Chunyuan Li, Shikun Feng, Ming Hu, Zhangquan Chen, Junbo Niu, Bo Li, Ziyong Feng, Ziwei Liu, Zongyuan Ge, Jiankang Deng

机构 * Glint Lab(Glint实验室) AIM for Health Lab(健康AI实验室) MVP Lab(MVP实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出LLaVA-OV-2模型,通过编解码流令牌化、窗口注意力和3D RoPE实现统一视频理解与时空定位,在多项基准上超越Qwen3-VL-8B。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03354 2026-05-26 q-bio.NC cs.AI 57%

Non-Invasive Reconstruction of Intracranial EEG Across the Deep Temporal Lobe from Scalp EEG based on Conditional Normalizing Flow

基于条件归一化流的从头皮脑电无创重建深颞叶颅内脑电

Dongyi He, Bin Jiang, Kecheng Feng, Luyin Zhang, Ling Liu, Yuxuan Li, Yun Zhao, He Yan

机构 * School of Artificial Intelligence, Chongqing University of Technology(重庆理工大学人工智能学院) School of Smart Health, Chongqing Polytechnic University of Electronic Technology(重庆电子工程职业大学智能健康学院)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI

AI总结 提出NeuroFlowNet,一种基于条件归一化流的跨模态生成框架,首次从头皮脑电信号重建整个深颞叶区域的颅内脑电信号,解决了高保真重建的难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24856 2026-05-26 cs.LG cs.AI 57%

The Concept Allocation Zone: Tracking How Concepts Form Across Transformer Depth

概念分配区:追踪概念如何跨越Transformer深度形成

James Henry

机构 * Independent Researcher(独立研究者)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出概念分配区(CAZ)框架,通过层间度量(分离度、概念一致性、概念速度)检测概念在残差流中逐渐形成的深度区间,并在34个模型上验证了分离曲线的多模态性及温和CAZ的因果活性。

Comments 34 models, 8 architectural families, 7 concepts. Companion papers: GEM (arXiv forthcoming), CAZ Validation (arXiv forthcoming), PRH Validation (arXiv forthcoming). Code: https://github.com/jamesrahenry/Rosetta_Tools

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22809 2026-05-26 cs.CV 57%

Sensor2Sensor: Cross-Embodiment Sensor Conversion for Autonomous Driving

Sensor2Sensor: 自动驾驶的跨本体传感器转换

Jiahao Wang, Bo Sun, Yijing Bai, Vincent Casser, Songyou Peng, Zehao Zhu, Meng-Li Shih, Xander Masotto, Shih-Yang Su, Kanaad V Parvate, Tiancheng Ge, Linn Bieske, Dragomir Anguelov, Mingxing Tan, Chiyu Max Jiang

机构 * Waymo Johns Hopkins University(约翰霍普金斯大学) Google DeepMind(谷歌DeepMind) University of Washington(华盛顿大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出Sensor2Sensor生成模型,将单目行车记录仪视频转换为多模态传感器数据(多视角相机图像和LiDAR点云),通过4D高斯泼溅重建和扩散架构解决无配对数据问题,为自动驾驶开发解锁外部数据源。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15678 2026-05-26 cs.CV 57%

Multi-Pair Temporal Sentence Grounding via Multi-Thread Knowledge Transfer Network

多对时序句子定位的多线程知识迁移网络

Xiang Fang, Wanlong Fang, Changshuo Wang, Daizong Liu, Keke Tang, Jianfeng Dong, Pan Zhou, Beibei Li

机构 * Sichuan University(四川大学) Nanyang Technological University, Singapore(南洋理工大学,新加坡) Peking University(北京大学) Guangzhou University(广州大学) Zhejiang Gongshang University(浙江工商大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 提出多对时序句子定位新任务,并设计多线程知识迁移网络,通过跨模态对比、原型对齐和自适应负样本选择实现多对视频-查询对的协同训练。

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23274 2026-05-25 cs.CV 57%

U-CESE: Unified Clip-based Event Search Engine for AI Challenge HCMC 2025

U-CESE:面向AI挑战赛胡志明市2025的统一基于片段的事件搜索引擎

Duc-Nhuan Le, Hoang-Phuc Nguyen, Thanh-Duy Lam, Minh-Nhut Dang, Minh-Hoang Le

机构 * Faculty of Information Technology, University of Science, VNU-HCM(越南国家大学胡志明市分校信息科技学院) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学胡志明市分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出U-CESE框架,通过统一剪辑算法、轻量级关键帧提取方法DAKE和时序一致字幕生成ReCap,实现大规模视频多模态事件检索。

Comments Accepted for publication in the Proceedings of the 14th International Symposium on Information and Communication Technology (SOICT 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22962 2026-05-25 cs.CV cs.CE cs.HC cs.SE q-bio.NC 57%

GazeBehavior Annotation Toolkit (GBAT): AI-powered toolkit for automatic annotation of egocentric eye-tracking and video data of child-caregiver interaction

凝视行为注释工具包 (GBAT): 基于AI的自动注释工具,用于自我中心眼动追踪和儿童-照顾者互动视频数据

Iba Baig, Kevin Li, Yanbin Xu, Seiji Cattelain, Marie Hallo, Hayato Ono, Sho Tsuji, Ming Bo Cai

机构 * Department of Psychology, University of Miami(迈阿密大学心理学系) Northeastern University(东北大学) Ecole Normale Supérieure, PSL University, EHESS, CNRS(巴黎高等师范学院(PSL大学)、EHESS、CNRS) International Research Center for Neurointelligence (WPI-IRCN), The University of Tokyo Institutes for Advanced Study(神经智能国际研究中心(WPI-IRCN)、东京大学高级研究机构)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出GBAT工具包,利用深度学习实现多视频同步、注视目标半自动注释和参与者姿态手部动作分类,提高从自我中心眼动和视频数据中提取特征的效率和可扩展性。

Comments submitted to IEEE International Conference on Development and Learning (ICDL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06885 2026-05-25 cs.CV 57%

Time-driven Survival Analysis from FDG-PET/CT in Non-Small Cell Lung Cancer

基于FDG-PET/CT的非小细胞肺癌时间驱动生存分析

Sambit Tarai, Ashish Chauhan, Elin Lundström, Johan Öfverstedt, Therese Sjöholm, Veronica Sanchez Rodriguez, Håkan Ahlström, Joel Kullberg

机构 * Radiology, Department of Surgical Sciences(外科科学系放射学部) Antaros Medical(Antaros医疗) Molecular Imaging and Medical Physics, Department of Surgical Sciences(外科科学系分子成像与医学物理部)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出一种结合组织FDG-PET/CT投影和时间输入的深度学习回归框架,用于预测非小细胞肺癌患者的总生存期,在AUC上比基线方法提升4.3%,并实现了风险分层。

Comments Under review

Journal ref Ann Biomed Eng (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22139 2026-05-22 cs.CV 57%

EventGait: Towards Robust Gait Recognition with Event Streams

EventGait: 向事件流中实现鲁棒的步态识别

Senyan Xu, Shuai Chen, Chuanfu Shen, Kean Liu, Zhijing Sun, Chengzhi Cao, Xueyang Fu

机构 * University of Science and Technology of China(中国科学技术大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出EventGait,一种端到端的双流框架,通过事件相机捕捉动态和形状信息,提升在复杂光照和运动环境下的步态识别鲁棒性,并通过合成数据集和新基准测试验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23224 2026-05-22 cs.CV 57%

Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning

Video-o3:长视频多跳推理的原生交错线索搜索

Xiangyu Zeng, Zhiqiu Zhang, Yuhan Zhu, Xinhao Li, Zikang Wang, Changlian Ma, Qingyu Zhang, Zizheng Huang, Kun Ouyang, Tianxiang Jiang, Ziang Yan, Yi Wang, Hongjie Zhang, Yali Wang, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) SIAT, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出Video-o3框架,通过迭代发现显著视觉线索、细粒度检查关键片段以及适应性终止,提升长视频多跳推理能力,实验表明其在MLVU和Video-Holmes上分别达到72.1%和46.5%的准确率。

Comments 27 pages, 15 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20785 2026-05-22 cs.CV 57%

LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling

LongVT: 通过原生工具调用激励'通过长视频思考'

Zuhao Yang, Sudong Wang, Kaichen Zhang, Keming Wu, Sicong Leng, Yifan Zhang, Bo Li, Chengwei Qin, Shijian Lu, Xingxuan Li, Lidong Bing

机构 * MiroMind NTU(国立台湾大学) HKUST(GZ)(香港科技大学(广州)) THU(清华大学) LMMs-Lab(LMMs实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出LongVT,一种端到端的代理框架,通过交错的多模态工具链式思考实现'通过长视频思考',通过利用LMM的固有时间定位能力作为原生视频裁剪工具,以解决长视频推理中的幻觉问题,并通过VideoSIAH数据集提升训练和评估效果。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23090 2026-05-22 cs.CL 57%

MAP4TS: A Multi-Aspect Prompting Framework for Time-Series Forecasting with Large Language Models

MAP4TS: 一个用于基于大语言模型的时间序列预测的多方面提示框架

Suchan Lee, Jihoon Choi, Sohyeon Lee, Minseok Song, Bong-Gyu Jang, Hwanjo Yu, Soyeon Caren Han

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出MAP4TS框架,通过将经典时间序列分析融入提示设计,提升大语言模型在时间序列预测中的性能,实验表明其在多个数据集上均优于现有方法。

Comments There is a error in modeling. Thereafter, paper will be revised and re-uploaded

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21282 2026-05-22 cs.LG cs.AI 57%

Stochastic MeanFlow Policies: One-Step Generative Control with Entropic Mirror Descent

随机均值流策略:带有熵镜降的一步生成控制

Zeyuan Wang, Da Li, Yulin Chen, Yuehu Gong, Yanming Guo, Ye Shi, Liang Bai, Tianyuan Yu, Yanwei Fu

机构 * Laboratory for Big Data and Decision(大数据与决策实验室) National University of Defense Technology(国防科技大学) Samsung AI Center Cambridge(三星AI研究中心) Queen Mary University of London(伦敦玛丽女王大学) Fudan University(复旦大学) ShanghaiTech University(上海科技大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种随机均值流策略(SMFP),通过均值流变换将高斯噪声映射到动作,以实现可训练的生成策略,从而在离线策略镜降框架下实现探索性且稳定的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21198 2026-05-21 cs.SI cs.AI 57%

SURGE: An Event-Centric Social Media Sentiment Time Series Benchmark with Interaction Structure

SURGE:一个以事件为中心的社会媒体情感时间序列基准,包含交互结构

Chen Su, Pengsen Cheng, Yuanhe Tian, Yan Song

机构 * University of Science and Technology of China(中国科学技术大学) Sichuan University Zhongguancun Academy(四川大学中关村学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 该研究提出了SURGE基准,通过整合事件级时间序列与对齐的文本和交互结构,用于评估社交互动如何影响预测行为,揭示了基准在局部持久性、转移能力及回复密集期的挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11768 2026-05-20 cs.AI 57%

Governing Evolving Memory in LLM Agents: Risks, Mechanisms, and the Stability and Safety Governed Memory (SSGM) Framework

在LLM代理中治理演化的记忆:风险、机制以及稳定性与安全性的治理记忆(SSGM)框架

Chingkwun Lam, Jiaxin Li, Lingfei Zhang, Kuo Zhao

机构 * College of Intelligent Science and Engineering(智能科学与工程学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文研究了LLM代理中记忆治理的问题,提出了一种新的SSGM框架,通过一致性验证、时间衰减建模和动态访问控制来缓解记忆腐蚀风险,提高记忆系统的稳定性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15343 2026-05-20 cs.HC cs.AI cs.LG 57%

When the Loop Closes: Architectural Limits of In-Context Isolation, Metacognitive Co-option, and the Two-Target Design Problem in Human-LLM Systems

当循环闭合时:人类-大语言模型系统中上下文隔离、元认知侵占和双目标设计问题的架构限制

Z. Cheng, N. Song

机构 * Independent Researcher(独立研究者)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文研究了人类-大语言模型系统中上下文隔离、元认知侵占和双目标设计问题的架构限制,通过案例研究揭示了上下文污染机制和元认知侵占动态,并提出了保护性系统设计与限制性系统设计的伦理区别。

Comments empirical case study with primary data; 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18636 2026-05-19 cs.CV 57%

SPIKE: An Adaptive Dual Controller Framework for Cost-Efficient Long-Horizon Game Agents

SPIKE:一种适应性双控制器框架,用于成本效益高的长周期游戏智能体

Wencan Jiang, Jiangning Zhang, Jianbiao Mei, Jinzhuo Liu, Yu Yang, Xiaobin Hu, Zhucun Xue, Yong Liu, Dacheng Tao

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SPIKE框架,通过双控制器设计实现成本高效长周期游戏智能体,通过事件触发机制和分层记忆结构提升目标导向性和任务完成率,实验表明在StarDojo数据集上显著提升成功率并降低资源消耗。

Comments https://wencanjiang.github.io/projects/SPIKE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18320 2026-05-19 cs.LG cs.AI 57%

ISEP: Implicit Support Expansion for Offline Reinforcement Learning via Stochastic Policy Optimization

ISEP: 通过随机策略优化实现离线强化学习的隐式支持扩展

Yifei Chen, Shaoqin Zhu, Xiaoqiang Ji

机构 * The Chinese University of Hong Kong, Shenzhen Longgang(香港中文大学(深圳)松山湖校区)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出ISEP方法,通过随机策略优化实现离线强化学习中的隐式支持扩展,以解决传统方法在安全约束下难以发现最优行为的问题,核心贡献是通过价值函数插值和随机动作选择策略提高策略改进的导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12978 2026-05-19 cs.RO cs.AI 57%

Learning Native Continuation for Action Chunking Flow Policies

学习原生延续以实现动作分块流策略

Yufeng Liu, Hang Yu, Juntu Zhao, Bocheng Li, Di Zhang, Mingzhu Li, Wenxuan Wu, Yingdong Hu, Junyuan Xie, Junliang Guo, Dequan Wang, Yang Gao

机构 * Spirit AI

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出Legato方法,通过训练时的延续技术改进动作分块流基于VLA策略,减少动作边界不连续性和伪多模态切换,提升轨迹平滑度和任务完成效率。

Comments Accepted by Robotics: Science and Systems 2026 (RSS 2026). Project page: https://lyfeng001.github.io/Legato/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16452 2026-05-19 cs.LG cs.AI 57%

Peak-Detector: Explainable Peak Detection via Instruction-Tuned Large Language Models in Physiological Sign

峰值检测器:通过指令调优的大语言模型实现可解释的多模态峰值检测

Jiahui Li, Yida Zhang, Zixuan Zeng, Jiayu Chen, Yingjian Song, Yin Xiao, Nishan Dong, Junjie Lu, Younghoon Kwon, Xiang Zhang, Jin Lu, Wenzhan Song, Fei Dou

机构 * University of Georgia(佐治亚大学) Yixing People’s Hospital(宜兴人民医院) University of Washington(华盛顿大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出Peak-Detector框架,利用指令调优的大语言模型实现跨模态、可解释的峰值检测,通过峰表示技术压缩时间序列数据并提升检测准确性,同时生成解释性内容以支持验证与错误分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16442 2026-05-19 cs.RO cs.AI cs.LG 57%

Hierarchical Two-Stage Framework for Environment-Aware Long-Horizon Vessel Trajectory Prediction

面向环境的长航程船舶轨迹预测分层两阶段框架

Ganeshaaraj Gnanavel, Tharindu Fernando, Sridha Sridharan, Clinton Fookes

机构 * SAIVT Research Group, Queensland University of Technology(SAIVT研究组,昆士兰理工大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出分层两阶段框架,结合长短期预测器与网格感知短期预测器,通过分层融合机制提升船舶轨迹预测精度,实验显示在ADE和FDE上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏