Can neurons speak? Semantic narration of vision at single-cell resolution
神经元能说话吗?单细胞分辨率的视觉语义叙述
专题命中 知识编辑与模型理解 :language model(abstract)
AI总结 提出NEURRATOR框架,通过将神经元活动解码为自然语言描述,实现单细胞分辨率的视觉语义叙述,并用于量化解码保真度及解析单个神经元和特定细胞类型的功能贡献。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
神经元能说话吗?单细胞分辨率的视觉语义叙述
专题命中 知识编辑与模型理解 :language model(abstract)
AI总结 提出NEURRATOR框架,通过将神经元活动解码为自然语言描述,实现单细胞分辨率的视觉语义叙述,并用于量化解码保真度及解析单个神经元和特定细胞类型的功能贡献。
内在4D高斯分割:基于场景线索
机构 * Istanbul Technical University(伊斯坦布尔理工大学) ; Texas A&M University(德克萨斯农工大学) ; Hamad Bin Khalifa University(哈马德·本·哈利法大学)
专题命中 知识编辑与模型理解 :foundation model(abstract)
AI总结 提出Intrinsic-GS方法,无需训练和掩码,通过构建高斯原语的亲和图并利用社区检测实现4D场景分割,在Neu3D和HyperNeRF上达到与掩码监督方法相当的精度,且速度提升12.5倍。
Comments 15 pages, 4 figures, 7 tables. Includes supplementary material. Preprint
基于反事实证据验证的医学视觉语言模型幻觉检测与纠正
机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) ; Yong Loo Lin School of Medicine, National University of Singapore(新加坡国立大学杨潞龄医学院) ; Key Laboratory of Data Protection and Intelligent Management, Ministry of Education, Sichuan University(四川大学数据保护与智能管理教育部重点实验室) ; National Key Laboratory of Autonomous Intelligent Unmanned Systems, Beijing Institute of Technology(北京理工大学自主智能无人系统国家重点实验室) ; Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局高性能计算研究所)
专题命中 知识编辑与模型理解 :language model(abstract)
AI总结 提出CoEV框架,通过文本与视觉证据的双向验证检测并纠正医学VLM幻觉,无需重新训练,在四个数据集上显著提升检测和纠正性能。
Comments MICCAI 2026 Accept. Submission Version
BrainWorld:一种用于全脑4D fMRI动力学的结构先验条件生成模型
机构 * Department of Biomedical Engineering, Southern University of Science and Technology(南方科技大学生物医学工程系) ; School of Biomedical Engineering, Shenzhen University(深圳大学生物医学工程学院)
专题命中 知识编辑与模型理解 :foundation model(abstract)
AI总结 提出BrainWorld模型,利用结构MRI作为解剖先验条件,通过去噪过程生成全脑4D fMRI动态,在22个数据集上稳定生成400帧轨迹,并通过生成样本增强提升下游任务性能。
TacStyle: 使用结构化行为表示个性化触觉机器人策略
机构 * Department of Computer Science, California State University, Northridge(加州州立大学北岭分校计算机科学系) ; Department of Mechanical Engineering, California State University, Northridge(加州州立大学北岭分校机械工程系)
专题命中 知识编辑与模型理解 :foundation model(abstract)
AI总结 提出通过结构化潜在表示组织用户偏好,结合基础模型解释语言指令,实现机器人行为精细调整,减少偏好标签需求。
Comments 14 pages, 5 figures
面向AI原生6G网络的可解释任务导向Token通信
机构 * IEEE
专题命中 知识编辑与模型理解 :foundation model(abstract)
AI总结 提出ET-TokenCom框架,通过跨模态注意力融合视觉Token与任务Token,实现可解释的任务导向图像通信,解决Token表示不足、协作差和可解释性低的问题。
HSQ-VLM: 一种用于糖尿病视网膜病变可解释性的新型空间约束象限分割VLM模型
机构 * Pittsburgh, Pennsylvania(宾夕法尼亚州匹兹堡)
专题命中 知识编辑与模型理解 :language model(abstract)
AI总结 提出HSQ-VLM,利用地标锚定笛卡尔交叉注意力机制和四象限拓扑潜在分割,实现眼底图像中病变的解剖精确量化与自然语言报告生成,在出血和微动脉瘤检测上达到99.6%和96.4%的灵敏度。
GridVQA-X: 评估多模态可解释性方法的框架
机构 * IIIT Hyderabad(印度海得拉巴国际信息技术学院) ; University of Virginia(弗吉尼亚大学)
专题命中 知识编辑与模型理解 :language model(abstract)
AI总结 提出GridVQA-X诊断框架,通过合成数据生成数学保证的解释,并训练纯推理与捷径依赖的配对模型,揭示现有可解释性方法无法区分真实跨模态推理与浅层捷径。
Comments 23 pages, 15 Figures, Accepted for poster presentation at CVPR 2026 TRUE-V Workshop
从地球观测嵌入中提取连续生物群落表示
专题命中 知识编辑与模型理解 :foundation model(abstract)
AI总结 针对离散生物群落图压缩生态连续性的问题,提出从卫星图像嵌入中学习连续概率表示,在巴西6个生物群落和4672种植物数据上验证,优于离散标签预测物种分布。
Comments 8 pages, 4 figures
IDEAL: 深度对齐实现离散表示自编码器
机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) ; Shanghai Innovation Institute(上海创新研究院) ; University of Maryland, College Park(马里兰大学帕克分校)
专题命中 知识编辑与模型理解 :foundation model(abstract)
AI总结 提出IDEAL框架,通过联合对齐量化令牌与浅层和深层VFM特征,提升离散表示自编码器的重建质量,在ImageNet上实现0.61 rFID,并创下自回归图像生成新纪录(gFID 1.89)。
Comments Code is available at https://github.com/Row11n/IDEAL
无需训练的通用的少样本分割通过开放词汇语义仲裁
机构 * University of Ghana(加纳大学)
专题命中 知识编辑与模型理解 :foundation model(abstract)
AI总结 提出Open-V框架,通过推理时协调冻结的语义先验(SAM3 PCS与K-shot CLIP支持质心)实现无需训练的通用少样本分割,在多个基准上超越有监督方法。
面向人机装配遥操作的不确定性感知意图预测
机构 * University of California, Riverside(加州大学河滨分校) ; University of Miami(迈阿密大学)
专题命中 知识编辑与模型理解 :pretraining(abstract)
AI总结 提出结合层次迁移学习、共形预测和VLM引导校正的不确定性感知意图预测框架,利用人类演示数据预训练,仅用少量机器人数据即提升动作分割性能。
Comments 7 pages, 6 figures. Preprint version