Financial Numerical Prediction and Allocation as Token Generation
金融数值预测与分配:以 token 生成的方式实现
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 本研究提出 FinATOM 框架,通过因果语言模型的 token 生成实现金融数值预测与 ETF 分配,在多组测试中显著提升了夏普比率与累计收益,验证了该方法的可行性。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
金融数值预测与分配:以 token 生成的方式实现
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 本研究提出 FinATOM 框架,通过因果语言模型的 token 生成实现金融数值预测与 ETF 分配,在多组测试中显著提升了夏普比率与累计收益,验证了该方法的可行性。
基于场条件内容-风格预训练的任务自适应3D跨场MRI转换
机构 * School of Integrated Circuits and Electronics, Beijing Institute of Technology(北京理工大学集成电路与电子学院) ; School of Biomedical Engineering, Tsinghua Medicine, Tsinghua University(清华大学医学院生物医学工程学院) ; Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)
专题命中 多模态训练与对齐 :any-to-any(abstract);分类 cs.CV
AI总结 针对跨场MRI转换的域偏移问题,提出基于场条件内容-风格预训练的3D非配对转换框架,适配三项挑战赛任务,可保留三维解剖结构。
Comments MICCAI 2026 Workshop on MRIxFields
解码表型:融合基因组语言模型与神经成像的框架
机构 * King’s College London(伦敦国王学院) ; Aston University(阿斯顿大学) ; University of Birmingham(伯明翰大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 该研究提出多模态框架GeneFuse,整合GLM遗传表征与神经成像特征,在NC vs. MCI、NC vs. AD任务上分别获0.77、0.83的AUROC,性能优于现有方法。
基于热成像与传感器融合深度学习的网络硬件预测性故障检测
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV
AI总结 该研究提出结合热成像与电源传感器数据的多模态深度学习模型,经ROI预处理后可实现网络硬件早期故障的高精度预测,为数据中心主动维护提供支撑。
Journal ref Proceedings of the 2025 3rd International Conference on Data Science and Network Security (ICDSNS), Tiptur, India, 25-26 July 2025, Institute of Electrical and Electronics Engineers (IEEE), pp. 1-6
CFGPNet:用于多光谱目标检测的基于交叉注意力的融合梯度编程网络框架
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 本文针对现有RGB-T目标检测方法的跨模态交互不足等问题,提出CFGPNet框架,采用改进GELAN骨干、CrossCEA模块等设计,在五个多光谱基准数据集上取得优异性能,实现精度与效率的良好权衡。
克服注意力漂移:面向低光照遥感图像增强的同质性-异质性引导特征聚合
机构 * School of Information and Artificial Intelligence, Yunnan University of Finance and Economics(云南财经大学信息与人工智能学院) ; Department of Computer Science, Hong Kong Baptist University(香港浸会大学计算机科学系) ; School of Electronics and Information, Northwestern Polytechnical University(西北工业大学电子信息学院)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 针对低光照遥感图像增强中现有方法的注意力漂移问题,提出双先验驱动的HALO框架,通过H2CAM模块融合同质性与异质性先验,在8个基准上实现SOTA性能,提升边界清晰度与色彩保真度。
Comments 10 pages, 7 figures, 7 tables. Yaozi Zhong and Xingxing Yang contributed equally. Code: https://github.com/AlexYangxx/HALO
用于视觉Transformer的Grad-CAM:可解释AI中方法歧义的系统分类与审计
机构 * University of South Dakota(南达科他大学) ; USD Artificial Intelligence Research(南达科他大学人工智能研究院)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 本文对175篇应用Grad-CAM于视觉Transformer(ViT)的论文开展审计,提出ViT Grad-CAM适配的系统分类,指出其常被误为CNN版Grad-CAM的简单扩展,存在方法选择未明确的问题。
GSBF:面向环境感知波束成形的高斯溅射
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI
AI总结 该研究针对传统波束成形依赖瞬时CSI导致开销高的问题,提出GSBF方法,通过3D高斯表示刻画环境,利用Bi-SG核与电磁光栅化合成波束,仿真显示其性能优于EBA且延迟更低。
RegisterBridgeMM:一种以寄存器为核心的RGB-红外目标检测框架
机构 * Jilin University(吉林大学) ; Taiyuan University of Technology(太原理工大学) ; Shenzhen University(深圳大学)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 针对RGB-红外目标检测的跨模态融合难题,提出以寄存器为核心的RegisterBridgeMM框架,通过三阶段寄存器生命周期实现高效融合,在四个基准数据集上取得最高mAP50-95性能。
RUTA:基于率-效用优化的原则性视觉令牌分配方法
机构 * City University of Hong Kong(香港城市大学) ; Google Inc.(谷歌公司)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 针对视觉语言模型因长视觉令牌序列导致的LLM侧计算和内存成本过高问题,提出RUTA方法,仅用2.0%、4.2%的视觉令牌,分别在LLaVA-NeXT-7B、Qwen3-VL-8B上保留88.2%、94.4%的任务性能。
SlimVLM:面向高效视觉-语言模型的感知敏感性动态结构化剪枝与自适应视觉token选择
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 SlimVLM是一种结构化剪枝框架,通过自适应视觉token选择和感知敏感性动态剪枝机制,在压缩视觉-语言模型的同时保持性能,在多模态基准测试中达到最优。
DRPFNet:用于RGB-热成像目标检测的双域残差渐进融合网络
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 针对现有RGB-T目标检测方法的跨尺度知识继承不足、噪声抑制弱及信息退化问题,提出DRPFNet,通过结构、特征、增强三级协同优化,在公开数据集上实现了兼具竞争力与高效性的检测性能。
Comments Accepted at ICME 2026
CalibBEV:基于鸟瞰图对齐的激光雷达-相机标定方法
机构 * University of Bologna(博洛尼亚大学) ; University of Parma(帕尔马大学) ; Stanford University(斯坦福大学) ; VisLab srl(VisLab有限公司) ; Ambarella Inc.(安霸公司)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 CalibBEV是一种激光雷达-相机标定方法,通过两步BEV对齐结合CLIP对比损失实现跨模态统一,在KITTI、nuScenes基准上大幅降低了标定误差,达到最优性能。
Journal ref Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision. 2026. p. 4345-4354
Sen-Cap:基于激光雷达-相机融合的传感器灵活且抗噪的人体运动捕捉框架
机构 * ShanghaiTech University(上海科技大学) ; Digital Trust Centre, Nanyang Technological University(南洋理工大学数字信托中心)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV
AI总结 Sen-Cap是一种无需传感器间校准的激光雷达-相机融合人体运动捕捉框架,通过跨传感器运动估计器与抗噪轨迹跟踪器实现灵活部署与强鲁棒性,在多数据集上达最优性能,适用于真实场景。
Comments 16 pages, 8 figures, 4 tables. Accepted at ECCV 2026. Aoru Xue and Yujing Sun contributed equally. Yuexin Ma is the corresponding author
消息而非令牌:用于忠实VLM压缩的基础核心集
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Wuhan AI Research(武汉人工智能研究院) ; Cardiff University(卡迪夫大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 该研究针对VLM视觉令牌压缩的现有缺陷,提出无需训练的GMC方法,通过联合分配多维度证据支持并传输被丢弃状态,在大幅减少视觉令牌的同时保持VLM性能,经多基准实验验证有效。
Comments 32 pages, 6 figures, 18 tables, including appendix
TELLER:面向大语言模型推理的非侵入式跨层根因分析
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL
AI总结 TELLER是面向LLM推理的非侵入式跨层根因分析框架,通过跟踪与日志结合实现异常定位与自然语言解释,在多节点GPU工作负载上兼具高效压缩与诊断性能,为LLM推理RCA提供实用支撑。
Comments 12 pages, 1 figure, 9 tables. Accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)
用于RGBT跟踪的参数动态自适应融合与校准网络
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 针对现有RGBT跟踪器融合参数无法适配目标状态变化的问题,提出PAFCNet,通过TA-HyperNet生成目标条件参数,实现动态融合与时序校准,在多RGBT跟踪基准上取得竞争力性能。
Comments 9 pages,4 figures; Under review
面向高效自我中心 grounding 的动态分辨率路由
机构 * National University of Singapore(新加坡国立大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Nanyang Technological University(南洋理工大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 该研究针对自我中心视觉 grounding 中视觉 token 处理成本过高的问题,提出 SmartRes 框架,通过动态分辨率路由减少视觉 token,在 Ego4D 等数据集上实现 token 缩减与性能提升,代码将公开。
AI模型的语义对齐:概念坍缩、检查点动态与跨语言迁移
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL
AI总结 该研究针对语言模型基准测试的难点,提出用拓扑方法将模型高维嵌入空间与可解释基线严格比较,以实现多模态对齐,追踪模型适应并测试跨语言短语理解。
Comments Code available at github.com/tylerashoff/persiscope (PyPI: persiscope)
无单一失效神经元:针对白盒攻击的分布式安全对齐
机构 * The University of Sydney(悉尼大学) ; National University of Singapore(新加坡国立大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 针对现有安全对齐方法的单点失效问题,提出分布式安全对齐(DSA),通过冗余编码安全能力提升模型对抗白盒神经元级攻击的鲁棒性,且保留通用语言与多模态效用。
面向医学视觉基础模型的位置感知细粒度表示学习
机构 * The University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(矢量研究所)
专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV
AI总结 本研究提出基于位置感知细粒度表示学习的医学视觉基础模型LoFi,构建大规模医学定位数据集MedG,在多项医学视觉任务中性能优于现有模型。
SpatialAfford:教紧凑视觉语言模型(VLMs)关注何处与定位何处以实现 affordance
机构 * Zhejiang University(浙江大学) ; Vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 SpatialAfford 是一个两阶段框架,通过空间注意力对齐和空间感知 GRPO,使紧凑 4B VLMs 在多个基准上的 affordance 定位性能优于更强的 7B+ 基线模型。
DS@GT ARC团队参与2026 MEDIQA-CORE-Task-1:采用带任务特定门控的三模态模型融合进行脑肿瘤亚型分类
机构 * Georgia Institute of Technology(佐治亚理工学院) ; University of Florida(佛罗里达大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 DS@GT ARC团队针对2026 MEDIQA-CORE-Task-1,提出带任务特定门控的三模态模型融合方法,结合多类嵌入与报告,获全多模态下0.801宏F1,排名第二。
Comments CLEF 2026 Working Notes, 21 - 24 September 2026, Jena, Germany
TerraNova:人类世的基础模型
机构 * Politecnico di Milano(米兰理工大学) ; RFF-CMCC European Institute on Economics and the Environment (EIEE)(RFF-CMCC欧洲经济与环境研究所) ; Euro-Mediterranean Center on Climate Change (CMCC)(欧洲地中海气候变化中心)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI
AI总结 TerraNova是适配原生几何的基础模型,融合地球物理与社会数据,可重建密集场、适配未见变量,兼具地理空间编码能力与国家层面功能。
Comments 32 pages, 16 figures. Supplementary Information (full methodological specification, ablation programme, extended results, computational cost; 157 pages) available at the project page: https://carlosrodriguezpardo.es/projects/TerraNova/
VFAD:变分语义提示与频率自适应表示学习结合的零样本异常检测
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 该研究提出VFAD框架,结合变分语义提示与频率自适应表示学习,在13个工业和医学基准上,其零样本异常检测性能优于现有最先进方法。
StraightDP:面向整流流Transformer的几何感知差分隐私
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 StraightDP利用整流流的几何异质性,通过释放类条件矩结合DP-SGD,在强差分隐私约束下提升文本条件生成模型的下游准确率与生成质量,且可迁移到SD3-medium。
VCP-DCN:超越视觉隐蔽属性的深度协作网络用于伪装目标检测
机构 * Xidian University(西安电子科技大学)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 针对现有伪装目标检测方法忽略深度域隐蔽目标模态特性的问题,提出VCP-DCN网络,通过SPE、MDA、DAI模块逐步实现多模态对齐、交互与融合,在三个权威数据集上验证了有效性。
Comments Accepted by ECCV 2026
OmniDelta:用于OmniLLMs中令牌压缩的技能驱动预算分配
机构 * Zhejiang University(浙江大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; University of Science and Technology of China(中国科学技术大学) ; Alibaba(阿里巴巴)
专题命中 多模态训练与对齐 :omni-modal(abstract);分类 cs.AI
AI总结 研究针对OmniLLMs长音频-视频令牌序列成本高的问题,提出技能驱动的OmniDelta框架,通过构建技能池、结合意图与内容感知分配预算,能与现有策略结合,实验证明其在多个基准上建立新的准确性-效率前沿,减少内存并加速推理。
Comments 24 pages, 8 figures
用于高效剪切变形可视化的高斯体表示
机构 * Indraprastha Institute of Information Technology Delhi(德里英迪拉甘地信息技术学院)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 研究针对医学图像可视化计算成本高的问题,提出基于高斯的体表示,用蒙特卡罗体估计和课程学习策略优化,能从稀疏监督中学习解剖细节与纹理,降低计算成本,支持高效渲染多模态医学数据集,实现高帧率和高压缩比。
解开语言调查与单词计数(LIWC)的解释性和预测性作用:抑郁症相关分类中的受控替换
专题命中 多模态训练与对齐 :multimodal(abstract);分类 eess.AS
AI总结 研究探讨LIWC在抑郁症相关分类中的作用,通过与三种局部替换版本比较,在多语料库中评估其对分类的影响,结果显示其在固定表示下增益有限,作为解释层有用,但结论不适用于特定架构。