arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2601.22164 2026-02-02 cs.CV cs.LG cs.RO 62%

Do Open-Vocabulary Detectors Transfer to Aerial Imagery? A Comparative Evaluation

开放词汇检测器能否迁移到航拍图像?一项比较评估

Christos Tsourveloudis

机构 * School of Electrical and Computer Engineering, National Technical University of Athens(电气与计算机工程学院,国家技术大学雅典)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文评估了开放词汇检测器在航拍图像上的迁移能力,发现语义混淆是主要瓶颈,且不同数据集表现差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00590 2026-01-30 cs.CL cs.AI cs.LG 62%

Wikontic: Constructing Wikidata-Aligned, Ontology-Aware Knowledge Graphs with Large Language Models

Wikontic: 构建与维基数据对齐、本体感知的知识图谱

Alla Chepurova, Aydar Bulatov, Mikhail Burtsev, Yuri Kuratov

机构 * Cognitive AI Systems Lab(认知人工智能系统实验室) Moscow Independent Research Institute of Artificial Intelligence(莫斯科独立人工智能研究所) London Institute for Mathematical Sciences(伦敦数学科学研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 Wikontic通过多阶段流程构建维基数据对齐、本体感知的知识图谱,提升KG质量并实现高效构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21615 2026-01-30 cs.LG cs.AI 62%

Beyond Parameter Finetuning: Test-Time Representation Refinement for Node Classification

超越参数微调:用于节点分类的测试时间表示精调

Jiaxin Zhang, Yiqi Wang, Siwei Wang, Xihong Yang, Yu Shi, Xinwang Liu, En Zhu

机构 * National University of Defense Technology(国防科技大学) Intelligent Game and Decision Lab(智能游戏与决策实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TTReFT框架,通过改进测试时间适应方法,解决图神经网络在分布外测试中的性能下降问题,提升节点分类的准确性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13993 2026-01-30 eess.IV cs.AI cs.CV 62%

OrthoInsight: Rib Fracture Diagnosis and Report Generation Based on Multi-Modal Large Models

OrthoInsight:基于多模态大模型的肋骨骨折诊断与报告生成

Ningyong Wu, Jiangbo Zhang, Wenhong Zhao, Jinzhi Wang, Chenzhan Yu, Zhigang Xiu, Duwei Dai, Ziyu Xu, Yongli Yang

机构 * Organizational Management Department, School of Management, Xi’an Jiaotong University(管理学院组织管理部,西安交通大学) West China Longquan Hospital, Sichuan University(四川大学西部临床医学院) School of Electronic Science and Engineering, Xi’an Jiaotong University(西安交通大学电子科学与工程学院) Systems Engineering Institute, Xi’an Jiaotong University(西安交通大学系统工程研究院) Institute of Medical Artificial Intelligence, the Second Affiliated Hospital of Xi’an Jiaotong University(西安交通大学第二附属医院医学人工智能研究所) School of Human Settlements and Civil Engineering, Xi’an Jiaotong University(西安交通大学人居环境与土木工程学院) School of Life Science and Technology, Xi’an Jiaotong University(西安交通大学生命科学与技术学院)

专题命中 视觉定位与Grounding :LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 OrthoInsight通过多模态大模型实现肋骨骨折的自动诊断与报告生成,结合CT图像分析与医学知识图谱,提升诊断效率和临床实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17673 2026-01-27 cs.CV cs.AI 62%

Uni-RS: A Spatially Faithful Unified Understanding and Generation Model for Remote Sensing

Uni-RS: 一种用于遥感的具有空间忠实性的统一理解和生成模型

Weiyu Zhang, Yuan Hu, Yong Li, Yu Liu

机构 * Institute of Remote Sensing and Geographic Information System, School of Earth and Space Sciences, Peking University(遥感与地理信息系统研究所,地球与空间科学学院,北京大学) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(土木与环境工程系,香港科学与技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 Uni-RS通过空间布局规划、空间感知查询监督和图像描述空间布局变化,提升遥感文本到图像生成的空间忠实性,同时保持多模态理解任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14525 2026-01-22 cs.CL cs.AI cs.LG 62%

Towards Execution-Grounded Automated AI Research

面向执行导向的自动化AI研究

Chenglei Si, Zitong Yang, Yejin Choi, Emmanuel Candès, Diyi Yang, Tatsunori Hashimoto

机构 * Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出自动化执行器,通过执行反馈学习改进LLM预训练和后训练方法,验证了进化搜索在样本效率上的优势,但强化学习存在模式崩溃问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10111 2026-01-22 cs.CV cs.AI cs.CR 62%

Training-Free In-Context Forensic Chain for Image Manipulation Detection and Localization

无需训练的上下文取证链用于图像篡改检测与定位

Rui Chen, Bin Liu, Changtao Miao, Xinghao Wang, Yi Li, Tao Gong, Qi Chu, Nenghai Yu

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 ICFC提出一种无需训练的多模态大语言模型框架,用于图像篡改检测与定位,通过可解释的推理流程实现高效且准确的图像分析。

Comments This version was uploaded in error and contains misleading information found in an early draft. The manuscript requires extensive and long-term revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13075 2026-01-21 cs.LG cs.AI 62%

METIS: Mentoring Engine for Thoughtful Inquiry & Solutions

METIS:面向深入探究与解决方案的导师引擎

Abhinav Rajeev Kumar, Dhruv Trehan, Paras Chopra

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 METIS通过工具增强和阶段意识功能,帮助本科生从想法发展到论文,优于GPT-5和Claude Sonnet 4.5,在文档基础阶段表现更佳。

Comments 12 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09147 2026-01-21 cs.CV cs.AI 62%

SSVP: Synergistic Semantic-Visual Prompting for Industrial Zero-Shot Anomaly Detection

SSVP:协同语义-视觉提示用于工业零样本异常检测

Chenhao Fu, Han Fang, Xiuzheng Zheng, Wenbo Wei, Yonghua Li, Hao Sun, Xuelong Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 SSVP通过协同语义-视觉提示机制,提升工业零样本异常检测的细粒度感知能力,实现93.0%的图像AUROC和92.2%的像素AUROC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12259 2026-01-21 cs.AI cs.CE cs.LG 62%

FutureX-Pro: Extending Future Prediction to High-Value Vertical Domains

FutureX-Pro: 将未来预测扩展到高价值垂直领域

Jiashuo Liu, Siyuan Chen, Zaiyuan Wang, Zhiyuan Zeng, Jiacheng Guo, Liang Hu, Lingyue Yin, Suozhi Huang, Wenxin Hao, Yang Yang, Zerui Cheng, Zixin Yao, Lingyue Yin, Haoxin Liu, Jiayi Cheng, Yuzhen Li, Zezhong Ma, Bingjie Wang, Bingsen Qiu, Xiao Liu, Zeyang Zhang, Zijian Liu, Jinpeng Wang, Mingren Yin, Tianci He, Yali Liao, Yixiao Tian, Zhenwei Zhu, Anqi Dai, Ge Zhang, Jingkai Liu, Kaiyuan Zhang, Wenlong Wu, Xiang Gao, Xinjie Chen, Zhixin Yao, Zhoufutu Wen, B. Aditya Prakash, Jose Blanchet, Mengdi Wang, Nian Si, Wenhao Huang

机构 * Hong Kong University of Science and Technology(香港科技大学) Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学) Princeton University(普林斯顿大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 FutureX-Pro通过扩展未来预测到金融、零售、公共健康和自然灾害等高价值垂直领域,评估代理LLMs在工业部署中的领域基础能力。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12082 2026-01-21 cs.CV cs.AI 62%

Conditional Random Fields for Interactive Refinement of Histopathological Predictions

用于病理预测交互细化的条件随机场

Tiffanie Godelaine, Maxime Zanella, Karim El Khoury, Saïd Mahmoudi, Benoît Macq, Christophe De Vleeschouwer

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HistoCRF框架,通过条件随机场细化病理预测,利用专家注释提升分类准确率,实验显示在无注释和少量注释情况下均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11514 2026-01-19 cs.CV cs.LG 62%

ShapeR: Robust Conditional 3D Shape Generation from Casual Captures

ShapeR: 从随意捕获序列中生成鲁棒的条件3D形状

Yawar Siddiqui, Duncan Frost, Samir Aroudj, Armen Avetisyan, Henry Howard-Jenkins, Daniel DeTone, Pierre Moulon, Qirui Wu, Zhengqin Li, Julian Straub, Richard Newcombe, Jakob Engel

机构 * Meta Reality Labs Research(Meta现实实验室) Simon Fraser University(西蒙弗雷泽大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 ShapeR通过整合视觉-惯性SLAM、3D检测和视觉-语言模型,从随意捕获的序列中生成鲁棒的条件3D形状,实验显示其在Chamfer距离上优于现有方法2.7倍。

Comments Project Page: http://facebookresearch.github.io/ShapeR Video: https://www.youtube.com/watch?v=EbY30KAA55I

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03585 2026-01-19 cs.CV cs.AI cs.CL 62%

Causal-SAM-LLM: Large Language Models as Causal Reasoners for Robust Medical Segmentation

Causal-SAM-LLM:大型语言模型作为因果推理器用于稳健的医学分割

Tao Tang, Shijie Xu, Jionglong Su, Zhixiang Lu

机构 * City University of Hong Kong, Hong Kong, China(香港城市大学) Xi’an Jiaotong-liverpool University, Suzhou, China(西安交通大学利物浦大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Causal-SAM-LLM利用大型语言模型作为因果推理器,提升医学图像分割的鲁棒性和泛化能力。

Comments Accepted by IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09858 2026-01-16 cs.CL cs.AI cs.LG 62%

OUTLINEFORGE: Hierarchical Reinforcement Learning with Explicit States for Scientific Writing

OUTLINEFORGE: 基于显式状态的分层强化学习用于科学写作

Yilin Bao, Ziyao He, Zayden Yang

机构 * UC San Diego(圣迭戈大学) Ohio State University(俄亥俄州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 OUTLINEFORGE通过分层强化学习和显式状态管理,提升科学写作的全局结构和引用一致性,改进文档规划和事实准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03910 2026-01-14 math.RT cs.AI cs.LG 62%

An Algebraic Representation Theorem for Linear GENEOs in Geometric Machine Learning

线性GENEOs在几何机器学习中的代数表示定理

Francesco Conti, Patrizio Frosini, Nicola Quercioli

机构 * Inria Sophia Antipolis(法国 Sophia Antipolis 研究所) University of Pisa(比萨大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出新的代数表示定理,用于描述在不同数据空间之间作用的线性GENEOs,通过广义T-置换测度实现,扩展了几何机器学习中对称性编码的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06937 2026-01-13 cs.AI cs.LG 62%

mind_call: A Dataset for Mental Health Function Calling with Large Language Models

mind_call: 一个用于大语言模型心理健康新功能调用的数据集

Fozle Rabbi Shafi, M. Anwar Hossain, Salimur Choudhury

机构 * School of Computing, Queen’s University Kingston(计算学院,女王大学金斯顿)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 mind_call数据集通过合成功能调用任务,为大语言模型在心理健康领域的应用提供支持,涵盖多种自然语言查询与标准化API调用的映射,促进意图识别和可靠功能调用的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05269 2026-01-13 cs.IR cs.CV cs.LG 62%

Studying Illustrations in Manuscripts: An Efficient Deep-Learning Approach

研究手稿中的插图:一种高效的深度学习方法

Yoav Evron, Michal Bar-Asher Siegal, Michael Fire

机构 * Faculty of Computer and Information Science, Ben-Gurion University of the Negev, Be’er Sheva, Israel(计算机与信息科学学院,内盖夫本· Gurion大学,贝尔谢巴,以色列) The Goldstein-Goren Department of Jewish Thought, Ben-Gurion University of the Negev, Be’er Sheva, Israel(犹太思想Goldstein-Goren部门,内盖夫本· Gurion大学,贝尔谢巴,以色列)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种高效的深度学习方法,用于大规模分析历史插图手稿,通过多模态描述和共享表示空间揭示视觉模式和跨手稿关系。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06781 2026-01-13 cs.HC cs.AI cs.CV 62%

AutoTour: Automatic Photo Tour Guide with Smartphones and LLMs

AutoTour:基于智能手机和LLMs的自动照片导览系统

Huatao Xu, Zihe Liu, Zilin Zeng, Baichuan Li, Mo Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV、cs.AI

AI总结 AutoTour利用智能手机和LLMs自动为用户照片生成细粒度地标注释和描述,实现可扩展且上下文感知的交互式探索体验。

Comments 21

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05266 2026-01-12 cs.IR cs.AI cs.CL cs.LG 62%

Retrieval-Augmented Multi-LLM Ensemble for Industrial Part Specification Extraction

基于检索增强的多LLM集成工业零件规范提取系统

Muzakkiruddin Ahmed Mohammed, John R. Talburt, Leon Claasssens, Adriaan Marais

机构 * ERIQ Research Center University of Arkansas - Little Rock(ERIQ研究所以及阿肯色大学-利文斯顿分校) PiLog Group(PiLog集团)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于检索增强的多LLM集成框架,通过整合多种先进模型提升工业零件规范提取的准确性和完整性。

Comments The 17th International Conference on Knowledge and Systems Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01792 2026-01-06 cs.LG cs.AI cs.CL cs.SD 62%

HyperCLOVA X 8B Omni

HyperCLOVA X 8B Omni:首个支持文本、音频和视觉的任何到任何多模态模型

NAVER Cloud HyperCLOVA X Team

机构 * NAVER Cloud HyperCLOVA X Team(NAVER云HyperCLOVA X团队)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 HyperCLOVA X 8B Omni是首个支持文本、音频和视觉的任何到任何多模态模型,通过统一的多模态处理实现高效且灵活的多模态交互。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22808 2026-01-06 cs.CV cs.AI 62%

EgoReAct: Egocentric Video-Driven 3D Human Reaction Generation

EgoReAct:基于第一人称视频的3D人体反应生成

Libo Zhang, Zekun Li, Tianyu Li, Zeyu Cao, Rui Xu, Xiaoxiao Long, Wenjia Wang, Jingbo Wang, Yuan Liu, Wenping Wang, Daquan Zhou, Taku Komura, Zhiyang Dou

机构 * THU(清华大学) Brown(布朗大学) Georgia Tech(佐治亚理工学院) Cambridge(剑桥大学) HKU(香港大学) NJU(南京大学) CUHK(香港中文大学) HKUST(香港科技大学) TAMU(德克萨斯大学奥斯汀分校) PKU(北京大学) MIT(麻省理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 EgoReAct通过构建HRD数据集,首次实现从第一人称视频实时生成3D对齐的人体反应运动,提升生成的现实感和空间一致性。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23739 2026-01-01 cs.CL cs.AI cs.CV cs.RO 62%

Break Out the Silverware -- Semantic Understanding of Stored Household Items

拿出银器——对存储家居物品的语义理解

Michaela Levi-Richter, Reuth Mirsky, Oren Glickman

机构 * Bar Ilan University, Computer Science Department(巴伊兰大学计算机科学系) Tufts University, Department of Computer Science(塔夫茨大学计算机科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出NOAM模型,通过结合结构化场景理解和大语言模型推理,实现对家庭物品存储位置的语义理解,显著提升预测准确率并接近人类水平。

Comments Poster presented at the Israeli Seminar on Computational Linguistics 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22220 2025-12-30 cs.CV cs.AI cs.RO 62%

On Extending Semantic Abstraction for Efficient Search of Hidden Objects

关于扩展语义抽象以实现隐藏物体的高效搜索

Tasha Pais, Nikhilesh Belulkar

机构 * Department of Computer Science(计算机科学系) Columbia University(哥伦比亚大学)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文通过扩展语义抽象,提出了一种高效搜索隐藏物体的方法,利用历史数据提升3D定位精度,帮助家庭机器人更快找到丢失物品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22129 2025-12-30 cs.MA cs.AI cs.LG 62%

ReCollab: Retrieval-Augmented LLMs for Cooperative Ad-hoc Teammate Modeling

ReCollab:基于检索增强的LLM用于协作即兴队友建模

Conor Wallace, Umer Siddique, Yongcan Cao

机构 * Department of Electrical and Computer Engineering, University of Texas at San Antonio(电子与计算机工程系,德克萨斯大学圣安东尼奥分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 ReCollab通过检索增强生成技术提升即兴团队合作中队友行为建模的适应性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21670 2025-12-29 cs.CV cs.LG 62%

The Deepfake Detective: Interpreting Neural Forensics Through Sparse Features and Manifolds

深度伪造侦探:通过稀疏特征和流形进行神经取证解释

Subramanyam Sahoo, Jared Junkin

机构 * Berkeley AI Safety Initiative (BASIS) University of California, Berkeley(伯克利人工智能安全倡议(BASIS)大学伯克利) Department of Electrical and Computer Engineering Johns Hopkins University(电气与计算机工程系约翰霍普金斯大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种通过稀疏特征和流形分析来解释深度伪造检测模型的框架,揭示了模型内部特征的使用规律和几何属性变化,以提升模型的可解释性和鲁棒性。

Comments 10 pages, 5 figures, Initial Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21099 2025-12-25 cs.GR cs.AI cs.CV 62%

TexAvatars : Hybrid Texel-3D Representations for Stable Rigging of Photorealistic Gaussian Head Avatars

TexAvatars : 混合的texel-3D表示用于稳定驱动的逼真高斯头avatars

Jaeseong Lee, Junyeong Ahn, Taewoong Kang, Jaegul Choo

机构 * KAIST(韩国科学技术院) Hanyang University(翰阳大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 TexAvatars通过混合texel-3D表示,结合分析rigging的几何基础与texel空间的连续性,实现逼真头avatars的稳定驱动和高保真表达。

Comments 3DV 2026, Project page with videos: https://summertight.github.io/TexAvatars/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19678 2025-12-23 cs.CV cs.AI 62%

WorldWarp: Propagating 3D Geometry with Asynchronous Video Diffusion

WorldWarp: 通过异步视频扩散传播3D几何

Hanyang Kong, Xingyi Yang, Xiaoxu Zheng, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 WorldWarp通过结合3D结构锚和2D生成细化器,利用时空扩散模型实现几何一致的视频生成,解决遮挡和复杂轨迹问题。

Comments Project page: https://hyokong.github.io/worldwarp-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18986 2025-12-23 cs.LG cs.AI 62%

R-GenIMA: Integrating Neuroimaging and Genetics with Interpretable Multimodal AI for Alzheimer's Disease Progression

R-GenIMA:整合神经影像与基因组学的可解释多模态AI用于阿尔茨海默病进展

Kun Zhao, Siyuan Dai, Yingying Zhang, Guodong Liu, Pengfei Gu, Chenghua Lin, Paul M. Thompson, Alex Leow, Heng Huang, Lifang He, Liang Zhan, Haoteng Tang

机构 * Eli and Lilly company(艾利和利公司)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 R-GenIMA通过整合神经影像与基因组学,利用可解释的多模态AI方法,实现了对阿尔茨海默病进展的精准预测与机制揭示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18177 2025-12-23 cs.AI cs.CV 62%

NEURO-GUARD: Neuro-Symbolic Generalization and Unbiased Adaptive Routing for Diagnostics -- Explainable Medical AI

NEURO-GUARD:神经符号泛化与无偏自适应路由用于诊断——可解释的医疗AI

Midhat Urooj, Ayan Banerjee, Sandeep Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 NEURO-GUARD通过整合视觉变换器与语言驱动推理,提升医疗图像诊断的准确性、透明性和泛化能力。

Comments Accepted at Asilomar Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12146 2025-12-22 cs.CV cs.AI 62%

Multi Anatomy X-Ray Foundation Model

多解剖X光基础模型

Nishank Singla, Krisztian Koos, Farzin Haddadpour, Amin Honarmandi Shandiz, Lovish Chum, Xiaojian Xu, Qing Jin, Erhan Bas

机构 * GE HealthCare(通用电气医疗)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 XR-0通过自监督学习在多解剖X光数据上训练,实现了在多种临床任务中的高性能表现,展示了解剖多样性对构建通用医学视觉模型的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏