arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 600 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 600 篇

2606.07653 2026-06-09 cs.CV cs.AI 新提交 62%

A Dataset for Dynamic Human Preferences for Vision Language Models

面向视觉语言模型的动态人类偏好数据集

Hannah Gao, Dylan Hadfield-Menell, Rachel Ma

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出一个评估视觉语言模型理解动态人类偏好能力的基准,通过自动化管道生成包含图像依赖变化的数据集,并评估了现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13100 2026-08-14 cs.AI cs.CY cs.HC 新提交 57%

Multi-Layer Context Camouflaging: A Semantic Superposition and Contextual Lamination Framework for Malpractice-Resilient Online Assessment

多层上下文伪装:一种用于抗作弊在线评估的语义叠加与上下文分层框架

Gupta Lovi Raj, Kaur Kamalpreet, Dama Sri Ram, Parani Prajithaa

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 该研究提出多层上下文伪装理论(MCCT),构建含六个耦合结构的数学框架,通过语义叠加保护在线评估内容,保障合法用户恢复,为抗作弊在线评估提供理论基础。

Comments 11 Pages, 36 Equations, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11891 2026-08-13 cs.CY cs.AI cs.HC 新提交 57%

Benchmark-Based Comparative Assessment of Publicly Benchmarked Indian Foundation Models: A Capability and Evaluation-Maturity Framework

基于基准的公开基准印度基础模型对比评估:能力与评估成熟度框架

Avinash Agarwal, Vridhi Jain

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出能力与评估成熟度框架,对公开基准的印度基础模型与全球同类模型对比评估,发现其在传统基准表现尚可但参与新评估不足,还提出基准成熟度指数,指出能力差距或源于评估生态问题。

Comments 18 pages, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11883 2026-08-13 cs.CV 新提交 57%

Warping Earth Observations for better ice labeling in the Marginal Marginal Ice Zone

利用地球观测数据对齐优化边缘冰区的冰标记

Tom Kelly, Martin S. J. Rogers

机构 * British Antarctic Survey(英国南极调查局)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出基于互信息对齐的架构,对齐Sentinel-1与MODIS的多模态卫星场景,构建稀疏专家标注数据集,提升海冰分类准确率,实现从稀疏监督的精确密集海冰分割。

Comments ECCV Workshop paper; BEAM 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11292 2026-08-13 cs.CV 新提交 57%

Self-Evolving Code-with-Image Reasoning

自演进的代码-图像推理

Tianze Yang, Liang Wu, Ruitong Sun, Yucheng Shi, Yanqiao Wang, Mayank Darbari, Ninghao Liu, Jin Sun, Liangjie Hong

机构 * Nokia(诺基亚) University of Georgia(佐治亚大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出代码-图像推理范式,通过无训练反思循环让模型自我演进技能,在CwI-Bench上显著提升多模态模型视觉任务准确率,技能可跨规模与任务家族迁移。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09285 2026-08-11 eess.SP cs.AI 新提交 57%

GLocFM: A Geometry-Aware Foundation Model for 3D Indoor Wireless Localization

GLocFM:面向三维室内无线定位的几何感知基础模型

Chenghong Bian, Chaozheng Wen, Hongze Chen, Jun Zhang

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 该研究针对现有学习式无线定位器无法利用环境几何信息的问题,提出GLocFM模型,联合利用WiFi测量与三维点云场景几何,在两类数据集上较基线降低近50%定位误差,鲁棒性与有效性经消融实验验证。

Comments 13 pages, single column

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09550 2026-08-11 cs.CV 新提交 57%

PressureMesh: 3D Human Mesh Estimation from Multi-Device Pressure Images

PressureMesh:基于多设备压力图像的3D人体网格估计

Changhai Ma, Ziyu Wu, Yunkang Zhang, Fangting Xie, Mengting Niu, Heyu Ding, Quan Wan, Jiayue Yuan, Boyan Liu, Yi Ke, Xiaohui Cai

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对单设备压力监测范围有限的问题,提出端到端网络MDP-Net,结合MoE框架的多模态融合机制,构建MDP数据集,实现跨设备压力数据的3D人体网格估计,关节位置误差为12.6cm。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09351 2026-08-11 cs.LG cs.AI stat.ML 新提交 57%

Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute

大语言模型的测试时增强:在计算资源匹配时输入多样性优于输出多样性

Nikita Kozodoi, Zainab Afolabi, Jack Butler

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本研究提出测试时增强(TTA),经匹配计算对比发现,中端大语言模型采用语义复述的TTA策略,比自洽性更高效地将计算转化为准确率,每美元准确率约为自洽性的1.8倍。

Comments Published at the COLM 2026 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09145 2026-08-11 cs.CV 新提交 57%

Right Answer, Wrong Heat: Explanation-Aware Evaluation and Thermal-Grounded Feedback for MLLMs on Infrared Images

正确答案,错误依据:面向红外图像多模态大语言模型的感知感知评估与热基础反馈机制

Yongsong Huang, Xiaofeng Liu, Tomo Miyazaki, Yaohou Fan, Shinichiro Omachi

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对红外图像多模态大语言模型仅以答案准确率评估的问题,提出感知感知评估框架与无需训练的热基础反馈机制,可提升解释热基础度,为可信红外场景理解模型的开发提供了方向。

Comments This manuscript is currently under peer review. Copyright may subsequently be transferred to the publisher, after which the availability of this version may be subject to the publisher's policy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08852 2026-08-11 cs.AI cs.CY cs.HC cs.MA 新提交 57%

Findings of the First Teaching Monster Challenge: A Benchmark of Pedagogical Content Knowledge in AI Agents

首届“教学怪兽挑战赛”的研究发现:AI智能体的教学内容知识基准

Yi-Cheng Lin, Yu-Kai Guo, Szu-Chi Chen, Bo-Han Feng, Yun-Man Hsu, Hsiang Hsieh, Yu-Jung Lin, Yue-Ling Wu, Jia-Kai Dong, An-Yu Cheng, Yu-Han Huang, Lok-Lam Ieong, Kuan-Yu Chen, Ming-Douo Tchouang, Shao-Hua Sun, Che Lin, Jian-Jiun Ding, Hung-yi Lee

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究推出首个以学习者角色为评估标准的教学视频生成基准“教学怪兽挑战赛”,测试发现当前AI教学系统内容适配能力不足,自动裁判存在局限,发布相关资源供后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08709 2026-08-11 cs.AI cs.SE 新提交 57%

AI Evaluation Should Measure Verification Cost, Not Correctness Alone

AI评估应衡量验证成本,而非仅正确性

Viviana Crescitelli, Generoso Immediato, Fabio Persia, Stefania Costantini

机构 * Hitachi, Ltd.(日立制作所) Hitachi Rail(日立铁路)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 该研究指出AI评估仅靠正确性不足,提出需纳入验证成本,定义了验证成本错误,通过代码生成等证据说明高基准准确率可能掩盖高验证成本,主张评估应考虑现实资源约束下的错误可检测性。

Comments 20 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08561 2026-08-11 cs.AI 新提交 57%

Deep probabilistic logic programming for diagnostic reasoning from incomplete information: A case study in stroke detection

面向不完整信息诊断推理的深度概率逻辑编程:以脑卒中检测为例

Felix Weitkämper, Monchito Avila, Elizabeth Nanjala, Siska, Grace Zawadi

机构 * German University of Digital Science(德国数字科学大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本研究以脑卒中检测为案例,提出结合最大熵技术与DeepProbLog的诊断系统构建方法,分析了不完整数据模型的性能及ProbFOIL 2压缩模型的潜力,拓展了神经符号方法在医疗诊断中的应用。

Comments Accepted for presentation at IJCLR 2026. This is the accepted version, _not_ the camera-ready version for the post-proceedings of the conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07993 2026-08-11 cs.CV 新提交 57%

MRBench: A Comprehensive Benchmark for Human Motion-Text Retrieval

MRBench:用于人体动作-文本检索的综合基准

Fulong Liu, Liang Xu, Chengqun Yang, Yuhao Zhang, Yichao Yan, Xiaokang Yang

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出综合动作-文本检索基准MRBench,针对现有基准缺陷构建,提出轻量级粒度感知模型,提升混合粒度检索效果,为动作-语言对齐评估提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07987 2026-08-11 cs.CV 新提交 57%

Advantage-Guided Gate: Reshaping Open-Ended Reasoning for Vision-Based Spatial Intelligence

优势引导门:重塑基于视觉的空间智能的开放式推理

Ling Lin, Yang Bai, Congcong Zhu, Jiangming Shi, Meng Wang, Yang Long, Jingrun Chen, Ling Shao, Huazhu Fu

机构 * University of Science and Technology of China(中国科学技术大学) Suzhou Institute for Advanced Research, USTC(中国科学技术大学苏州高等研究院) Institute of Advanced Intelligence and Computing (IAIC), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局高级智能与计算研究所) East China Normal University(华东师范大学) National University of Singapore(新加坡国立大学) Durham University(杜伦大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文针对MLLMs开放式推理易出错的问题,提出优势引导门框架,结合蒙特卡洛价值评估与两类优势门,构建Reasoning-Tree-160k数据集并经两阶段学习,有效提升了基准MLLMs的视觉空间推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07941 2026-08-11 cs.CV 新提交 57%

LAD-COD: Language-Aligned Dense Perception for Camouflaged Object Detection

LAD-COD:面向伪装目标检测的语言对齐密集感知

Shangye Song, Tianzhi Zhu, Syed Ariff Syed Hesham, Xin He, Yun Liu

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本研究针对伪装目标检测中密集视觉特征缺乏语言指导的问题,提出LAD-COD框架,通过语言对齐双视觉融合实现语义与分层视觉特征的对齐,在三个数据集的12组对比中取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07517 2026-08-11 cs.HC cs.CL stat.AP 新提交 57%

The Judge Knows When It Knows: Calibrated Abstention for LLM-Based A/B-Test Prediction

法官知道自己何时知晓:基于大语言模型的A/B测试预测的校准弃权(不执行)

Tyler Dooskin, Squoosh Technical Staff

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 该研究探究多模态LLM能否仅通过网页截图预测A/B测试结果,发现Gemini 3 Flash法官表现不佳,提出投票边际关卡隔离置信判断可提升性能,还在人类中重现了共识与真实结果脱节的现象,并发布了相关研究资源。

Comments 15 pages. Pre-registered experimental program with a public, tiered claims ledger; includes powered negative results, a label-validity audit, a cross-judge shared-prior measurement (n_eff ~ 2 of 16 votes), and a first-party 15-expert human baseline. Pre-registrations, statistical harness, human responses, and the full experiment ledger are released

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07036 2026-08-10 cs.SE cs.CV 新提交 57%

CAS2UML: A Handwritten Sketch-to-PlantUML Dataset for Class and Activity Diagrams

CAS2UML:用于类图和活动图的手绘草图到PlantUML数据集

Simon Scholz, Mersedeh Sadeghi

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 CAS2UML是含557幅手绘类图与活动图及对应PlantUML代码的公开数据集,配套验证工具与脚本,可实现草图转UML方法的可复现基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07015 2026-08-10 cs.CV 新提交 57%

Understand Before Detect: Vision--Language Learning for Omni-Domain Infrared Small Target Detection

先理解再检测:用于全域红外小目标检测的视觉-语言学习

Haoyang Yuan, Boyang Li, Yingqian Wang, Yimian Dai, Nuo Chen, Xinfei Huang, Shuqi Yi, Zaiping Lin, Weidong Sheng, Wei An

机构 * National University of Defense Technology(国防科技大学) College of Computer Science, Nankai University(南开大学计算机学院) Peking University(北京大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对全域红外小目标检测的域偏移问题,提出“先理解再检测”范式及JinSight方法,构建视觉-语言数据集OmniIRST-VL,实现跨异构红外域的泛化检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06931 2026-08-10 cs.AI 新提交 57%

Science Edge Evaluation: SEE the Missing Step Toward Real Scientific Discovery

科学边缘评估:SEE——迈向真实科学发现的缺失环节

Taolin Han, Yuchen Zhang, Jinghang Wang, Yun Wu, Wai Yuet Chiu, Zhaohai Li, Yifei Zhang, Jinxin Wang, Yuhao Zhou, Chen Zhao, Jiajia Li, Jiaxin Li, Qile Jin, Kewei Sun, Shuang Wu, Weiqi Zhai, Renquan Lv, Junchao Li, Ruodan Chen, Qingteng Chen, Zhibo Yang, Hu Wei, Lin Qu, Shuai Bai, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) University of Alberta(阿尔伯塔大学) Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 该研究构建多模态基准SEE评估19个MLLMs,发现其仅达48.7%准确率,通用模型优于专用模型,工具使用可提至52.7%但仍难实现科学发现所需的证据约束推断,需从解释转向推导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06300 2026-08-07 cs.AI 新提交 57%

Bias Analysis of L2 Speaking Assessment Systems Using Concept Activation Vectors

基于概念激活向量的L2口语评估系统的偏差分析

Arya Labroo, Mengjie Qian, Kate Knill

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 该研究将概念激活向量(CAV)分析扩展到BERT和Whisper两个L2口语评估系统,发现概念可恢复性及对概念的敏感性依赖于模型架构,稀疏自编码器(SAEs)可提升概念线性恢复性但会减弱激活空间敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03474 2026-08-05 cs.CV 新提交 57%

MT-Web2Code: Benchmarking Coding Agents on Multi-Turn Regional Reconstruction and Localized Modification

MT-Web2Code:面向多轮区域重构与局部修改的编码智能体基准测试

Qiming Li, Shujie Hu, Haohan Liu, Xiaocheng Feng, Songxiang Liu, Guanglu Wan

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 MT-Web2Code是首个面向多轮区域重构与局部修改的多模态编码基准,实验发现现有编码智能体存在多轮错误滚雪球等问题,其评估指标或助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03451 2026-08-05 cs.AI 新提交 57%

DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces

DataSpace:针对异构工作空间可验证分析的数据智能体基准测试

Boyan Li, Zhuowen Liang, Yupeng Xie, Xiaotian Lin, Tianqi Luo, Xinyu Liu, Yizhang Zhu, Zhangyang Peng, Yuan Li, Zhengxuan Zhang, Jiayi Zhang, Nan Tang, Guoliang Li, Yuyu Luo

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 该研究推出DataSpace基准,用于评估异构工作空间下数据智能体的可验证分析能力,包含多类型任务与数据,实验揭示了智能体框架、多模态集成等对准确率的影响,为提升数据智能体可靠性指明了方向。

Comments 8 pages of main text, 7 figures, with a supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03279 2026-08-05 cs.CV 新提交 57%

3DGSI-Assessor: A Large-Scale Dataset and An LMM-based Method for 3D Gaussian Splatting Image Quality Assessment

3DGSI-Assessor:面向3D高斯溅射图像质量评估的大规模数据集与基于大视觉语言模型的方法

Yuke Xing, Jiarui Wang, William Gordon, Zhu Li, Guangtao Zhai, Yiling Xu

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对3D高斯溅射压缩的失真评估缺口,提出含15200张图像的多维IQA数据集3DGS-IEval-15K+,并构建基于大视觉语言模型的一体化IQA框架3DGSI-Assessor,该框架在对应数据集上达SOTA且泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03225 2026-08-05 cs.CV 新提交 57%

Open-Linguistic Concept Unified Learning for Cross-Site Interpretable Dermatology Image Diagnosis

面向跨站点可解释皮肤病图像诊断的开放语言概念统一学习

Chengyu Wu, Junpeng Tan, Wanxiang Luo, Yaqi Wang, Yandong Wen, Yefeng Zheng

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对现有概念模型跨站点泛化差、适配FVLMs成本高的问题,提出开放语言概念统一学习框架UniCon,通过共享语义空间等三项创新实现多模态可解释皮肤病诊断,获顶级准确率且具备跨站点干预能力。

Comments accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02589 2026-08-04 cs.CV 新提交 57%

CAPEval: A Decoupled Caption Evaluation across Understanding and Generation

CAPEval:跨理解与生成的解耦式标题评估

Zhipeng Liu, Haochen Wang, Zhaoxiang Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出解耦式标题评估基准CAPEval,将标题质量分为覆盖度与精确度,发现二者分别对应理解与生成任务性能,为标题生成器的选择优化提供指导。

Comments 21 pages, 8 figures. Code and dataset will be available at https://liuzhipenggg.github.io/CAPEval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02192 2026-08-04 cs.CV 新提交 57%

T$^2$exture: Sparsely Perturbed Thermal-to-Texture Imaging

T²exture:稀疏扰动热成像转纹理成像

Jiashuo Chen, Cheng Dai, Yanan Hu, Fanglin Bao

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 针对现有热纹理成像方法的缺陷,提出T²exture框架,通过两阶段重建实现稀疏主动采集成像下的热纹理序列,在模拟基准上参数增量小且PSNR提升显著,纹理与结构恢复效果优于VFI基线。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01977 2026-08-04 cs.CV 新提交 57%

SVGEval: A Vision-Grounded Framework for Perceptual-Quality Benchmarking and Evaluation in Text-to-SVG Generation

SVGEval:用于文本到SVG生成中感知质量基准测试与评估的视觉基础框架

Yiming Wang, Ye Chen, Hanqi Chen, Bingbing Ni

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) School of Integrated Circuits (School of Information Science and Electronic Engineering), Shanghai Jiao Tong University(上海交通大学集成电路学院(信息科学与工程学院)) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学致远学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究针对文本到SVG生成评估的缺陷,提出视觉基础的SVGEval基准,发现多模态模型在几何布局判断上的差距,训练出可解释的SVG质量评分器,为SVG生成评估改进提供支撑。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01848 2026-08-04 cs.CV 新提交 57%

Decoupling semantics from vision: A framework for faithful visual-text compression evaluation

将语义与视觉解耦:一种用于可靠视觉-文本压缩评估的框架

Yonghan Gao, Zehong Chen, Lijian Xu, Jingzhi Chen, Jingwei Guan, Xingyu Zeng

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) Shenzhen Technology University(深圳技术大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本研究针对现有视觉-文本压缩评估依赖下游任务性能的缺陷,提出解耦语义与视觉的评估框架,引入ZeroSense基准消除文本依赖,实验证实VTC质量与下游任务准确率存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01407 2026-08-04 cs.CV 新提交 57%

Training-Free Out-of-Distribution Detection for Pathology Whole-Slide Images

面向病理全切片图像的无分布外检测训练方法

Sabri Mustafa Kahya, Richard R. Chen, Muhammet Sami Yavuz, Jerry Jierui Lou, Akanimoh Adeleye, Haci Ali Kahya, Jana Lipkova

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于视觉-语言病理基础模型的无训练多模态OOD检测器ZIO,在14700余张病理WSI上优于40种现有OOD方法,为临床AI安全部署提供支撑。

Comments Under review. The code is available in https://github.com/muskahya/ZIO

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00084 2026-08-04 cs.CV physics.optics 新提交 57%

From Pixels to PCells: A Neurosymbolic Approach to Photonic Component Creation

从像素到光子单元(PCells):一种用于光子组件创建的神经符号方法

Aadarsh Agarwal, Kenaish Al Qubaisi, Dirk Englund

机构 * Massachusetts Institute of Technology(麻省理工学院) Research Laboratory of Electronics(电子学研究实验室) University of Chicago(芝加哥大学) The College(学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出神经符号系统PixCell,用多模态智能体将视觉呈现的光子组件转为参数化程序,经验证器引导修正的模型在光子组件设计任务上IoU显著提升,建立了相关设计的受控框架。

Comments 16 pages, 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏