Unified Data Discovery across Query Modalities and User Intents
跨查询模态和用户意图的统一数据发现
专题命中 跨模态检索 :cross-modal(abstract)
AI总结 本文提出UniDisc框架,支持自然语言和表格查询,统一处理多样用户意图,通过上下文信号学习鲁棒表征,实现在不同数据发现场景中的统一相关性评估。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
跨查询模态和用户意图的统一数据发现
专题命中 跨模态检索 :cross-modal(abstract)
AI总结 本文提出UniDisc框架,支持自然语言和表格查询,统一处理多样用户意图,通过上下文信号学习鲁棒表征,实现在不同数据发现场景中的统一相关性评估。
文化启发的多模态配色生成与配色:一个中国青年亚文化案例
机构 * Tongji University(同济大学) ; Tezign.com Ltd.(Tezign.com有限公司) ; University of Delaware(德雷塞尔大学)
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文通过构建基于中国青年亚文化的配色数据集,提出多模态生成框架,实现具有亚文化特色的配色方案,通过用户研究验证其有效性。
Comments accepted by the 3rd IEEE Workshop on Artificial Intelligence for Art Creation
从幻象到基础:迈向可靠的多模态电路到Verilog代码生成
机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) ; Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security, Hangzhou(杭州高新技术区(滨江)区块链与数据安全研究院,杭州) ; School of Artificial Intelligence and Computer Science, Nantong University(人工智能与计算机科学学院,南通大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出VeriGround模型,通过标识符匿名化、拒绝增强和D-ORPO对齐,解决了多模态模型在电路到Verilog代码生成中的可靠性问题,验证了真实视觉基础的重要性。
EDU-CIRCUIT-HW:评估多模态大语言模型在真实世界大学级STEM学生手写解答中的表现
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Virginia Tech(弗吉尼亚理工学院)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 本文提出EDU-CIRCUIT-HW数据集,用于评估多模态大语言模型在处理包含数学公式、图表和文本推理的大学STEM学生手写解答中的性能,揭示模型在自动评分中的可靠性问题,并提出通过纠正识别错误提升AI评分系统鲁棒性的方法。
Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026. Project Website: https://gt-learning-innovation.github.io/CIRCUIT_EDU_HW_ACL GitHub and Dataset: https://gt-learning-innovation.github.io/CIRCUIT_EDU_HW_ACL
MEG-RAG: 多模态证据 grounding 的量化研究以提升 RAG 中的证据选择
机构 * Institute for Clarity in Documentation(清晰文档研究所) ; Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化研究所) ; Rajiv Gandhi University(拉吉夫·甘地大学) ; Tsinghua University(清华大学) ; Palmer Research Laboratories(帕勒尔研究实验室) ; Zhejiang University(浙江大学) ; Peking University(北京大学) ; University of New South Wales(新南威尔士大学) ; Macquarie University(麦考瑞大学) ; CSIRO’s Data61(CSIRO 数据61)
专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CL
AI总结 本文提出 MEG-RAG 框架,通过语义感知的多模态证据 grounding 方法提升 RAG 中的证据选择准确性与多模态一致性。
GuideDog: 一种用于视障和低视力者无障碍引导的现实世界单人视角多模态数据集
机构 * Yonsei University(延世大学) ; LG AI Research(LG AI研究所) ; Euler Robotics(Euler机器人) ; Seoul National University(首尔国立大学)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 本文提出GuideDog数据集,包含22K图像描述对,用于提升视障者导航能力,通过人机协同标注提升数据质量,并展示深度感知评估基准,揭示当前多模态大语言模型在深度感知方面的挑战。
Comments ACL 2026 Main. Project page: https://jun297.github.io/GuideDog/
VeriTaS:首个动态多模态自动事实核查基准
机构 * Multimodal AI Lab(多模态AI实验室) ; Technical University of Darmstadt(达姆施塔特技术大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 为应对在线虚假信息的扩大规模,本文提出VeriTaS动态基准,通过自动化流程持续更新,涵盖104个专业机构的25000个真实声明,支持多模态事实核查评估。
Comments ACL 2026 Oral
CheXthought:一个包含临床推理链和视觉注意力的全球多模态数据集,用于胸部X光解读
机构 * Center for Artificial Intelligence in Medicine and Imaging(医学与影像人工智能中心) ; Department of Radiology(放射科) ; Department of Pediatrics(儿科) ; Department of Radiology, Weill Cornell Medicine(韦氏 Cornell 医学院放射科) ; Department of Radiology, Brigham and Women’s Hospital(布里奇妇产科医院放射科) ; University of California, Berkeley(加州大学伯克利分校) ; University of California, San Francisco(加州大学旧金山分校) ; Department of Biomedical Data Science(生物医学数据科学部)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 CheXthought数据集通过501名放射科医生的50312例多读X光片,提供了103592条推理链和6609082条同步视觉注意力标注,展示了临床推理模式,并在事实准确性、空间定位、病理分类、视觉忠实度、时间推理和不确定性沟通等方面提升了视觉语言模型性能。
Comments 51 pages, 7 figures, 10 tables
Echo-α:用于超声解读的大型代理多模态推理模型
机构 * MiliLab(Mili实验室)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 Echo-α结合了精确的病变定位和整体临床推理,通过九任务监督课程和强化学习提升超声解读的准确性和可解释性。
Comments 12 pages, 4 figures. Technical report
K2MUSE:一种涵盖任务和采集变异性的下肢多模态行走数据集,用于康复机器人
机构 * State Key Laboratory of Robotics and Intelligent Systems, Shenyang Institute of Automation, Chinese Academy of Sciences(机器人与智能系统国家重点实验室,沈阳自动化研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; College of Artificial Intelligence, Tianjin Key Laboratory of Intelligent Robotics, Nankai University(人工智能学院,天津智能机器人重点实验室,南开大学) ; School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(人工智能与自动化学院,华中科技大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 K2MUSE数据集通过多模态数据揭示下肢康复机器人与生物力学信息的关系,为康复机器人开发提供大规模步态样本和数据驱动方法支持。
Comments 34 pages, 30 figures,7 tables
VTBench: 一种基于图表表示的多模态时间序列分类框架
机构 * University of California, Davis(加州大学戴维斯分校)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出VTBench,通过融合原始序列和图表可视化,系统评估了时间序列分类中图表类型、视觉编码和数据集的影响,展示了图表模型在特定领域的竞争力及多模态融合的优势。
Comments 8 pages main text
迈向认知下降评估的个性化数字孪生:一种多模态、不确定性感知的框架
机构 * Department of Mechanical, Industrial \& Manufac. Eng. The University of Toledo Toledo, OH, USA ; Department of Industrial Eng. ; Mngt. Systems University of Central Florida Orlando, FL, USA ; Department of Statistics ; Data Science University of Central Florida Orlando, FL, USA ; Department of Internal Medicine University of Central Florida Orlando, FL, USA
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出了一种多模态、不确定性感知的框架,用于从稀疏、噪声和不规则的纵向数据中建模患者特定的疾病轨迹,通过结合潜在状态空间模型、多模态融合和不确定性感知验证,实现对认知下降的个性化评估。
Comments 6 pages, 6 figures
通过跨模态特征归因验证CineECG 3D重建的临床价值
机构 * Department of Human-Centered Artificial Intelligence, Institute of Applied Computer Science, Jagiellonian University(人类中心人工智能系,应用计算机科学研究所,雅盖隆大学) ; Faculty of Medicine, Jagiellonian University Medical College(医学系,雅盖隆大学医学院)
专题命中 多模态评测 :cross-modal(title,abstract)
AI总结 本文提出跨模态方法,将高性能12导联ECG模型的特征归因投影到CineECG 3D解剖空间,验证了其在临床整合中的有效性。
Comments Accepted to the CompHealth workshop at the 26th International Conference on Computational Science
CBEN -- 一种用于云鲁棒遥感图像理解的多模态机器学习数据集
专题命中 多模态评测 :multimodal(title);分类 cs.CV
AI总结 本文提出CBEN数据集,用于研究云干扰对遥感图像理解的影响,通过结合光学与雷达数据,验证云鲁棒方法在云覆盖场景下的有效性。
Comments We are currently in the process of selecting an appropriate journal for submission
从应试到认知支架:一种面向LLM的教育诊断基准测试标准测试
机构 * Binghamton University(宾夕法尼亚州立大学比灵顿分校) ; BlossomsAI(BlossomsAI公司) ; Dartmouth College(达特茅斯学院)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种教育诊断基准,通过认知框架模拟英语标准化测试问题解决过程,展示ESTBook基准测试在识别认知轨迹和改进教学推理中的实用价值。
SpecVQA:一种用于科学图像光谱理解和视觉问答的基准测试
机构 * DP Technology(DP技术)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 SpecVQA通过7种典型光谱类型和专家标注的问答对,评估多模态模型在科学光谱理解中的能力,提出光谱数据采样与插值重建方法,提升模型在科学光谱理解中的表现。
MTAVG-Bench: 多说话人对话中心音频视频生成的诊断基准
机构 * Beijing Institute of Technology(北京理工大学) ; Shanghai University(上海大学) ; OpenNLP Lab(OpenNLP实验室) ; Beijing University of Technology(北京工业大学) ; The University of Adelaide(阿德莱德大学) ; Tsinghua University(清华大学) ; Inkeverse Group Limited(Inkeverse集团)
专题命中 多模态评测 :audio-visual(abstract);分类 cs.MM
AI总结 本文提出MTAVG-Bench,用于评估多说话人对话中心音频视频生成的失败模式诊断,通过半自动化流程生成1.8k视频并标注2.4k问答对,评估音频视频信号保真度、时间属性一致性、社交互动和电影表现四个层面。
在细粒度图像任务上评估大型视觉-语言模型:全面评估
机构 * School of Computer Science and Engineering, School of Intelligence Science and Engineering and Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, China(东南大学计算机科学与工程学院、智能科学与工程学院及新一代人工智能技术及其跨学科应用关键实验室,中国) ; Wangxuan Institute of Computer Technology, Peking University, China(北京大学王轩计算机技术研究所,中国) ; University of Copenhagen, Denmark(丹麦哥本哈根大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 本文提出FG-BMK基准,通过101万问题和33万张图像评估LVLMs的语义识别与细粒度特征表示能力,揭示训练范式、模态对齐等对性能的影响,为未来模型设计提供指导。
Comments Accepted to ICLR 2026
NUTSHELL:用于从科学演讲中生成摘要的数据集
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CL
AI总结 本文提出NUTSHELL数据集,用于科学演讲摘要生成,通过建立基线模型和评估生成摘要质量,揭示SAG的挑战并促进改进模型和评估方法的发展。
MSR:用于带有标注数据集的颈椎脊柱CT-MRI刚-变形配准的混合场建模
机构 * School of Biomedical Engineering, Southern Medical University, Guangzhou, 510515, China.(南方医科大学生物医学工程学院) ; Guangdong Provincial Key Laboratory of Medical Image Processing, Guangzhou, 510515, China.(广东省医学图像处理重点实验室) ; Guangdong Province Engineering Laboratory for Medical Imaging(广东省医学影像与诊断技术工程实验室) ; Information Center, Nanfang Hospital, Southern Medical University, Guangzhou, 510515, China.(南方医科大学南华医院信息中心) ; Division of Spine Surgery, Department of Orthopaedics, Nanfang hospital, Southern Medical University, Guangzhou, Guangdong, 510515, China.(南方医科大学南华医院骨科脊柱外科)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 本文提出MSR框架,通过混合刚-变形配准方法提升颈椎脊柱CT-MRI配准精度,解决复杂结构配准难题。
评判,然后驾驶:一种以评判为中心的视觉语言动作框架用于自动驾驶
机构 * Bosch Research(博世研究院)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 本文提出CriticVLA框架,通过多模态评估和单步优化提升自动驾驶决策质量,实验显示其在复杂场景中性能显著优于现有方法。
Comments preprint
用于抑郁症检测和诊断的AI模型:综述
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 本文综述了55项研究中的最新AI方法,提出层次分类体系,揭示图神经网络、大语言模型和多模态融合三大趋势,提供数据集和评估指标,为计算精神病学未来创新提供路线图。
野外阅读识别
机构 * Meta Reality Labs Research(Meta现实实验室) ; VGG, University of Oxford(VGG,牛津大学) ; The Ohio State University(俄亥俄州立大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 本文提出阅读识别任务,通过多模态数据和Transformer模型实现对阅读行为的识别,扩展了阅读研究的规模和现实场景。
Comments NeurIPS 2025. Project Page: https://www.projectaria.com/datasets/reading-in-the-wild/
论文是否讲完了全部故事?一个用于揭示生物信息学中隐藏实现差距的基准和框架
机构 * Xi’an Jiaotong University(西安交通大学)
专题命中 多模态评测 :cross-modal(abstract)
AI总结 本文提出论文-代码一致性检测任务,构建首个生物信息学基准数据集BioCon,通过统一框架提升代码与论文的一致性与语义对齐。
InteractWeb-Bench: 多模态代理能否在交互式网站生成中避免盲目执行?
机构 * Shenzhen Institute of Advanced Technology Chinese Academy of Sciences(深圳先进技术研究院中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Dalian University of Technology(大连理工大学) ; UNSW Sydney(悉尼大学) ; Shenzhen University of Advanced Technology(深圳先进技术大学)
专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出InteractWeb-Bench,首个针对非专家低代码用户的多模态交互基准,通过模拟用户行为中的模糊性、冗余性和矛盾性,揭示前沿多模态大语言模型在意图识别和适应性交互上的局限。
Comments 21 pages, 13 figures, 7 tables
从提示到物理执行:LLM赋能机器人系统的整体威胁建模
机构 * School of Informatics, Computing, and Cyber Systems, Northern Arizona University(信息学、计算与网络系统学院,北亚利桑那大学) ; Department of Software Science, Tallinn University of Technology(软件科学系,塔林技术大学)
专题命中 多模态Agent :cross-modal(abstract);分类 cs.AI
AI总结 本文提出基于数据流图的LLM赋能机器人系统威胁分析方法,揭示了传统威胁、对抗威胁和对话威胁在感知-规划-执行流程中的交互与传播,首次完整分析了三个威胁类别在全系统中的跨边界攻击链。
Comments Submitted to 23rd Annual International Conference on Privacy, Security, and Trust (PST2026)
AutoSurfer -- 通过全面浏览、学习和建模教学网络代理
机构 * Microsoft Research(微软研究院)
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 AutoSurfer通过系统性广度优先探索策略、任务合成引导和轨迹优化,实现全面覆盖网站操作空间,提升网络代理轨迹生成的准确性和多样性。
Comments 21 pages, 3 figures
面向高效计算机使用代理的步骤级优化
机构 * Yale NLP Lab(耶鲁大学自然语言处理实验室) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 本文提出一种事件驱动的步骤级级联框架,通过动态分配计算资源提升计算机使用代理的效率,减少冗余计算并增强任务完成能力。
无需正态性:基于惩罚高斯混合的真效应分布估计
专题命中 多模态Agent :multimodal(abstract)
AI总结 本文提出基于惩罚高斯混合的方法,用于在不假设正态分布的情况下估计真效应分布,适用于大规模异质数据集,提高尾部概率和密度估计的准确性。
Comments 38 pages, 17 figures
结构溶解:人工智能如何解构协调架构并重构生产的政治经济
专题命中 多模态Agent :multimodal(abstract)
AI总结 本文提出结构溶解框架,探讨人工智能如何重构传统产业的协调架构,通过内部化人类多模态接口,导致生产关系的质变,产生四个主要转变:企业与行业边界的消解、价值创造从物理资源和人力协作转向持续的数据流、领域特定数据精炼基础设施的兴起以及区域数据主权实体的出现。