arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-10 至 2026-08-10 共收录 46 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2608.07282 2026-08-10 cs.CL cs.CV 新提交 73%

Gaze Behavior in Visual World Experiments Can be Modeled With Off-the-shelf Language-Vision Encoders

视觉世界实验中的注视行为可采用现成的语言-视觉编码器建模

Rahul Murali Shankar, Titus von der Malsburg, Sebastian Padó

机构 * University of Stuttgart(斯图加特大学)

专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 该研究提出结合CLIP双编码器与双模态归因方法的新方法,无需微调或生成式架构,即可复现经典视觉世界研究的人类注视行为预测结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06612 2026-08-10 cs.CV cs.AI 新提交 62%

SLED: Scalable Location Encoding via Distillation

SLED:通过知识蒸馏实现可扩展位置编码

Kevin Lane, Zhongying Wang, Esther Rolf, Morteza Karimzadeh

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对现有位置编码器计算成本高、扩展性差等问题,提出基于蒸馏的SLED,可灵活融入多模态地理空间数据,在19项基准任务上性能优于或媲美现有模型,大幅降低预训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06901 2026-08-10 cs.CV cs.LG 新提交 57%

Prune Once: Retraining-Free Task-Agnostic Pruning for Vision-Language Models

一次剪枝:面向视觉-语言模型的无需重训练的任务无关剪枝

Minseok Kang, Hyunwoo Kim, Chanyoung Kim, Minwoo Kim, Jaekoo Lee, Dahuin Jung

机构 * Chung-Ang University(中央大学) Soongsil University(崇实大学) Kookmin University(国民大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出名为PORTA的无需重训练的任务无关VLM剪枝框架,通过自适应稀疏分配实现高压缩下的竞争力性能,支持高效VLM压缩。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 5 篇

2608.06930 2026-08-10 cs.CV 新提交 70%

AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward

AVCap:用细节感知奖励强化音视频联合字幕

Mingyang Wu, Kaituo Feng, Bohao Li, Kaixiong Gong, Zihao Yin, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MMLab) Peking University(北京大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 针对音视频联合字幕的数据集、奖励信号、评估基准的局限,提出AVCap-100K数据集、AVCap模型及专用基准指标,通过Da-GRPO优化的AVCap模型性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06773 2026-08-10 cs.CV 新提交 70%

AnyTrack: Unifying Visual Object Tracking with Any Modalities

AnyTrack:用任意模态统一视觉目标跟踪

Hao Li, Yunzhi Zhuge, Wenning Hao, Pingping Zhang, Xiaoxiong Zhang, Dong Wang, Huchuan Lu

机构 * Army Engineering University of PLA(中国人民解放军陆军工程大学) Dalian University of Technology(大连理工大学) National University of Defense Technology(国防科技大学)

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对现有多模态目标跟踪器适配性与泛化性差的问题,提出AnyTrack框架,通过MIM与CUM模块实现任意模态的统一跟踪,扩展基准后实验验证其性能先进、灵活有效。

Comments Accepted by ACM MM2026. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06900 2026-08-10 cs.SD eess.AS 新提交 57%

MMAG: A Multi-Control Mixed Audio Generation Benchmark

MMAG:多控制混合音频生成基准

Zihao Zheng, Xuenan Xu, Jiahao Mei, Yixuan Li, Minghao Lv, Wen Wu, Chao Zhang, Mengyue Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本研究针对现有音频生成基准的不足,推出MMAG混合音频生成基准,构建含4000个标注音频的数据集,提出系统评估协议,测试发现各类模型在多控制能力间存在性能权衡,为该领域提供综合基准。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06632 2026-08-10 cs.AI 新提交 57%

Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation

塑造你的信息流:一种基于大语言模型的智能体对话推荐系统

Ziyun Xu, Bosen Ding, Yue Zhang, Ji Qi, Qingyuan Song, Jizhou Huang, Liwei Wang, Jefferey Santelli, Yue Weng, Qichao Que, Zhenheng Yang, Junfeng Pan, Linhong Zhu

机构 * Meta Platforms(元平台公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出基于LLM的智能体推荐框架SYF,采用三层架构实现实时多模态内容协同策划,经离线评估与在线A/B实验验证,可提升信息流相关性与用户情感,为工业场景提供交互式推荐方案。

Comments Accepted in RecSys 2026 Industrial Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06633 2026-08-10 cs.SD 新提交 50%

Frame-Level Pansori Mode Classification with Complementary Audio Representations

基于互补音频表示的帧级盘索里调式分类

Sangheon Park, Seonguk Ju, Suin Chung, Danbinaerin Han, Dasaem Jeong

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 本研究针对韩国传统声乐盘索里,采用46小时帧级标注与4种互补音频表示,构建调式分类模型,验证其学习调式特征而非记忆曲目,揭示了源分离对线索的影响及预训练的局限性。

Comments Accepted to the 27th International Society for Music Information Retrieval (ISMIR) Conference, 2026

Journal ref ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 4 篇

2608.06973 2026-08-10 cs.CV 新提交 79%

When One Modality Is Not Enough: Multimodal Sex and Life-Stage Classification of Red Deer from Aerial RGB-Thermal Video

当单模态不够时:基于航拍RGB-热红外视频的马鹿多模态性别与生命阶段分类

Hugo Markoff, Christoph Praschl, Ivan Ludoški, Sara Beery, Michael Ørsted, David C. Schedl

机构 * Aalborg University(奥尔堡大学) University of Applied Sciences Upper Austria(上奥地利应用科学大学) University of Novi Sad(诺威萨德大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究以马鹿为对象,融合航拍RGB与热红外视频的自监督DINOv3特征,构建多模态分类流程,在四次飞行中实现26只个体25只的正确分类,提升了种群性别与生命阶段分类的鲁棒性,可自动化获取兽群结构数据。

Comments Accepted at the ECCV 2026 Workshop on Computer Vision for Ecology (CV4Ecology), archival proceedings track. 17 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07417 2026-08-10 cs.CV cs.AI 新提交 73%

I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning

我在视频中寻找你:面向以人为中心的视频推理的身份条件查询

Shibo Gao, Chongxiao Wang, Chenglong Huang, Jie Ma, Haolin Shi, Fei Ding, Jing Li, Qiang Lyu, Yangyang Liu, Yang Liu, Jun Liu, Linlin Huang, Peipei Yang

机构 * Beijing Jiaotong University(北京交通大学) HUJING Digital Media & Entertainment Group(汇晶数字媒体与娱乐集团) MAIS Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究提出了身份条件查询(ICQ)任务,构建了ISYV基准、训练集与框架,实验显示主流多模态大语言模型在该任务上表现不佳,ISYV模型性能优于强基线且接近闭源模型。

Comments Accepted to ACM Multimedia 2026 (MM '26). 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06407 2026-08-10 cs.CV cs.AI 新提交 62%

TransSLR: A Lightweight Transformer for Sign Language Recognition

TransSLR:用于手语识别的轻量级Transformer

Lucia Yen Wanchi, Samuel Johnny, Victor Tolulope Olufemi, Emmanuel Aaron, Moise Busogi

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对CASL手语识别的低准确率问题,提出轻量级Transformer模型TransSLR,在CASL-W60基准上取得80.39%的最新准确率,且计算开销低,适用于资源受限环境。

Comments This paper has been accepted for oral presentation at Deep Learning Indaba 2026 which will be hosted on the IJCAI hosting platform. paper link: https://chairingtool.com/conferences/dli2026/main-track/submissions/356

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06783 2026-08-10 eess.SP 新提交 50%

Design and Validation of a Portable EEG-tES Platform Supporting High-Rate EEG Recording and Temporal Interference Stimulation

支持高速脑电图记录和时间干扰刺激的便携式脑电图-经颅电刺激平台的设计与验证

Le Xing, Maoxing Liang, Disi A, Yifei Jia, Gaoxiang Xie, Linfeng Xu, Xiang'ao Chen, Jiebin Shi, Gang Pan, Bicheng Han

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究设计并验证了一款以MCU为核心的便携式EEG-tES平台,集成8通道EEG采集与2通道tES功能,具备高信号保真度与低刺激误差,为便携式闭环神经调控系统提供了实用基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 4 篇

2608.06516 2026-08-10 cs.LG cs.AI 新提交 83%

CertBind from Multimodal Connectivity to Certifiable Retrieval Decisions

CertBind:从多模态连接到可验证的检索决策

Shuheng Cao, Zhenhao Zhang, Ruiqi Chen, Renjie Cao, Weijia Zhang, Siyu Zhang, Jiaxin Liu, Xiangyu Zeng, Haotian Geng, Fan Gu

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 该研究提出CertBind多尺度理论,解决多模态编码器组合后的检索决策可验证问题,通过多尺度设计实现误差控制与恢复,在实验中验证了其对原生检索能力的可控性与无损害性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06943 2026-08-10 cs.CV 新提交 79%

Dual-Space Modality Consistency Learning for Universal Cross-Modal Re-Identification

用于通用跨模态行人重识别的双空间模态一致性学习

Yujian Zhao, Yukang Zhao, Hankun Liu, Haoxuan Xu, Bo Li, Hanzi Wan, Guanglin Niu

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) School of Humanities and Social Sciences, Beihang University(北京航空航天大学人文与社会科学高等研究院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Informatics, Xiamen University(厦门大学信息学院)

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出DSMCL即插即用框架,联合建模空间与频域一致性,在5个数据集的17项协议上提升跨模态ReID基线性能,适配多样化异构模态场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07067 2026-08-10 cs.AI cs.CL cs.IR cs.MM 新提交 78%

DocMemo: Dynamic Evidence Discovery via Probabilistic Memory-Guided Retrieval for Multi-Modal Document Understanding

DocMemo:面向多模态文档理解的概率记忆引导检索动态证据发现框架

Hanshu Yao, Janfeng Zhong, Niu Lian, Jinpeng Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 跨模态检索 :multi-modal(title);分类 cs.CL、cs.AI、cs.MM

AI总结 针对长文档理解的静态检索与跨轮记忆局限,提出记忆引导框架DocMemo,通过三层记忆与多轮优化实现动态证据发现,在3个基准上取得SOTA性能。

Comments DocMemo is a memory-guided framework for long-document reasoning that uses tri-level memory and dynamic Bayesian belief updating to overcome static retrieval limits and improve evidence tracking. 16 pages, 4 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07291 2026-08-10 cs.CV 新提交 74%

Foundation Models Adaptation for Multi-View Multi-modal Cardiac MRI Segmentation and Direct Ejection Fraction Estimation

基础模型在多视图多模态心脏MRI分割与直接射血分数估算中的适配

Sina Amirrajab, Cian M Scannell, Volker Vehof, Michael Bietenbeck, Ali Yilmaz

机构 * Maastricht University(马斯特里赫特大学) University Hospital Münster(明斯特大学医院) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 跨模态检索 :multi-modal(title);分类 cs.CV

AI总结 本研究针对CMR-Multi挑战,微调CineMA并组合冻结CMR基础模型,实现多视图CMR分割与直接LVEF估算,验证了基础模型适配多视图CMR分析的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 6 篇

2608.06770 2026-08-10 cs.AI cs.CV 新提交 81%

Surg-UniWorld: A Unified Surgical World Model with Multimodal Control Experts

Surg-UniWorld:具有多模态控制专家的统一外科世界模型

Rulin Zhou, Wanhao Liu, Guoheng Ma, Liangjin Shao, Qiujie Song, Yidu Wang, Guankun Wang, Tong Chen, Long Bai, Luping Zhou, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院) the University of Sydney(悉尼大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出Surg-UniWorld统一外科世界模型,构建Chlec80-SurgWAM基准,经实验证实其在可控外科视频生成相关指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06722 2026-08-10 cs.HC 新提交 75%

CustomDance: Customized 3D Dance Generation with Coarse-to-Fine Human-Centered Interactive Control

CustomDance:基于以人为中心的粗到细交互式控制的定制化3D舞蹈生成

Xulong Tang, Kaixing Yang, Xiaohu Guo, Prabhakaran Balakrishnan, Rawan Alghofaili

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract)

AI总结 CustomDance是基于粗到细交互式控制的定制化3D舞蹈生成系统,通过三阶段流程实现AI辅助编舞,在定量和定性比较中优于基线,为用户提供全面控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06917 2026-08-10 cs.AI 新提交 70%

ReGraph: Learning to Generate Recipe Graphs from Food Images

ReGraph:从食物图像生成食谱图的学习方法

Guoshan Liu, Bin Zhu, Pengkun Jiao, Jingjing Chen, Chong-Wah Ngo, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信体智能研究院) Singapore Management University(新加坡管理大学)

专题命中 多模态生成 :multimodal(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对现有食谱生成方法的过程结构捕捉不足问题,构建了ReGraph食谱图数据集并提出RGL两阶段框架,可让LMM从食物图像生成结构化食谱图,提升了烹饪实体与过程关系的生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07006 2026-08-10 cs.CL cs.CV 新提交 62%

Does More Retrieved Evidence Help Visual Retrieval-Augmented Generation with Diffusion Language Models?

更多检索到的证据是否有助于基于扩散语言模型的视觉检索增强生成?

Jiankun Wang, Yisen Gao, Ziwei Zhang, Xingcheng Fu, Jiaxin Bai, Chen Gao

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 针对基于扩散语言模型的视觉检索增强生成,研究发现无条件扩大检索证据会因语义冲突降低准确率,提出无需训练的基于熵的候选过滤框架,可平均提升答案准确率2.62个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06967 2026-08-10 cs.CL 新提交 57%

Can Language Models Imagine Without Seeing? Ekphrasis: Measuring Visual Creative Ideation in Text-Only LLMs

语言模型无需视觉输入即可进行想象?Ekphrasis:测量仅文本大型语言模型的视觉创意构想能力

Hongyu Luo, He Wang, Huihao Jing, Hong Ting Tsang, Yuxuan Liu, Wuganjing Song, Yauwai Yim, Chunyang Li, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CL

AI总结 本研究推出基准Ekphrasis,测量仅文本大型语言模型的视觉创意构想能力,发现该能力与流畅度分离,且其排序可跨模态稳定存在。

Comments 25 pages, 4 main figures, with appendices. Code and data: https://github.com/Imhongyu/Ekphrasis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06878 2026-08-10 cs.CV 新提交 57%

ControlRef: Efficient Layout-Guided Multi-Instance Generation via Anchored 4D-RoPE

ControlRef:基于锚定4D-RoPE的高效布局引导多实例生成

Yunkai Yang, Yudong Zhang, Xinying Chen, Haoyuan Liang, Yizhuo Niu, Jinshuai Cheng, Kunquan Zhang, Liziyue Fang, Weitao Wan, Runmin Dong

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 ControlRef是一种高效布局引导多实例合成框架,通过UILC注意力掩码与锚定4D-RoPE提升空间对齐,在保证视觉保真度和定位精度的同时大幅降低推理延迟与内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 9 篇

2608.07188 2026-08-10 cs.AI 新提交 79%

SetEasy: A Multi-Modal Classroom Engagement Assessment and Seating Optimization Framework

SetEasy:多模态课堂参与度评估与座位优化框架

Zhihao Xie, Hongye Yang, Shien Liu

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 SetEasy融合多模态感知与v-Gage模型,通过CP-SAT优化固定座位布局,在23名学生331个班级的四周部署中,将平均参与度从0.30提升至0.70,为课堂空间设计提供了可迁移路径。

Comments 18 pages, 4 figures, 2 tables. Published in the Proceedings of ASCAAD 2025

Journal ref Proceedings of the 13th International Conference of the Arab Society for Computation in Architecture, Art and Design (ASCAAD 2025), Riyadh, Saudi Arabia, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06934 2026-08-10 cs.LG cs.CV 新提交 79%

Walkable to Whom? Capturing Subjective Variability in Walkability Perception Using Multimodal Deep Learning

对谁而言是可步行的?使用多模态深度学习捕捉步行感知中的主观变异性

Moloud Damandeh, Meead Saberi

机构 * School of Civil and Environmental Engineering, University of New South Wales (UNSW)(新南威尔士大学土木与环境工程学院) Research Centre for Integrated Transport Innovation (rCITI)(综合交通创新研究中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究构建含29870条评分的步行性数据集,提出用户条件多模态深度学习框架,发现人行道图像评分更高,模型一致性提升65%,助力构建更包容的行人环境评估模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06769 2026-08-10 cs.CV 新提交 79%

GraphVerse: A Comprehensive Visual Graph Reasoning Benchmark for Multimodal Large Language Models

GraphVerse:面向多模态大语言模型的综合性视觉图推理基准

Yuanfu Sun, Yuanhang Ren, Kang Li, Chuanhao Ji, Jiaxi Li, Jiajin Liu, Ninghao Liu, Qiaoyu Tan

机构 * New York University(纽约大学) Sensetime Research(商汤科技研究院) Tsinghua University(清华大学) New York University Shanghai(上海纽约大学) University of Georgia(佐治亚大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有多模态大语言模型(MLLMs)评估缺乏结构化视觉推理测试的问题,提出GraphVerse基准,通过以图为中心的图像编辑(GIE)策略和VGR-Score指标,评估MLLMs在单/配对图像场景下的视觉图推理能力,揭示其相关局限并验证方法有效性。

Comments 33 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06406 2026-08-10 cs.CV cs.LG 新提交 79%

Deep Evidential Regression for Sparse Forest Height Estimation from Multimodal Satellite Imagery

基于多模态卫星图像的稀疏林高估计的深度证据回归

Laura Bader, Muhammad Ammar Ahmed, Xiao Xiang Zhu, Göran Kauermann

机构 * LMU Munich(慕尼黑大学) TU Munich(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究针对TreeUQ基准数据集,采用融合多模态卫星输入的U-Net架构,提出掩码证据损失函数,应用深度证据回归实现了树高与不确定性的联合预测,性能优于确定性模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06378 2026-08-10 cs.HC cs.AI 新提交 79%

Multimodal Drivers' Emotion Recognition and Safety-Oriented Intervention for Intelligent Transportation Systems

面向智能交通系统的多模态驾驶员情绪识别与安全导向干预

Chang Liu, Dalai Mengke, Hanbo Zhou, Jia Hu, Peter Mihajlik, Tamas Sziranyi

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究针对智能交通系统,提出安全优先的多模态驾驶员辅助框架,构建多模态数据集并引入CARE分数,实现环境风险报告与情绪感知调节的平衡,提供安全驱动的可行方向。

Comments 6 pages, 2 figures, IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07036 2026-08-10 cs.SE cs.CV 新提交 57%

CAS2UML: A Handwritten Sketch-to-PlantUML Dataset for Class and Activity Diagrams

CAS2UML:用于类图和活动图的手绘草图到PlantUML数据集

Simon Scholz, Mersedeh Sadeghi

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 CAS2UML是含557幅手绘类图与活动图及对应PlantUML代码的公开数据集,配套验证工具与脚本,可实现草图转UML方法的可复现基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07015 2026-08-10 cs.CV 新提交 57%

Understand Before Detect: Vision--Language Learning for Omni-Domain Infrared Small Target Detection

先理解再检测:用于全域红外小目标检测的视觉-语言学习

Haoyang Yuan, Boyang Li, Yingqian Wang, Yimian Dai, Nuo Chen, Xinfei Huang, Shuqi Yi, Zaiping Lin, Weidong Sheng, Wei An

机构 * National University of Defense Technology(国防科技大学) College of Computer Science, Nankai University(南开大学计算机学院) Peking University(北京大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对全域红外小目标检测的域偏移问题,提出“先理解再检测”范式及JinSight方法,构建视觉-语言数据集OmniIRST-VL,实现跨异构红外域的泛化检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06931 2026-08-10 cs.AI 新提交 57%

Science Edge Evaluation: SEE the Missing Step Toward Real Scientific Discovery

科学边缘评估:SEE——迈向真实科学发现的缺失环节

Taolin Han, Yuchen Zhang, Jinghang Wang, Yun Wu, Wai Yuet Chiu, Zhaohai Li, Yifei Zhang, Jinxin Wang, Yuhao Zhou, Chen Zhao, Jiajia Li, Jiaxin Li, Qile Jin, Kewei Sun, Shuang Wu, Weiqi Zhai, Renquan Lv, Junchao Li, Ruodan Chen, Qingteng Chen, Zhibo Yang, Hu Wei, Lin Qu, Shuai Bai, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) University of Alberta(阿尔伯塔大学) Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 该研究构建多模态基准SEE评估19个MLLMs,发现其仅达48.7%准确率,通用模型优于专用模型,工具使用可提至52.7%但仍难实现科学发现所需的证据约束推断,需从解释转向推导。

详情

展开后加载摘要…

URL PDF HTML 收藏