arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-12 至 2026-08-12 共收录 98 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 4 篇

2608.10665 2026-08-12 cs.AI cs.CV cs.GT 新提交 84%

VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus

VERDICT:基于分歧感知共识的多模态推理无训练逐步验证方法

Rohit Sinha, Kunal Tilaganji, Tanuja Ganu, Nagarajan Natarajan, Amit Sharma, Vineeth Balasubramanian

机构 * Indian Institute of Technology, Hyderabad(印度理工学院海得拉巴分校) Microsoft Research(微软研究院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对多模态大语言模型推理链易出错的问题,提出无训练的VERDICT方法,利用跨模态分歧的闭式解计算共识评分,在六个基准上提升最高达5.95%,性能接近需大量监督的特定领域评论家。

Comments European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10857 2026-08-12 cs.LG 新提交 78%

FiGuRO: Intrinsic Dimension Estimation for Multi-Modal Data

FiGuRO:面向多模态数据的本征维度估计

Viktoria Schuster, Sana Tonekaboni, Caroline Uhler

专题命中 跨模态检索 :multi-modal(title,abstract)

AI总结 本研究提出FiGuRO框架,用于在模型容量与超参数约束下估计单/多模态数据的本征维度,可实现共享与私有信息解耦,性能优于现有技术且可应用于单模态预训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10524 2026-08-12 cs.CV cs.AI 新提交 62%

Rethinking Text-Based Image Retrieval in Specific Domain

重新思考特定领域的基于文本的图像检索

Jingyang Tan, Sheng Yang, Yuanpeng Chen, Jian Wang, Nianjin Ye, Chen Xing, Lanpeng Jia

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 针对现有TBIR基准的单匹配假设无法适配监控等特定领域的问题,构建了SecMM-TBIR基准,提出SAFT框架解决特定领域TBIR的语义压缩问题,在SecMM-TBIR上平均提升mAP@20达7.8点且优化通用领域性能。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11030 2026-08-12 cs.IR cs.CL 新提交 57%

Self-Knowledge Retrieval Augmented Generation Framework for Patent Matching

用于专利匹配的自知识检索增强生成框架

Jian Zhang, Songlin Lei, Zhuohao Yang, Bangli Liu, Ziwei Wang, Xufeng Weng, Gehan Amaratunga, Yu Lin, Hongwei Wang

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL

AI总结 针对专利匹配的LLM方法存在成本高、易遗忘等问题,本文提出自知识RAG框架,结合FAISS检索与生成式匹配机制,在真实专利数据集上提升了检索匹配准确率。

Comments Accepted by IEEE CSCWD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态生成 10 篇

2605.02937 2026-08-12 cs.LG cs.AI cs.CE 版本更新 84%

Proteo-R1: Reasoning Foundation Models for De Novo Protein Design

Proteo-R1:用于从头蛋白质设计的推理基础模型

Fang Wu, Weihao Xuan, Heli Qi, Hanqun Cao, Heng-Jui Chang, Zeqi Zhou, Haokai Zhao, Ma Jian, Carl Ma, Yu-Chi Cheng, Kuan Pang, Xiangru Tang, Zehong Wang, Guanlue Li, Hanchen Wang, Kejun Ying, Pan Lu, Chiho Im, Seungju Han, Peng Xia, Tinson Xu, Yinxi Li, Deyao Zhu, Pheng-Ann Heng, Naoto Yokoya, Masashi Sugiyama, Li Erran Li, Jure Leskovec, Yejin Choi

专题命中 多模态生成 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.AI

AI总结 针对现有从头蛋白质设计模型缺乏推理能力的问题,本文提出 Proteo-R1 双专家架构框架,通过 MLLM 识别关键功能残基作为硬约束,结合扩散模型实现稳定可解释的蛋白质设计。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03922 2026-08-12 cs.CL cs.AI cs.CV 版本更新 82%

HSSBench: Benchmarking Humanities and Social Sciences Ability for Multimodal Large Language Models

HSSBench: 多模态大语言模型在人文学与社会科学能力评估中的基准测试

Zhaolu Kang, Junhao Gong, Jiaxu Yan, Wanke Xia, Yian Wang, Ziwen Wang, Huaxuan Ding, Zhuo Cheng, Wenhao Cao, Zhiyuan Feng, Siqi He, Shannan Yan, Junzhe Chen, Xiaomin He, Chaoya Jiang, Wei Ye, Kaidong Yu, Xuelong Li

机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院) Tsinghua University(清华大学) Chinese Academy of Sciences(中国科学院) University of British Columbia(不列颠哥伦比亚大学) Renmin University of China(中国人民大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 HSSBench是一个专门评估多模态大语言模型在人文学与社会科学任务能力的基准测试,包含多语言样本,通过协作生成数据提升跨学科推理能力。

Comments ICLR 2026 (OpenReview: https://openreview.net/forum?id=iQsKotob31)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10291 2026-08-12 cs.CV cs.AI cs.LG 新提交 81%

MRIComp4Flow: Compression of 3D Brain MRI for Training Multi-Modal Generative Models

MRIComp4Flow:用于训练多模态生成模型的三维脑部MRI压缩

Lisa K. Fischer, Mykhailo Riabets, Daniel Rueckert, Benedikt Wiestler, Anke Meyer-Baese, Sandeep Nagar

机构 * Technical University of Munich (TUM)(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Imperial College London(帝国理工学院) Florida State University(佛罗里达州立大学) Institute for Advanced Study, TUM (TUM-IAS)(慕尼黑工业大学高等研究院) TUM University Hospital(慕尼黑工业大学医院)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究针对大规模多模态MRI的存储与I/O问题,采用JPEG2000或JPEG-LS压缩三维脑肿瘤MRI,在20:1压缩率下训练Wavelet Flow Matching模型,证实其合成质量与未压缩数据训练的模型相当,为可扩展三维MRI生成建模提供了实用方案。

Comments Accepted: MICCAI 2026 SASHIMI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10129 2026-08-12 cs.CV cs.AI 版本更新 81%

LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning

LaViT:对齐潜在视觉思维以进行多模态推理

Linquan Wu, Tianxiang Jiang, Yifei Dong, Haoyu Yang, Fengji Zhang, Shichaang Meng, Ai Xuan, Linqi Song, Jacky Keung

机构 * City University of Hong Kong(香港城市大学) University of Science and Technology of China(中国科学技术大学) Utrecht University(乌特勒支大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 LaViT通过对齐潜在视觉思维提升多模态推理能力,实现视觉感知增强和模型性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10983 2026-08-12 cs.IR cs.AI 新提交 79%

TimeRoute: Time-Aware Modality Routing and Diffusion for Multi-Modal Recommendation

TimeRoute:面向多模态推荐的时间感知模态路由与扩散模型

Pengyu Zhang, Yangqin Jiang, Klim Zaporojets, Congfeng Cao, Paul Groth

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI

AI总结 TimeRoute通过时间感知模态路由器和带FiLM的双流去噪扩散图重构器,解决多模态推荐的模态时间尺度不匹配问题,在三个公开数据集上提升了推荐指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23548 2026-08-12 cs.LG cs.AI 79%

Disentanglement of Variations with Multimodal Generative Modeling

Yijie Zhang, Yiyang Shen, Weiran Wang

机构 * Department of Computer Science University of Iowa(计算机科学系 印第安纳大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

Comments 22 pages, 14 figures, 7 tables

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08494 2026-08-12 cs.CV 版本更新 70%

Linguistically-Aligned and Visually-Grounded Preference Optimization for Clinically-Augmented Medical Report Generation

面向临床增强型医疗报告生成的语言对齐与视觉 grounded 的偏好优化

Qiang Hu, Yuxuan Luo, Yingjie Guo, Hao Wang, Qimei Wang, Qiang Li, Zhiwei Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对现有医疗报告生成方法的临床事实错误与视觉-语言对齐不足问题,提出DPO-Clin框架,通过ECD模块、M²DPO及反事实偏好数据构建提升模型可靠性,在多医学数据集上取得优异性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23452 2026-08-12 cs.CV cs.CL 版本更新 62%

FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing

FoR-SALE:基于参考坐标系引导的LLM驱动扩散编辑中的空间调整

Tanawan Premsri, Parisa Kordjamshidi

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 FoR-SALE是SLD的扩展,通过参考坐标系引导的潜在空间操作调整图像朝向与深度,在三个空间理解基准上仅单轮校正就将SOTA T2I模型性能提升最高7.0个百分点,解决了非相机视角空间表达的生成偏差问题。

Comments Published in COLM 2026. 10 main pages, 4 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22525 2026-08-12 cs.CV 版本更新 57%

DreamOmni3: Scribble-based Editing and Generation

DreamOmni3:基于涂鸦的编辑与生成

Bin Xia, Bohao Peng, Jiyang Liu, Sitong Wu, Jingyao Li, Junjia Huang, Xu Zhao, Yitong Wang, Ruihang Chu, Bei Yu, Jiaya Jia

机构 * CUHK(香港中文大学) ByteDance Inc(字节跳动公司) HKUST(香港科技大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 DreamOmni3通过结合文本、图像和自由手绘涂鸦,实现更灵活的图形用户界面编辑与生成,解决了复杂编辑任务中的数据创建和框架设计问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04235 2026-08-12 cs.ET 版本更新 50%

Scale-CDA: A Scalable Retrofit Platform for Cooperative Driving Automation in Production Vehicles

Scale-CDA:一款用于量产车的、可扩展的原型,旨在普及AI辅助的协同驾驶自动化(CDA)

Hao Zhou, Shengming Yuan, Yuhang Wang, Alina Hagen, Haibin Wen

专题命中 多模态生成 :MLLM(abstract_cn)

AI总结 本研究提出Scale-CDA这一开源工具链,基于OpenDBC与Openpilot构建,成本低于1000美元,可实现AI辅助CDA的即插即用改装,通过多车辆测试验证了其低时延与数据隐私保护能力,为普及协同自动驾驶提供了实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态评测 18 篇

2608.10724 2026-08-12 cs.CV 新提交 83%

InterPruner: Interactive Structured Pruning via Taylor-Implicit Criterion and Language-Prior Modulator for Multimodal Object Detection

InterPruner:面向多模态目标检测的、基于泰勒隐式准则与语言先验调制器的交互式结构化剪枝框架

Qi Ming, Zihan Yang, Shaoguang Huang, Si Sun, Hanqing Zhang, Nanqing Liu, Jiahui Lv, Juan Fang, Aleksandra Pizurica

机构 * Beijing University of Technology(北京工业大学) Southwest University(西南大学) China University of Geosciences Wuhan(中国地质大学(武汉)) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Yunnan Normal University(云南师范大学) Beijing Forestry University(北京林业大学) Ghent University(根特大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出首个面向红外-可见光目标检测器的交互式结构化通道剪枝框架InterPruner,结合TIC、MIRA、SPCA方法,在FLIR数据集剪枝50%通道时mAP提升0.6%,代码将发布于GitHub。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10954 2026-08-12 cs.CV cs.AI 新提交 81%

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

复杂城市场景中基于证据的可信多模态推理与评估基准

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tencent CDG(腾讯云与智慧产业事业群) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对复杂城市场景中多模态大语言模型的推理可靠性问题,提出AD2-Bench基准与EGVOR模型,提升了不利条件下的多模态推理稳定性。

Comments Accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11533 2026-08-12 cs.CL cs.CV 版本更新 81%

Checkup2Action: A Multimodal Clinical Check-up Report Dataset for Patient-Oriented Action Card Generation

Checkup2Action:面向患者行动的多模态临床检查报告数据集

Sike Xiang, Shuang Chen, Kevin Qinghong Lin, Jialin Yu, Yijia Sun, Philip Torr, Amir Atapour-Abarghouei

机构 * Durham University(杜伦大学) University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出Checkup2Action数据集,用于生成结构化的行动卡,通过多模态检查报告生成患者导向的行动建议,评估行动的准确性、优先级和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11149 2026-08-12 cs.CV 新提交 79%

PRMU: A Corpus-Free Benchmark for Person-Centric Knowledge Unlearning in Multimodal Large Language Models

PRMU:面向多模态大语言模型中以人为中心的知识遗忘的无语料基准

Huafeng Chen, Yueming Lyu, Ziyuan Chen, Wenda Tan, Chenyang Si, Liucheng Guo, Caifeng Shan

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有多模态大语言模型(MLLMs)遗忘方法依赖语料的局限,提出无语料基准PRMU及基线SGPE,实验显示SGPE在目标遗忘、局部性保留等方面权衡更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10796 2026-08-12 cs.CV 新提交 79%

E$^3$mo-Bench: A Scalable Benchmark for Multimodal Evoked and Expressed Emotion Understanding via Bayesian Pairwise Alignment

E³mo-Bench:基于贝叶斯成对对齐的可扩展多模态诱发与表达情感理解基准

Lancheng Gao, Ziheng Jia, Shengyan Li, Zixuan Xing, Jiarui Wang, Huiyu Duan, Xiongkuo Min

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对现有多模态情感理解基准的不足,推出E³mo-Bench基准,提出贝叶斯成对对齐方法与E³mo-Score智能体,验证了框架有效性并指出MLLMs在情感任务中的缺陷,为多模态情感智能发展指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10680 2026-08-12 cs.CV 新提交 79%

Bridging Severe Cross-Modal Misalignment: End-to-End Visible-Infrared Object Detection via Explicit Feature-Domain Affine Registration

缓解严重跨模态错位:通过显式特征域仿射配准实现端到端可见光-红外目标检测

Qi Ming, Yuyang Wang, Mingjing Zhao, Yifan Xiao, Zhixin Guo, Zhiqiang Zhou, Peng Sun, Juan Fang, Fuqiang Yang, Xudong Zhao

机构 * Beijing University of Technology(北京工业大学) Central South University(中南大学) Beijing Electronics Science & Technology Institute(北京电子科学技术研究所) China Aerospace Science & Industry Corporation(中国航天科技集团) Beijing Institute of Technology(北京理工大学) Information Support Force Engineering University(信息支援部队工程大学) Trunk Technology (Beijing) Co., Ltd.(trunk技术(北京)有限公司)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对可见光-红外目标检测的严重跨模态错位问题,提出JFRDet网络,含CMAA、IGCF、AQCG模块,构建DVMA基准,在该基准上达到69.7% mAP₅₀的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08326 2026-08-12 cs.AI 版本更新 79%

StructReward: Efficient Structured Process Rewards for Self-Correcting Multimodal Reasoning

StructReward:用于自修正多模态推理的高效结构化过程奖励

Yifan Li, Ruxin Sun, Tongzhou Zhao

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究提出StructReward框架,通过结构化步骤级奖励对齐结合GRPO目标等方式,在无额外验证器的情况下降低多模态强化学习开销,实现自修正多模态推理。

Comments 9 pages, 3 figures. Yifan Li and Ruxin Sun contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10825 2026-08-12 eess.SY cs.SY 新提交 78%

Cross-modal topology decodes battery faults from sparse voltage snapshots

跨模态拓扑从稀疏电压快照解码电池故障

Jinwen Li, Yunhong Che, Simona Onori, Weihan Li, Xiaosong Hu

专题命中 多模态评测 :cross-modal(title,abstract)

AI总结 本研究针对EV电池安全瓶颈,提出跨模态诊断框架DeFault,通过将电压序列展开为相空间拓扑解码故障,在99辆EV的1640万条数据上对四种故障类型平均准确率达0.96,无需新增传感器即可实现高可解释性故障诊断。

Comments 33 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10127 2026-08-12 astro-ph.CO 新提交 78%

Evaporation of Primordial Black Holes with Multimodal Mass and Extended Spin Distributions: Cosmological Imprints on the Effective Number of Relativistic Species

多模态质量与扩展自旋分布的原初黑洞蒸发:对有效相对论粒子数的宇宙学印记

T. Toghrai, A. Daassou, Y. Ouchhaine, H. Laassiri, R. Benbrik

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究构建FRISHBEE代码实现多模态质量函数与扩展自旋分布,计算原初黑洞蒸发对有效相对论粒子数$\Delta N_{\rm eff}$的影响,发现质量分布和自旋会改变$\Delta N_{\rm eff}$,其可作为原初黑洞形成通道的判别依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10706 2026-08-12 cs.CV cs.MM 新提交 76%

MMArt A Multi-Perspective Multimodal Dataset for Visual Art Understanding

MMArt:用于视觉艺术理解的多视角多模态数据集

Shuai Wang, Wangyuan Ding, Yixian Shen, Jia-Hong Huang, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) Amazon AGI(亚马逊AGI) College of Business and Economics, University of Johannesburg(约翰内斯堡大学经济与商学院)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.MM

AI总结 针对现有艺术数据集单视角局限,推出含74234幅WikiArt画作的多视角多模态数据集MMArt,通过分析各视角特性证实多视角设计的必要性,为视觉艺术理解提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08991 2026-08-12 cs.CV cs.AI 版本更新 66%

PinpointQA: A Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos

PinpointQA: 一个用于室内视频中微小物体中心空间理解的数据集和基准

Zhiyu Zhou, Peilin Liu, Ruoxuan Zhang, Luyang Zhang, Cheng Zhang, Hongxia Xie, Wen-Huang Cheng

机构 * Jilin University(吉林大学) National Taiwan University(国立台湾大学)

专题命中 多模态评测 :multimodal(abstract,comments);分类 cs.CV、cs.AI

AI总结 本文提出PinpointQA数据集,用于评估多模态大语言模型在室内视频中对微小物体空间定位的精准理解能力,通过四个递进任务验证模型性能,并展示其作为诊断基准和训练数据集的效果。

Comments Accepted at the ECCV 2026 Workshop on Embodied Multimodal Reasoning in Physical Environments (EMR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10964 2026-08-12 cs.CV cs.AI 新提交 62%

CARE: Confidence-Aware Reasoning for Reliable Medical VQA

CARE:用于可靠医学视觉问答的置信感知推理

Yuetian Du, Yucheng Wang, Zhenyuan Chen, Luyuan Chen, Rongyu Zhang, Jinjian Zhang, Wei Zhou, Zhijie Xu, Ming Kong, Zhan Zhou, Jie Liu, Qiang Zhu

机构 * Ant Group(蚂蚁集团) University of Michigan(密歇根大学) City University of Hong Kong(香港城市大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对医学多模态大语言模型的置信度校准问题,提出CARE框架,通过双阶段流程优化准确率与校准度,在三个医学VQA基准上取得最优性能,为临床决策支持提供可信基础。

Comments Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06110 2026-08-12 cs.AI cs.CL 版本更新 62%

ECHO: A Locally-Deployable Agentic Health Assistant with Temporal Memory, Safety Guardrails, and Speech Assessment

ECHO:具备时序记忆、安全护栏与语音评估功能的本地可部署智能体式健康助手

Abdulkadir Külçe, Alihan Esen, Çağla Fikir, Berke Kurt, Kuzey Arar, Gökhan Ercan, Faik Boray Tek

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出具备时序记忆、安全护栏与语音评估功能的本地可部署智能体式健康助手ECHO,其核心聊天机器人、安全层、语音评估模块均达特定性能指标,且可在消费级硬件运行,符合数据保护法规。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02892 2026-08-12 cs.CV 版本更新 57%

Modeling Scientific Experiment Scenes: Dataset and Model

科学实验场景建模:数据集与模型

Minghao Zou, Qingtian Zeng, Shangkun Liu, Cong Liu, Paul L. Rosin, Guanghui Yue, Jun Liu, Wei Zhou

机构 * College of Computer Science and Engineering, Shandong University of Science and Technology(山东科技大学计算机科学与工程学院) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) ABC FINTECH Company Limited(ABC金融科技有限公司) NOVA Information Management School, Universidade Nova de Lisboa(里斯本新大学NOVA信息管理学院) School of Biomedical Engineering, Shenzhen University(深圳大学生物医学工程学院)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 针对现有SGG基准忽略科学实验场景的问题,构建首个物理实验场景SGG数据集PhysScene,并提出跨模态双路径生成器CM-DPG,在PhysScene和VG150上取得具竞争力的SGG性能。

Comments The authors have identified issues that require substantial revision and have therefore decided to withdraw the current version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11470 2026-08-12 cs.CL 版本更新 57%

The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes

LLM推理的周期表:推理范式、方法与失败模式的结构化综述

Avinash Anand, Mahisha Ramesh, Avni Mittal, Ashutosh Kumar, Rishitej Reddy Vyalla, Erik Cambria, Zhengkui Wang, Timothy Liu, Aik Beng Ng, Simon See, Rajiv Ratn Shah

机构 * Singapore Institute of Technology(新加坡理工大学) Nvidia AI Center (SNAIC)(英伟达人工智能中心(SNAIC)) MIDAS Lab, IIIT Delhi(IIIT德里MIDAS实验室) MIDAS Lab, IIT Mandi(IIT曼迪MIDAS实验室) Owl Autonomous Imaging, Inc.(Owl自主成像公司) College of Computing & Data Science, NTU Singapore(新加坡南洋理工大学计算与数据科学学院) NVIDIA AI Technology Centre, Singapore(英伟达新加坡人工智能技术中心) Department of Computer Science and Engineering, IIT Kanpur(IIT坎普尔计算机科学与工程系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文系统综述了300多篇论文,提出LLM推理研究的结构化分类法,涵盖多种推理范式,分析方法论趋势,并总结常见限制与失败模式,旨在为开发更鲁棒、可解释和可泛化的推理系统提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09942 2026-08-12 cs.SE cs.AI 版本更新 57%

Anomaly Detection and Root Cause Analysis for Microservice Systems

微服务系统的异常检测与根因分析

Luan Pham

机构 * Viet Nam National University Ho Chi Minh City - University of Technology (HCMUT)(越南国家大学胡志明城-技术大学(HCMUT)) School of Computing Technologies(计算技术学院) College of Science, Technology, Engineering and Maths(科学、技术、工程和数学学院) Royal Melbourne Institute of Technology (RMIT University)(皇家墨尔本理工学院(RMIT大学))

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 针对微服务系统异常检测与根因分析的五大局限性,提出端到端方法BARO、EventADL和TORAI,并构建基准RCAEval,通过实验验证有效性与鲁棒性。

Comments This is the pre-print of my PhD thesis, submitted to RMIT University

详情

展开后加载摘要…

URL PDF HTML 收藏