arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-15 至 2026-05-15 共收录 88 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 9 篇

2605.14059 2026-05-15 cond-mat.dis-nn stat.ML 50%

Finite-size scaling of hetero-associative retrieval in continuous-signal-driven Ising spin systems

异关联记忆在连续信号驱动的伊辛自旋系统中的有限尺寸缩放

Andrea Ladiana

专题命中 跨模态检索 :cross-modal(abstract)

AI总结 本文提出多层伊辛框架,结合几何保持的连续到伊辛编码器与Kanter-Sompolinsky伪逆记忆耦合,实现跨模态回忆,并验证有限尺寸修正对存储容量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态生成 11 篇

2512.22317 2026-05-15 cs.LG cs.AI cs.CV 81%

LangPrecip: Language-Aware Multimodal Precipitation Nowcasting

LangPrecip: 基于语言的多模态降水现在预报

Xudong Ling, Chaorong Li, Tianxi Huang, Qian Dong, Guiduo Duan

机构 * Laboratory of Intelligent Collaborative Computing, University of Electronic Science(智能协同计算实验室,电子科学科技大学) School of Computer Science(计算机科学学院) Technology (School of Artificial Intelligence), Yibin University(技术(人工智能学院),宜宾大学) College of Humanities(人文学院) General Education, Chengdu Textile College(通识教育,成都纺织学院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出LangPrecip框架,通过将气象文本作为语义运动约束,结合雷达信息进行降水演变预测,提升预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02271 2026-05-15 cs.CV 79%

Medical Report Generation: A Hierarchical Task Structure-Based Cross-Modal Causal Intervention Framework

医学报告生成:基于层次任务结构的跨模态因果干预框架

Yucheng Song, Yifan Ge, Junhao Li, Zhining Liao, Zhifang Liao

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出HTSC-CIF框架,通过层次任务分解解决医学报告生成中领域知识不足、跨模态对齐差和虚假相关性三大问题,提升生成效果。

Comments Due to issues with the training epochs and training strategy in our paper, there are numerical errors in the result comparison table presented in the preprint. Therefore, we have decided to withdraw the manuscript for further revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14159 2026-05-15 cs.RO 78%

MIMIC-D: Multi-modal Imitation for MultI-agent Coordination with Decentralized Diffusion Policies

MIMIC-D: 多模态模仿用于多智能体协调的去中心化扩散策略

Dayi Dong, Maulik Bhatt, Seoyeon Choi, Negar Mehr

机构 * Department of Mechanical Engineering, University of California Berkeley(加州大学伯克利分校机械工程系)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出MIMIC-D,通过去中心化扩散策略实现多智能体多模态模仿学习,解决了传统方法在多模态任务中协调效率低的问题。

Comments 8 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14594 2026-05-15 cs.CV cs.GR 70%

TOPOS: High-Fidelity and Efficient Industry-Grade 3D Head Generation

TOPOS: 高保真且高效的工业级3D人脸生成

Bojun Xiong, Zoubin Bi, Xinghui Peng, Yunmu Wang, Junchen Deng, Jun Liang, Jing Li, Bowen Cai, Huan Fu

机构 * HUJING Digital Media & Entertainment Group(华景数字媒体与娱乐集团)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 TOPOS框架通过统一拓扑结构实现单图像条件下的3D人脸生成,生成具有固定拓扑的高保真人脸网格,提升顶点级对应一致性,优于传统方法。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14068 2026-05-15 cs.CV 70%

CoCoEdit: Content-Consistent Image Editing via Region Regularized Reinforcement Learning

CoCoEdit:通过区域正则化的强化学习实现内容一致的图像编辑

Yuhui Wu, Chenxi Xie, Ruibin Li, Liyi Chen, Qiaosi Yi, Lei Zhang

机构 * The Hong Kong Polytechnic University, Hong Kong(香港理工大学) OPPO Research Institute, ShenZhen, China(OPPO研究院,深圳,中国)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出CoCoEdit框架,通过区域正则化强化学习提升图像编辑内容一致性,利用改进的指令和掩码生成高质量训练集,并引入像素相似度奖励和区域正则化器,提升编辑质量和一致性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13609 2026-05-15 cs.CV cs.LG 57%

Do-Undo Bench: Reversibility for Action Understanding in Image Generation

Do-Undo基准:图像生成中动作理解的可逆性

Shweta Mahajan, Shreya Kadambi, Hoang Le, Rajeev Yasarla, Apratim Bhattacharyya, Munawar Hayat, Fatih Porikli

机构 * York University(约克大学) Vector Institute for AI(人工智能向量研究所) Qualcomm AI Research(高通人工智能研究)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Do-Undo任务和基准,解决视觉-语言模型在理解并生成由现实动作驱动的场景变换中的关键缺口。通过要求模型模拟现实动作的后果并逆转至原始状态,测试真正的因果理解。实验表明当前模型在动作可逆性上存在困难,凸显评估动作理解的必要性。

Comments Project page: https://s-mahajan.github.io/Do-Undo-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14842 2026-05-15 cs.CV 57%

Editor's Choice: Evaluating Abstract Intent in Image Editing through Atomic Entity Analysis

编辑推荐:通过原子实体分析评估图像编辑中的抽象意图

Mor Ventura, Roy Hirsch, Yonatan Bitton, Regev Cohen, Roi Reichart

机构 * Technion – Israel Institute of Technology(技术ion – 以色列理工学院) Google Research(谷歌研究)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出通过原子实体分析评估图像编辑中抽象意图的方法,引入Entity-Rubrics框架并构建AbstractEdit基准,揭示现有模型在平衡意图与保留之间的挑战,强调结合先进LLM和迭代思维的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14626 2026-05-15 cs.CV 57%

UniTriGen: Unified Triplet Generation of Aligned Visible-Infrared-Label for Few-Shot RGB-T Semantic Segmentation

UniTriGen: 一致的可见-红外-标签三元组生成用于少样本RGB-T语义分割

Ping Zhou, Haoyu Wang, Mengmeng Zheng, Lei Zhang, Wei Wei, Chen Ding, Fei Zhou

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) School of Computer Science & Technology, Xi’an University of Posts & Telecommunications(西安邮电大学计算机科学与技术学院) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 UniTriGen提出统一三元组生成框架,通过共享潜在空间和扩散过程生成一致的可见-红外-标签三元组,解决少样本RGB-T语义分割中的对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09304 2026-05-15 cs.CV 57%

GeRM: A Generative Rendering Model From Physically Realistic to Photorealistic

GeRM:从物理真实到照片级的生成渲染模型

Jiayuan Lu, Rengan Xie, Xuancheng Jin, Zhizhen Wu, Qi Ye, Tian Xie, Hujun Bao, Rui Wang. Yuchi Huo

机构 * State Key Lab of CAD\&CG, Zhejiang University Zhejiang Lab China State Key Laboratory of Industrial Control Technology, Zhejiang University China Zhejiang University China Zhejiang Lab State Key Laboratory of Industrial Control Technology, Zhejiang University Zhejiang University

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 GeRM是首个多模态生成渲染模型,通过学习分布转移向量场实现从物理真实到照片级的过渡,结合控制网络和多代理框架提升图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17588 2026-05-15 cs.CV 57%

HERO: Hierarchical Extrapolation and Refresh for Efficient World Models

HERO:高效世界模型的分层外推与刷新

Quanjian Song, Xinyu Wang, Donghao Zhou, Jingyu Lin, Cunjian Chen, Yue Ma

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 HERO通过分层策略提升世界模型推理效率,采用补丁刷新和线性外推技术,在保持质量的同时实现1.73倍加速。

Comments 12 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05319 2026-05-15 cs.LG 50%

Accelerated Sequential Flow Matching: A Bayesian Filtering Perspective

加速的序列流匹配:从贝叶斯过滤视角

Yinan Huang, Hans Hao-Hsun Hsu, Junran Wang, Bo Dai, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出基于贝叶斯过滤的序列贝叶斯流匹配框架,通过学习概率流在时间步间传输后验分布,实现高效采样,提升实时流处理中的推断效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态评测 18 篇

2605.12034 2026-05-15 cs.MM cs.AI cs.CV 85%

Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation

提升多模态语言模型:带有视觉偏见评估的分阶段训练

Che Liu, Lichao Ma, Xiangyu Tony Zhang, Yuxin Zhang, Haoyang Zhang, Xuerui Yang, Fei Tian

机构 * StepFun-Audio Team(StepFun-Audio团队)

专题命中 多模态评测 :omni-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文研究了多模态基准在视觉偏见评估下的表现,提出OmniBoost三阶段训练方法,通过混合双模SFT、混合模态RLVR和自蒸馏数据SFT提升模型性能,验证了小模型在分阶段训练下的有效性。

Comments Project page: https://cheliu-computation.github.io/omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07045 2026-05-15 cs.CV cs.AI 82%

VLRS-Bench: A Vision-Language Reasoning Benchmark for Remote Sensing

VLRS-Bench: 一种面向遥感的视觉-语言推理基准

Zhiming Luo, Di Wang, Haonan Guo, Jing Zhang, Bo Du

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 多模态评测 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLRS-Bench,首个专注于复杂遥感推理的基准,包含2000个问题-答案对,涵盖14项任务和八个时间阶段,揭示现有MLLM在遥感任务中的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15128 2026-05-15 cs.CV cs.CL cs.IR 81%

MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory

MemEye:一种以视觉为中心的多模态代理记忆评估框架

Minghao Guo, Qingyue Jiao, Zeru Shi, Yihao Quan, Boxuan Zhang, Danrui Li, Liwei Che, Wujiang Xu, Shilong Liu, Zirui Liu, Mubbasir Kapadia, Vladimir Pavlovic, Jiang Liu, Mengdi Wang, Yiyu Shi, Dimitris N. Metaxas, Ruixiang Tang

机构 * Rutgers(罗格斯大学) Notre Dame(圣母大学) Princeton(普林斯顿大学) UMN(明尼苏达大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 MemEye框架从视觉证据的粒度和证据使用的复杂性两个维度评估多模态代理记忆,通过8个生活场景任务构建新基准,验证记忆方法在细粒度视觉细节保留和时间状态推理上的不足。

Comments 46 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14635 2026-05-15 cs.CV cs.AI 81%

MultiEmo-Bench: Multi-label Visual Emotion Analysis for Multi-modal Large Language Models

MultiEmo-Bench:多标签视觉情绪分析用于多模态大语言模型

Tianwei Chen, Takuya Furusawa, Yuki Hirakawa, Ryotaro Shimizu, Mo Fan, Takashi Wada

机构 * ZOZO NEXT Inc.(ZOZO NEXT公司)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一个多标签视觉情绪分析基准数据集,用于评估多模态大语言模型对图像引发情绪的预测能力。通过改进标注方案,提供更可靠的数据集,并评估了多个模型在情绪预测上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10550 2026-05-15 cs.CL 79%

Multi-domain Multi-modal Document Classification Benchmark with a Multi-level Taxonomy

多领域多模态文档分类基准与多级分类法

Denghao Ma, Qing Liu, Zulong Chen, Chuanfei Xu, Jia Xu, Zhibo Yang, Wei Shao, Zhao Li

机构 * Beijing Information Science and Technology University(北京信息科学与技术大学) Alibaba Group(阿里巴巴集团) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) Guangzhou University(广州大学) Zhejiang Lab(浙江实验室)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CL

AI总结 本文提出首个多级多领域多模态文档分类基准MMMBench,包含五级多级分类体系和12个商业领域的5990个真实多模态文档,通过系统实验识别出四个核心挑战并提供解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02920 2026-05-15 cs.LG cs.CV cs.SI 79%

Learning Multimodal Embeddings for Traffic Accident Prediction and Causal Estimation

学习多模态嵌入用于交通事故预测和因果估计

Ziniu Zhang, Minxuan Duan, Haris N. Koutsopoulos, Hongyang R. Zhang

机构 * Northeastern University(东北大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文通过结合道路网络数据与卫星图像,提出多模态学习方法,提升交通事故预测精度,并发现降水、高速道路和季节因素对事故率的影响。

Comments 17 pages. Appeared in KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23477 2026-05-15 cs.CL 79%

MMTutorBench: The First Multimodal Benchmark for AI Math Tutoring

MMTutorBench:首个多模态AI数学辅导基准

Tengchao Yang, Sichen Guo, Mengzhao Jia, Jiaming Su, Yuanyang Liu, Zhihan Zhang, Meng Jiang

机构 * Tongji University(同济大学) Fudan University(复旦大学) University of Notre Dame(圣母大学) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 MMTutorBench首次提出多模态AI数学辅导基准,包含685个围绕教学关键步骤构建的问题,通过六维度细粒度评估和三个任务(洞察发现、操作构建、操作执行)评估12个顶级MLLMs,揭示了专有与开源系统间的性能差异及OCR、少样本提示等对辅导质量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03519 2026-05-15 cs.LG 67%

Revisiting Model Inversion Evaluation: From Misleading Standards to Reliable Privacy Assessment

重新审视模型反向评估:从误导性标准到可靠的隐私评估

Sy-Tuyen Ho, Koh Jun Hao, Ngoc-Bao Nguyen, Alexander Binder, Ngai-Man Cheung

机构 * Singapore University of Technology and Design(新加坡科技设计大学) University of Maryland College Park(马里兰大学学院公园分校)

专题命中 多模态评测 :MLLM(abstract,abstract_cn)

AI总结 本文重新审视模型反向攻击的评估框架,揭示其存在虚假正例问题,并提出基于大规模语言模型的新评估方法以提升隐私评估的可靠性。

Comments Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15016 2026-05-15 cs.CL cs.AI 62%

COTCAgent: Preventive Consultation via Probabilistic Chain-of-Thought Completion

COTCAgent:通过概率性思维链完成实现预防性咨询

Zihan Deng, Xiaozhen Zhong, Chuanzhi Xu

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(中国电子科学与技术大学深圳高级研究所) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出COTCAgent框架,通过概率性思维链完成实现纵向电子健康记录的预防性咨询,解决了现有大语言模型在纵向EHR推理中的统计学推理不足和时间序列依赖性捕捉困难问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25855 2026-05-15 cs.CV cs.AI 62%

SIEVES: Selective Prediction Generalizes through Visual Evidence Scoring

SIEVES:通过视觉证据评分实现选择性预测

Hector G. Rodriguez, Marcus Rohrbach

机构 * TU Darmstadt(图宾根大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SIEVES通过视觉证据评分提升视觉问答在分布外任务中的覆盖范围,相比非 grounding 基准线提升三倍,适用于多种推理模型,无需依赖模型权重或 logit。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08888 2026-05-15 cs.CL cs.CV 62%

DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding

DocScope:可验证推理的可信长文档理解基准测试

Xiang Feng, Jiawei Zhou, Zhangfeng Huang, Kewei Wang, Shanshan Ye, Jinxin Hu, Zulong Chen, Yong Luo, Jing Zhang

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, China(计算机学院,国家多媒体软件工程技术研究中心和湖北多媒体与网络通信工程重点实验室,武汉大学,中国) Alibaba Group, Hangzhou, China(阿里巴巴集团,杭州,中国) Independent Researcher(独立研究者) Department of Machine Learning, Mohamed bin Zayed University of Artificial Intelligence, United Arab Emirates(机器学习系,Mohamed bin Zayed人工智能大学,阿拉伯联合酋长国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 DocScope通过结构化推理轨迹预测方法评估多模态大语言模型在长文档中的可验证推理能力,发现答案准确度无法替代轨迹级评估,且区域定位仍是薄弱环节。

Comments 50pages, 25 figures, 14 tables;

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14399 2026-05-15 cs.CV cs.GR 57%

SceneForge: Structured World Supervision from 3D Interventions

SceneForge: 从3D干预中获取结构化世界监督

Jizhizi Li, Jiayang Ao, Danny Wicks, Petru-Daniel Tudosiu

机构 * Canva Research(Canva研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 SceneForge通过生成可编辑3D世界状态的结构化监督,提升多模态学习中干预一致性。其利用显式干预和场景依赖传播,生成对齐的输出,如反事实观察和阴影反射信号,覆盖单视图和多视图场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06226 2026-05-15 cs.AI 57%

GeoLaux: A Benchmark for Evaluating MLLMs' Geometry Performance on Long-Step Problems Requiring Auxiliary Lines

GeoLaux:一个评估多模态大语言模型在需要辅助线的长步骤问题上几何性能的基准

Yumeng Fu, Jiayin Zhu, Lingling Zhang, Wenjun Wu, Bo Zhao, Shaoxuan Ma, Yushun Zhang, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Ministry of Education Key Laboratory of Intelligent Networks and Network Security, China(教育部智能网络与网络安全重点实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering, China(陕西省大数据知识工程重点实验室) School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 GeoLaux通过2186道计算与证明题,评估23个领先MLLMs在长步骤推理和辅助线构造上的表现,揭示模型在长步骤问题上性能显著下降,强调提升辅助线理解的重要性,并发现有限答案提示能提高过程正确性。

Comments 26 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14040 2026-05-15 cs.CL 57%

Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning

Physics-R1: 一个经过审计的奥林匹克语料库及视觉物理推理的配方

Shan Yang

机构 * Independent Researcher(独立研究者)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文通过审计多模态物理评估流程,揭示了训练-评估污染、翻译漂移和MCQ饱和等三个问题,并提出PhysR1配方,基于Qwen3-VL-8B-Thinking,提升了多个基准测试的性能。

Comments 10 pages, 3 tables. Project page: https://shanyang.me/physics-r1-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22197 2026-05-15 cs.LG cs.AI eess.SP 57%

Neural Signals Generate Clinical Notes in the Wild

神经信号在真实环境中生成临床笔记

Jathurshan Pradeepkumar, Zheng Chen, Jimeng Sun

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) SANKEN, Osaka University(大阪大学SANKEN)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出CELM模型,首个能从长期EEG记录中生成多尺度临床报告的EEG-语言基础模型,通过整合预训练EEG模型与语言模型,实现了可扩展的多模态学习,实验表明其在多个评估设置中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14186 2026-05-15 cs.LG 50%

LLMs Know When They Know, but Do Not Act on It: A Metacognitive Harness for Test-time Scaling

Qi Cao, Yufan Wang, Peijia Qin, Shuhao Zhang, Pengtao Xie

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 多模态评测 :multimodal(abstract)

AI总结 大型语言模型(LLMs)在解决问题前后能够产生自我监控信号,如对自身能否成功解决问题的预判以及对答案正确性的后验判断,但这些信号通常未被用于控制推理过程。本文提出一种元认知控制框架,基于认知心理学中的纳尔逊-纳雷恩斯理论,将监控与推理分离,使模型在推理过程中根据预判和后验判断动态决定是否信任当前结果、是否重试或汇总多轮结果。实验表明,该框架无需参数更新或特定任务微调,即可显著提升基础模型在文本、代码和多模态任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14142 2026-05-15 stat.ML cs.LG stat.CO 50%

To discretize continually: Mean shift interacting particle systems for Bayesian inference

持续离散化:用于贝叶斯推断的均值偏移交互粒子系统

Ayoub Belhadji, Daniel Sharp, Youssef M. Marzouk

机构 * Center for Computational Science and Engineering(计算科学中心) Laboratory for Information and Decision Systems(信息与决策系统实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出基于均值偏移交互粒子系统的新型方法,用于近似概率分布的积分,该方法通过最小化最大均差来构建权重样本,适用于连续分布的贝叶斯推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13871 2026-05-15 cs.NE cs.LG 50%

Indian Wedding System Optimization (IWSO): A Novel Socially Inspired Metaheuristic with Operational Design and Analysis

印度婚礼系统优化(IWSO):一种受社会文化动态启发的新型元启发式算法及其操作设计与分析

Deepika Saxena, Kishu Gupta, Jitendra Kumar, Jatinder Kumar, Sakshi Patni, Vinaytosh Mishra, Niharika Singh, Ashutosh Kumar Singh

机构 * Department of Computer Science, the VIZJA University, Warsaw, 01-043, Poland(VIZJA大学计算机科学系)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出了一种基于群体的元启发式算法IWSO,受印度传统婚礼的社会文化动态启发,通过家庭、候选人和牵线人的协作模拟匹配过程,采用匹配师引导影响策略和自适应淘汰重初始化机制,提升收敛性与多样性,实验表明其在高维多模态函数上的收敛速度、解质量及鲁棒性优于GA、PSO、DE等算法。

详情

展开后加载摘要…

URL PDF HTML 收藏