arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 511 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 511 篇

2606.07974 2026-06-09 cs.RO cs.AI 新提交 57%

PRISM: PRior-guided Imagination Sampling in world Models

PRISM:世界模型中基于先验引导的想象采样

Yuhai Wang, Jiawei Xia, Rongxuan Zhou, Xiao Hu, Yongliang Shi, Jing Du, Yang Ye

机构 * Northeastern University(东北大学) University of California, Berkeley(加州大学伯克利分校) Qiyuan Lab(启元实验室) University of Florida(佛罗里达大学)

专题命中 VLM训练与架构 :VLM(abstract_cn);分类 cs.AI

AI总结 提出PRISM框架,通过从世界模型编码器提取状态条件高斯先验,并利用精度加权高斯乘积更新规划器的采样分布,在不增加架构复杂度的情况下显著提升基于模型的连续控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07113 2026-06-08 cs.AI 新提交 57%

Beyond Post-hoc Explanation: Toward Glassbox AI via Probabilistic Mediation

超越事后解释:通过概率中介迈向玻璃箱AI

Manuele Leonelli

机构 * Manuele Leonelli(曼努埃尔·莱奥内利)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 针对大语言模型在关键领域的不透明性,提出玻璃箱框架,利用贝叶斯网络作为事前中介层,实现可审计推理、不确定性量化和可争议输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07000 2026-06-08 cs.AI 新提交 57%

Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization

教方法而非答案:用于多模态策略优化的特权辅导蒸馏

Shizhe Xiang, Ke An, Wenlong Yu, Yue Liu, Jian Luan, Pei Fu, Qilong Wang

机构 * Tianjin University(天津大学) Beijing Institute of Technology(北京理工大学) Singapore Management University(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) Xiaomi Inc(小米公司)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 提出PTD-PO框架,通过构建特权提示提供密集的令牌级监督,避免暴露答案,并采用Top-K JS散度稳定蒸馏,显著提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06672 2026-08-10 cs.CL 新提交 50%

TA-RAG: Tone Awareness as a Design Imperative for Retrieval-Augmented Generation

TA-RAG:将语气感知作为检索增强生成的设计要务

Yong-Bin Kang, Anthony McCosker

机构 * Swinburne University of Technology(斯威本科技大学)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 该研究针对标准RAG系统存在的语境脱耦问题,提出TA-RAG框架,将交流对齐与事实准确性并列为核心设计目标,明确语气感知是高风险语境下RAG系统的设计要务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05967 2026-08-07 cs.MM 新提交 50%

M$^3$Prune: Hierarchical Collaborative Pruning for Efficient Multi-Modal Multi-Agent Retrieval-Augmented Generation

M³Prune:面向高效多模态多智能体检索增强生成的分层协同剪枝

Taolin Zhang, Weizi shao, Zijie Zhou, Chen Chen, Daiyang Yu, Tingyuan Hu, Chengyu Wang, Xiaofeng He

专题命中 VLM训练与架构 :MLLM(abstract_cn)

AI总结 M³Prune是优化多模态多智能体检索增强生成的分层协同剪枝框架,通过剪枝冗余通信边提升性能与token效率,实验中优于单智能体及多智能体基准系统。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03154 2026-08-05 cs.CL 新提交 50%

ANCHOR-RE: An Agentic Neuro-Symbolic Framework for Grounded Biomedical Relation Extraction

ANCHOR-RE:用于接地生物医学关系抽取的智能体神经符号框架

Shufan Ming, Yikun Han, Gibong Hong, Rui Zhang, Halil Kilicoglu

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 该研究提出ANCHOR-RE框架,将本体引导推理等集成到LLM推理中,在多个BioRE基准及2026年生物医学文章数据集上,该框架性能优于直接LLM提示及部分现有方法,是实用的无训练生物医学文献挖掘方法。

Comments Submitted to Journal of Biomedical Informatics (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02500 2026-08-04 cs.IR 新提交 50%

Requirement--Evidence Alignment for Compositional E-Commerce Queries

面向组合式电商查询的需求-证据对齐

Weihao Shen, Wei Chen, Fuwei Zhang, Meng Yuan, Yuqin Lan, Guojun Liu, Qingsong Hua, Wei Lin, Fuzhen Zhuang

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 针对现有电商查询重排序器忽略组合需求约束的问题,提出REAlign框架,通过区分需求状态、优化排序,在电商基准上提升了重排序效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01458 2026-08-04 cs.CL 新提交 50%

PALMs: Using Multi Construct-Grounded Rationales for Modeling Population Preferences in LLMs

PALMs:使用多构造基础理由对大语言模型中的群体偏好进行建模

Priyanka Dey, Brihi Joshi, Preyashi Poddar, Jieyu Zhao, Emilio Ferrara

机构 * University of Southern California(南加州大学) Information Sciences Institute(信息科学研究所)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 该研究提出了群体对齐语言模型PALMs,通过结合心理与文化构造的理由进行偏好调优,在多维度评估中优于基准模型,且下游任务泛化能力强

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00507 2026-08-04 cs.CL eess.AS 新提交 50%

The Learning Objective Governs Perceptual Narrowing: A Cross-Lingual, Layer-Wise, Ten-Seed Study of Self-Supervised Speech Encoders

学习目标调控感知窄化:自监督语音编码器的跨语言、分层、十种子研究

Sejin Yoo

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 该研究通过十种子实验发现,自监督语音编码器的学习目标(而非架构)是感知窄化型表征变化的首要决定因素,重构与预测目标对非母语音素辨别能力的影响相反。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29069 2026-08-03 cs.DC 新提交 50%

Rethinking AI Cloud Infrastructure for Agentic Serving Systems with the Aries Experimentation Framework

基于Aries实验框架重新思考智能体服务系统的AI云基础设施

Leonid Kondrashov, Hongrui Liu, JooYoung Park, Boxi Zhou, Zonghao Liu, Chengzhi Lu, Riccardo Mancini, Esha Choukse, Haris Javaid, German Sviridov, Tao Peng, Chen Zhao, Anastasia Avdeeva, Aleksei Gusev, Marios Kogias, Luo Mai, Dmitrii Ustiugov

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 该研究针对自主智能体对传统LLM服务的挑战,提出Aries全栈实验框架,通过实验揭示服务系统的关键瓶颈,探讨智能体原生服务系统的设计愿景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28637 2026-08-03 cs.CL 新提交 50%

ZeroR@CHiPSAL 2026: Two-Stage Vision-Language Adaptation with Contrastive Learning for Nepali Meme Classification

ZeroR@CHiPSAL 2026:用于尼泊尔表情包分类的对比学习两阶段视觉-语言适配

Nitiz Khanal

机构 * Pulchowk Campus, Institute of Engineering, Tribhuvan University(特里布万大学工程学院普尔乔克校区)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 该研究针对尼泊尔表情包多模态仇恨言论与情感检测任务,适配RA-HMD框架,采用两阶段视觉-语言对比学习方法,取得两项任务的优异排名,为低资源南亚语言适配大模型提供了见解。

Comments 9 pages, 2 figures, system description paper for the CHiPSAL 2026 shared task at LREC 2026

Journal ref Proceedings of the Second Workshop on Challenges in Processing South Asian Languages (CHiPSAL 2026) @ LREC 2026, pages 275-283, Palma, Mallorca, Spain, 16 May 2026. ELRA Language Resources Association (ELRA). ISBN 978-2-493814-66-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27366 2026-07-31 cs.CL 新提交 50%

BridgeAlign: Bridging Preference Alignment for Humanities and Social Sciences

BridgeAlign:面向人文社科的偏好对齐框架

Ru Peng, Haokai Xu, Xijun Gu, Tianyu Zhao, Zhiting Fan, Yawen Zeng, Yihong Zhuang, Jinyang Zhang, Kexin Yang, Jian Wu, Hao Chen, Junyang Lin, Dayiheng Liu, Junbo Zhao

机构 * Alibaba Group(阿里巴巴集团) Ant Group(蚂蚁集团)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 该研究针对人文社科领域的偏好对齐需求,提出BridgeAlign框架,经21万+合成偏好样本对齐后,使Qwen3-8B在17个基准测试中优于11个强基线,且人工偏好与知识能力无权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26346 2026-07-30 math.ST cs.SI stat.ME stat.ML stat.TH 新提交 50%

Toward a Unified Statistical Theory of Unsupervised Pretraining and Supervised Neural Knowledge Graph Learning

迈向无监督预训练与监督神经知识图谱学习的统一统计理论

Jifan Zhang, Miklos Racz, Suqi Liu

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本研究针对知识图谱学习中数据与理论问题,提出含无监督预训练与监督学习的两阶段框架,建立非渐近风险界,经合成与真实实验验证其有效性。

Comments 49 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25346 2026-07-29 cs.IR 新提交 50%

The Case Against Generation for Retrieval: Discriminative Language Models as Effective Retrievers

反对用于检索的生成式模型:判别式语言模型作为有效的检索器

Zhe Xu, Prachi Agrawal, Kavosh Asadi, Tianyi Chen, Carl Hu, Justin Johnson, Wuwei Lan, Mingfu Liang, Xi Liu, Tik On Lui, Oladipo Ositelu, Sandeep Pandey, Ankit Peshin, Feng Qi, Anil Ramakrishna, Kaushik Rangadurai, Frank Shyu, Luke Simon, Yang Yang, Chiyu Zhang

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 研究探讨大语言模型用于检索的问题,通过将其作为语义表示主干重振双塔检索架构,引入创新的双塔框架,经实验评估,该架构在公共基准和生产系统中表现出色,证明传统双塔范式结合现代学习后在工业检索中仍具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23740 2026-07-28 cs.CL 新提交 50%

Zing: Social Mind for LLMs

Zing:大语言模型的社交智能

Zing Team, Ao Xiang, Bi Jingping, Chen Jiahui, Chen Lehan, Chen Yilin, Cheng Xueqi, Fan Yixing, Gan Kairong, Gao Haowen, Gao Jinhua, Gao Shuxuan, Gong Chang, Guo Jiafeng, Guo Ruijie, Han Zhouyu, He Guangfu, He Yichun, Jiang Shuo, Jing Shaoling, Jing Ya, Lei Chenhao, Lei Yan, Li Anqi, Li Chengao, Li Haoyu, Li Shitian, Liang Xinjian, Liu Zhaoge, Lyu Xingyu, Nie Zhuwei, Pang Liang, Quan Zeping, Shan Shiguang, Shen Huawei, Tang Xinran, Tian Feng, Wang Qian, Wang Ruiping, Wang Xiaohong, Xia Zaiyu, Xiao Yi, Xu Jiayuan, Xu Kehan, Xu Qianqian, Xu Tianyu, Xu Yongjun, Yang Haoming, Yang Jun, Yao Di, Yu Xiaoming, Zhang Futong, Zhang Jie, Zhang Shixuan, Zhang Yuxuan, Zhao Xinyu, Zhao Zhuoran, Zhong Yunfei, Zhu Shengyu

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 研究大语言模型社交智能,提出Zijing框架,含测量基准SoMBench、训练方法Zing及推理架构Actio,通过实验证明社交智能大语言模型在评估、内化和落地方面需协同发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23038 2026-07-28 cs.IR 新提交 50%

EGR: Embedding-Native Generative Retrieval with a Shared LLM

EGR:使用共享语言模型的嵌入原生生成式检索

Xiaodong Liu, Congfei Zhang, Hsiang-wei Chao, Siman Wang, Tong Zhao, Xiao Bai, Vincent Zhang, Jingxiao Ma, Zhe Liu, Wenfeng Zhuo, Zichu Li, Jitin Krishnan, Yunzhi Zhou, Yajun Wang, Jinchao Li, Yu Zhang

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 研究针对生成式检索在推荐和广告系统中的问题,提出EGR框架,利用共享语言模型在同一嵌入空间学习项目与用户表示,经联合对比训练,在多场景评估中表现出色,提升了转化率,简化了系统设计。

Comments Accepted to RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19836 2026-07-23 cs.IR cs.DL 新提交 50%

Using Hierarchical Controlled Vocabularies to Understand CLIP Retrieval Failures in Historical Photo Collections

使用分层控制词汇表理解历史照片集中CLIP检索失败的原因

Ratan Sebastian, Anett Hoppe, Christoph Rippe, Ralph Ewerth

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 研究探讨用AAT词汇表的根面类型和层次深度解释CLIP在历史照片集检索的成败及微调作用,通过三个标注集研究视觉连贯性等指标,发现两指标可区分失败模式,根面类型有区分作用,微调对层次浅的术语更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19033 2026-07-22 cs.CL 新提交 50%

Content is What Remains: Invariant Speech Tokenization from Parallel Utterances

内容是留存之物:基于平行话语的不变语音分词

Laurin Wagner, Bernhard Thallinger, Miroslav Stankovic, Mario Zusag

机构 * nyra labs(nyra实验室)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 研究针对离散语音分词器问题,提出PINT方法,通过微调SSL编码器及相关损失和增强来提取共享残差,降低条件熵,使词元保留时间基础,实验证明该方法能有效提升效果,正确不变性对高效学习很关键。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14277 2026-07-17 cs.CL 新提交 50%

Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making

多头潜在控制:大语言模型智能体决策的统一接口

Amirhosein Ghasemabadi, Ruichen Chen, Bahador Rashidi, Di Niu

机构 * University of Alberta(阿尔伯塔大学) Huawei Technologies Canada Co., Ltd.(华为加拿大技术有限公司)

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 研究大语言模型作智能体时的决策控制问题,提出多头潜在控制方法,通过读取冻结模型的隐藏状态轨迹生成控制信号,能在不修改模型的情况下进行事后适配,改善多模型系统质量成本权衡,减少大模型使用并提高工具使用决策质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10655 2026-07-14 cs.RO 新提交 50%

Artificial Foveated Perception for Mitigating Shortcut Learning in Robotic Foundation Models

用于减轻机器人基础模型中捷径学习的人工中央凹感知

Xiatao Sun, Yuan Zhuang, Mateo Sanchez Lopez Negrete, Matei-Victor Coldea, Chen Liang, Haoyang Zhang, Che Liu, Ziyao Zeng, Shawn Li, Qian Wang, Fei Miao, Daniel Rakita

机构 * Yale University(耶鲁大学) University of Connecticut(康涅狄格大学) Peking University(北京大学) Imperial College London(帝国理工学院) Digients

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 研究机器人基础模型因捷径学习难以稳健部署的问题,提出人工中央凹感知模块AFP,通过预测任务条件掩码辅助微调,使策略关注任务相关区域,实验证明其能减少微调时间、抑制过拟合并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06055 2026-07-08 cs.HC cs.CL 新提交 50%

Nested Episodic State Topology (NEST): A Graph-Theoretic Architecture of Cognitive States

嵌套情节状态拓扑(NEST):认知状态的一种图论架构

Ishant

机构 * Ishant(独立研究者)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 研究提出NEST图论架构用于认知建模,将概念等表示为带类型加权图,通过多种运算符和工具包构成核心,还包括现象签名等实例化内容,为后续相关工作提供透明表示基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05722 2026-07-08 cs.CL 新提交 50%

Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding

Nemotron-Labs-Diffusion:一种统一自回归、扩散和自推测解码的三模式语言模型

Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Norouzi, Jingyu Liu, Shiyi Lan, Ligeng Zhu, Jin Wang, Jindong Jiang, Morteza Mardani, Mehran Maghoumi, Song Han, Ante Jukić, Nima Tajbakhsh, Jan Kautz, Pavlo Molchanov

机构 * Nemotron-Labs(Nemotron实验室)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 介绍了统一AR、扩散和自推测解码的三模式语言模型Nemotron-Labs-Diffusion,通过联合目标训练,能切换模式。研究表明其目标互补,自推测模式表现优,有长期潜力,该模型家族在精度和速度上优于现有开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02590 2026-07-07 cs.SE 新提交 50%

OmniPresent: Generating Coherent Presentation Suites from Scientific Papers

OmniPresent:从科学论文生成连贯的演示文稿套件

Qianli Ma, Jipeng Xiao, Siyu Wang, Zhiheng Tian, Wangyu Feng, Shibo Wang, Chang Guo, Shuochen Chang, Qingyang Liu, Zhipeng Zhang

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 研究如何将静态论文转化为动态媒体,提出OmniPresent框架,采用可渲染HTML表示和自校正循环解决模态冲突,还发布数据集与评估协议,生成的演示文稿套件质量高。

Comments In progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00387 2026-07-02 eess.AS 新提交 50%

From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning

从目标到应用:对齐音频自监督学习中的架构偏差

Kele Xu, Yulu Fang, Boda Zhou, Yulin Sun, Qisheng Xu, Qiya Song, Jin Zhang, Cheng Yang, Huaimin Wang

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文通过预训练目标、架构归纳偏差与下游应用的对齐,系统分析音频自监督学习,围绕五种范式讨论不同监督信号对表征的影响,并关联到CNN、RNN、状态空间模型、Transformer及混合架构的偏差,最后解读在语音、环境声、音乐、医学及多模态等领域的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22480 2026-06-23 cs.RO 新提交 50%

ARP: Enhancing Quantized Skill Abstractions via Visual Alignment and Iterative Refinement for Robotic Manipulation

ARP:通过视觉对齐与迭代细化增强机器人操作的量化技能抽象

Yuntian Wang, Zesheng Jia, Yuhui Duan, Qibing Wang, Yang Liu, Song Wang, Siao Liu, Jin Wang

机构 * School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院) Key Laboratory of General Artificial Intelligence and Large Models in Provincial Universities, Soochow University(苏州大学省高校通用人工智能与大模型重点实验室) College of Mechanical and Electronic Engineering, China Jiliang University(中国计量大学机电工程学院) College of Electronics and Information Engineering, Tongji University(同济大学电子与信息工程学院) Leju Robotics(乐聚机器人)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 提出ARP框架,通过视觉-动作对比对齐和迭代残差头细化,解决离散量化技能中的语义弱对齐和精度损失问题,在LIBERO和Meta-World基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20890 2026-06-23 cs.CL cs.IR 新提交 50%

Topic-to-Timestamp Alignment by Constrained Evidence Selection

通过约束证据选择的主题到时间戳对齐

Zeynep Yılbırt, Marina Litvak, Michael Färber

机构 * TU Dresden(德累斯顿工业大学) SpeechMind GmbH(SpeechMind 公司) Shamoon College of Engineering(沙蒙工程学院) ScaDS.AI Dresden/Leipzig(ScaDS.AI 德累斯顿/莱比锡)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 针对会议记录中主题到时间戳的对齐问题,提出将时间戳预测重构为约束时间候选选择,通过检索时间戳转录块并选择最佳候选而非生成时间码,显著提升召回率和解析输出数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20772 2026-06-23 cs.RO eess.IV 新提交 50%

Mind the Privileged-to-Camera Gap: Actor-Centric Sidecar Supervision for Camera-First Open-Loop Waypoint Prediction

注意特权到摄像头的差距:面向摄像头优先开环路径预测的以参与者为中心的侧车监督

Feeza Khan Khanzada, Jaerock Kwon

机构 * University of Michigan-Dearborn(密歇根大学迪尔伯恩分校)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 针对摄像头优先开环路径预测中缺乏对道路参与者显式监督的问题,提出侧车监督方法,利用模拟器生成的参与者标签(如相关性、短时运动)训练模型,在部署时无需额外输入,最终将终点位移误差降低32.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18656 2026-06-18 cs.CL 新提交 50%

The Wrong Kind of Right: Quantifying and Localizing Misfired Alignment in LLMs

错误的正确:量化和定位大语言模型中的失调对齐

Naihao Deng, Yiming Feng, Chimaobi Okite, Kaijian Zou, Lu Wang, Rada Mihalcea, Yulong Chen

机构 * University of Michigan(密歇根大学) University of Cambridge(剑桥大学) University of Aberdeen(阿伯丁大学)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文提出VETO基准和失调对齐率(MAR)指标,发现所有LLM在刻板印象相关问题上均存在非平凡的失调对齐,且人类为0%,机制分析表明对齐诱导的线索会放大该现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15325 2026-06-16 cs.CL 新提交 50%

Prior over Evidence: Stereotype-Driven Diagnosis in LLM-Based L2 Pronunciation Feedback

先验优于证据:基于LLM的二语发音反馈中的刻板印象驱动诊断

Rong Wang, Kun Sun

机构 * University of Tuebingen(蒂宾根大学) Tongji University(同济大学)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 研究测试了LLM在二语发音反馈中是否基于语音证据而非预训练先验进行诊断,发现评分准确性与推理脱钩,音素级反馈收敛于固定困难音素集,且声学证据仅在直接探测目标维度时改善评分。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07402 2026-06-08 cs.CL 新提交 50%

M$^3$Exam: Benchmarking Multimodal Memory for Realistic User-Agent Interactions

M$^3$Exam: 面向真实用户-智能体交互的多模态记忆基准

Zhengjun Huang, Wenxuan Liu, Zhoujin Tian, Wei Chen, Junle Chen, Yuqian Wu, Fangyuan Zhang, Qintian Guo, Xiaofang Zhou

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Beijing University of Chemical Technology(北京化工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Beijing Institute of Technology (Zhuhai)(北京理工大学(珠海)) Tencent Hy(腾讯(深圳)) Peng Cheng Laboratory(鹏城实验室)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 提出M$^3$Exam基准,用于评估多模态大语言模型在真实用户-智能体交互中的跨模态推理和隐式信息推断能力,并设计M$^3$Proctor方法通过按需处理视觉源提升准确率13%,同时降低索引构建时间和检索token超70%。

详情

展开后加载摘要…

URL PDF HTML 收藏