arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 582 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 582 篇

2607.04729 2026-07-07 cs.CR cs.AI cs.SE 新提交 57%

RustMizan: A Compilable, Contamination-Aware Benchmarking Framework for Rust Vulnerabilities

RustMizan:用于Rust漏洞的可编译、污染感知基准测试框架

Tarek Elsayed, Shiping Yang, Eunsong Koh, Sanika Goyal, Vincent Huang, Paul Ngo, Nathan Young, Mohammad Omidvar Tehrani, Alvyn Kang, Arnell Kang, Zeyu Chen, Angélica Moreira, Xuan Feng, Angel X. Chang, Nick Sumner, Steven Y. Ko

机构 * Simon Fraser University(西蒙弗雷泽大学) Trinity University(特里尼蒂大学) Microsoft Research(微软研究院) Amii(阿米国际)

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.AI

AI总结 针对现有Rust漏洞分析基准不足,介绍RustMizan框架,含可编译代码变体及注释,用配对突变框架测试,给出不同模型在该框架下的测试结果。

Comments 36 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03994 2026-07-07 cs.CV cs.AI 新提交 57%

Full Glyph Images Beat Token Embeddings: A Controlled Study for Transformers

完整字形图像胜过词元嵌入:Transformer的对照研究

Shuyang Xiang, Hao Guan

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 挑战用离散词元嵌入表示文本,用字符序列光栅化图像经视觉编码器处理替代,构建双分支框架对比,发现基于视觉模型性能优于基线,揭示优势条件及跨脚本差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03973 2026-07-07 cs.LG 新提交 57%

MANCE: Manifold Aware Concept Erasure

MANCE:流形感知概念擦除

Matan Avitan, Yoav Goldberg, Yanai Elazar

机构 * Bar-Ilan University(巴伊兰大学) Allen Institute for Artificial Intelligence(艾伦人工智能研究所)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 提出流形约束假设,在新概念擦除方法MANCE中实例化,利用分类器信号迭代更新表示,投影概念移除更新到估计流形,经多设置评估,其改进泄漏结果,MANCE+和MANCE++有更好权衡,MANCE++达非线性概念擦除最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03903 2026-07-07 cs.LG 新提交 57%

CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning

CDCP:用于多任务离线安全强化学习的带上下文提示的条件扩散模型

Jiayi Guan, Tianle Zhang, Li Shen, Ruiqi Zhang, Ao Zhou, Lusong Li, Guai Chen, Mengjie Li, Alois Knoll, Xiaodong He, Changjun Jiang

机构 * Tongji University(同济大学) JD Explore Academy(京东探索研究院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院) Berkeley AI Research Lab, University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究实验室) Technical University of Munich(慕尼黑工业大学)

专题命中 知识编辑与模型理解 :prompting(abstract);分类 cs.LG

AI总结 针对多任务离线安全强化学习面临的挑战,提出CDCP模型。通过重新审视需求建立目标,用扩散模型转化问题,设计策略并引入新方法,提升性能与安全性,提供灵活成本约束解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03731 2026-07-07 cs.HC cs.AI 新提交 57%

CoGen3D: An Agentic Human-AI Co-Design Pipeline for 3D Asset Generation for Virtual Reality

CoGen3D:用于虚拟现实3D资产生成的智能人机协同设计管道

Weiwei Jiang, Wanyu He, Zheyu Tan, Zheyuan Kuang, Difeng Yu, Shinobu Hasegawa, Sven Mayer, Zhanna Sarsenbayeva

机构 * Nanjing University of Information Science and Technology(南京信息工程大学) Japan Advanced Institute of Science and Technology(日本科学技术大学) The University of Sydney(悉尼大学) University of Copenhagen(哥本哈根大学) TU Dortmund University(多特蒙德技术大学) Research Center Trustworthy Data Science and Security(可信数据科学与安全研究中心)

专题命中 知识编辑与模型理解 :prompting(abstract);分类 cs.AI

AI总结 研究针对虚拟现实3D资产创作需建模专业知识的问题,引入CoGen3D智能人机协同设计管道,经用户研究评估,发现其可促进创作、改变情感反应,推动创作从技术执行转向协作空间设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31422 2026-07-07 cs.AI 新提交 57%

Ask the World Before Acting: Environment Probing for Calibrated Agent World Models

行动前先询问世界:预算受限的环境探测用于世界模型校准

Xinyuan Song, Zekun Cai

机构 * Emory University(埃默里大学) The University of Tokyo(东京大学) LocationMind

专题命中 知识编辑与模型理解 :language agent(abstract);分类 cs.AI

AI总结 提出预算受限的环境探测算子,通过结构化信念表在行动前校准世界模型,减少长期任务中的终端误差。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01303 2026-07-03 cs.CV cs.AI 新提交 57%

CPG-PAD: Concept-Informed Prompts Guided Presentation Attack Detection

CPG-PAD: 概念引导提示的呈现攻击检测

Haoyuan Zhang, Xiangyu Zhu, Li Gao, Ajian Liu, Siran Peng, Zhen Lei

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) China Mobile Financial Technology Co., Ltd.(中移动金融科技有限公司) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences(中国科学院香港创新研究院人工智能与机器人创新中心) School of Computer Science and Engineering, the Faculty of Innovation Engineering, Macau University of Science and Technology(澳门科技大学创新工程学院计算机科学与工程学院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 提出概念引导提示的呈现攻击检测框架,通过可解释AI发现攻击相关视觉概念并注入提示空间,提升跨域泛化能力,在多个基准数据集上达到最优。

Comments Accepted by IEEE Transactions on Information Forensics & Security (TIFS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00958 2026-07-02 cs.LG 新提交 57%

LeNEPA: No-Augmentation Next-Latent Prediction for Time-Series Representation Learning

LeNEPA:无增强的下一潜在预测用于时间序列表示学习

Alexander Chemeris, Ming Jin, Randall Balestriero

机构 * Langotime South Africa(Langotime南非) Griffith University Australia(澳大利亚格里菲斯大学) Brown University United States(美国布朗大学)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 提出LeNEPA,一种无需数据增强的下一潜在预测架构,通过SIGReg正则化和轻量投影空间,在固定配方测试中跨数据集保持性能,优于ECG调优的JEPA。

Comments 9 pages, 4 figures, 6 tables; accepted by the 12th Mining and Learning from Time Series (KDD MILETS 2026); source code and artifacts: https://github.com/langotime/lenepa-milets-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00777 2026-07-02 cs.SD cs.LG 新提交 57%

Evaluating Pretrained Music Embeddings for Cross-Performance Jazz Standard Recognition

评估预训练音乐嵌入在跨演奏爵士标准曲识别中的表现

Çağrı Eser

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 研究利用预训练音乐嵌入进行跨演奏爵士标准曲识别,对比从头训练的谐波CNN基线,发现预训练嵌入在top-k结果上更优但对演奏者身份敏感,轻量对比投影可部分缓解。

Comments 6 pages, 2 figures, 4 tables. Accepted to the ICML 2026 Workshop on Machine Learning for Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32016 2026-07-01 cs.LG 新提交 57%

FedLAB: Traceable Semantic Codebooks for Federated Multimodal Graph Foundation Learning

FedLAB: 面向联邦多模态图基础学习的可追踪语义码本

Zekai Chen, Kairui Yang, Xuaner Chen, Xunkai Li, Xun Wu, Rong-Hua Li, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 提出FedLAB框架,通过类型化分层码本组织模态证据、节点语义和拓扑上下文,实现联邦多模态图学习中的可追踪语义,在10个基准和6个下游任务上提升达7.53%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27440 2026-06-29 cs.LG 新提交 57%

PairSAE: Mechanistic Interpretability from Pair Representations in Protein Co-Folding

PairSAE: 蛋白质共折叠中成对表示的机制可解释性

Giosue Migliorini, Aristofanis Rontogiannis, Grigori Guitchounts, Nicholas Franklin, Axel Elaldi, Olivia Viessmann

机构 * University of California, Irvine(加州大学尔湾分校) Flagship Pioneering

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 针对蛋白质共折叠模型中的成对表示,提出PairSAE方法,通过N-mode SVD总结成对张量为token级交互角色,再用稀疏自编码器学习共享特征,实现可解释性并避免传统SAE的二次爆炸问题。

Comments Accepted at the Machine Learning in Structural Biology (MLSB) 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24997 2026-06-25 cs.LG 新提交 57%

What's in an Earth Embedding? An Explainability Analysis of Location Encoders

地球嵌入中有什么?位置编码器的可解释性分析

Livia Betti, Sebastian Ricke, Ivica Obadic, Adam J. Stewart, Esther Rolf

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 通过稀疏自编码器、自然语言概念和视觉特征分解地理隐式神经表示的位置嵌入,揭示其编码的可解释地理结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24716 2026-06-24 cs.CV cs.AI 新提交 57%

Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations

评估稀疏自编码器与概念标注的可解释性

Jonas Klotz, Cassio F. Dantas, Pallavi Jain, Diego Marcos, Begüm Demir

机构 * The Berlin Institute for the Foundations of Learning and Data (BIFOLD)(柏林学习与数据基础研究所) Technische Universität Berlin(柏林工业大学) INRAE(法国国家农业、食品与环境研究院) Inria, EVERGREEN(法国国家信息与自动化研究所,EVERGREEN) UMR TETIS, Univ Montpellier(UMR TETIS,蒙彼利埃大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 提出一种基于人类标注的评估框架,通过合成基准和二分匹配方法量化稀疏自编码器潜在变量与概念的对齐,并验证可解释性。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21179 2026-06-23 cs.LG 新提交 57%

Rejections Based on Predictive Uncertainty Enable Reliable Routine Soil Spectroscopy

基于预测不确定性的拒绝机制实现可靠的常规土壤光谱学

Jonas Schmidinger, Robin Gebbers, Marc-Olivier Gasser, Viacheslav Barkov, G. Mick Wu, Viacheslav I. Adamchuk

机构 * Joint Lab Artificial Intelligence and Data Science, Osnabrück University(奥斯纳布吕克大学人工智能与数据科学联合实验室) Department of Agromechatronics, Leibniz Institute for Agricultural Engineering and Bioeconomy (ATB)(莱布尼茨农业工程与生物经济研究所农业机电一体化系) Research and Development Institute for the Agri-environment (IRDA)(农业环境研究与发展研究所) Department of Bioresource Engineering, McGill University(麦吉尔大学生物资源工程系)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 提出“拒绝-重测”框架,结合概率建模与不确定性引导的拒绝,在保证准确性的同时降低土壤光谱测量成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20705 2026-06-23 cs.CV cs.AI cs.RO 新提交 57%

MotionPyramid: Hierarchical Motion Representation and Residual Interfaces

MotionPyramid: 分层运动表示与残差接口

Gao Zhu, Zaishuo Xia, Yubei Chen

机构 * UC Davis(加州大学戴维斯分校)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.AI

AI总结 提出MotionPyramid,一种从运动数据中学习层次化动作表示的方法,通过冻结预训练层次为下游强化学习提供多分辨率控制接口,并引入残差接口实现粗细粒度协同控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20559 2026-06-19 cs.CV cs.LG 新提交 57%

UNIEGO: Proxies as Mediators for Unified Egocentric Video Representation Learning

UNIEGO:代理作为中介的统一自我中心视频表示学习

Wenhao Chi, Arkaprava Sinha, Dominick Reilly, Hieu Le, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 提出分层多教师蒸馏框架UNIEGO,通过代理模型将异构教师知识转化为同质自我中心空间,并采用选择性代理蒸馏自适应筛选可靠监督,在三个自我中心视频理解任务上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18043 2026-06-17 cs.RO cs.LG 新提交 57%

Uncertainty Quantification for Flow-Based Vision-Language-Action Models

基于流的视觉-语言-动作模型的不确定性量化

Ralf Römer, Maximilian Seeliger, Saida Liu, Ben Sturgis, Marco Bagatella, Daniel Marta, Andreas Krause, Angela P. Schoellig

机构 * TU Munich(慕尼黑工业大学) ETH Zurich(苏黎世联邦理工学院) MPI IS Tübingen(马克斯·普朗克智能系统研究所)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 提出利用速度场差异(VFD)量化流匹配模型中的认知不确定性,用于故障检测和主动微调,在LIBERO基准上实现高效任务适应。

Comments Project page: tum-lsy.github.io/uq_vla/. 28 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15503 2026-06-16 cs.AI cs.CY cs.MA cs.NE 新提交 57%

Synthetic Counteradaptation: A Principle of Human-AI Co-evolution

合成反适应:人机共同进化的一个原理

Ivar Frisch, Jackie Kay, Philip Moreira Tomei

机构 * Spectral Circuits Research Independent Researcher(独立研究者) AI Objectives Institute(AI Objectives研究所)

专题命中 知识编辑与模型理解 :prompting(abstract);分类 cs.AI

AI总结 提出合成反适应概念,描述人机通过相互适应策略和行为实现共同进化,并分析围棋、混合动机社交和地缘政治模拟等案例。

Comments 15 pages, 1 figure. Published in Antikythera (MIT Press), February 2025

Journal ref Antikythera Journal, MIT Press, February 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15038 2026-06-16 cs.AI 新提交 57%

Fusion is not one-size-fits-all: Cross-Modal Representation Alignment for Time-to-Event Modeling

融合并非一刀切:用于时间-事件建模的跨模态表示对齐

Zhemin Zhang, Weijie Chen, David Le, Amara Tariq, Alex Wallace, Matthew Stib, Juan Maria Farina, Chadi Ayoub, Reza Arsanjani, Imon Banerjee

机构 * Arizona State University(亚利桑那州立大学) Mayo Clinic(梅奥诊所)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI

AI总结 针对多模态临床数据中的模态不平衡和分布偏移问题,提出一种基于基础模型的跨模态对齐框架,通过四种融合策略在CT影像和纵向EHR数据间进行表示对齐,在肺栓塞死亡率和心血管疾病结局预测任务上验证了融合的有效性,并首次系统分析了时间-事件预测中的模态不平衡对融合行为的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14758 2026-06-16 cs.CV cs.AI 新提交 57%

Disentangling Hallucinations: Orthogonal Semantic Projection for Robust Interpretability

解构幻觉:正交语义投影实现鲁棒可解释性

Emirhan Bilgiç, Baptiste Caramiaux, Zhi Yan, Gianni Franchi

机构 * U2IS, ENSTA, Institut Polytechnique de Paris(巴黎综合理工学院ENSTA学院U2IS实验室) ISIR, Université Sorbonne, Pierre et Marie Curie(索邦大学皮埃尔和玛丽·居里分校ISIR实验室) AMIAD, Pôle Recherche(AMIAD研究部)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 针对视觉语言模型解释中的语义幻觉问题,提出线性语义归因(LSA)理论框架,并引入正交语义投影(OSP)方法,通过正交化查询向量消除共享特征干扰,最小化幻觉。

Comments 41 pages in total. 5 figures, and 2 tables in the main paper; 10 figures and 17 tables in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12088 2026-06-11 cs.CL 新提交 57%

Debiasing Without Protected Attributes: Latent Concept Erasure from Textual Profiles

无保护属性的去偏:从文本画像中消除潜在概念

Shun Shao, Zheng Zhao, Anna Korhonen, Yftah Ziser, Shay B. Cohen

机构 * University of Cambridge(剑桥大学) University of Edinburgh(爱丁堡大学) University of Groningen(格罗宁根大学) NVIDIA Research(英伟达研究院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

AI总结 提出H-SAL方法,利用自我描述文本作为隐式信号进行后处理概念和属性消除,在无直接敏感属性下实现去偏,并在多领域Stack Exchange基准上验证其效果与显式标签去偏相当或更优。

Comments 23 pages, 5 figures, 12 tables. The paper is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10614 2026-06-10 cs.RO cs.CV cs.LG 新提交 57%

Dexterous Point Policy: Learning Point-based Dexterous Hand Policies from Human Demonstrations

灵巧点策略:从人类演示中学习基于点的灵巧手策略

Beomjun Kim, Seong Hyeon Park, Seunghoon Sim, Seungjun Moon, Sanghyeok Lee, Jinwoo Shin

机构 * KAIST(韩国科学技术院)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 提出Dexterous Point Policy框架,通过统一3D关键点表示从人类视频学习灵巧操作策略,无需机器人演示,在真实任务中达到75%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09148 2026-06-09 cs.CL 新提交 57%

Explicit Representation Alignment for Multimodal Sentiment Analysis

显式表示对齐用于多模态情感分析

Baode Wang, Ziming Wang, Huacan Wang, Ronghao Chen, Biao Wu

机构 * AgentAlpha

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

AI总结 针对多模态情感分析中表示不对齐问题,提出利用视觉-语言模型将视觉内容转为文本描述,结合语义标记选择和批量级均匀性正则化,实现跨模态对齐,在多个基准上取得最优性能。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14428 2026-08-17 cs.CV 新提交 50%

GhostPoint: Self-Supervised Representation Learning by Hallucinating Occluded LiDAR Structure

GhostPoint:通过幻觉生成被遮挡的激光雷达结构实现自监督表示学习

Mohamed Abdelsamad, Bin Yang, Michael Ulrich, Miao Zhang, Yakov Miron, Alexandru Paul Condurache, Abhinav Valada

机构 * Bosch Center for AI(博世人工智能中心) University of Freiburg(弗莱堡大学) University of Luebeck(吕贝克大学)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 GhostPoint是一种自监督学习框架,通过实例体素膨胀幻觉生成激光雷达被遮挡区域特征,在nuScenes和Waymo数据集上提升了下游3D检测性能,尤其适用于稀疏扫描和有限标签场景。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13556 2026-08-14 cs.CV 新提交 50%

V-RAE: Rethinking Video Latent Spaces for Generation

V-RAE:重新思考用于生成的视频隐空间

Minghui Guo, Shengqiong Wu, Hao Fei

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本研究提出V-RAE视频表示自动编码器,基于冻结视觉基础模型构建生成隐空间,在多项视频任务上优于现有模型,还引入tFVD指标,证明冻结语义表示可支持多种视频建模任务。

Comments 26 pages, 8 tables, 13 figures, project page: https://v-rae.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10659 2026-08-12 cs.SD 新提交 50%

DINO-A: Adapting Self-Distillation Vision Transformers to General Audio Representation Learning

DINO-A:将自蒸馏视觉Transformer适配至通用音频表示学习

Tomasz Radzikowski, Mateusz Modrzejewski, Przemysław Rokita

机构 * Warsaw University of Technology(华沙理工大学)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 本研究提出DINO-A,将自蒸馏视觉Transformer适配至通用音频表示学习,通过替换输入模态和增强方式实现,在多音频数据集上验证了其性能,发现了补丁分辨率、骨干选择对任务的影响及与BYOL-A v2的性能差异原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05616 2026-08-07 cs.CV 新提交 50%

TruthLens: Object Hallucination Detection via Self-Evaluating Truthfulness Scores in LVLMs

TruthLens:通过大型视觉语言模型(LVLM)中的自评估真实性分数检测对象幻觉

Yanqi Wu, Runhe Lai, Xinhua Lu, Qichao Chen, Zhiping Zhou, Jia-Xin Zhuang, Weijiang Yu, Ruixuan Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Peng Cheng Laboratory(鹏城实验室) University of Nottingham Malaysia(马来西亚诺丁汉大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 TruthLens 是一种无需额外成本的 LVLM 对象幻觉检测框架,通过微调 LM 头部输出真实性分数,在 MS-COCO 数据集上的 Qwen2.5-VL-7B 上实现了超 17% 的 AUROC 提升,性能达当前最优。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03410 2026-08-05 cs.CV 新提交 50%

Earth Embeddings

地球嵌入

Adam J. Stewart, Heng Fang, Isaac A. Corley, Xiao Xiang Zhu

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 该研究介绍地球嵌入的类型、特性与应用场景,通过案例展示其实用工作流程,为嵌入的选择等提供指导,并探讨相关开放问题,助力地球观测领域的高效分析。

Comments book chapter

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00279 2026-08-04 eess.IV cs.CV 新提交 50%

Learning to See Locally and Align Clinically with Pathology Semantics for Radiology Report Generation

学习局部感知并与病理学语义临床对齐的放射学报告生成方法

Xuan Cuong Ngo

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 针对放射学视觉-语言模型的图像-文本对齐缺陷,提出病理学感知对齐框架PALM,结合共享病理学原型与掩码证据建模,在多数据集上提升报告生成与异常鲁棒性

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28993 2026-08-03 cs.RO cs.CV 新提交 50%

ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts

ST-WAM:面向视觉分布偏移下鲁棒操作的语义-时间世界动作模型

Mingxin Wang, Bin Hu, Bin Qian, Kaitao Jiang, Haoning Wu, Feng Yan, Bowen Jing, Ruiyang Hao, Enyi Wang, Kangning Niu, Yandan Yang, Mu Xu, Yan Wang, Houde Liu, Tianlun Li

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 该研究针对视觉分布偏移下机器人操作的鲁棒性问题,提出ST-WAM模型,采用DINOv3等技术,在多个基准测试中取得优异性能,大幅提升了偏移场景下的零样本操作表现。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏