arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-23 至 2026-04-23 共收录 287 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 30 篇

2604.18570 2026-04-23 cs.LG cs.AI cs.CL 82%

A multimodal and temporal foundation model for virtual patient representations at healthcare system scale

面向医疗系统规模的多模态与时间基础模型:虚拟患者表示

Andrew Zhang, Tong Ding, Sophia J. Wagner, Caiwei Tian, Ming Y. Lu, Rowland Pettit, Joshua E. Lewis, Alexandre Misrahi, Dandan Mo, Long Phi Le, Faisal Mahmood

机构 * Department of Pathology, Mass General Brigham, Harvard Medical School(病理学系,马萨诸塞州总医院与哈佛医学院) Cancer Program, Broad Institute of Harvard and MIT(癌症计划,哈佛-麻省理工Broad研究所) Data Science Program, Dana-Farber Cancer Institute(数据科学计划,达纳-法伯癌症研究所) Health Sciences and Technology, Harvard-MIT(健康科学与技术,哈佛-麻省理工) Harvard John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛约翰·A·保罗森工程与应用科学学院,哈佛大学) Department of Biomedical Informatics, Harvard Medical School(生物医学信息学系,哈佛医学院) Electrical Engineering and Computer Science, Massachusetts Institute of Technology (MIT)(电气工程与计算机科学,麻省理工学院(MIT)) School of Computer and Communication Sciences, EPFL, Lausanne, Switzerland(计算机与通信科学学院,EPFL,瑞士洛桑)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Apollo模型,整合多模态和时间信息,构建虚拟患者表示,用于预测疾病风险、治疗反应等,展示其在医疗计算中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20055 2026-04-23 cs.AI cs.HC 81%

From Fuzzy to Formal: Scaling Hospital Quality Improvement with AI

从模糊到正式:利用AI扩展医院质量改进

Patrick Vossler, Jean Feng, Venkat Sivaraman, Robert Gallo, Hemal Kanzaria, Dana Freiser, Christopher Ross, Amy Ou, James Marks, Susan Ehrlich, Christopher Peabody, Lucas Zier

机构 * University of California, San Francisco(加州大学旧金山分校) Zuckerberg San Francisco General Hospital(扎克伯格旧金山总医院)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出通过AI框架优化医院质量改进过程,通过学习LLM提示和自然语言规范,提升质量因素发现的效率与可追溯性,实现人类与AI协同优化。

Comments 34 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25223 2026-04-23 cs.AI 81%

FELA: A Multi-Agent Evolutionary System for Feature Engineering of Industrial Event Log Data

FELA:一种用于工业事件日志数据特征工程的多智能体进化系统

Kun Ouyang, Haoyu Wang, Dong Fang

机构 * Department of Electronic Engineering, Tsinghua University LIGHTSPEED STUDIOS, China

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出FELA,一种基于大语言模型的多智能体系统,通过协作生成、验证和实现新颖特征,提升工业事件日志数据的特征工程效率与性能。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03624 2026-04-23 cs.HC cs.CL 81%

LLAMADRS: Evaluating Open-Source LLMs on Real Clinical Interviews--To Reason or Not to Reason?

LLAMADRS:在真实临床访谈中评估开源大语言模型——理性推理还是不理性推理?

Gaoussou Youssouf Kebe, Jeffrey M. Girard, Einat Liebenthal, Justin Baker, Fernando De la Torre, Louis-Philippe Morency

机构 * Carnegie Mellon University, School of Computer Science(卡内基梅隆大学计算机学院) University of Kansas, Department of Psychology(堪萨斯大学心理学系) McLean Hospital, Harvard Medical School(麦肯纳医院哈佛医学院)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过LLAMADRS基准测试,评估了25种开源大语言模型在结构化临床评估中的表现,发现理性推理模型在误差控制上并不总是更优,提示提示设计对模型性能有关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12910 2026-04-23 cs.CL cs.AI 79%

SciCoQA: Quality Assurance for Scientific Paper--Code Alignment

SciCoQA:科学论文与代码对齐的质量保障

Tim Baumgärtner, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(普遍知识处理实验室(UKP实验室)、计算机科学系、德累斯顿技术大学和应用网络安全国家研究中心ATHENE)

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出SciCoQA数据集,用于评估LLM在科学论文与代码对齐任务中的表现,揭示自动化科学质量保障的关键差距。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20389 2026-04-23 cs.CR cs.AI 77%

CyberCertBench: Evaluating LLMs in Cybersecurity Certification Knowledge

CyberCertBench: 评估大语言模型在网络安全认证知识中的表现

Gustav Keppler, Ghada Elbez, Veit Hagenmeyer

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CyberCertBench,通过行业认证试题评估大语言模型的网络安全知识,验证了前沿模型在通用知识上的表现,但其在特定厂商标准问题上的准确性下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19772 2026-04-23 cs.CL cs.AI 73%

CoAuthorAI: A Human in the Loop System For Scientific Book Writing

CoAuthorAI:一种用于科学书籍写作的人机协作系统

Yangjie Tian, Xungang Gu, Yun Zhao, Jiale Yang, Lin Yang, Ning Li, He Zhang, Ruohua Xu, Hua Wang, Kewen Liao, Ming Liu

机构 * Kexin Technology, Beijing(凯欣科技,北京) Institute for Sustainable Industries and Liveable Cities, Victoria University(可持续产业与宜居城市研究所,维多利亚大学) School of Information Technology, Deakin University(信息科技学院,德坎大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CoAuthorAI通过人机协作系统,结合检索增强生成、专家设计的层级大纲和自动参考链接,提升科学书籍写作的准确性和一致性,实现从文章到整本书的出版扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19765 2026-04-23 cs.CL cs.AI 73%

Do Hallucination Neurons Generalize? Evidence from Cross-Domain Transfer in LLMs

幻觉神经元能否泛化?来自LLMs跨领域迁移的证据

Snehit Vaddi, Pujith Vaddi

机构 * Independent Researcher(独立研究员)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了LLMs中幻觉神经元在不同知识领域间的泛化能力,发现其在跨领域迁移时性能显著下降,表明幻觉机制具有领域特异性。

Comments 18 pages, 5 models, 6 domains, ACL format. Includes causal intervention analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19797 2026-04-23 eess.AS cs.AI cs.CL 62%

Enhancing ASR Performance in the Medical Domain for Dravidian Languages

增强达罗毗荼语言医学领域ASR性能

Sri Charan Devarakonda, Ravi Sastry Kolluru, Manjula Sri Rayudu, Rashmi Kapoor, Madhu G, Anil Kumar Vuppala

机构 * Vallurupalli Nageswara Rao Vignana Jyothi Institute of Engineering and Technology(瓦卢鲁普利·纳加斯瓦拉·拉奥维迦纳·乔蒂学院工程与技术学院)

专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种结合静态感知和声学相似度及动态模型熵的混合置信度训练框架,通过整合真实和合成语音数据提升达罗毗荼语言医学领域ASR性能,实验显示在Telugu和Kannada医疗数据集上显著降低识别错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06606 2026-04-23 cs.LG cs.AI 62%

CEDAR: Context Engineering for Agentic Data Science

CEDAR:面向代理的数据科学应用

Rishiraj Saha Roy, Chris Hinze, Luzian Hahn, Fabian Kuech

机构 * Department of Generative AI, Fraunhofer IIS(生成人工智能系,弗劳恩霍夫研究所)

专题命中 领域大模型 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 CEDAR通过有效的上下文工程解决数据科学任务中的复杂性、数据规模、计算限制和上下文限制问题,采用分步生成计划和代码块的方式提升数据科学任务自动化水平。

Comments Accepted at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19176 2026-04-23 cs.LG cs.IR 57%

From Raw Features to Effective Embeddings: A Three-Stage Approach for Multimodal Recipe Recommendation

从原始特征到有效嵌入:一种多模态食谱推荐的三阶段方法

Jeeho Shin, Kyungho Kim, Kijung Shin

机构 * KAIST(韩国科学技术院)

专题命中 领域大模型 :foundation model(abstract);分类 cs.LG

AI总结 本文提出TESMR三阶段框架,通过内容、关系和学习增强多模态特征,提升食谱推荐性能,实验表明其在Recall@10上比现有方法高7-15%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16658 2026-04-23 math.ST cs.LG stat.ML stat.TH 57%

Multi-Armed Bandits With Machine Learning-Generated Surrogate Rewards

多臂老虎机与机器学习生成的代理奖励

Wenlong Ji, Yihan Pan, Ruihao Zhu, Lihua Lei

机构 * Stanford University(斯坦福大学) Northwestern University(西北大学) Cornell University(康奈尔大学)

专题命中 领域大模型 :language model(abstract);分类 cs.LG

AI总结 本文提出MLA-UCB算法,利用机器学习模型将辅助信息转换为代理奖励,解决代理奖励偏差问题,改进累积遗憾并实现渐近最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20531 2026-04-23 cs.CL 57%

Effects of Cross-lingual Evidence in Multilingual Medical Question Answering

多语言医疗问答中跨语言证据的影响

Anar Yeginbergen, Maite Oronoz, Rodrigo Agerri

机构 * HiTZ Center - Ixa, University of the Basque Country UPV/EHU(巴斯克大学希茨中心 - Ixa,巴斯克国家大学UPV/EHU)

专题命中 领域大模型 :LLM(abstract);分类 cs.CL

AI总结 本文研究了多语言医疗问答中跨语言证据的作用,探讨了不同规模模型在三种外部证据源下的表现,发现大模型在英语中表现更优,而低资源语言需结合英式和目标语言检索以获得相近准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19591 2026-04-23 cs.CV 50%

Structure-Semantic Decoupled Modulation of Global Geospatial Embeddings for High-Resolution Remote Sensing Mapping

全局地理嵌入的结构-语义解耦调制用于高分辨率遥感制图

Jienan Lyu, Miao Yang, Jinchen Cai, Yiwen Hu, Guanyi Lu, Junhao Qiu, Runmin Dong

机构 * Sun Yat-Sen University(中山大学) Tsinghua University(清华大学)

专题命中 领域大模型 :foundation model(abstract)

AI总结 本文提出SSDM框架,通过解耦全局地理表示为两个互补的跨模态注入路径,提升高分辨率遥感制图的结构和语义一致性,实现更准确的土地覆盖分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20826 2026-04-23 cs.CR 50%

An Analysis of Attack Vectors Against FIDO2 Authentication

对FIDO2认证攻击向量的分析

Alexander Berladskyy, Andreas Aßmuth

专题命中 领域大模型 :prompting(abstract)

AI总结 本文分析了FIDO2认证的攻击方法,探讨了两种新型攻击方式,发现其安全性较高,相比传统密码认证更具优势。

Comments 7 pages

Journal ref Proc of the First International Conference on Cross-Domain Security in Distributed, Intelligent and Critical Systems (CROSS-SEC 2026), Lisbon, Portugal, pp.~77--83, April 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 知识编辑与模型理解 16 篇

2604.20098 2026-04-23 cs.LG 92%

Differentiable Conformal Training for LLM Reasoning Factuality

可微 conformal 训练用于 LLM 推理事实性

Nathan Hittesdorf, Marco Salzetta, Lu Cheng

机构 * Department of Computer Science, University of Illinois at Chicago, Chicago, United States(伊利诺伊大学芝加哥分校计算机科学系) Department of Physics, University of Illinois at Urbana-Champaign, Urbana, United States(伊利诺伊大学厄巴纳-香槟分校物理系)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出可微 conformal 训练方法,通过联合验证推理步骤中的事实性声明,提升 LLM 的事实性可靠性,实验显示在保持可靠性的同时,事实性声明保留率提升141%。

Comments Submitted ICML

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14593 2026-04-23 cs.CL cs.AI 90%

Mechanistic Decoding of Cognitive Constructs in Large Language Models

大语言模型中认知结构的机制解码

Yitong Shou, Manhao Guan

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出基于Representation Engineering的Cognitive Reverse-Engineering框架,分析社会比较嫉妒的认知机制,揭示模型内部对嫉妒的结构化编码,并展示如何机械检测和抑制有毒情绪状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14128 2026-04-23 cs.CL cs.AI cs.LG 87%

Rhetorical Questions in LLM Representations: A Linear Probing Study

语言模型表示中的修辞问题:一项线性探测研究

Louie Hong Yao, Vishesh Anand, Yuan Zhuang, Tianyu Jiang

机构 * Independent Researcher(独立研究者) University of Cincinnati(辛辛那提大学) Amazon(亚马逊)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过线性探测研究语言模型对修辞问题的表示,发现修辞信号在模型早期层中出现,并主要由最后一层表示捕捉,且在不同数据集间可转移,但不同数据集训练的探测器在目标数据集上的排名差异较大,反映出修辞问题的多维度编码特性。

Comments 18 pages, 15 figures, accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03335 2026-04-23 cs.LG 86%

EvolveSignal: A Large Language Model Powered Coding Agent for Discovering Traffic Signal Control Strategies

EvolveSignal:一种基于大语言模型的编程代理,用于发现交通信号控制策略

Leizhen Wang, Peibo Duan, Hao Wang, Yue Wang, Jian Xu, Nan Zheng, Zhenliang Ma

机构 * Department of Data Science and Artificial Intelligence, Monash University(数据科学与人工智能系,墨尔本大学) School of Transportation, Southeast University(交通学院,东南大学) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) Department of Civil and Environmental Engineering, Monash University(土木与环境工程系,墨尔本大学) Department of Civil and Architectural Engineering, KTH Royal Institute of Technology(土木与建筑工程系,皇家理工学院)

专题命中 知识编辑与模型理解 :large language model(title);language model(title);LLM(abstract);分类 cs.LG

AI总结 本文提出EvolveSignal,利用大语言模型自动发现可解释的启发式策略,通过程序合成方法优化交通信号控制,实验表明其在减少延误和停车次数方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20202 2026-04-23 cs.SE 86%

Hallucination Inspector: A Fact-Checking Judge for API Migration

幻觉检查员:一种用于API迁移的事实核查法官

Marcos Tileria, Santanu Kumar Dash, Profir-Petru Pârţachi, Earl T. Barr

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出Hallucination Inspector,一种静态分析工具,用于检测LLM生成代码中的幻觉错误,通过轻量评估框架验证抽象语法树中的符号与API文档知识库的一致性,有效减少误报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19974 2026-04-23 cs.LG cs.CL 84%

Are LLM Uncertainty and Correctness Encoded by the Same Features? A Functional Dissociation via Sparse Autoencoders

语言模型的不确定性和正确性是否由相同特征编码?通过稀疏自编码器的函数解离

Het Patel, Tiejin Chen, Hua Wei, Evangelos E. Papalexakis, Jia Chen

机构 * University of California, Riverside(加州大学河滨分校) Arizona State University(亚利桑那州立大学)

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究通过稀疏自编码器探讨语言模型的不确定性与正确性是否由同一内部机制驱动,发现三类功能不同的特征群体,揭示其在模型性能中的作用差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02989 2026-04-23 cs.CL 81%

Mechanistic Interpretability of Large-Scale Counting in LLMs through a System-2 Strategy

通过系统2策略解析大语言模型中大规模计数的机制

Hosein Hasani, Mohammadali Banayeeanzade, Ali Nafisi, Sadegh Mohammadian, Fatemeh Askari, Mobin Bagherian, Amirmohammad Izadi, Mahdieh Soleymani Baghshah

机构 * Sharif University of Technology(谢里夫理工大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种系统2策略,通过分解大计数任务为小问题来提升LLM计数精度,揭示了计数机制并验证了其有效性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20003 2026-04-23 q-bio.QM cs.AI cs.LG 81%

scpFormer: A Foundation Model for Unified Representation and Integration of the Single-Cell Proteomics

scpFormer:单细胞蛋白质组学的统一表示与整合基础模型

Qifeng Zhou, Lei Yu, Yuzhi Guo, Yuwei Miao, Hehuan Ma, Wenliang Zhong, Lin Xu, Junzhou Huang

机构 * Department of Computer Science and Engineering, The University of Texas at Arlington(德克萨斯理工大学计算机科学与工程系) Quantitative Biomedical Research Center, Department of Health Data Science and Biostatistics, Peter O’Donnell Jr. School of Public Health, University of Texas Southwestern Medical Center(德克萨斯西南医学中心量化生物医学研究中心、健康数据科学与生物统计学系、彼得·奥·donnell Jr. 公共卫生学院)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 scpFormer通过连续序列锚定方法整合单细胞蛋白质组数据,生成竞争性的全局细胞表示,支持大规模批次整合和无监督聚类,并可扩展至bulk-omics任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20366 2026-04-23 cs.CV 78%

Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation

在不降低性能的情况下缓解大型视觉-语言模型的幻觉

Xingyu Zhu, Junfeng Fang, Shuo Wang, Beier Zhu, Zhicai Wang, Yonghui Yang, Xiangnan He

机构 * MoE Key Lab of BIPC(BIPC摩尔实验室) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 本文提出MPD框架,通过语义感知组件解耦和可解释参数更新,有效减少幻觉并保持生成能力,实验显示在LLaVA-Bench和MME上减少23.4%幻觉同时保持97.4%的生成能力。

Comments ACL 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20595 2026-04-23 cs.NE cs.LG nlin.AO 74%

An explicit operator explains end-to-end computation in the modern neural networks used for sequence and language modeling

一个显式算子解释了现代用于序列和语言建模的神经网络的端到端计算

Anif N. Shikder, Ramit Dey, Sayantan Auddy, Luisa Liboni, Alexandra N. Busch, Arthur Powanwe, Ján Mináč, Roberto C. Budzinski, Lyle E. Muller

机构 * Department of Mathematics, Western University, London ON, Canada(温哥华大学数学系,伦敦ON,加拿大) Fields Lab for Network Computation, Fields Institute, Toronto ON, Canada(网络计算实验室,Fields研究所,多伦多ON,加拿大) King's University College at Western University, London ON, Canada(温哥华大学国王学院,伦敦ON,加拿大) Department of Neuroscience, University of Lethbridge, Lethbridge AB, Canada(利思堡大学神经科学系,利思堡AB,加拿大)

专题命中 知识编辑与模型理解 :language model(title);分类 cs.LG

AI总结 本文通过建立状态空间模型与可解非线性振荡网络的数学对应关系,揭示了S4D模型的端到端计算机制,并展示了其在序列分类中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20372 2026-04-23 physics.flu-dyn cs.AI cs.LG nlin.PS 73%

AI models of unstable flow exhibit hallucination

AI模型在不稳定流中的表现出现幻觉

Ramdhan Wibawa, Birendra Jha

机构 * University of Southern California(南加州大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究发现AI模型在模拟不稳定流时出现物理不合理的幻觉现象,通过DeepFingers框架改进了多尺度流体动态建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19761 2026-04-23 cs.AI cs.LG cs.NE 73%

EvoForest: A Novel Machine-Learning Paradigm via Open-Ended Evolution of Computational Graphs

EvoForest:一种通过计算图开放式进化实现的新型机器学习范式

Kamer Ali Yuksel, Hassan Sawaf

机构 * aiXplain, Inc.(aiXplain公司)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出EvoForest,一种混合神经符号系统,通过端到端开放式进化计算图,联合进化可重用计算结构、可调用函数族和可训练低维连续组件,以解决结构预测问题中的计算发现挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20135 2026-04-23 cs.CL cs.IR 70%

AFMRL: Attribute-Enhanced Fine-Grained Multi-Modal Representation Learning in E-commerce

AFMRL: 基于属性增强的电商细粒度多模态表示学习

Biao Zhang, Lixin Chen, Bin Zhang, Zongwei Wang, Tong Liu, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出AFMRL,通过属性生成任务提升电商细粒度多模态表示学习,结合属性引导对比学习和检索感知属性强化,实现更精准的相似商品检索。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19902 2026-04-23 cs.CV cs.AI cs.LG 62%

MMCORE: MultiModal COnnection with Representation Aligned Latent Embeddings

MMCORE:多模态连接与表征对齐的潜在嵌入

Zijie Li, Yichun Shi, Jingxiang Sun, Ye Wang, Yixuan Huang, Zhiyao Guo, Xiaochen Lian, Peihao Zhu, Yu Tian, Zhonghua Zhai, Peng Wang

机构 * ByteDance Seed(字节跳动种子)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 MMCORE通过预训练视觉-语言模型生成语义视觉嵌入,结合扩散模型实现多模态图像生成与编辑,提升生成质量并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09591 2026-04-23 cs.CV cs.AI 57%

Variational Visual Question Answering for Uncertainty-Aware Selective Prediction

变分视觉问答用于不确定性感知的选择性预测

Tobias Jan Wieczorek, Nathalie Daun, Mohammad Emtiyaz Khan, Marcus Rohrbach

机构 * TU Darmstadt(图宾根大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 本文提出变分VQA方法,通过变分贝叶斯方法提升视觉问答和视觉推理任务的可靠性,尤其在低误差容忍度下表现优异,且优于AdamW训练模型。

Comments TMLR April 2026 version. 13 pages main paper, 31 pages with appendix. Updated bibliography

Journal ref Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏