arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-15 至 2026-05-15 共收录 348 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 23 篇

2605.14698 2026-05-15 cs.LG cs.AI 81%

NeuroAtlas: Benchmarking Foundation Models for Clinical EEG and Brain-Computer Interfaces

NeuroAtlas:用于临床EEG和脑机接口的基础模型基准测试

Konstantinos Kontras, Trui Osselaer, Stylianos G. Mouslech, Angeliki-Ilektra Karaiskou, Guido Gagliardi, Thomas Strypsteen, Mohammad Hossein Badiei, Anku Rani, Maarten Vanmarcke, Miguel Bhagubai, Chanakya Ekbote, Jaedong Hwang, Christos Chatzichristos, Paul Pu Liang, Maarten De Vos

机构 * KU Leuven(鲁文大学) MIT(麻省理工学院)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 NeuroAtlas是首个大规模EEG基准测试,包含42个数据集和260万小时的数据,涵盖癫痫、睡眠医学和脑年龄估计等领域,评估了EEG基础模型与通用时间序列模型的性能,揭示了现有模型在统一EEG模型上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14566 2026-05-15 cs.CV 78%

SpectraFlow: Unifying Structural Pretraining and Frequency Adaptation for Medical Image Segmentation

SpectraFlow:统一结构预训练与频率适应用于医学图像分割

Zhiquan Chen, Haitao Wang, Guowei Zou, Hejun Wu

机构 * School of Computer Science(计算机科学学院) Engineering, Sun Yat-sen University(工程,中山大学) Guangdong Key Laboratory of Big Data Analysis(大数据分析与处理重点实验室)

专题命中 领域大模型 :pretraining(title,abstract)

AI总结 本文提出SpectraFlow框架,结合结构感知编码器预训练与边界导向解码,解决低数据下医学图像分割的挑战,提升鲁棒性和边界精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14301 2026-05-15 cs.LG stat.ML 77%

Language-Induced Priors for Domain Adaptation

领域适应中的语言诱导先验

Qiyuan Chen, Jiayu Zhou, Raed Al Kontar

机构 * University of Michigan(密歇根大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出语言诱导先验(LIP)用于领域适应,通过利用目标领域的专家描述,结合预训练大语言模型学习偏好,改进源域选择并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14089 2026-05-15 cs.AI 77%

SkillFlow: Flow-Driven Recursive Skill Evolution for Agentic Orchestration

SkillFlow: 以流程驱动的递归技能进化用于代理编排

Mingda Zhang, Tiesunlong Shen, Haoran Luo, Wenjin Liu, Zikai Xiao, Erik Cambria, Xiaoying Tang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 SkillFlow通过流程驱动的递归技能进化解决代理编排中的策略崩溃、梯度方差高和无指导技能进化问题,实现高效任务编排。

Comments 49 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15168 2026-05-15 cs.CL cs.AI cs.LG stat.ML 75%

Text Knows What, Tables Know When: Clinical Timeline Reconstruction via Retrieval-Augmented Multimodal Alignment

文本知晓什么,表格知晓何时:通过检索增强的多模态对齐进行临床时间线重建

Sayantan Kumar, Shahriar Noroozizadeh, Juyong Kim, Jeremy C. Weiss

机构 * National Library of Medicine National Institutes of Health(国家医学图书馆国立卫生研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种检索增强的多模态对齐框架,通过结合文本和结构化EHR数据,提高临床时间线的精确度,提升时间一致性,同时保持事件匹配率。

Comments Sayantan Kumar, Shahriar Noroozizadeh, Juyong Kim (authors contributed equally)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01664 2026-05-15 cs.AI cs.LG 73%

FlowSteer: Towards Agents Designing Agentic Workflows via Reinforced Progressive Canvas Editing

FlowSteer:通过强化递进画布编辑设计代理工作流

Mingda Zhang, Wenjin Liu, Tiesunlong Shen, Qika Lin, Rui Mao, Erik Cambria, Xiaoying Tang, Haoran Luo

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出FlowSteer,一种通过强化学习递进画布编辑设计代理工作流的新范式,解决传统工作流构建中依赖人类、缺乏图级执行反馈和无法在长周期内修复错误的问题。

Comments 51 pages, 6 figures, 5 tables. Project page: http://flowsteer.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14671 2026-05-15 cond-mat.mtrl-sci cs.AI 70%

Agentic Design of Compositional Descriptors via Autoresearch for Materials Science Applications

通过Autoresearch进行组合描述符的代理设计用于材料科学应用

Matteo Cobelli, Stefano Sanvito

机构 * School of Physics(物理系) CRANN Institute, Trinity College, Dublin 2, Dublin, Ireland(CRANN研究所,三一学院,都柏林2号,都柏林,爱尔兰)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过Autoresearch框架设计输入描述符,利用大语言模型生成化学化合物的组合描述符,并通过随机森林工作流评估,提升了材料性质预测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14660 2026-05-15 cs.AI 70%

MindGap: A Conversational AI Framework for Upstream Neuroplastic Intervention in Post-Traumatic Stress Disorder

MindGap:一种用于创伤后应激障碍上游神经可塑性干预的对话式AI框架

Eranga Bandara, Ross Gore, Asanga Gunaratna, Ravi Mukkamala, Nihal Siriwardanagea, Sachini Rajapakse, Isurunima Kularathna, Pramoda Karunarathna, Wathsala Herath, Chalani Rajapakse, Sachin Shetty, Anita H. Clayton, Christopher K. Rhea, Ng Wee Keong, Kasun De Zoysa, Amin Hass, Shaifali Kaushik, Preston Samuel, Atmaram Yarlagadda

机构 * Old Dominion University(旧 Dominion 大学) AI Motion Labs(AI Motion 实验室) Nanyang Technological University(南洋理工大学) University of Colombo(科伦坡大学) Accenture Technology Labs(Accenture 技术实验室) Department of Psychiatry and Neurobehavioral Sciences(精神病学与神经行为科学系) University of Virginia School of Medicine(弗吉尼亚大学医学院) Blanchfield Army Community Hospital(Blanchfield 军队社区医院) McDonald Army Health Center(McDonald 军队健康中心)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MindGap通过依赖起源于佛教心理框架的三层观察层,实现对PTSD患者神经可塑性康复的结构化干预,通过设备端运行的轻量级大语言模型提供每日校准暴露训练,实现对神经可塑性路径的上游溶解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14542 2026-05-15 cs.AI 70%

VerbalValue: A Socially Intelligent Virtual Host for Sales-Driven Live Commerce

VerbalValue:面向销售驱动直播电商的社会智能虚拟主持人

Yuyan Chen

机构 * Cornell University(康奈尔大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出VerbalValue,一种以销售转化为导向的虚拟主持人,通过构建产品知识库和销售术语词典,结合大语言模型微调,提升直播电商中的信息传达和说服力。

Comments Accepted to the CVPR 2026 HiGen Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13905 2026-05-15 cs.SE cs.AI 70%

A Non-Destructive Methodological Framework for Modernizing Legacy Clinical Reporting Systems for AI-Driven Pharmacoinformatics: A SAS Case Study

一种非破坏性的方法论框架用于现代ize遗留临床报告系统以实现AI驱动的药理信息学:SAS案例研究

Jaime Yan

机构 * Harrisburg University of Science and Technology(哈里斯堡科学与技术大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出非破坏性框架,通过元数据层实现遗留系统与AI的兼容,SAS案例显示其在保持原有功能的同时提升AI处理能力,减少专有代码并验证药理学应用效果。

Comments 29 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14600 2026-05-15 cs.CL 57%

SciPaths: Forecasting Pathways to Scientific Discovery

SciPaths: 预测科学发现的路径

Eric Chamoun, Yizhou Chi, Yulong Chen, Rui Cao, Zifeng Ding, Michalis Korakakis, Andreas Vlachos

机构 * University of Cambridge(剑桥大学) The Alan Turing Institute(艾伦·图灵研究所) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 领域大模型 :language model(abstract);分类 cs.CL

AI总结 本文提出SciPaths基准,通过专家标注的262条金路径和2444条银路径,评估科学发现路径预测任务,发现核心方法依赖最难恢复,需改进分解质量以提升端到端路径恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02271 2026-05-15 cs.CV 50%

Medical Report Generation: A Hierarchical Task Structure-Based Cross-Modal Causal Intervention Framework

医学报告生成:基于层次任务结构的跨模态因果干预框架

Yucheng Song, Yifan Ge, Junhao Li, Zhining Liao, Zhifang Liao

专题命中 领域大模型 :language model(abstract)

AI总结 本文提出HTSC-CIF框架,通过层次任务分解解决医学报告生成中领域知识不足、跨模态对齐差和虚假相关性三大问题,提升生成效果。

Comments Due to issues with the training epochs and training strategy in our paper, there are numerical errors in the result comparison table presented in the preprint. Therefore, we have decided to withdraw the manuscript for further revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05008 2026-05-15 cs.CV 50%

Multimodal Causal-Driven Representation Learning for Generalizable Medical Image Segmentation

多模态因果驱动表示学习用于通用化医学图像分割

Xusheng Liang, Lihua Zhou, Nianxin Li, Miao Xu, Ziyang Song, Dong Yi, Jinlin Wu, Jiawei Ma, Hongbin Liu, Zhen Lei, Jiebo Luo

机构 * City University of Hong Kong(香港城市大学) Shenzhen Loop Area Institute(深圳河套学院) CAIR, HKISI, Chinese Academy of Sciences(中国科学院计算智能研究所) UESTC(电子科技大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 领域大模型 :language model(abstract)

AI总结 本文提出MCDRL框架,结合因果推理与VLM解决医学图像分割的领域泛化问题,通过文本提示识别病变区域并消除领域特定影响,提升分割准确性与泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 知识编辑与模型理解 17 篇

2605.11453 2026-05-15 cs.MA cs.AI cs.LG cs.SI math.SP 92%

Predictive Maps of Multi-Agent Reasoning: A Successor-Representation Spectrum for LLM Communication Topologies

多智能体推理的预测地图:一种用于LLM通信拓扑的后继表示谱

Ethan Parks, Dalal Alharthi

机构 * University of Arizona(亚利桑那大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于后继表示谱的结构诊断方法,用于评估多智能体LLM通信拓扑的性能,通过分析谱半径、谱间隙和条件数等指标,预测拓扑在漂移、共识和扰动鲁棒性方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14075 2026-05-15 cs.LG cs.CL 90%

Rethinking Layer Relevance in Large Language Models Beyond Cosine Similarity

重新思考超越余弦相似度的大型语言模型层相关性

Cristian Hinostroza, Rodrigo Toro Icarte, Christ Devia, Andres Carvallo De Ferari, Eugenio Herrera-Berg, Denis Parra, Jorge F Silva

机构 * Pontificia Universidad Católica de Chile(天主教智利大学) National Center for Artificial Intelligence (CENIA)(人工智能国家中心) Universidad de Chile(智利大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 本文指出余弦相似度不适合作为评估层移除影响的指标,提出基于模型准确率下降的实际指标,以更准确地评估层重要性,改进模型压缩策略。

Comments Published at ICLR 2026

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14749 2026-05-15 cs.CL cs.AI cs.LG 89%

Non-linear Interventions on Large Language Models

非线性干预大语言模型

Sangwoo Kim

机构 * Department of Linguistics, Seoul National University, Republic of Korea(韩国首尔国立大学语言系)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出非线性干预方法,用于处理大语言模型中非线性特征,通过隐式特征干预提升拒绝绕过性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13919 2026-05-15 cs.CL cs.LG 88%

Merging Methods for Multilingual Knowledge Editing for Large Language Models: An Empirical Odyssey

多语言知识编辑中合并方法的融合:一项实证探索

Kunil Lee, Ki-Young Shin, Jong-Hyeok Lee, Young-Joo Suh

机构 * Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系) Designovel Co., Ltd.(Designovel公司) LLSOLLU Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了多语言知识编辑中向量合并方法的有效性,分析了TSVM在减少多语言干扰方面的表现,并发现权重缩放因子和秩压缩比对性能有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14535 2026-05-15 cs.LG 88%

Exploring Geographic Relative Space in Large Language Models through Activation Patching

通过激活修补探索大语言模型中的地理相对空间

Stef De Sabbata, Rahul Baiju, Stefano Mizzaro, Kevin Roitero

机构 * School of Geography, Geology and the Environment, University of Leicester, UK(地理、地质与环境学院,莱斯特大学,英国) Department of Mathematics, Computer Science and Physics, University of Udine, Italy(数学、计算机科学与物理系,乌迪内大学,意大利)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 研究大语言模型处理地理相对空间的机制,通过激活修补技术揭示其内部运作,提升地理应用的安全性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14115 2026-05-15 cs.CL 84%

When Evidence Conflicts: Uncertainty and Order Effects in Retrieval-Augmented Biomedical Question Answering

当证据冲突时:检索增强式生物医学问答中的不确定性与顺序效应

Yikun Han, Mengfei Lan, Halil Kilicoglu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文评估了六个开源LLM在不同证据条件下的表现,发现证据冲突导致模型准确性下降,并提出冲突感知的置疑评分以提升鲁棒性。

Comments Accepted by BioNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11410 2026-05-15 cs.AI 83%

What Do EEG Foundation Models Capture from Human Brain Signals?

EEG基础模型从人类大脑信号中捕捉了什么?

Ling Tang, Qian Chen, Jilin Mei, Houshi Xu, Quanshi Zhang, Jing Shao, Na Zou, Xia Hu, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Tongji University(同济大学) University of Houston(休斯顿大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 研究探讨EEG基础模型如何从原始信号中学习,并通过实验验证其表示与特征工程基线的对齐情况,揭示了模型学习、使用及解释性方面的关键发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13483 2026-05-15 cs.LG cs.AI 81%

Finding Interpretable Prompt-Specific Circuits in Language Models

在语言模型中寻找可解释的提示特定电路

Gabriel Franco, Lucas M. Tassis, Azalea Rohr, Mark Crovella

机构 * Department of Computer Science(计算机科学系) Boston University(波士顿大学) Faculty of Computing & Data Sciences(计算与数据科学学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ACC++方法,用于识别语言模型中可解释的提示特定电路,通过分析注意力机制揭示模型行为,展示电路在不同任务中的可解释性及语言相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05306 2026-05-15 cs.LG cs.AI cs.CL 80%

LLMs Should Express Uncertainty Explicitly

大型语言模型应显式表达不确定性

Junyu Guo, Shangding Gu, Ming Jin, Costas Spanos, Javad Lavaei

机构 * University of California, Berkeley(加州大学伯克利分校) Virginia Tech(弗吉尼亚理工大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究通过训练使模型在回答时显式表达不确定性,以减少过度自信的错误,提升回答质量,并通过检索增强生成技术改进最终响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14449 2026-05-15 cs.LG cs.AI cs.CL 75%

When Answers Stray from Questions: Hallucination Detection via Question-Answer Orthogonal Decomposition

当答案偏离问题:通过问题-答案正交分解进行幻觉检测

Siyang Yao, Erhu Feng, Yubin Xia

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出QAOD框架,通过正交分解回答表示以抑制领域变化,结合双策略实现领域内检测与跨领域泛化,提升检测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23912 2026-05-15 cs.CL cs.AI 73%

LoVeC: Reinforcement Learning for Better Verbalized Confidence in Long-Form Generations

LoVeC:强化学习用于长文生成中的更可靠的 verbalized 自信度

Caiqi Zhang, Xiaochen Zhu, Chengzu Li, Nigel Collier, Andreas Vlachos

机构 * University of Cambridge(剑桥大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LoVeC,一种基于强化学习的方法,通过在长文生成过程中实时附加数值自信度评分,提升事实性生成的可靠性。实验表明,该方法在多个长文问答数据集上实现了更好的校准和跨领域泛化能力,且效率显著高于传统自一致性方法。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14694 2026-05-15 cs.LG 70%

The Rate-Distortion-Polysemanticity Tradeoff in SAEs

SAEs中速率-失真-多义性权衡

Tommaso Mencattini, Francesco Montagna, Francesco Locatello

机构 * EPFL(瑞士联邦理工学院) Institute of Science and Technology Austria(奥地利科学技术研究所)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了SAEs中准确重建输入、高效编码和可解释性之间的矛盾,发现限制SAEs为单义性必然导致速率和失真增加,且多义性由训练数据分布决定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14406 2026-05-15 cs.LG cs.CV 70%

GeoViSTA: Geospatial Vision-Tabular Transformer for Multimodal Environment Representation

GeoViSTA:用于多模态环境表示的地理视觉-表格变压器

Yuhao Liu, Sadeer Al-Kindi, Ashok Veeraraghavan, Guha Balakrishnan

机构 * Department of Electrical and Computer Engineering, Rice University(理海大学电气与计算机工程系) Center for Cardiovascular Computational and Precision Health, Department of Cardiology, DeBakey Heart and Vascular Center, Houston Methodist(休斯顿方法主义医疗中心心血管计算与精准健康中心、心内科部门、德贝基心脏和血管中心)

专题命中 知识编辑与模型理解 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 GeoViSTA通过融合栅格影像与表格数据,构建统一的地理嵌入表示,提升对环境、社会和健康问题的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01172 2026-05-15 cs.CL 70%

Energy-Regularized Sequential Model Editing on Hyperspheres

超球面能量正则化的序列模型编辑

Qingyuan Liu, Jia-Chen Gu, Yunzhi Yao, Hong Wang, Nanyun Peng

机构 * Columbia University(哥伦比亚大学) University of California, Los Angeles(加州大学洛杉矶分校) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SPHERE方法,通过超球面能量正则化提升模型在序列编辑中的稳定性与知识保留能力,实验表明其在编辑性能上优于基线方法16.41%。

Comments Accepted by ICLR 2026. The code is available at https://github.com/PlusLabNLP/SPHERE. Project page: https://www.qingyuanliu.net/sphere_projectpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14231 2026-05-15 cs.LG cs.AI cs.SD 62%

AudioMosaic: Contrastive Masked Audio Representation Learning

AudioMosaic:基于对比学习的音频表示学习

Hanxun Huang, Qizhou Wang, Xingjun Ma, Cihang Xie, Christopher Leckie, Sarah Erfani

机构 * School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系统学院) Baskin School of Engineering, University of California, Santa Cruz, USA(加州大学圣克鲁兹分校工程学院) Institute of Trustworthy Embodied AI, Fudan University, China(复旦大学可信具身人工智能研究所)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 AudioMosaic通过结构化时频掩码构建正样本对,提升音频表示学习效果,实现跨数据集和声学条件的强迁移能力,优于生成方法。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16196 2026-05-15 cs.CV cs.AI 57%

Seeing Through the Brain: New Insights from Decoding Visual Stimuli with fMRI

穿透大脑:通过fMRI解码视觉刺激的新见解

Zheng Huang, Enpei Zhang, Weikang Qiu, Yinghao Cai, Carl Yang, Elynn Chen, Xiang Zhang, Rex Ying, Dawei Zhou, Yujun Yan

机构 * Dartmouth College(达特茅斯学院) Yale University(耶鲁大学) Emory University(埃默里大学) New York University(纽约大学) UNC Charlotte(北卡罗来纳大学柴郡分校) Virginia Tech(弗吉尼亚理工大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 研究通过fMRI信号重建视觉刺激,发现文本空间比视觉或联合文本图像空间更接近神经活动结构,并提出PRISM模型利用结构化文本空间提升重建效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07459 2026-05-15 cs.CV 50%

DAPL: Integration of Positive and Negative Descriptions in Text-Based Person Search

DAPL: 文本基于人物搜索中正负描述的整合

Yuchuan Deng, Zhanpeng Hu, Zijie Xin, Chuang Deng, Qijun Zhao

机构 * Sichuan University(四川大学) Renmin University of China(中国人民大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 DAPL通过整合正负描述提升文本基于人物搜索中视觉-语言模型的解释准确性,结合DIAC和SIAM学习,引入DTS损失以平衡视觉与文本嵌入的粗细粒度对齐,提升匹配精度和鲁棒性。

Journal ref 2025 IEEE International Conference on Multimedia and Expo (ICME)

详情

展开后加载摘要…

URL PDF HTML 收藏