arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-24 至 2026-04-24 共收录 178 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 14 篇

2604.20924 2026-04-24 cs.LG 92%

Clinically Interpretable Sepsis Early Warning via LLM-Guided Simulation of Temporal Physiological Dynamics

基于LLM的临床可解释性脓毒症早期预警:时间生理动态模拟

Weizhi Nie, Zhen Qu, Weijie Wang, Chunpei Li, Ke Lu, Bingyang Zhou, Hongzhi Yu

机构 * School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系) Department of Orthopedics, Affiliated Kunshan Hospital of Jiangsu University(江苏大学附属昆山医院骨科部) Tianjin University Chest Hospital(天津大学胸科医院) Haihe Hospital, Tianjin University(天津大学海河医院) Key Laboratory of Education Blockchain and Intelligent Technology, Ministry of Education, Guangxi Normal University(广西师范大学教育区块链与智能技术重点实验室)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于LLM的时间生理动态模拟框架,通过模拟疾病前的生理轨迹,实现可解释的脓毒症早期预警,实验表明其在AUC指标上优于传统方法,并提供可解释的风险趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20331 2026-04-24 cs.CL cs.AI cs.LG 89%

Surrogate modeling for interpreting black-box LLMs in medical predictions

对医疗预测中黑箱大语言模型的代理建模解释

Changho Han, Songsoo Kim, Dong Won Kim, Leo Anthony Celi, Jaewoong Kim, SungA Bae, Dukyong Yoon

机构 * Medical Big Data Research Center, Seoul National University Medical Research Center, Seoul National University College of Medicine(首尔国立大学医学院医学大数据研究中心,首尔国立大学医学院) Department of Biomedical Systems Informatics, Yonsei University College of Medicine(延世大学医学院生物医学系统信息学系) Laboratory for Computational Physiology, Massachusetts Institute of Technology(麻省理工学院计算生理学实验室) Division of Pulmonary, Critical Care and Sleep Medicine, Beth Israel Deaconess Medical Center(贝斯以色列德aconess医疗中心呼吸科、重症医学科和睡眠医学科) Department of Biostatistics, Harvard T.H. Chan School of Public Health(哈佛大学T.H. Chan公共卫生学院生物统计学系) Department of Cardiology, Yongin Severance Hospital, Yonsei University College of Medicine(延世大学医学院永宁松甫医院心内科) Center for Digital Health, Yongin Severance Hospital, Yonsei University Health System(延世大学健康系统永宁松甫医院数字健康中心) Institute for Innovation in Digital Healthcare, Severance Hospital, Seoul, Republic of Korea(首尔松甫医院数字医疗创新研究所)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种代理建模框架,通过输入输出对近似复杂系统,揭示LLM编码知识的范围,揭示医疗预测中潜在的不准确和偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12867 2026-04-24 cs.AI 86%

QuarkMedSearch: A Long-Horizon Deep Search Agent for Exploring Medical Intelligence

QuarkMedSearch: 一种长Horizon深度搜索代理用于探索医学智能

Zhichao Lin, Zhichao Liang, Gaoqiang Liu, Meng Xu, Baoyu Xiang, Shuxin Zhao, Yao Wu, Jian Xu, Guanjun Jiang

机构 * Qwen Applications Business Group, Alibaba(阿里巴巴文库应用事业部)

专题命中 领域大模型 :SFT(summary_cn,abstract);foundation model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出QuarkMedSearch,通过构建医疗多跳数据、训练策略和评估基准,提升垂直领域性能。采用两阶段SFT和RL训练策略,结合大规模医疗知识图谱和实时探索生成长Horizon训练数据,实验显示其在开源模型中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27820 2026-04-24 cs.CL 84%

Improving Clinical Diagnosis with Counterfactual Multi-Agent Reasoning

通过反事实多智能体推理提升临床诊断

Zhiwen You, Xi Chen, Aniket Vashishtha, Simo Du, Gabriel Erion-Barner, Hongyuan Mei, Hao Peng, Yue Guo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Jacobi Medical Center, Albert Einstein College of Medicine(雅各布医疗中心,阿尔伯特·爱因斯坦学院) Department of Emergency Medicine, Beth Israel Deaconess Medical Center(贝斯以色列医疗中心急诊科) Leaning machines(Leanings machines)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种基于反事实推理的多智能体诊断框架,通过反事实案例编辑和反事实概率差距方法,提升诊断准确性与可解释性,尤其在复杂和模糊病例中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21421 2026-04-24 cs.CR cs.AI cs.CL 82%

Differentially Private De-identification of Dutch Clinical Notes: A Comparative Evaluation

差分隐私的荷兰临床笔记去标识化:比较评估

Michele Miranda, Xinlan Yan, Nishant Mishra, Rachel Murphy, Ameen Abu-Hanna, Sébastien Bratières, Iacer Calixto

机构 * Sapienza University of Rome(罗马大学) Translated Amsterdam UMC(阿姆斯特丹大学医学中心) University of Amsterdam(阿姆斯特丹大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究比较了差分隐私、命名实体识别和大型语言模型在荷兰临床文本去标识化中的性能,发现结合语言预处理可显著提升隐私与效用的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21070 2026-04-24 cs.CL cs.LG 82%

DWTSumm: Discrete Wavelet Transform for Document Summarization

DWTSumm:基于离散小波变换的文档摘要

Rana Salama, Abdou Youssef, Mona Diab

机构 * School of Engineering and Applied Science, George Washington University(乔治华盛顿大学工程与应用科学学院) Faculty of Computers and Artificial Intelligence, Cairo University(开罗大学计算机与人工智能学院) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种基于离散小波变换的多分辨率框架,用于长文档摘要,通过分解文本为全局和局部成分,提升摘要的语义相似性和事实一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20906 2026-04-24 cs.SE cs.AI 81%

Biomedical systems biology workflow orchestration and execution with PoSyMed

生物医学系统生物学工作流编排与执行与PoSyMed

Simon Süwer, Zoe Chervontseva, Kester Bagemihl, Jan Baumbach, Olga Tsoy, Andreas Maier

机构 * Institute for Computational Systems Biomedicine, University of Hamburg(计算系统生物医学研究所,汉堡大学) Faculty of Science, Computer Science, Vrije Universiteit Amsterdam(科学与计算机科学学院,阿姆斯特丹自由大学) Department for Mathematics and Computer Science, University of Southern Denmark(数学与计算机科学系,南丹麦大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PoSyMed平台通过模块化架构和容器化流程,提升生物医学分析的可重复性与透明度,利用大语言模型辅助工具识别与参数设置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21590 2026-04-24 cs.CL 79%

AgenticQwen: Training Small Agentic Language Models with Dual Data Flywheels for Industrial-Scale Tool Use

AgenticQwen:通过双数据飞轮训练小型代理语言模型以实现工业级工具使用

Yuanjie Lyu, Chengyu Wang, Haonan Zheng, Yuanhao Yue, Junbing Yan, Ming Wang, Jun Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL

AI总结 本文提出AgenticQwen模型,通过多轮强化学习在合成数据和有限开源数据上训练,结合推理强化学习和代理强化学习的双数据飞轮,提升工业场景下的多步骤推理和工具使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21365 2026-04-24 cs.LG cs.AI cs.CL cs.SE 75%

mcdok at SemEval-2026 Task 13: Finetuning LLMs for Detection of Machine-Generated Code

mcdok在SemEval-2026任务13中的应用:微调大语言模型以检测机器生成的代码

Adam Skurla, Dominik Macko, Jakub Simko

机构 * Faculty of Information Technology, Brno University of Technology(布拉格技术学院) Kempelen Institute of Intelligent Technologies(智能技术研究所)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过微调大语言模型,针对多领域机器生成代码检测问题,提出了改进的mcdok方法,提升了对不同编程语言代码片段的检测能力,但在部分子任务上仍有提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20871 2026-04-24 cs.CY cs.AI cs.CL cs.LG 75%

M-CARE: Standardized Clinical Case Reporting for AI Model Behavioral Disorders, with a 20-Case Atlas and Experimental Validation

M-CARE:用于AI模型行为障碍的标准化临床案例报告,附20例图谱及实验验证

Jihoon Jeong

机构 * Department of Electrical Engineering and Computer Science, Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆bu科学技术大学电气工程与计算机科学系) ModuLabs

专题命中 领域大模型 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 M-CARE框架通过20例案例分析,提出AI行为障碍的诊断与分类方法,揭示Shell指令对模型行为的主导作用及领域依赖性特征。

Comments 31 pages, 5 figures, 14 tables. Second paper in the Model Medicine series (Paper #1: arXiv:2603.04722)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20468 2026-04-24 cs.RO cs.AI cs.CL cs.HC cs.LG 75%

MOMO: A framework for seamless physical, verbal, and graphical robot skill learning and adaptation

MOMO:一种无缝物理、语言和图形机器人技能学习与适应框架

Markus Knauer, Edoardo Fiorini, Maximilian Mühlbauer, Stefan Schneyer, Promwat Angsuratanawech, Florian Samuel Lay, Timo Bachmann, Samuel Bustamante, Korbinian Nottensteiner, Freek Stulp, Alin Albu-Schäffer, João Silvério, Thomas Eiband

机构 * German Aerospace Center (DLR), Institute of Robotics and Mechatronics (RMC)(德国航空航天中心(DLR)机器人与机电研究所) School of Computation, Information and Technology (CIT), Technical University of Munich (TUM)(计算、信息与技术学院(CIT),慕尼黑技术大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MOMO框架,通过三种互补交互方式实现机器人技能的灵活适应,结合触觉、自然语言和图形界面,提升非专家用户在工业环境中的应用能力。

Comments 15 pages, 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22753 2026-04-24 cs.SE 75%

From Rookie to Expert: Manipulating LLMs for Automated Vulnerability Exploitation in Enterprise Software

从新手到专家:利用LLMs实现企业软件自动漏洞利用

Moustapha Awwalou Diouf, Maimouna Tamah Diao, Iyiola Emmanuel Olatunji, Abdoul Kader Kaboré, Jordan Samhi, Gervais Mendy, Samuel Ouya, Jacques Klein, Tegawendé F. Bissyandé

专题命中 领域大模型 :LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文展示如何利用公开的LLMs将新手转变为具备攻击能力的用户,提出RSA策略以绕过安全机制,验证了LLMs在漏洞利用中的有效性,挑战了传统安全原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08561 2026-04-24 cs.SE cs.CL 70%

Automating Computational Reproducibility in Social Science: Comparing Prompt-Based and Agent-Based Approaches

在社会科学中自动化计算可重复性:比较基于提示和基于代理的方法

Syed Mehtab Hussain Shah, Frank Hopfgartner, Arnim Bleier

机构 * University of Koblenz Koblenz Germany University of Koblenz

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了大型语言模型和AI代理能否自动诊断和修复计算失败,通过可控的可重复性测试平台评估两种方法在不同复杂度下的表现,发现基于代理的方法在可重复性上表现更优。

Comments 12 pages, 5 figures. Submitted to ACM conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21082 2026-04-24 cs.CL cs.LG 62%

Weighting What Matters: Boosting Sample Efficiency in Medical Report Generation via Token Reweighting

权重什么重要:通过标记重加权提升医学报告生成的样本效率

Alexander Weers, Daniel Rueckert, Martin J. Menten

机构 * TUM School of Computation, Information and Technology(慕尼黑技术大学计算、信息与技术学院) Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Department of Computing, Imperial College London(伦敦帝国学院计算机系)

专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过标记重加权方法提升医学报告生成的样本效率,实验表明在眼科报告生成中,该方法在较少训练数据下也能获得高质量报告。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 知识编辑与模型理解 7 篇

2604.20945 2026-04-24 cs.CR cs.LG 89%

Breaking Bad: Interpretability-Based Safety Audits of State-of-the-Art LLMs

打破坏:基于可解释性的最新LLM安全审计

Krishiv Agarwal, Ramneet Kaur, Colin Samplawski, Manoj Acharya, Anirban Roy, Daniel Elenius, Brian Matejek, Adam D. Cobb, Susmit Jha

机构 * NuSCI Research Group, Computer Science Laboratory, SRI(NuSCI研究组、计算机科学实验室、SRI)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于可解释性的 jailbreaking 审计方法,评估了八种最新开源LLM的安全性,发现Llama-3模型易受攻击,而GPT-oss-120B表现稳健,Qwen和Phi模型结果混杂,揭示了可解释性工具在安全审计中的有效性及潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20903 2026-04-24 cs.CR 88%

Sensitivity Uncertainty Alignment in Large Language Models

大语言模型中的敏感性不确定性对齐

Prakul Sunil Hiremath, Harshit R. Hiremath

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出SUA框架,用于分析大语言模型在对抗性和模糊输入下的失败原因,通过敏感性与不确定性对齐提升模型可靠性。

Comments 24 pages, 4 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21036 2026-04-24 cs.AI 87%

Who Defines Fairness? Target-Based Prompting for Demographic Representation in Generative Models

谁定义了公平性?面向生成模型的基于目标的提示方法用于人口特征表示

Marzia Binta Nizam, James Davis

机构 * University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 知识编辑与模型理解 :prompting(title);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种轻量级框架,在推理阶段通过提示级干预减轻生成模型中的代表性偏见,允许用户选择多种公平性定义,通过审计目标符合度和肤色分布来评估公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21433 2026-04-24 q-fin.GN 80%

ChatGPT as a Time Capsule: The Limits of Price Discovery

ChatGPT 作为时间胶囊:价格发现的局限性

Sebastian Lehner, Alejandro Lopez-Lira

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文研究ChatGPT等冻结大语言模型如何提取预截止公开文本信息,用于预测股票回报,发现其与分析师修正和股价变化正相关,且预测性随时间 horizon 增加而增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19192 2026-04-24 cs.GR 80%

Empowering NPC Dialogue with Environmental Context Using LLMs and Panoramic Images

通过LLMs和全景图像增强NPC对话的环境上下文

Grega Radež, Ciril Bohak

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出利用LLMs和计算机视觉技术增强游戏NPC的环境感知能力,通过语义分割生成环境结构化数据,提升NPC对玩家行为的响应性和沉浸感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21139 2026-04-24 cs.CL cs.LG 62%

Slot Machines: How LLMs Keep Track of Multiple Entities

老虎机:大语言模型如何跟踪多个实体

Paul C. Bogdan, Jack Lindsey

机构 * Anthropic Fellows Program(Anthropic 合作者计划)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了大语言模型如何在上下文中绑定多个实体及其属性,通过多槽探针方法揭示当前实体与前一实体的表示机制,发现当前实体槽用于事实检索,而前一实体槽支持关系推理,但存在信息与实际使用之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21043 2026-04-24 cs.CY cs.AI cs.LG 62%

Strategic Polysemy in AI Discourse: A Philosophical Analysis of Language, Hype, and Power

人工智能话语中的战略多义性:语言、炒作与权力的哲学分析

Travis LaCroix, Fintan Mallory, Sasha Luccioni

机构 * Durham University(杜伦大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨人工智能话语中语言的策略性使用,分析术语如'幻觉'、'思考链'等的多义性如何影响机构和话语实践,揭示语言作为社会技术机制塑造AI发展与治理的作用。

Comments Accepted in the Ninth Annual ACM Conference on Fairness, Accountability, and Transparency (ACM FAccT) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他LLM 7 篇

2604.21152 2026-04-24 cs.CY cs.AI cs.CL cs.HC cs.IR 92%

Dialect vs Demographics: Quantifying LLM Bias from Implicit Linguistic Signals vs. Explicit User Profiles

方言与人口统计数据:从隐含语言信号与显式用户资料中量化LLM偏见

Irti Haq, Belén Saldías

机构 * University of Washington(华盛顿大学)

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过对比显式身份声明与隐含方言信号,揭示LLM在不同敏感领域中的偏见来源,发现隐含方言可降低拒绝率但影响内容安全。

Comments In The 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26), June 25--28, 2026, Montreal, Canada. ACM, New York, NY, USA, 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19934 2026-04-24 cs.CL 88%

Tracing Relational Knowledge Recall in Large Language Models

追踪大型语言模型中的关系知识回忆

Nicholas Popovič, Michael Färber

机构 * TU Dresden(德累斯顿技术大学)

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究大型语言模型在文本生成中如何回忆关系知识,通过线性探测识别适合关系分类的潜在表示。分析不同潜在表示,发现注意力头对残差流的贡献是线性关系分类的强特征。

Comments ACL 2026 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21570 2026-04-24 cs.SE 87%

SpecSyn: LLM-based Synthesis and Refinement of Formal Specifications for Real-world Program Verification

SpecSyn: 基于大语言模型的正式规范合成与细化以支持现实世界程序验证

Lezhi Ma, Shangqing Liu, Yi Li, Qiong Wu, Han Wang, Lei Bu

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出SpecSyn,一种基于大语言模型的规范生成方法,通过分解程序并引入语义非等价变异和变体辨别机制,提升规范的语义强度,实验显示其在精度和召回率上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21530 2026-04-24 cs.CV cs.AI 79%

Attention-based multiple instance learning for predominant growth pattern prediction in lung adenocarcinoma wsi using foundation models

基于注意力机制的多实例学习用于肺腺癌全切片中主导生长模式预测

Laura Valeria Perez-Herrera, M. J. Garcia-Gonzalez, Karen Lopez-Linares

机构 * Vicomtech Foundation, Basque Research and Technology Alliance (BRTA)(Vicomtech基金会,巴斯克研究与技术联盟(BRTA)) eHealth Group, Bioengineering Area, Biogipuzkoa Health Research Institute(eHealth集团,生物工程领域,Biogipuzkoa健康研究中心)

专题命中 其他LLM :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出基于注意力机制的多实例学习框架,利用预训练病理基础模型提取特征,通过全切片级预测减少标注负担,实验显示细调编码器提升性能,与基线方法相比预测更稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19537 2026-04-24 cs.HC 67%

InvestChat: Exploring Multimodal Interaction via Natural Language, Touch, and Pen in an Investment Dashboard

InvestChat:通过自然语言、触控和笔在投资仪表板中探索多模态交互

Sarah Lykke Tost, Adson Lucas de Paiva Sales, Henrik Østergaard, Vaishali Dhanoa, Gabriela Molina León

专题命中 其他LLM :LLM(abstract,abstract_cn)

AI总结 InvestChat通过多模态输入提升投资探索体验,研究发现自然语言触控和笔输入能增强用户参与度,参与者在不同模态间互补使用,自然语言效果最佳。

Comments Poster accepted at AVI 2026; DOI included

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21326 2026-04-24 cs.CV cs.AI 57%

MiMIC: Mitigating Visual Modality Collapse in Universal Multimodal Retrieval While Avoiding Semantic Misalignment

MiMIC: 缓解通用多模态检索中的视觉模态崩溃并避免语义错位

Juan Li, Chuanghao Ding, Xujie Zhang, Cam-Tu Nguyen

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) School of Artificial Intelligence(人工智能学院)

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 MiMIC通过融合-解码器架构和鲁棒训练方法,解决通用多模态检索中视觉模态崩溃和语义错位问题,在WebQA+和EVQA+数据集上优于早融合和晚融合基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21978 2026-04-24 cs.CV 50%

PAT3D: Physics-Augmented Text-to-3D Scene Generation

PAT3D:融合物理的文本到3D场景生成

Guying Lin, Kemeng Huang, Michael Liu, Ruihan Gao, Hanke Chen, Lyuhao Chen, Beijia Lu, Taku Komura, Yuan Liu, Jun-Yan Zhu, Minchen Li

机构 * Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Genesis AI

专题命中 其他LLM :language model(abstract)

AI总结 PAT3D通过融合视觉-语言模型与物理模拟,生成物理合理且无交叠的3D场景,提升场景质量和物理稳定性。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏