arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-20 至 2026-03-20 共收录 263 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 22 篇

2603.18428 2026-03-20 cs.CL cs.AI 79%

Adaptive Decoding via Test-Time Policy Learning for Self-Improving Generation

通过测试时策略学习实现自适应解码

Asmita Bhardwaj, Yuya Jeremy Ong, Eelaaf Zahid, Basel Shbita

机构 * UC San Diego(加州大学圣地亚哥分校) Plastic Labs IBM Research(IBM研究院)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于强化学习的解码器采样器,通过在测试时调整采样参数提升生成质量,实验表明其在多个数据集上优于传统方法,且能稳定提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18008 2026-03-20 cs.CL cs.AI cs.CY 79%

TherapyGym: Evaluating and Aligning Clinical Fidelity and Safety in Therapy Chatbots

TherapyGym: 评估和对齐疗法聊天机器人中的临床忠实性与安全性

Fangrui Huang, Souhad Chbeir, Arpandeep Khatua, Sheng Wang, Sijun Tan, Kenan Ye, Lily Bailey, Merryn Daniel, Ryan Louie, Sanmi Koyejo, Ehsan Adeli

机构 * Department of Computer Science, Stanford University, Stanford, CA, USA(计算机科学系,斯坦福大学,斯坦福,加州,美国) Department of Psychiatry and Behavioral Sciences, Stanford University, Stanford, CA, USA(精神病学与行为科学系,斯坦福大学,斯坦福,加州,美国) Department of Biomedical Data Science, Stanford University, Stanford, CA, USA(生物医学数据科学系,斯坦福大学,斯坦福,加州,美国) University of California, Berkeley, Berkeley, CA, USA(加州大学伯克利分校,伯克利,加州,美国) The University of Hong Kong, Hong Kong(香港大学,香港)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TherapyGym通过评估和提升疗法聊天机器人中的忠实性与安全性,结合CTRS评分和多标签标注方案,利用RL训练框架改进模型性能,提升临床应用的安全性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18573 2026-03-20 cs.AI cs.IR 77%

Interplay: Training Independent Simulators for Reference-Free Conversational Recommendation

交互:为无参考对话推荐系统训练独立模拟器

Jerome Ramos, Feng Xia, Xi Wang, Shubham Chatterjee, Xiao Fu, Hossein A. Rahmani, Aldo Lipani

机构 * University College London(伦敦大学学院) University of Sheffield(谢菲尔德大学) Missouri University of Science and Technology(密苏里科技大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种无参考模拟框架,通过训练两个独立的LLM分别扮演用户和推荐系统,生成更真实多样化的对话数据,提升推荐系统质量与可扩展性。

Comments Accepted at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06415 2026-03-20 cs.HC cs.AI 77%

Biased AI can Influence Political Decision-Making

有偏见的AI会影响政治决策

Jillian Fisher, Shangbin Feng, Robert Aron, Thomas Richardson, Yejin Choi, Daniel W. Fisher, Jennifer Pan, Yulia Tsvetkov, Katharina Reinecke

机构 * Department of Statistics, University of Washington(华盛顿大学统计学系) Department of Computer Science, University of Washington(华盛顿大学计算机科学系) Dallas, Texas(德克萨斯州达拉斯) Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Psychiatry and Behavioral Science, University of Washington(华盛顿大学精神病学与行为科学系) Department of Communication, Stanford University(斯坦福大学传播学系)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过两个互动实验研究了LLM偏见对政治观点和决策的影响,发现参与者更容易接受与模型偏见一致的观点,即使个人政治倾向相反,且AI知识水平与偏见影响减弱相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19008 2026-03-20 cs.CL cs.AI cs.LG 75%

Hypothesis-Conditioned Query Rewriting for Decision-Useful Retrieval

基于假设的查询重写用于决策有用的检索

Hangeol Chang, Changsun Lee, Seungjoon Rho, Junho Yeo, Jong Chul Ye

机构 * Graduate School of AI, KAIST, Republic of Korea(韩国科学技术院人工智能研究生院) School of Electrical Engineering, KAIST, Republic of Korea(韩国科学技术院电气工程学院) Department of Industrial Engineering, Yonsei University, Republic of Korea(延世大学工业工程系)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出HCQR框架,通过重写查询获取证据支持假设、区分替代方案和验证关键线索,提升检索与答案选择的对齐度,实验表明在MedQA和MMLU-Med上优于传统RAG方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18235 2026-03-20 cs.CR cs.CV 75%

Toward Reliable, Safe, and Secure LLMs for Scientific Applications

迈向科学应用中可靠、安全和安全的LLM

Saket Sanjeev Chaturvedi, Joshua Bergerson, Tanwi Mallick

机构 * Argonne National Laboratory(阿贡国家实验室)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文探讨了科学应用中LLM代理的安全与安全挑战,提出通过多代理系统生成领域特定对抗性安全基准,构建多层次防御框架以提升LLM可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16313 2026-03-20 cs.AI cs.LG 73%

Learning to Predict, Discover, and Reason in High-Dimensional Event Sequences

学习预测、发现和推理高维事件序列

Hugo Math

机构 * Faculty of Applied Computer Science(应用计算机科学系) University of Augsburg(艾格堡大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出统一事件序列建模、因果发现和大语言模型的框架,用于高维事件流中的自动化故障诊断,解决传统方法在高维数据中的不足。

Comments PhD dissertation, 135 pages of main content, 201 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08193 2026-03-20 cs.CL cs.AI cs.HC cs.IR 73%

ClinicalTrialsHub: Bridging Registries and Literature for Comprehensive Clinical Trial Access

ClinicalTrialsHub:连接注册和文献以实现全面的临床试验访问

Jiwoo Park, Ruoqi Liu, Avani Jagdale, Andrew Srisuwananukorn, Jing Zhao, Lang Li, Ping Zhang, Sachin Kumar

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ClinicalTrialsHub通过整合ClinicalTrials.gov数据并自动提取PubMed文献信息,提升结构化临床试验数据访问量83.8%,为患者、医生、研究人员和政策制定者提供证据支持的医学信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18037 2026-03-20 cs.LG 70%

Adapting Methods for Domain-Specific Japanese Small LMs: Scale, Architecture, and Quantization

为领域特定的日语小型语言模型适应方法:规模、架构和量化

Takato Yasuno

专题命中 领域大模型 :language model(abstract);small language model(abstract);分类 cs.LG

AI总结 本文提出系统方法构建日语领域特定小型语言模型,通过QLoRA微调解决训练规模、基础模型选择和架构感知量化问题,实验显示Swallow-8B在Q4_K_M量化下表现最佳,适用于低资源技术领域。

Comments 16 pages, 11 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18470 2026-03-20 cs.HC 67%

CyberJustice Tutor: An Agentic AI Framework for Cybersecurity Learning via Think-Plan-Act Reasoning and Pedagogical Scaffolding

网络正义导师:一种基于思考-计划-行动推理和教学支架的AI框架,用于网络安全学习

Baiqiang Wang, Yan Bai, Juan Li

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 本文提出CyberJustice Tutor,通过Think-Plan-Act推理和教学支架框架,解决传统聊天机器人在网络安全教育中的局限性,验证了其在专业教育中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18116 2026-03-20 cs.CY 67%

Responsible AI in criminal justice: LLMs in policing and risks to case progression

负责任的AI在司法领域:大语言模型在警务中的应用及对案件进展的风险

Muffy Calder, Marion Oswald, Elizabeth McClory-Tiarks, Michele Sevegnani, Evdoxia Taka

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 本文探讨了大语言模型在警务中的应用及其对案件进展的风险,识别了15项可能的应用任务和17项潜在风险,并通过40多个案例展示其影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18273 2026-03-20 cs.AI 57%

EDM-ARS: A Domain-Specific Multi-Agent System for Automated Educational Data Mining Research

EDM-ARS:一种面向领域的多智能体系统用于自动化教育数据挖掘研究

Chenguang Pan, Zhou Zhang, Weixuan Xiao, Chengyuan Yao

专题命中 领域大模型 :LLM(abstract);分类 cs.AI

AI总结 EDM-ARS通过多智能体系统实现教育数据挖掘的自动化研究,包含五个LLM驱动的智能体,生成包含实证分析和同行评审的LaTeX论文。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09909 2026-03-20 cs.AI 57%

MedMASLab: A Unified Orchestration Framework for Benchmarking Multimodal Medical Multi-Agent Systems

MedMASLab:多模态医疗多智能体系统的统一协调框架

Yunhang Qian, Xiaobin Hu, Jiaquan Yu, Siyang Xin, Xiaokun Chen, Jiangning Zhang, Peng-Tao Jiang, Jiawei Liu, Hongwei Bran Li

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Zhejiang University(浙江大学) vivo Stanford University(斯坦福大学)

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 本文提出MedMASLab框架,解决医疗多智能体系统中多模态整合碎片化问题,通过标准化通信协议、自动化评估器和大规模基准测试,揭示领域特定性能差距,为未来自主临床系统建立新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19187 2026-03-20 eess.IV 50%

GenMFSR: Generative Multi-Frame Image Restoration and Super-Resolution

GenMFSR: 生成多帧图像恢复与超分辨率

Harshana Weligampola, Joshua Peter Ebenezer, Weidi Liu, Abhinau K. Venkataramanan, Sreenithy Chandran, Seok-Jun Lee, Hamid Rahim Sheikh

专题命中 领域大模型 :foundation model(abstract)

AI总结 本文提出GenMFSR,首个生成多帧原始图像到RGB超分辨率流水线,利用基础模型图像先验获取子像素信息,实现多帧对齐与高频率区域限制,避免低频率伪影。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18393 2026-03-20 cs.SE 50%

Where are the Hidden Gems? Applying Transformer Models for Design Discussion Detection

隐藏的宝石在哪里?应用变换器模型进行设计讨论检测

Lawrence Arkoh, Daniel Feitosa, Wesley K. G. Assunção

专题命中 领域大模型 :language model(abstract)

AI总结 本文探讨了使用变换器模型(如BERT、RoBERTa等)检测设计讨论的有效性,发现ChatGPT-4o-mini在召回率上表现最佳,而LaMini-Flan-T5-77M提供了轻量级替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 知识编辑与模型理解 17 篇

2603.18009 2026-03-20 cs.CL cs.AI 90%

How Confident Is the First Token? An Uncertainty-Calibrated Prompt Optimization Framework for Large Language Model Classification and Understanding

第一个token的可信度如何?一种用于大型语言模型分类和理解的不确定性校准提示优化框架

Wei Chen, Guoyang Ju, Yuanyuan Qi

机构 * China Jiliang University(中国嘉兴大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LSFU指标和UCPOF框架,通过校准提示优化提升模型性能,实验显示在少样本基准上准确率提升6.03%,超越全RAG方法,并降低检索触发率50.66%。

Comments 27 pages,16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19144 2026-03-20 cs.CL cs.AI 88%

UGID: Unified Graph Isomorphism for Debiasing Large Language Models

UGID: 用于去偏大型语言模型的统一图同构

Zikang Ding, Junchi Yao, Junhao Li, Yi Zhang, Wenbo Jiang, Hongbo Liu, Lijie Hu

机构 * University of Electronic Science and Technology of China(电子科技大学) Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) South China University of Technology(华南理工大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 UGID通过构建Transformer的结构化计算图,在内部表示层面减少模型偏见,通过约束注意力路由和隐藏表示,提升模型行为一致性并保持安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16749 2026-03-20 cs.CL cs.LG 88%

Probing Cultural Signals in Large Language Models through Author Profiling

通过作者画像探测大语言模型中的文化信号

Valentin Lafargue, Ariel Guerra-Adames, Emmanuelle Claeys, Elouan Vuichard, Jean-Michel Loubes

机构 * IMT, Toulouse, France(法国图卢兹IMT学院) INRIA Bordeaux, France(法国波尔多INRIA) ANITI 2, Toulouse, France(法国图卢兹ANITI) IRIT, Toulouse, France(法国图卢兹IRIT) Université de Bordeaux, Bordeaux, France(法国波尔多大学) BPH, Inserm, France(法国Inserm BPH) CNRS IRL CROSSING, Adelaide, Australia(澳大利亚阿德莱德CNRS IRL CROSSING)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究通过零样本设置评估大语言模型能否从歌曲歌词中推断歌手性别和种族,发现模型存在系统性文化偏见,提出两种公平性指标量化差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10045 2026-03-20 cs.CL 83%

Do Language Models Associate Sound with Meaning? A Multimodal Study of Sound Symbolism

语言模型是否将声音与意义关联?一种多模态研究声音象征主义

Jinhong Jeong, Sunghyun Lee, Jaeyoung Lee, Seonah Han, Youngjae Yu

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学) Korea University(韩国大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 研究语言模型在多模态输入中对声音象征性的处理,通过分析不同语义维度下的音节注意力分数,揭示模型对声音与意义关联的理解机制。

Comments 33 pages, 27 tables, 10 figures, accepted to AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18523 2026-03-20 cs.CV cs.AI 79%

Counting Circuits: Mechanistic Interpretability of Visual Reasoning in Large Vision-Language Models

计数电路:大视觉-语言模型中视觉推理的机制可解释性

Liwei Che, Zhiyu Xue, Yihao Quan, Benlin Liu, Zeru Shi, Michelle Hurst, Jacob Feldman, Ruixiang Tang, Ranjay Krishna, Vladimir Pavlovic

机构 * Rutgers University(罗格斯大学) UC Santa Barbara(加州大学圣巴巴拉分校) University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文研究了大视觉-语言模型在计数任务中的机制,提出两种新方法揭示计数电路结构,并通过干预策略提升模型计数精度和视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18353 2026-03-20 cs.AI 79%

Interpretability without actionability: mechanistic methods cannot correct language model errors despite near-perfect internal representations

无需可操作性:机制方法无法纠正语言模型错误,尽管内部表示几乎完美

Sanjay Basu, Sadiq Y. Patel, Parth Sheth, Bhairavi Muralidharan, Namrata Elamaran, Aakriti Kinra, John Morgan, Rajaie Batniji

机构 * University of California San Francisco(加州大学旧金山分校) Waymark University of Pennsylvania(宾夕法尼亚大学) Virginia Commonwealth University(弗吉尼亚 Commonwealth 大学) Stanford University(斯坦福大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 研究探讨了机制解释方法在纠正语言模型错误中的有效性,发现尽管内部表示接近完美,但现有方法无法有效将知识转化为正确输出,揭示了AI安全框架中的潜在问题。

Comments 27 pages, 5 figures, 10 tables. Code available at https://github.com/sanjaybasu/interpretability-triage

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03415 2026-03-20 cs.CL cs.AI 73%

Farther the Shift, Sparser the Representation: Analyzing OOD Mechanisms in LLMs

越远离分布,表示越稀疏:分析LLM中的OOD机制

Mingyu Jin, Yutong Yin, Jingcheng Niu, Qingcheng Zeng, Wujiang Xu, Mengnan Du, Wei Cheng, Zhaoran Wang, Tianlong Chen, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) Northwestern University(西北大学) UKP Lab, TU Darmstadt(德累斯顿技术大学UKP实验室) New Jersey Institute of Technology(新泽西理工学院) NEC Lab American(美国NEC实验室) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究LLM在面对难度增加的输入时内部表示的适应机制,发现任务难度提升导致最后隐藏层表示稀疏化,提出基于稀疏性的课程学习策略提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09734 2026-03-20 cs.CL cs.AI 73%

From Detection to Diagnosis: Advancing Hallucination Analysis with Automated Data Synthesis

从检测到诊断:通过自动化数据合成推进幻觉分析

Yanyi Liu, Qingwen Yang, Tiezheng Guo, Feiyu Qu, Jun Liu, Yingyou Wen

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出从检测到诊断的新范式,通过自动化数据合成生成高质量训练样本,训练出HDM-4B-RL模型,在幻觉诊断任务中超越现有检测模型,实现更可靠的生成式AI系统。

Comments Accepted at The 40th Annual AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16698 2026-03-20 cs.LG 70%

Causality is Key for Interpretability Claims to Generalise

因果性是可解释性主张泛化的关键

Shruti Joshi, Aaron Mueller, David Klindt, Wieland Brendel, Patrik Reizinger, Dhanya Sridhar

机构 * Mila - Qu\'ebec AI Institute \& Universit\'e de Montr\'eal Boston University Cold Spring Harbor Laboratory Max-Planck-Institute for Intelligent Systems, ELLIS Institute T\"ubingen, University of T\"ubingen

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨了大语言模型可解释性研究中因果推理的重要性,提出通过因果表示学习框架,明确可解释性研究的因果层级,以指导方法选择和评估,确保研究结果的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06678 2026-03-20 cs.CV cs.LG 70%

Flexible Concept Bottleneck Model

灵活的概念瓶颈模型

Xingbo Du, Qiantong Dou, Lei Fan, Rui Zhang

专题命中 知识编辑与模型理解 :language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出灵活的概念瓶颈模型(FCBM),通过动态概念适应和改进的稀疏max模块,提升模型在新概念下的适应性与灵活性,实验表明其在多个基准上的表现优异。

Comments To appear in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18911 2026-03-20 cs.CL cs.AI 62%

Progressive Training for Explainable Citation-Grounded Dialogue: Reducing Hallucination to Zero in English-Hindi LLMs

逐步训练用于可解释的引用导向对话:在英语-印地语LLM中将幻觉减少到零

Vedant Pandya

机构 * School of Artificial Intelligence and Data Engineering (SAIDE)(人工智能与数据工程学院) Indian Institute of Technology Jodhpur(印度理工学院朱罗普尔)

专题命中 知识编辑与模型理解 :SFT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出XKD-Dial,一种逐步四阶段训练流程,用于生成可解释的引用导向对话,通过跨语言适应、英语对话SFT与引用定位、双语对话SFT及GRPO对齐与引用感知奖励,减少幻觉并提升印地语能力。

Comments 30 pages, 15 figures, 11 tables. Comprehensive study across 6 LLMs (250M-7B parameters) with explainability analysis. Code and data available upon request

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19980 2026-03-20 cs.SE cs.AI 57%

Neuron-Guided Interpretation of Code LLMs: Where, Why, and How?

指导神经元的代码LLM解释:在哪里、为什么和如何?

Zhe Yin, Xiaodong Gu, Beijun Shen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 研究通过分析代码LLM的神经元层面,发现语言特定神经元和概念层在多语言生成中的作用,提出基于神经元的微调、克隆检测和跨语言总结方法。

Comments Accepted by FSE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18184 2026-03-20 cs.CL 57%

CWoMP: Morpheme Representation Learning for Interlinear Glossing

CWoMP:形态表示学习用于互线 glossing

Morris Alper, Enora Rice, Bhargav Shandilya, Alexis Palmer, Lori Levin

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Colorado Boulder(科罗拉多大学波德福分校)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.CL

AI总结 CWoMP通过对比学习将词素作为原子形式-意义单元进行表示,提升低资源语言的互线 glossing 效率与效果。

Comments Project page: http://cwomp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19232 2026-03-20 cs.CV 50%

Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens

三次离散扩散:高维表示上的离散视觉生成

Yuqing Wang, Chuofan Ma, Zhijie Lin, Yao Teng, Lijun Yu, Shuai Wang, Jiaming Han, Jiashi Feng, Yi Jiang, Xihui Liu

机构 * University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) Carnegie Mellon University(卡内基梅隆大学) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出CubiD,首个高维表示离散生成模型,通过精细掩码实现高维离散表示的生成,具备固定步数的生成能力,且在ImageNet-256上达到SOTA性能,验证离散token保留原始表示能力。

Comments Accepted by CVPR 2026 main track; Code: https://github.com/YuqingWang1029/CubiD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18660 2026-03-20 cs.CV 50%

Multimodal Model for Computational Pathology:Representation Learning and Image Compression

多模态模型用于计算病理学:表示学习与图像压缩

Peihang Wu, Zehong Chen, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳大学先进技术学院)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文探讨了多模态计算病理学中的表示学习和图像压缩技术,分析了自监督学习、多模态数据生成、参数高效适应及多代理协作推理等方向,旨在提升病理诊断的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏