arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-07 至 2026-04-07 共收录 396 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 83 篇

2604.03250 2026-04-07 cs.CY 67%

Ethical Implications of Training Deceptive AI

训练欺骗性人工智能的伦理影响

Jason Starace, Bert Baumgaertner, Terence Soule

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出DRL框架,通过生物安全等级系统模型,对欺骗性算法研究进行分类,评估风险并制定相应保障措施,以填补监管与研究间的治理空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06252 2026-04-07 cs.AR 67%

D-Legion: A Scalable Many-Core Architecture for Accelerating Matrix Multiplication in Quantized LLMs

D-Legion:一种可扩展的多核架构,用于加速量化大语言模型中的矩阵乘法

Ahmed J. Abdelmaksoud, Cristian Sestito, Shiwei Wang, Themis Prodromakis

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出D-Legion架构,通过自适应精度流体数组核心加速量化大语言模型的矩阵乘法,实现低延迟、高内存节省和高吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07700 2026-04-07 cs.SE 67%

PatchTrack: A Comprehensive Analysis of ChatGPT's Influence on Pull Request Outcomes

PatchTrack: 对ChatGPT对拉取请求结果影响的全面分析

Daniel Ogenrwot, John Businge

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 研究分析了338个包含ChatGPT使用的拉取请求,发现ChatGPT生成的代码被完全采用的比例仅为25%,开发者通常将AI输出作为起点进行调整和迭代,影响不仅限于代码生成,还涉及协作流程中的决策过程。

Comments 59 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13777 2026-04-07 cs.CL cs.AI 62%

Generate Then Correct: Single Shot Global Correction for Aspect Sentiment Quad Prediction

生成后再校正:面向方面情感四元组预测的单次全局校正

Shidong He, Haoyu Wang, Wenjie Luo

机构 * School of Cyber Security and Computer, Hebei University(河北大学网络空间安全与计算机学院) Faculty of Computer Science, Dalhousie University(达尔豪斯大学计算机科学学院)

专题命中 效率与部署 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出生成后再校正方法,通过生成器和校正器实现单次全局校正,提升方面情感四元组预测性能,实验表明优于现有基线模型。

Comments 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03643 2026-04-07 cs.CV cs.CL cs.LG 62%

Optical Context Compression Is Just (Bad) Autoencoding

光学上下文压缩只是(糟糕)的自编码

Ivan Yee Lee, Cheng Yang, Taylor Berg-Kirkpatrick

机构 * UC San Diego(加州大学圣迭戈分校)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究比较了光学上下文压缩与直接方法,发现直接方法在重建和语言建模中表现更优,光学压缩未超越最佳直接基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04297 2026-04-07 cs.AI 57%

PanLUNA: An Efficient and Robust Query-Unified Multimodal Model for Edge Biosignal Intelligence

PanLUNA: 一种高效且稳健的多模态模型,用于边缘生物信号智能

Marija Zelic, Anna Tegon, Yawei Li, Thorir Mar Ingolfsson, Luca Benini

机构 * DEI, University of Bologna(博洛尼亚大学DEI)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 PanLUNA是一种紧凑的多模态基础模型,能够高效处理EEG、ECG和PPG信号,实现跨模态早期融合,同时在推理时对缺失模态具有鲁棒性。其在生物信号检测和睡眠分期任务中表现出色。

Comments 5 pages, 5 tables, 1 figure, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15458 2026-04-07 cs.LG 57%

Amortized Safe Active Learning for Real-Time Data Acquisition: Pretrained Neural Policies From Simulated Nonparametric Functions

为实时数据采集设计的 amortized 安全主动学习:从模拟非参数函数中预训练的神经策略

Cen-You Li, Marc Toussaint, Barbara Rakitsch, Christoph Zimmer

机构 * Technical University of Berlin(柏林工业大学) University of Helsinki(赫尔辛基大学) Robotics Institute Germany(德国机器人研究所) Bosch Center for Artificial Intelligence(博世人工智能中心) Baden-Württemberg Cooperative State University, Mannheim(巴登-符腾堡州立合作大学曼海姆校区)

专题命中 效率与部署 :pretraining(abstract);分类 cs.LG

AI总结 本文提出了一种用于回归的 amortized 主动学习和 amortized 安全主动学习方法,通过预训练神经策略替代昂贵的在线计算,提升实时决策效率,同时保持学习质量。

Comments Part of the content published earlier at arXiv:2407.17992. Proceedings of AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03759 2026-04-07 cs.RO cs.AI 57%

Build on Priors: Vision--Language--Guided Neuro-Symbolic Imitation Learning for Data-Efficient Real-World Robot Manipulation

基于先验知识:视觉-语言引导的神经符号模仿学习用于数据高效的现实机器人操作

Pierrick Lorang, Johannes Huemer, Timothy Duggan, Kai Goebel, Patrik Zips, Matthias Scheutz

机构 * Tufts University(塔夫茨大学) Austrian Institute of Technology GmbH (AIT)(奥地利技术研究所(AIT))

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 本文提出一种可扩展的神经符号框架,通过少量未标注的示范数据自动构建符号规划领域和高效控制策略,无需手动领域工程,提升现实机器人操作的效率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03330 2026-04-07 cs.CR cs.AI 57%

AICCE: AI Driven Compliance Checker Engine

AICCE:基于人工智能的合规检查引擎

Mohammad Wali Ur Rahman, Martin Manuel Lopez, Lamia Tasnim Mim, Carter Farthing, Julius Battle, Kathryn Buckley, Salim Hariri

机构 * University of Arizona(亚利桑那大学) Avirtek, Inc.(Avirtek公司) Joint Interoperability Test Command (JITC), United States Department of Defense(美国国防部联合互操作性测试司令部)

专题命中 效率与部署 :LLM(abstract);分类 cs.AI

AI总结 本文提出AICCE,一种结合双架构推理与检索增强生成的新型生成系统,用于自动化IPv6合规性验证,通过语义编码提升检测精度,实现99%的准确率和F1分数。

Comments Accepted for publication in IEEE Transactions on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04913 2026-04-07 cs.CV 50%

A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens

一个标记值得一个标记:高效生成世界建模与Delta标记

Tommie Kerssies, Gabriele Berton, Ju He, Qihang Yu, Wufei Ma, Daan de Geus, Gijs Dubbelman, Liang-Chieh Chen

机构 * Amazon(亚马逊) Eindhoven University of Technology(埃因霍温理工大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文提出DeltaTok和DeltaWorld,通过将视频特征差值编码为单个连续标记,实现高效生成世界建模,减少参数和计算量,提升预测多样性。

Comments CVPR 2026. Code and weights: https://deltatok.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04905 2026-04-07 cs.CV cs.GR cs.HC 50%

ClickAIXR: On-Device Multimodal Vision-Language Interaction with Real-World Objects in Extended Reality

ClickAIXR: 基于设备的多模态视觉-语言交互与现实世界对象在扩展现实中的交互

Dawar Khan, Alexandre Kouyoumdjian, Xinyu Liu, Omar Mena, Dominik Engel, Ivan Viola

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 效率与部署 :language model(abstract)

AI总结 ClickAIXR通过设备端视觉-语言模型与基于控制器的对象选择方法,实现对现实世界对象的精确点击交互,提升隐私和延迟方面的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03949 2026-04-07 cs.IR 50%

Semantic IDs for Recommender Systems at Snapchat: Use Cases, Technical Challenges, and Design Choices

在Snapchat中的推荐系统中使用语义ID:用例、技术挑战和设计选择

Clark Mingxuan Ju, Tong Zhao, Leonardo Neves, Liam Collins, Bhuvesh Kumar, Jiwen Ren, Lili Zhang, Wenfeng Zhuo, Vincent Zhang, Xiao Bai, Jinchao Li, Karthik Iyer, Zihao Fan, Yilun Xu, Yiwen Chen, Peicheng Yu, Manish Malik, Neil Shah

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文探讨了在Snapchat中使用语义ID的挑战、实验及设计选择,展示了其在推荐系统中的应用效果和实际成果。

Comments Accepted to the Industry Track of SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03933 2026-04-07 cs.DC 50%

Deploy, Calibrate, Monitor, Heal -- No Human Required: An Autonomous AI SRE Agent for Elasticsearch

部署、校准、监控、修复——无需人工:一个用于Elasticsearch的自主AI SRE代理

Muhamed Ramees Cheriya Mukkolakkal

专题命中 效率与部署 :LLM(abstract)

AI总结 本文提出ES Guardian Agent,通过十一阶段自主管理Elasticsearch全生命周期,利用多源预测失败引擎实现故障预测与修复,展示LLM在高可用性目标中的应用。

Comments 8 pages, 1 figure, 15 tables. Submitted to IEEE CNSM 2026. Cluster: Elasticsearch 8.17.0, 3 master + 12 data nodes, Kubernetes

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03446 2026-04-07 cs.AR 50%

Fast Cross-Operator Optimization of Attention Dataflow

注意力数据流的快速跨操作符优化

Haodong Chang, Hailiang Hu, Zhenrui Wang, Yu Gong, Rongjian Liang, Zhexiang Tang, Bo Yuan, Jiang Hu

专题命中 效率与部署 :LLM(abstract)

AI总结 本文提出MMEE方法,通过矩阵编码和高效剪枝技术,在注意力计算中实现性能和能效的提升,优化结果在能耗和延迟上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17514 2026-04-07 cs.CV 50%

EI: Early Intervention for Multimodal Imaging based Disease Recognition

EI:基于多模态影像的疾病识别早期干预

Qijie Wei, Hailan Lin, Xirong Li

机构 * Renmin University of China(中国人民大学) Beijing Key Laboratory for Intelligent Diagnosis of Fundus Diseases and Drug-Device R&D and Translation(眼底疾病智能诊断与药械研发转化北京市重点实验室)

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文提出EI框架,通过早期干预提升多模态影像疾病识别性能,引入MoR方法优化Vision Foundation Models适应,验证了在三个公开数据集上的有效性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 35 篇

2604.03688 2026-04-07 cs.IR cs.AI 89%

Fusion and Alignment Enhancement with Large Language Models for Tail-item Sequential Recommendation

基于大语言模型的尾项序列推荐融合与对齐增强

Zhifu Wei, Yizhou Dang, Guibing Guo, Chuang Zhao, Zhu Sun

机构 * Northeastern University(东北大学) Tianjin University(天津大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出FAERec框架,通过自适应门控机制和双层对齐方法提升尾项序列推荐中物品表示的质量,解决协同信号与语义知识融合不足及嵌入空间结构不一致的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03986 2026-04-07 cs.SE cs.PL 89%

COBOL-Coder: Domain-Adapted Large Language Models for COBOL Code Generation and Translation

COBOL-Coder:面向COBOL代码生成与翻译的领域适应性大语言模型

Anh T. V. Dau, Shin Hwei Tan, Jinqiu Yang, Nghi D. Q. Bui, Anh Tuan Nguyen

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出COBOL-Coder,一种专为COBOL设计的大型语言模型,通过自动化数据管道和领域适应技术,在代码生成与翻译任务中表现出色,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03509 2026-04-07 physics.med-ph 89%

Applications of Large Language Models in Radiation Oncology: From Workflow Automation to Clinical Intelligence

大型语言模型在放射肿瘤学中的应用:从工作流自动化到临床智能

Yuzhen Ding, Jason Holmes, Yuexing Hao, Zhengliang Liu, Peilong Wang, Junjie Cui, Meiyun Cao, Caiwen Jiang, Shuoyang Wei, Lin Zhao, Chenbin Liu, Lian Zhang, Yunze Yang, Tianming Liu, Wei Liu

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文探讨了大型语言模型在放射肿瘤学中的应用,包括工作流自动化、临床智能及决策支持,展示了其在标准化命名、注册管理及放疗计划评估中的核心贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04020 2026-04-07 cs.CL cs.LG 88%

Unmasking Hallucinations: A Causal Graph-Attention Perspective on Factual Reliability in Large Language Models

揭示幻觉:从因果图注意力视角探讨大语言模型中的事实可靠性

Sailesh kiran kurra, Shiek Ruksana, Vishal Borusu

专题命中 领域大模型 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出因果图注意力网络框架,通过构建token级图来减少大语言模型中的幻觉问题,提升事实可靠性。

Comments Paper accepted for publication at IEEE International Conference on Emerging Computing and Intelligent Technologies 2026 (ICoECIT),5 Pages,5 figures,1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04475 2026-04-07 cs.LG cs.AI 86%

Discrete Prototypical Memories for Federated Time Series Foundation Models

联邦时间序列基础模型的离散原型记忆

Liwei Deng, Qingxiang Liu, Xinhe Niu, Shengchao Chen, Sheng Sun, Yuankai Wu, Guodong Long, Yuxuan Liang

机构 * Australian Artificial Intelligence Institute, University of Technology Sydney(澳大利亚人工智能研究所,悉尼科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shenzhen University(深圳大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Sichuan University(四川大学)

专题命中 领域大模型 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FeDPM框架,通过离散原型记忆解决联邦学习中时间序列数据与文本空间语义不匹配的问题,提升模型泛化能力与效率。

Comments 13 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03755 2026-04-07 cs.CY cs.AI cs.CL cs.HC 86%

Can Humans Tell? A Dual-Axis Study of Human Perception of LLM-Generated News

人类能否辨识?对LLM生成新闻的人类感知双轴研究

Alexander Loth, Martin Kappes, Marc-Oliver Pahl

机构 * Frankfurt University of Applied Sciences(法兰克福应用技术大学)

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨人类能否区分LLM生成与人工写作的新闻,发现人类无法可靠区分,且认知疲劳导致准确性下降,指出用户层面的检测不可行,需系统级对策。

Comments 6 pages, 6 figures, 1 table. Accepted at the 18th ACM Web Science Conference (WebSci Companion '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04174 2026-04-07 cs.AI 85%

CoALFake: Collaborative Active Learning with Human-LLM Co-Annotation for Cross-Domain Fake News Detection

CoALFake:协作主动学习与人类-大语言模型共注释用于跨领域假新闻检测

Esma Aïmeur, Gilles Brassard, Dorsaf Sallami

机构 * University of Montreal(蒙特利尔大学)

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CoALFake,通过人类与大语言模型共注释和领域感知主动学习,解决跨领域假新闻检测中数据获取困难和领域特征丢失的问题,实验显示其在多个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03898 2026-04-07 cs.AI stat.CO 85%

LLM-Agent-based Social Simulation for Attitude Diffusion

基于大语言模型的社交模拟用于态度扩散

Deepak John Reji

机构 * University of Limerick(利默里克大学)

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出discourse_sim框架,结合LLM与基于代理的建模,模拟公众对移民态度随时间变化的动态,通过生成社交媒体帖子和解读观点来研究态度扩散和信念演变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20669 2026-04-07 physics.app-ph cond-mat.mtrl-sci 85%

Integrating Domain-Specialized Language Models with AI Measurement Tools for Deterministic Atomic-Resolution Experimentation

将领域专用语言模型与AI测量工具整合用于确定性原子分辨率实验

Zhuo Diao, Kouma Matsumoto, Linfeng Hou, Masahiro Ohara, Hayato Yamashita, Masayuki Abe

专题命中 领域大模型 :language model(title,abstract);large language model(abstract);small language model(abstract)

AI总结 本文提出一种框架,通过专门的小语言模型实现扫描探针显微镜的自主控制,结合AI驱动的测量工具,实现室温下的原子分辨率SPM实验,提升实验可靠性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04175 2026-04-07 cs.LG 83%

Uncertainty-Aware Foundation Models for Clinical Data

具有不确定性的临床数据基础模型

Qian Zhou, Yuanyun Zhang, Shi Li

机构 * University of the Chinese Academy of Sciences(中国科学院大学) Columbia University(哥伦比亚大学)

专题命中 领域大模型 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出一种考虑不确定性的临床数据基础模型框架,通过学习集合值表示并强制一致性,提升预测性能和数据缺失下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25890 2026-04-07 cs.SE cs.AI 83%

ATLAS: A Layered Constraint-Guided Framework for Structured Artifact Generation in LLM-Assisted MDE

ATLAS:一种分层约束引导的结构化艺术创作框架,用于LLM辅助的MDE

Tong Ma, Hui Lai, Hui Wang, Zhenhu Tian, Chaochao Li, Fengjie Xu, Ling Fang

机构 * University of Science and Technology of China(中国科学技术大学) Hefei Institutes of Physical Science, Chinese Academy of Sciences(中国科学院合肥物质科学研究院) Anhui University(安徽大学)

专题命中 领域大模型 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ATLAS通过分层约束引导框架生成符合显式模式、领域规则和审计要求的结构化工程制品,结合元模型整合、约束模型编译和后生成验证,确保生成结果的正确性和完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09901 2026-04-07 cs.AI 81%

Autonomous Agents for Scientific Discovery: Orchestrating Scientists, Language, Code, and Physics

自主代理用于科学发现:协调科学家、语言、代码和物理

Lianhao Zhou, Hongyi Ling, Cong Fu, Yepeng Huang, Michael Sun, Wendi Yu, Xiaoxuan Wang, Xiner Li, Xingyu Su, Junkai Zhang, Xiusi Chen, Chenxing Liang, Xiaofeng Qian, Heng Ji, Wei Wang, Marinka Zitnik, Shuiwang Ji

机构 * Department of Computer Science and Engineering, Texas A&M University(德克萨斯农工大学计算机科学与工程系) Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Computer Science and Artificial Intelligence Laboratory, Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室) Department of Computer Science, University of California, Los Angeles(加州大学洛杉矶分校计算机科学系) Siebel School of Computing and Data Science, University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校西贝尔计算与数据科学学院) Department of Materials Science and Engineering, Texas A&M University(德克萨斯农工大学材料科学与工程系) Department of Electrical and Computer Engineering, Texas A&M University(德克萨斯农工大学电气与计算机工程系) Department of Physics and Astronomy, Texas A&M University(德克萨斯农工大学物理与天文学系)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);language agent(abstract)

AI总结 本文探讨基于LLM的科学代理,通过协调科学家、语言、代码和物理,加速科学发现的全过程,分析现有方法并提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03406 2026-04-07 cs.GR 80%

SASAV: Self-Directed Agent for Scientific Analysis and Visualization

SASAV:面向科学分析和可视化的自主代理

Jianxin Sun, David Lenz, Tom Peterka, Hongfeng Yu

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出SASAV,首个无需外部提示或人类在环反馈的自主AI代理,可自动执行科学数据分析并生成有洞察力的可视化,推动AI for Science加速大规模科学发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04323 2026-04-07 cs.CL 79%

How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings

代理技能在真实环境中的表现如何:在现实场景中评估LLM技能使用的基准测试

Yujian Liu, Jiabao Ji, Li An, Tommi Jaakkola, Yang Zhang, Shiyu Chang

机构 * UC Santa Barbara(加州大学圣塔芭芭拉分校) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 领域大模型 :LLM(title,abstract);分类 cs.CL

AI总结 本文研究了在更现实的环境下LLM技能的实用性,发现技能效果随环境复杂性增加而下降,通过查询特定的技能细化策略可恢复性能,实验在Terminal-Bench 2.0上提升了Claude Opus 4.6的通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04155 2026-04-07 cs.LG cs.IT math.IT q-bio.QM stat.ML 79%

The Geometric Alignment Tax: Tokenization vs. Continuous Geometry in Scientific Foundation Models

几何对齐税:令牌化与连续几何在科学基础模型中的对比

Prashant C. Raju

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.LG

AI总结 科学基础模型在预测精度优化中面临连续几何保持问题,研究发现几何对齐税是内在成本,通过连续头替代交叉熵可显著减少几何失真,但编码本存在非单调双关现象,不同架构在连续与离散目标下表现差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏