arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-18 至 2026-08-18 共收录 661 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 57 篇

2608.15147 2026-08-18 cs.AI cs.MA 新提交 70%

Constitutive Priors for Machine Intelligence: A Legitimacy Theory of the Artificial Physical World

机器智能的构成先验:人工物理世界的合法性理论

Jiang Jiang, Yifu Sun, Qi Shen

机构 * Persagy Science and Technology Co.(珀萨吉科技有限公司)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对物理人工智能的冷启动死锁,提出人工物理世界的构成先验框架,确立合法性准则与分层下界,结合工业领域数据与可证伪预测展开论证,为机器智能攻克物理世界提供新路径。

Comments 55 pages, 3 figures, 75 references. Appendix A contains the semi-formal statements. First of three companion works; the two companions are in preparation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10584 2026-08-18 astro-ph.IM cs.AI gr-qc 70%

An agentic framework for gravitational-wave counterpart association in the multi-messenger era

一种用于多信使时代引力波反演关联的代理框架

Yiming Dong, Yacheng Kang, Junjie Zhao, Xinyuan Zhu, Ziming Wang, Lijing Shao

机构 * Department of Astronomy, School of Physics(天文学系,物理系) Kavli Institute for Astronomy and Astrophysics(天体物理研究所) Institute for Gravitational Wave Astronomy(引力波天文研究所) School of Information Science and Technology(信息科学与技术学院) National Astronomical Observatories(国家天文台)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出GW-Eyes框架,利用大语言模型实现引力波与电磁信号的自动关联,支持自然语言交互,提升多信使天文研究效率。

Journal ref The Innovation 7 (2026) 101538

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14631 2026-08-18 cs.LG 70%

Synergistic Fusion of Multi-Source Knowledge via Evidence Theory for High-Entropy Alloy Discovery

Minh-Quyet Ha, Dinh-Khiet Le, Duc-Anh Dao, Tien-Sinh Vu, Duong-Nguyen Nguyen, Viet-Cuong Nguyen, Hiori Kino, Van-Nam Huynh, Hieu-Chi Dam

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.LG

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16618 2026-08-18 cs.SE cs.PL 新提交 67%

The Specification Paradox: Rethinking Requirements Engineering in the Age of AI

规范悖论:人工智能时代的需求工程再思考

Tassio Sirqueira, Jessica Faciroli

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 该研究探讨大型语言模型普及下软件工程从代码中心转向规范驱动开发的趋势,提出规范悖论,指出AI生成软件能力越强,越依赖高质量人类规范,强调需求工程的核心地位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14869 2026-08-18 cs.HC 新提交 67%

RaivenTracks: Branching Provenance for Conversational Visualization Workflows

RaivenTracks:面向对话式可视化工作流的分支溯源系统

Ella Hugie, Alexandra Irger, Grace Guo, Kenneth Moreland, David Pugmire, Scott Klasky, Hanspeter Pfister

专题命中 领域大模型 :LLM(abstract,abstract_cn)

AI总结 RaivenTracks是Raiven可视化管道的工作流感知扩展,通过两级状态管理架构实现可分支的版本树与细粒度撤销/重做,试点研究显示其支持可视化工作流的分支与恢复,为AI驱动科学工作流的溯源监督提供了新方向。

Comments *Ella Hugie and Alexandra Irger are co-first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25055 2026-08-18 cs.CY cs.SI physics.soc-ph 版本更新 67%

Building Digital Societies as Ecosystems: How Recognition and Repeat Relationships Sustain Cross-Community Work in Open Source

构建数字社会作为生态系统:认可与重复关系如何维持开源中的跨社区工作

Lucia Gomez Tejeiro, Thibaut Chataing, Julian Jang-Jaccard, Alain Mermoud, Thomas Maillart

专题命中 领域大模型 :LLM(abstract,abstract_cn)

AI总结 通过分析464个网络安全项目和11372名贡献者的二部图,利用Louvain社区检测和逻辑斯蒂轨迹,研究开源生态系统中跨边界协作的识别与重复关系机制。

Comments 52 pages (main text + supplementary material), 5 main figures, 13 supplementary figures, 2 main tables. Submitted to EPJ Data Science. Data and code: https://doi.org/10.17605/OSF.IO/5RWEK

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16273 2026-08-18 cs.LG cs.AI 新提交 62%

Foresight-England: Development of a National-Scale Generative AI Model of Electronic Health Records for Medical Event Prediction across the COVID-19 Pandemic

Foresight-England:面向COVID-19大流行期间医疗事件预测的全国规模电子健康记录生成式AI模型的开发

Simon Ellershaw, Christopher Tomlinson, Zeljko Kraljevic, Spiros Denaxas, Harry Hemingway, Cathie Sudlow, Angela M. Wood, Anoop D. Shah, Richard Dobson

机构 * University College London(伦敦大学学院) King’s College London(伦敦国王学院) University College London Hospitals National Institute for Health Research Biomedical Research Centre(伦敦大学学院医院国家卫生研究院生物医学研究中心) Interdisciplinary Transformation University(跨学科转型大学) British Heart Foundation Data Science Centre(英国心脏基金会数据科学中心) Health Data Research UK(英国健康数据研究中心) The University of Edinburgh(爱丁堡大学) University of Cambridge(剑桥大学) Victor Phillip Dahdaleh Heart and Lung Research Institute, University of Cambridge(剑桥大学维克多·菲利普·达德赫心肺研究所) British Heart Foundation Centre of Research Excellence, University of Cambridge(剑桥大学英国心脏基金会卓越研究中心)

专题命中 领域大模型 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本研究开发了首个全国规模的电子健康记录生成式基础模型Foresight-E,在6100万患者数据上训练,可零样本预测医疗事件,为大流行期间的医疗事件预测提供了方法模板。

Comments Methodology and evaluation framework for Foresight-England. As detailed in the Project Status section, NHS England has paused access to data for the Foresight-E project, meaning quantitative results are not currently available. On behalf of the CVD-COVID-UK/COVID-IMPACT Consortium

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16269 2026-08-18 cs.CL cs.LG 新提交 62%

Domain-Agnostic Neural Topic Modeling with Contextual Token-Level Semantic Graph Representation

基于上下文词级语义图表示的领域无关神经主题模型

Seung-Won Seo, Won Ik Cho, Yongmin Yoo

机构 * TelePIX AI Center(TelePIX人工智能中心) Samsung Electronics(三星电子) School of Computing & Frontier AI Research Centre Macquarie University(麦考瑞大学计算与前沿人工智能研究中心)

专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出领域无关框架DARTopic,通过构建词级语义图并联合训练GNN编码器与主题推理模块,在多领域基准测试中优于基线且效率更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02763 2026-08-18 cs.CL cs.AI cs.CY 版本更新 62%

Bye-bye, Bluebook? Automating Legal Drudgery With AI-Augmented Rule Following

再见,蓝皮书?用AI辅助规则遵循实现法律苦差事自动化

Matthew Dahl, Eric Martínez

机构 * Yale Law School(耶鲁法学院)

专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对法律AI在《蓝皮书》引文格式任务的表现,构建了新基准,提出神经符号系统方法使准确率提升32.4个百分点至最高85.5%,指出AI与符号规则引擎结合是可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16211 2026-08-18 cs.AI 新提交 57%

BaT: Towards Self-Evolving Medical Research Agent with Stage Rubrics

BaT:构建具备阶段式评分标准的自演化医学研究智能体

Junqi Liu, Yufan He, Yexiao He, Pengfei Guo, Dong Yang, Andriy Myronenko, Can Zhao, Hanrong Ye, Tianhao Qi, Yuyin Zhou, Daguang Xu, Yucheng Tang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) NVIDIA(英伟达)

专题命中 领域大模型 :post-training(abstract);分类 cs.AI

AI总结 本文提出BaT系统,结合Stage Bank与BiCuRL方法,使医学研究智能体在AutoMedBench-Lite上得分大幅提升,BaT-9B性能优于Claude Opus 4.6。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15270 2026-08-18 cs.CL 新提交 57%

Time as Structure: Temporal Dependency Graphs for Verifiable Deadline Computation over Legal Documents

作为结构的时间:用于法律文件上可验证截止日期计算的时间依赖图

Maryia Zhyrko, Lifeng Han, Suzan Verberne

机构 * Leiden Institute of Advanced Computer Science (LIACS)(莱顿高级计算机科学研究所(LIACS)) Leiden University(莱顿大学)

专题命中 领域大模型 :language model(abstract);分类 cs.CL

AI总结 该研究针对法律文件截止日期计算问题,提出时间依赖图结合日历引擎的方法,在英国就业上诉法庭案件中表现优于语言模型,正确率达90.2%,可用于可验证的法律截止日期计算。

Comments 13 pages, 2 figures, 5 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11980 2026-08-18 cs.IR cs.AI 版本更新 57%

Learning from Unreachable Rewards: Hint-Conditioned Reinforcement Learning for Generative Recommendation

HCGRec:带有语义ID的提示条件生成式推荐

Kangning Zhang, Haotian Fang, Xukun Luo, Hao Yin, Yang Gao, Peng Yan, Weiwen Liu, Weinan Zhang, Yong Yu

专题命中 领域大模型 :post-training(abstract);分类 cs.AI

AI总结 该研究提出HCGRec框架,通过提示感知信用分解优化语义ID生成式推荐,解决零奖励训练问题,在序列推荐基准上大幅提升性能并降低零优势样本占比。

Comments Accepted by CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20615 2026-08-18 cs.AI cs.MA cs.PL cs.SE 版本更新 57%

Specifying AI-SDLC Processes: A Protocol Language for Human-Agent Boundaries

指定AI-SDLC流程:一种用于人-智能体边界的协议语言

Ylli Prifti, Pasquale De Meo, Alessandro Provetti

机构 * Birkbeck, University of London(伦敦大学伯贝克学院)

专题命中 领域大模型 :foundation model(abstract);分类 cs.AI

AI总结 提出一种领域特定语言,用于将AI-SDLC流程指定为协议,通过形式语法、良构条件、操作语义和执行不变量,区分策略与机制,实现结构强制以约束流程非确定性,并证明其能有效降低系统故障率。

Comments v2: substantially revised - enforcement soundness theorem with Lean 4 mechanisation, restructured failure-rate analysis, expressiveness study, end-to-end evaluation on SWE-bench Verified. 30 pages. Artifact: https://doi.org/10.5281/zenodo.21967946. Under review at ACM TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11374 2026-08-18 cs.CL cs.CY 57%

Mining Legal Arguments to Study Judicial Formalism

从法律论证中研究司法形式主义

Tomáš Koref, Lena Held, Mahammad Namazov, Harun Kumru, Yassine Thlija, Ivan Habernal

机构 * Center for Critical Computational Studies(批判性计算研究所以) Goethe University Frankfurt(法兰克福歌德大学) Department for Legal Theory and Legal Doctrines, Faculty of Law(法学院法律理论与法律学说系) Charles University(查尔斯大学) Technical University of Darmstadt(达姆施塔特技术大学) Research Center Trustworthy Data Science and Security of the University Alliance Ruhr & Ruhr University Bochum(鲁尔大学博德姆大学可信数据科学与安全研究所以)

专题命中 领域大模型 :pretraining(abstract);分类 cs.CL

AI总结 本文通过自动化方法分析捷克最高法院判决中的法律论证,建立MADON数据集,验证了东欧司法形式主义的主张,提升了司法决策分类的准确性和可解释性。

Comments pre-print under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06697 2026-08-18 cs.CV cs.AI 版本更新 57%

Thinking with Gaze: Sequential Eye-Tracking as Visual Reasoning Supervision for Medical VLMs

通过目光思考:将眼动作为视觉推理监督用于医学视觉语言模型

Yiwei Li, Yifan Zhou, Huaqin Zhao, Zihao Wu, Zhengliang Liu, Xiang Li, Quanzheng Li, Tianming Liu, Lin Zhao

机构 * School of Computing, University of Georgia(佐治亚大学计算机学院) Department of Computer Science and Engineering, University of Texas, Arlington(德克萨斯大学阿灵顿分校计算机科学与工程系) Massachusetts General Hospital, Harvard Medical School(麻省总医院哈佛医学院) Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系)

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 通过引入眼动标记,利用时间有序的注视轨迹引导医学VLM的视觉推理,提升放射学任务的性能与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06842 2026-08-18 cs.CY cs.AI 57%

Agentic AI for Scaling Diagnosis and Care in Neurodegenerative Disease

神经退行性疾病诊断与护理的代理AI

Andrew G. Breithaupt, Michael Weiner, Alice Tang, Katherine L. Possin, Marina Sirota, James Lah, Allan I. Levey, Pascal Van Hentenryck, Reza Zandehshahvar, Marilu Luisa Gorno-Tempini, Joseph Giorgio, Jingshen Wang, Andreas M. Rauschecker, Howard J. Rosen, Rachel L. Nosheny, Bruce L. Miller, Pedro Pinheiro-Chagas

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 本文提出了一套六阶段路线图,旨在通过代理AI系统提升神经退行性疾病诊断与护理的效率,强调数据收集、决策支持、临床整合和伦理框架的综合应用。

Comments 28 pages, 2 figures, 1 table, 1 box

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15252 2026-08-18 cs.HC 新提交 50%

MDwAIstScheduler: Bringing On-Device Voice Documentation into Clinical Practice

MDwAIstScheduler:将设备端语音记录引入临床实践

Diego Mardian, Frank Liu

专题命中 领域大模型 :language model(abstract)

AI总结 该研究提出设备端临床语音记录工具MDwAIstScheduler,通过设备端运行转录和意图提取,将诊疗语音转化为EHR可审核草稿,减轻医生记录负担并提升诊疗专注度。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 知识编辑与模型理解 30 篇

2608.16002 2026-08-18 cs.CL cs.AI 新提交 90%

From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents

从序列到结构:面向大语言模型智能体的关系型不确定性传播

Zhengzhao Ma. Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对现有LLM智能体不确定性量化方法忽略长程依赖的问题,提出RUPA框架,通过建模轨迹图的关系依赖传播不确定性,在多个基准上实现更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15400 2026-08-18 cs.AI cs.MA 新提交 89%

Implementation of a Metacognition Framework for Self-Awareness and Self-Regulation in Ensembles of LLMs

面向大语言模型(LLM)集合的自我意识与自我调节元认知框架的实现

Charles Courchaine, Ricky J. Sethi, Hefei Qiu

机构 * Fitchburg State University(菲奇堡州立大学) National University(美国国立大学) Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文首次实现面向LLM集合的元认知框架,通过MSV量化自我意识,基于查询复杂度切换系统1/2处理,分配专门角色,经PoC演示证明其可行性。

Comments 5 pages, 5 figures. Charles Courchaine and Ricky J. Sethi contributed equally. Demo and code: https://research.sethi.org/metacognition/

Journal ref Companion Proceedings of the ACM Web Conference 2026 (WWW Companion '26), ACM, 2026, pp. 152-155

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14896 2026-08-18 cs.CL cs.LG 新提交 88%

Interpretable Cross-Lingual Alignment in Small Language Models: Probing Cultural and Pragmatic Reasoning in Japanese-English Bilingual LLMs

小语言模型中的可解释跨语言对齐:探究日英双语大语言模型的文化与语用推理

Florian Braun

机构 * Sakaguchi–Inui Laboratory (Tohoku University)(东北大学坂口–乾实验室) Natural Language Understanding Team at RIKEN AIP(理化学研究所先进智能项目中心自然语言理解团队) Swallow Project at the Institute of Science Tokyo(东京科学大学Swallow项目) Sakana AI Tohoku University(东北大学) RIKEN AIP(理化学研究所先进智能项目中心) Institute of Science Tokyo(东京科学大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);small language model(title);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究构建J-PragEval-v0基准,结合线性探针与教师强制评估探究TinySwallow-1.5B的日英语用表征,提出语用表征引导方法,下一步将扩展至Llama-3.1-Swallow-8B。

Comments 15 pages, no figures. Introduces the J-PragEval-v0 minimal-pair benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14588 2026-08-18 cs.AI cs.CL cs.MA 新提交 88%

The Hallucination Snowball: Modeling Error Propagation as State Transitions in Multi-Agent LLM Pipelines

幻觉滚雪球:将多智能体大语言模型流水线中的错误传播建模为状态转移

Prabhjot Singh, Bhushan Pawar

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 该研究发现多智能体LLM流水线中存在幻觉滚雪球效应,即幻觉会随状态转移而逃逸,且边界门控验证比末端检查更能有效降低幻觉存活率,还提出了最优验证资源分配策略。

Comments 10 pages, 3 figures; accepted at the FAGEN Workshop (Failure Modes in Agentic AI), ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14653 2026-08-18 cs.LG cs.AI 新提交 87%

Do Uncertainty Signals Help? A Systematic Study of Uncertainty-Aware Decoding with Rollback Mechanisms

不确定信号是否有用?对带有回滚机制的不确定感知解码的系统研究

Xianzong Wu, Xiaohong Li, Yuejun Guo, Xinyang Liu, Tianlin Li, Junjie Wang, Qiang Hu

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过系统研究带有回滚机制的不确定感知解码,发现其可提升代码LLM的生成性能,其中token熵等信息论不确定信号效果最优,反馈引导的回滚是主要改进来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07195 2026-08-18 cs.CL cs.AI 版本更新 87%

Adapting LLMs to Time Series Forecasting via Temporal Heterogeneity Modeling and Representation Alignment

通过时间异质性建模与表示对齐将大语言模型(LLMs)适配到时间序列预测任务

Yanru Sun, Emadeldeen Eldele, Zongxia Xie, Yucheng Wang, Wenzhe Niu, Qinghua Hu, Chee Keong Kwoh, Min Wu

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出TALON框架,通过异构时间编码器建模时间异质性、表示对齐模块弥合模态差距,在7个真实世界基准上较SOTA方法平均MSE提升最高11%,实现高效且高性能的LLM时间序列预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14632 2026-08-18 cs.CL cs.AI 新提交 86%

DeMTS: Denoising Trajectories as Multivariate Time Series for Hallucination Detection in Diffusion Language Models

DeMTS:将去噪轨迹作为多元时间序列用于扩散语言模型的幻觉检测

Xin Zhang, Yili Wang, Yue Tan, Xin He, Yanyu Qian, Yixin Liu, Yi Chang, Shirui Pan, Xin Wang

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 针对现有D-LLMs幻觉检测方法压缩轨迹丢失关键信息的问题,提出DeMTS框架,将去噪轨迹作为多元时间序列,实验显示其性能优于现有方法且兼具鲁棒性、效率与迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16657 2026-08-18 cs.CY 新提交 86%

The ultimate carbon cost of a ChatGPT query

一次ChatGPT查询的最终碳成本

Paul Kron

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究结合多领域成果,估算ChatGPT类LLM单次查询最终碳成本约0.4美元、对应10gCO₂eq,引入QCC概念以凸显AI对地球健康的影响,为相关研究提供方向。

Comments 5 pages,0 figures. Accepted at the 2nd International Workshop on Low Carbon Computing (LOCO 2026), Lancaster University, United Kingdom, 10-11 September 2026. Part of the LOCO 2026 proceedings, arXiv:LOCO2026/P15

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14707 2026-08-18 cs.AI 新提交 81%

Semantic Uncertainty-Guided Orchestration in Hierarchical Multi-Agent Systems

分层多智能体系统中基于语义不确定性的协调策略

John Knowlton, Aritra Guha, Risto Miikkulainen

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) AT&T Chief Data Office(AT&T首席数据办公室) Cognizant AI Lab(高知特人工智能实验室)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出HASSUM框架,利用语义熵和密度估计不确定性实现多智能体自适应协调,在StrategyQA等基准上验证其可提升复杂推理任务的可靠性。

Comments 17 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15102 2026-08-18 cs.CL 新提交 79%

A Declarative-Procedural Perspective on Expert Routing in Bilingual Mixture-of-Experts Language Models

双语混合专家语言模型中专家路由的声明式-过程式视角

Amrit Gopinath, Raghul, Durairaj Thenmozhi

机构 * Sri Sivasubramaniya Nadar College of Engineering(斯里·西瓦苏布拉马尼亚·纳达尔工程学院) Shiv Nadar University Chennai(钦奈希夫·纳达尔大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 该研究探究双语MoE语言模型的专家路由是否形成语言结构,对比课程学习与无课程训练的模型,发现无课程模型专业化更强但依赖随机种子,课程模型路由更均衡,揭示MoE路由可出现可解释语言组织。

Comments 15 pages, 6 figures, 12 tables (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14819 2026-08-18 cs.SD cs.LG eess.AS 新提交 79%

What Makes a Good Layer? Assessing the Layer-Wise Intrinsic Properties of Music Foundation Models

什么构成了好的层?评估音乐基础模型的逐层固有属性

Angelos-Nikolaos Kanatas, Yuexuan Kong, Pablo Alonso-Jiménez, Xavier Serra, Dmitry Bogdanov

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 该研究分析12个音乐基础模型的逐层固有属性,发现现有指标无法通用追踪所有音乐任务的层质量,提出音高转置等变度指标,该指标可有效用于层选择,性能优于可训练多层融合方法,尤其在数据有限场景

Comments 11 pages, 2 figures, 2 tables. Accepted at ISMIR 2026. Project page: https://angeloskanatas.github.io/music-fms-layer-eval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03982 2026-08-18 cs.CL 版本更新 79%

Language Models Compare Quantities Using Number-specific and Unit-specific Heuristics

语言模型使用数字特定和单位特定启发式比较数量

Mutsumi Sasaki, Go kamoda, Ryosuke Takahashi, Kosuke Sato, Kentaro Inui, Keisuke Sakaguchi, Benjamin Heinzerling

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本研究通过控制实验发现,语言模型在比较带单位的数量时,并非进行精确的尺度转换,而是依赖数字差异和单位尺度差异的启发式策略,导致在比较边界附近系统性错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16353 2026-08-18 cs.CL cs.AI 新提交 73%

HalluTracer: Hallucination Detection via Depth-Averaging Truth Signals

HalluTracer:基于深度平均真值信号的幻觉检测方法

Zhihao Guo, Zonghan Wu, Huan Huo, DaYong Ye, Junwei Zhang, Weiran Yao, Zhiwei Liu, Qingsong Wen, Yilei Shao

机构 * University of Technology Sydney(悉尼科技大学) City University of Macau(澳门城市大学) Meta actAVA AI(actAVA人工智能公司) Microsoft AI(微软人工智能) Squirrel Ai Learning(松鼠人工智能学习公司) East China Normal University(华东师范大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HalluTracer是一种在模型生成答案前聚合各层真值证据的幻觉检测框架,在六个开源语言模型和五个基准上优于白盒基线,将幻觉检测转化为深度聚合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏