Structure-Aware Text Recognition for Ancient Greek Critical Editions
面向古希腊校勘本的结构感知文本识别
机构 * Inria(法国国家信息与自动化技术研究所)
专题命中 预训练与数据 :language model(abstract)
AI总结 本文通过构建大规模合成语料库和真实扫描基准,评估了视觉语言模型在结构感知文本识别上的性能,发现Qwen3VL-8B模型在真实扫描上达到1.0%的中位字符错误率。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
面向古希腊校勘本的结构感知文本识别
机构 * Inria(法国国家信息与自动化技术研究所)
专题命中 预训练与数据 :language model(abstract)
AI总结 本文通过构建大规模合成语料库和真实扫描基准,评估了视觉语言模型在结构感知文本识别上的性能,发现Qwen3VL-8B模型在真实扫描上达到1.0%的中位字符错误率。
新时代的视觉生成:从原子映射到智能世界建模的演进
机构 * Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学) ; University of Hong Kong(香港大学) ; National University of Singapore(新加坡国立大学) ; University of Waterloo(滑铁卢大学) ; StepFun ; MiroMind ; Baidu(百度) ; Fudan University(复旦大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; LMMs-Lab(LMMs实验室)
专题命中 预训练与数据 :post-training(abstract)
AI总结 提出五级分类法(原子生成、条件生成、上下文生成、智能生成、世界建模生成),分析流匹配、统一理解与生成模型等关键技术,并指出现有评估高估感知质量而忽视结构、时序和因果缺陷。
Comments Project Page: https://github.com/EvolvingLMMs-Lab/Evolving-Visual-Generation
BabAR:从音素识别到幼儿语音产出的发展性测量
专题命中 预训练与数据 :pretraining(abstract)
AI总结 提出跨语言音素识别系统BabAR,利用多语种儿童语音语料库TinyVox训练,通过预训练和上下文微调提升性能,自动测量与发育评估一致。
回溯应达到何种程度?探索SFT与RL在增强大语言模型推理能力中的相互作用
机构 * Duke University(杜克大学) ; Mila - Quebec AI Institute(魁北克人工智能研究所)
专题命中 指令微调 :SFT(title,title_cn);LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 本研究探索SFT与RL在LLM推理中的相互作用,提出回溯是关键算子,发现最优回溯深度随任务难度变化,引入以回溯为核心的训练方案,证实合理回溯可提升模型推理能力。
理解从预训练到训练后阶段的推理
机构 * New York University(纽约大学) ; Modal Labs(模态实验室) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Columbia University(哥伦比亚大学)
专题命中 指令微调 :SFT(summary_cn,abstract);pretraining(title,abstract);post-training(title,abstract);LLM(abstract,abstract_cn)
AI总结 研究强化学习在大语言模型从预训练到训练后阶段对推理的作用,以国际象棋为测试平台,按标准流程训练模型,发现预训练损失可预测RL后性能,RL奖励曲线斜率与预训练令牌有关,还揭示RL对SFT策略的影响,且在数学领域也有相同模式。
最大化提示与响应之间的互信息无需额外数据即可提升LLM性能
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 提出互信息偏好优化(MIPO)方法,通过对比数据增强构建偏好对,利用直接偏好优化最大化提示与响应间的点互信息,无需额外数据或外部监督即可提升LLM在个性化和可验证任务上的性能。
Comments International Conference on Machine Learning 2026
平行四边形反击:LLM生成的类比优于人类
机构 * Princeton University(普林斯顿大学) ; The University of Hong Kong(香港大学)
专题命中 指令微调 :LLM(title_cn,summary_cn);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 研究比较了人类和LLM在类比任务中的表现,发现LLM生成的类比更符合平行四边形结构,且人类在生成关系保持的类比时表现较差。
增强大型语言模型在金属有机框架结构预测中的空间推理能力
机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) ; Nanjing University(南京大学) ; Institute of AI Industry Research (AIR)(人工智能产业研究院) ; Tsinghua University(清华大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; University of Chinese Academy of Sciences(中国科学院大学) ; ChemBIC(化学信息学中心)
专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn)
AI总结 针对MOF结构预测中原子数量多、复杂度高的问题,提出MOF-LLM框架,通过空间感知持续预训练、结构监督微调和匹配驱动强化学习,增强Qwen-3 8B模型的空间推理能力,实现35.78%匹配率和0.04秒/结构的采样效率。
Comments KDD 2026
通过数据调度实现低资源阿拉伯语音频LLM的多任务指令微调
机构 * Qatar Computing Research Institute(卡塔尔计算研究院)
专题命中 指令微调 :LLM(title_cn,summary_cn);instruction tuning(title,abstract);large language model(abstract,comments);language model(abstract,comments)
AI总结 本文研究了在资源受限环境下,通过数据调度优化多任务指令微调方法,提出AraMega-SSum用于训练和评估阿拉伯语中心的音频LLM,并比较了四种训练策略,发现两阶段TPC→ADS策略在任务平衡上表现最佳。
Comments Foundation Models, Large Language Models, Native, Speech Models, Arabic
大型语言模型在创造性思维过程中与人类大脑对齐
机构 * EPFL(瑞士联邦理工学院洛桑) ; Università della Svizzera italiana (USI)(意大利语区大学(瑞士)) ; Wesleyan University(卫斯理大学) ; Paris Brain Institute (ICM)(巴黎大脑研究所) ; Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)
AI总结 研究探讨了在创造性思维过程中,fMRI数据揭示了大脑与不同规模LLM之间的对齐关系,发现模型大小和想法原创性影响对齐程度,且训练目标影响表示与人类创造力神经几何的匹配程度。
Comments Accepted at COLM 2026
SFT冲突,RL共存:大语言模型多任务学习的理论与实证分析
专题命中 指令微调 :SFT(title,title_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)
AI总结 该研究针对大语言模型多任务学习,通过理论与实证分析揭示SFT存在任务冲突而RL可稳定共存的机制,进而提出Parallel-RL范式以解耦多任务训练,提升效率与灵活性。
Comments Code: https://github.com/GaryStack/Parallel-RL
面向电信客户支持的SLM的PEFT:LoRA配置与能耗分析的比较研究
机构 * Orange
专题命中 指令微调 :SLM(title,title_cn);LLM(summary_cn,abstract);large language model(abstract);language model(abstract)
AI总结 本研究系统比较了不同LoRA配置在Qwen2.5-3B模型上的参数高效微调效果,结合能耗分析和LLM评判框架,发现验证损失最低的配置并不一定获得最佳定性排名,并提出了组合式合成数据生成方法。
大规模进化策略:超越强化学习的LLM微调
机构 * University of California, Los Angeles, Los Angeles, CA, USA(加州大学洛杉矶分校) ; Cognizant AI Lab, San Francisco, CA, USA(Cognizant AI实验室) ; The University of Texas at Austin, Austin, TX, USA(德克萨斯大学奥斯汀分校) ; Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院)
专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本文提出使用进化策略进行大规模LLM微调,证明其在多个方面优于强化学习,为LLM微调提供了新的方法。
Comments Published at ICML 2026 main conference
面向隐私敏感的临床信息抽取的自提示小型语言模型
机构 * McWilliams School of Biomedical Informatics, The University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校麦克威廉斯生物医学信息学学院) ; School of Public Health, The University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校公共卫生学院) ; School of Dentistry, The University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校牙科学院) ; Willamette Dental and Skourtes Institute(威廉特牙科与斯库尔特斯研究所)
专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);prompting(title);post-training(abstract)
AI总结 针对牙科病历中非结构化、领域特定且隐私敏感的命名实体识别挑战,提出一种本地可部署的自提示框架,通过多提示集成推理和基于QLoRA的微调及直接偏好优化,使小型语言模型在Qwen2.5-14B-Instruct上达到微宏F1分数0.864/0.837。
CIgrate:利用大语言模型自动化持续集成服务迁移
专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)
AI总结 本文提出基于大语言模型(LLM)的CI配置迁移框架CIgrate,经对比实验,其性能显著优于现有基于规则的方法CIMig,为CI配置迁移提供了更实用准确的方案。
用于故障定位的大语言模型:一项实证研究
专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)
AI总结 本文通过在HumanEval-Java、Defects4J数据集上评估四款LLMs,对比非LLM基线,分析不同提示策略,明确其在语句级故障定位的优缺与实际权衡,为软件工程应用提供实证支持。
基于多视角语音特征的LoRA微调大语言模型用于痴呆检测
机构 * NAVER Cloud(NAVER云) ; Division of Communication and Media, Ewha Womans University(通信与媒体系,成均馆大学)
专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出LoRA微调LLM,通过统一提示整合ASR转录、话语主题、时间流畅度和音韵序列四种语音特征,实现多视角推理,在ADReSSo上F1达90.14%。
Comments Accepted at INTERSPEECH 2026
学习协调符号工具:用于验证平方和(SOS)证书的大语言模型(LLM)智能体
专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 该研究开发结合领域训练、符号工具和验证反馈的LLM智能体,在加权SOS验证任务上达到78.96%成功率,为可精确检查输出领域的工具调用智能体设计提供案例。
Comments 15 pages, 4 figures
多语言OCR感知微调和提示引导的链式思维推理用于多模态大语言模型
机构 * Meta AI ; UT Austin(德克萨斯大学奥斯汀分校)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);post-training(abstract)
AI总结 提出一种多语言OCR感知的多模态训练框架,通过合成数据生成、OCR感知微调和结构化视觉链式思维提示,提升多模态大语言模型在复杂视觉条件下的OCR完整性和多语言翻译准确性。
价值漂移:在大语言模型训练后追踪价值对齐
机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) ; McGill University(麦吉尔大学) ; Université de Montréal(蒙特利尔大学) ; ETH Zurich(苏黎世联邦理工学院) ; University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 指令微调 :SFT(summary_cn,abstract);post-training(title,abstract);LLM(title);preference optimization(abstract)
AI总结 研究大语言模型训练后价值对齐问题,通过实验区分训练后算法和数据集影响,测量价值漂移,发现SFT阶段确立模型价值,后续偏好优化难重对齐,不同算法在偏好数据不变时也有不同结果,为相关选择提供见解。
Comments TACL 2026
基于大语言模型的生成式检索用于Snapchat内容推荐
专题命中 指令微调 :LLM(title,summary_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 该研究针对将预训练LLM转化为生成式检索器的挑战,设计了SnapLGR系统,通过三项核心优化实现了Snapchat短视频推荐效果的提升。
LLM导师院长:AI生成反馈的自动质量审查框架
专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 提出DeanLLM框架,通过16维度评估LLM导师反馈的内容、教育效果和幻觉风险,并利用微调GPT-4.1实现与人类专家高度一致的自动审查。
LP-SFT:通过多模态熵结构进行局部保持监督微调
机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; College of Computing, Georgia Institute of Technology(佐治亚理工学院计算学院)
专题命中 指令微调 :SFT(title,title_cn);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG
AI总结 研究监督微调中存在的问题,利用香农和雷尼熵分析揭示预训练模型的多模态熵结构,提出LP-SFT目标,在多领域实验中提升性能,平衡准确率和k准确率。
Comments 20 pages, 3 figures. Code is available at https://github.com/Wakaka161/LP-SFT
迷失在序列化中:LLM图推理器的不变性与泛化能力
机构 * University of Cambridge(剑桥大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究LLM图推理器对图表示对称性的缺乏不变性,通过分解序列化因素并评估微调影响,发现大模型更鲁棒,微调降低节点重标敏感但增加结构和格式敏感,且不保证泛化。
Comments ICML 2026 Workshop on Graph Foundation Models
基于语言的试错在经验时代落后了
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 指令微调 :LLM(summary_cn,abstract);SFT(summary_cn,abstract);large language model(abstract);language model(abstract)
AI总结 针对LLM在非语言环境中探索成本高的问题,提出SCOUT框架,用轻量级模型探索环境,通过SFT和RL激活LLM的世界知识,显著提升性能并降低计算开销。
即时强化学习:无需梯度更新的LLM智能体持续学习
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出JitRL框架,通过动态非参数记忆和即时优势估计,无需梯度更新即可实现LLM智能体的测试时策略优化,在WebArena和Jericho上达到训练无关方法最优,且性能超越微调方法,成本降低30倍以上。
使用具有交易成本意识的大语言模型模拟租户对能源政策干预的反应
机构 * Mistral AI(米斯特拉尔人工智能公司) ; Ollama(奥拉马)
专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);SFT(abstract)
AI总结 研究利用感知交易成本,开发摩擦感知角色建模方法,以模拟租户对能源政策干预的反应。通过荷兰公民调查数据,比较不同模型和设置,发现纳入该方法能提升模型性能,为政策理论与LLM政策模拟搭建桥梁。
用于持续指令微调的渐进式多模态对齐
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Center for Excellence in Brain Science and Intelligence Technology, Chinese Academy of Sciences(中国科学院脑科学与智能技术卓越创新中心) ; Kyoto University(京都大学) ; Migu Culture Technology Co.,Ltd.(咪咕文化科技有限公司) ; State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与类脑智能技术国家重点实验室)
专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn)
AI总结 针对多模态持续指令微调中投影器级遗忘问题,提出渐进式多模态对齐框架PMA,以亚线性参数增长平衡稳定性与可塑性,在多基准实验中提升了现有方法性能且适配多种MLLM主干。
Comments Accepted by ACM MM2026
DatedGPT:通过时间感知预训练防止大语言模型中的前瞻性偏差
机构 * Department of Finance, CUHK Business School, The Chinese University of Hong Kong(香港中文大学商学院金融系,香港中文大学) ; Centre for Artificial Intelligence, University College London(伦敦大学学院人工智能中心)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);pretraining(title);post-training(abstract)
AI总结 DatedGPT通过时间感知预训练和指令微调,防止大语言模型中的前瞻性偏差,确保模型知识受限于数据截止年份,并在基准测试中表现出竞争力。
Multi$^2$:基于LLM智能体在交互环境中的分层多智能体决策
机构 * KAIST(韩国科学技术院)
专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出Multi$^2$分层多智能体决策框架,通过高层智能体(System 1)使用监督微调生成子目标,低层智能体(System 2)使用离线到在线强化学习执行原子动作,以缓解目标漂移并实现长期稳定控制。
Comments Accepted at ICML 2026