arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-03 至 2026-07-03 共收录 347 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 19 篇

2607.02329 2026-07-03 cs.AI cond-mat.mtrl-sci physics.comp-ph 新提交 90%

Grounded autonomous research: a fault-tolerant LLM pipeline from corpus to manuscript in frontier computational physics

基于语料库的前沿计算物理容错LLM流水线:从语料到论文的自主研究

Haonan Huang

机构 * Princeton University(普林斯顿大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一个端到端LLM流水线,从11,083篇arXiv论文语料库出发,自主完成前沿计算物理研究,包括构思方向、复现文献、第一性原理计算和撰写论文,通过冗余设计实现容错。

Comments 39 pages, 5 figures. Accepted at the ICML 2026 AI for Science Workshop (https://openreview.net/forum?id=R5YXaPgUAx). Includes the pipeline-generated companion physics manuscript as an appendix. Data and scaffolding archive: https://doi.org/10.5281/zenodo.21126996

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01733 2026-07-03 cs.CL eess.AS 新提交 89%

Rethinking Speech-LLM Integration for ASR: Effective Joint Speech-Text Training by Interleaving

重新思考语音-LLM集成用于ASR:通过交错实现有效的联合语音-文本训练

Ruchao Fan, Yiming Wang, Rui Zhao, Liliang Ren, Keqi Deng, Xiaoyang Chen, Ali Zare, Bo Ren, Yuxuan Hu, Junkun Chen, Yan Huang, Yelong Shen, Jinyu Li

机构 * Microsoft(微软)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(abstract);分类 cs.CL

AI总结 提出JSTIP,一种面向ASR的预训练策略,通过构建词级和段级交错语音-文本序列,在38k小时数据上相比基线提升了实体识别准确率,并缩小了模态差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02221 2026-07-03 cond-mat.stat-mech 新提交 88%

Alternative routes to universal diversity scaling in component systems: from proteomes to large language models

组件系统中通用多样性标度的替代路径:从蛋白质组到大语言模型

Andrea Mazzolini, Leonardo Agasso, Filippo Valle, Michele Caselle, Marco Cosentino Lagomarsino, Matteo Osella

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract)

AI总结 研究复杂组件系统中多样性标度定律的涌现条件,发现创新驱动增长模型与潜在异质性模型均能产生相同的宏观定律,但无法唯一确定生成机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05707 2026-07-03 cs.CL cs.AI 87%

Multimodal In-context Learning for ASR of Low-resource Languages

多模态上下文学习用于低资源语言的语音识别

Zhaolin Li, Jan Niehues

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了通过多模态上下文学习提升低资源语言语音识别性能的方法,分析了跨语言迁移学习对模型效率的影响,并提出结合更强声学模型与语音LLM的改进系统。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02546 2026-07-03 cs.CV cs.LG 版本更新 83%

RGB-Pointmap Pretraining for Unified 3D Scene Understanding

对比语言-彩色点图预训练用于统一3D场景理解

Ye Mao, Weixun Luo, Ranran Huang, Junpeng Jing, Krystian Mikolajczyk

机构 * Imperial College London(帝国理工学院伦敦分校)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 提出UniScene3D,一种基于Transformer的编码器,通过多视图彩色点图联合建模外观和几何,并引入跨视图几何对齐和接地视图对齐,在少样本和任务特定微调中达到SOTA。

Comments 19 Pages, ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18466 2026-07-03 cs.CL 83%

CEFR-Annotated WordNet: LLM-Based Proficiency-Guided Semantic Database for Language Learning

CEFR标注的WordNet:基于大语言模型的 proficiency 指导语义数据库用于语言学习

Masato Kikuchi, Masatsugu Ono, Toshioki Soga, Tetsu Tanabe, Tadachika Ozono

机构 * Nagoya Institute of Technology(名古屋技术大学) Kitami Institute of Technology(Kitami技术学院) Chitose Institute of Science and Technology(常立科学技术学院) Hokkaido University(北海道大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于CEFR的WordNet标注数据库,利用大语言模型自动整合语义网络与语言水平,开发出有效的上下文词法分类器,实验表明其性能与标准标注相当,且在语言教育中具有应用价值。

Comments The 15th edition of the Language Resources and Evaluation Conference (LREC 2026); resources are available at https://doi.org/10.5281/zenodo.17395388

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02513 2026-07-03 cs.CL cs.AI cs.LG 新提交 82%

LACUNA: A Testbed for Evaluating Localization Precision for LLM Unlearning

LACUNA: 评估大语言模型遗忘定位精度的测试平台

Matteo Boglioni, Thibault Rousset, Siva Reddy, Marius Mosbach, Verna Dankers

机构 * Mila – Quebec Artificial Intelligence Institute(米拉-魁北克人工智能研究所) McGill University(麦吉尔大学)

专题命中 预训练与数据 :LLM(title);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LACUNA测试平台,通过注入合成个人身份信息到模型参数,评估遗忘方法是否真正擦除知识,发现现有方法定位不精确且易受重现攻击,而精确定位可实现强擦除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02466 2026-07-03 cs.RO cs.AI 新提交 79%

Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs

先学移动再学做事:面向VLA的任务无关预训练

Junhao Shi, Siyin Wang, Xiaopeng Yu, Li Ji, Jingjing Gong, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 提出任务无关预训练(TAP)框架,先通过自监督逆动力学从廉价无标签交互数据学习可迁移运动先验,再用少量专家数据将先验与语言对齐,显著降低VLA模型对专家演示的依赖。

Comments Accepted to ICML 2026, 21 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02259 2026-07-03 cs.CL 新提交 79%

BamiBERT: A New BERT-based Language Model for Vietnamese

BamiBERT: 一种新的基于BERT的越南语语言模型

Dat Quoc Nguyen, Thinh Pham, Chi Tran, Linh The Nguyen

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 提出BamiBERT,一种从头训练的越南语BERT模型,支持2048 token上下文长度且无需分词,在15项指标中11项最优,刷新越南语编码器性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01538 2026-07-03 cs.CL 新提交 79%

Can Language Models Actually Retrieve In-Context? Drowning in Documents at Million Token Scale

语言模型真的能进行上下文检索吗?在百万Token规模的文档中淹没

Siddharth Gollapudi, Nilesh Gupta, Prasann Singhal, Sewon Min

机构 * UC Berkeley(加州大学伯克利分校) UT Austin(得克萨斯大学奥斯汀分校)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本文首次系统研究百万Token语料库上的上下文检索,提出0.6B参数的BlockSearch模型,通过注意力稀释分析引入长度感知调整,在MS MARCO和NQ上匹配稠密检索,在LIMIT上得分高出3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01594 2026-07-03 eess.AS 新提交 78%

Enhancing Acoustic-to-Articulatory Inversion with Multi-Target Pretraining for Low-Resource Settings

面向低资源场景的声学-发音反演的多目标预训练增强方法

Jesuraj Bandekar, Prasanta Kumar Ghosh

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出一种多目标预训练方法,利用音素标签、发音特征标签和关键发音器官标签,在低资源场景下提升声学-发音反演性能,同时降低推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28896 2026-07-03 cs.CV 版本更新 78%

Fisheye3R: Adapting Unified 3D Feed-Forward Foundation Models to Fisheye Lenses

Fisheye3R:将统一的3D前馈基础模型适应于鱼眼镜头

Ruxiao Duan, Erin Hong, Dongxu Zhao, Eric Turner, Alex Wong, Yunwen Zhou

机构 * Yale University(耶鲁大学) Google XR(谷歌XR)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 本文提出Fisheye3R框架,通过灵活学习方案在不退化性能的前提下,使多视角3D重建模型适应高径向畸变的鱼眼图像。

Comments European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01766 2026-07-03 cs.AI 新提交 70%

SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation

SimWorlds: 一个用于动态3D场景创建的多智能体系统

Chunjiang Liu, Xiaoyuan Wang, Haoyu Chen, Yizhou Zhao, Ming-Hsuan Yang, László A. Jeni

机构 * Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) University of California, Merced(加州大学默塞德分校)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出多智能体框架SimWorlds,通过规划-编码-审查流程和运行时状态检查工具,从文本生成动态4D场景,并引入基准4DBuildBench评估视觉保真度和物理一致性。

Comments 20 pages, 3 figures. Project page: https://dynsimworlds.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16205 2026-07-03 cond-mat.mtrl-sci cs.AI physics.chem-ph 版本更新 70%

ChemGraph-XANES: An Agentic Framework for XANES Simulation and Curation

ChemGraph-XANES:用于XANES模拟与分析的代理框架

Vitor F. Grizzi, Thang Duc Pham, Luke N. Pretzie, Jiayi Xu, Murat Keceli, Cong Liu

机构 * Chemical Sciences and Engineering Division Argonne National Laboratory(阿贡国家实验室化学科学与工程部) Computational Science Division Argonne National Laboratory(阿贡国家实验室计算科学部)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出ChemGraph-XANES框架,结合自然语言任务描述与结构获取,实现XANES模拟与分析的自动化,支持高通量计算与机器学习应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22710 2026-07-03 cs.CR cs.CL 版本更新 70%

AlienLM: Alienization of Language for API-Boundary Privacy in Black-Box LLMs

AlienLM: 面向黑盒大语言模型API边界隐私的语言异化

Jaehee Kim, Pilsung Kang

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出AlienLM,通过词汇级双射将文本转化为异化语言,在仅使用API的情况下减少明文暴露,平均保留81%以上的性能,且恢复攻击成功率低于0.22%。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01640 2026-07-03 cs.SE cs.CR 新提交 67%

AgentFlow: Building Agent Dependency Graphs for Static Analysis of Agent Programs

AgentFlow:构建用于智能体程序静态分析的智能体依赖图

Shenao Wang, Xinyi Hou, Yanjie Zhao, Xiao Cheng, Haoyu Wang

专题命中 预训练与数据 :LLM(abstract,abstract_cn)

AI总结 提出AgentFlow,首个从智能体程序中恢复和分析智能体依赖的静态分析框架,通过构建框架无关的智能体依赖图(ADG)支持智能体治理和安全分析,在5399个真实程序中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23041 2026-07-03 cs.CV 新提交 67%

SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models

SPAR: 语义-像素自对齐与自适应路由的统一多模态模型

Hongxiang Li, Hongxu Chen, Chenyang Zhu, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiaohongshu Inc.(小红书公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 提出SPAR框架,通过非对称双流统一分词器协调语义感知与像素重建,利用自对齐生成范式消除外部依赖,并引入动态令牌路由实现灵活多模态交互,在统一架构中达到生成、重建与视觉理解的最优性能。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01686 2026-07-03 cs.LG 新提交 57%

WARP: Weight-Space Analysis for Recovering Training Data Portfolios

WARP: 基于权重空间分析恢复训练数据组合

Tzu-Heng Huang, Aditya Goyal, John Cooper, Frederic Sala

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

AI总结 提出WARP框架,通过模型合并生成伪检查点,从权重空间几何特征恢复微调模型的训练数据域混合比例,在BERT和GPT-2上平均MAE分别低至0.046和0.104。

Comments This work appears in the ICML 2026 Workshop on Weight-Space Symmetries (WSS): from Foundations to Practical Applications. Our source code is available at github.com/SprocketLab/WARP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02139 2026-07-03 cs.CV 新提交 50%

AdaCount: Training-Free Similarity-Guided Spatial and Feature Adaptation for Zero-Shot Object Counting

AdaCount: 基于相似性引导的空间与特征自适应无训练零样本目标计数

Muhammad Ibraheem Siddiqui, Muhammad Haris Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫萨德·本·扎耶德人工智能大学)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 针对零样本目标计数在密集小目标场景下的漏检和分割不佳问题,提出无训练框架AdaCount,通过原型驱动相似性图引导空间扭曲和特征调制,提升SAM3对目标区域的表征能力,达到新SOTA。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 29 篇

2607.02214 2026-07-03 cs.CL eess.AS 新提交 93%

Unlocking Speech-Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning

解锁语音-文本组合能力:无需指令微调的指令跟随语音语言模型

Congrui Du, Yang Zhang, Kaizhi Qian, Shiyu Chang

机构 * University of California, Santa Barbara, USA(加州大学圣芭芭拉分校) MIT-IBM Computing Research Lab, IBM Research, USA(麻省理工-IBM计算研究实验室,IBM研究)

专题命中 指令微调 :LLM(summary_cn,abstract);language model(title,abstract);instruction tuning(title,abstract);SLM(abstract,abstract_cn)

AI总结 提出SpeechCombine,通过单轮30k小时语音预训练和权重组合,无需指令微调即可实现指令跟随,有效将文本LLM能力迁移至语音域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05952 2026-07-03 cs.CY 版本更新 92%

Dean of LLM Tutors: A Framework for Automated Quality Review of AI-generated Feedback

LLM导师院长:AI生成反馈的自动质量审查框架

Keyang Qian, Yixin Cheng, Rui Guan, Wei Dai, Flora Jin, Kaixun Yang, Sadia Nawaz, Zachari Swiecki, Guanliang Chen, Lixiang Yan, Dragan Gašević

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出DeanLLM框架,通过16维度评估LLM导师反馈的内容、教育效果和幻觉风险,并利用微调GPT-4.1实现与人类专家高度一致的自动审查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01772 2026-07-03 cs.CV eess.SP 新提交 91%

LLM-Empowered Multimodal Fusion Framework for Autonomous Driving: Semantic Enhancement and Channel-Adaptive Design

LLM赋能的自动驾驶多模态融合框架:语义增强与信道自适应设计

Wen Wang, Yaping Sun, Yejun He, Hao Chen, Zhiyong Chen, Xiaodong Xu, Nan Ma, Shuguang Cui

机构 * National Natural Science Foundation of China(国家自然科学基金) Shenzhen Natural Science Foundation(深圳市自然科学基金) Shenzhen Key Laboratory Evaluation(深圳市重点实验室评估)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出LM-SCIP框架,以LLM为核心推理中枢,通过信道自适应语义模块动态融合视觉与雷达特征,实现低信噪比下的视觉主导回退和高信噪比下的协同融合,在nuScenes和VIRAT数据集上显著提升定位精度。

Comments 6 pages, 4 figures. Accepted by 2026 IEEE 37th International Symposium on Personal, Indoor and Mobile Radio Communications (PIMRC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01433 2026-07-03 cs.AI cs.LG 新提交 90%

CreativityNeuro: Steering Language Model Weights to Improve Divergent Thinking and Reduce Mode Collapse

CreativityNeuro: 引导语言模型权重以改善发散思维并减少模式崩溃

Samuel Schapiro, Core Francisco Park, Felix Sosa, Lav R. Varshney

机构 * Center for Brain Science, Harvard University(哈佛大学脑科学中心) CBS-NTT Program in Physics of Intelligence, Harvard University(哈佛大学CBS-NTT智能物理项目) Prior Computers AI Innovation Institute, Stony Brook University(石溪大学人工智能创新研究所)

专题命中 指令微调 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 提出数据无关的对比权重引导方法CreativityNeuro,通过调整LLM权重增强发散思维,在多项创造力测试中提升原创性并减少模式崩溃,无需重新训练或微调。

Comments Accepted at ICML 2026 Workshop on Creativity & Generative AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01764 2026-07-03 cs.AI 新提交 89%

Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction

Mastermind: 基于策略学习的仓库级漏洞复现

Mingzhe Du, Luu Anh Tuan, Tianyi Wu, Renyang Liu, Zhijiang Guo, Dong Huang, See-Kiong Ng

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(summary_cn,abstract);分类 cs.AI

AI总结 提出Mastermind双循环框架,通过策略学习(SFT+GRPO)提升LLM代理在仓库级漏洞复现中的表现,在260个训练任务和200个测试任务上达到84.5%通过率,并成功迁移至不同执行器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01436 2026-07-03 cs.AI cs.LG 新提交 88%

Discrete Diffusion Language Models for Interactive Radiology Report Drafting

离散扩散语言模型用于交互式放射报告草稿生成

Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert

机构 * Stanford University School of Medicine(斯坦福大学医学院) Ghent University(根特大学) Stanford University(斯坦福大学)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出将离散扩散语言模型用于放射报告草稿生成,利用其任意顺序填充能力实现交互式编辑,在医学VQA任务上达到或超越自回归模型,解码速度快3.5-4.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01239 2026-07-03 cs.CL cs.AI 新提交 88%

Breaking Safety at the Token Boundary: How BPE Tokenization Creates Exploitable Gaps in LLM Alignment

在Token边界打破安全:BPE分词如何在LLM对齐中制造可利用的漏洞

Tung-Ling Li, Hongliang Liu, Yuhao Wu

机构 * Palo Alto Networks

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究发现BPE分词将安全关键词拆分为子词,导致对齐数据集缺乏此类碎片化输入,通过优化碎片化可绕过80-100%的安全拒绝,并定位到模型最后约30%层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27999 2026-07-03 cs.CV 版本更新 87%

CLIP-AUTT: Test-Time Personalization with Action Unit Prompting for Fine-Grained Video Emotion Recognition

CLIP-AUTT: 基于动作单元提示的测试时个性化方法用于细粒度视频情绪识别

Muhammad Osama Zeeshan, Masoumeh Sharafi, Benoit Savary, Alessandro Lameiras Koerich, Marco Pedersoli, Eric Granger

机构 * LIVIA, ILLS, Dept. of Systems Engineering, ETS Montreal(LIVIA, ILLS, 系统工程学院, 蒙特利尔高等技术学院) LIVIA, Dept. of Software and IT Engineering, ETS Montreal(LIVIA, 软件与IT工程学院, 蒙特利尔高等技术学院) Dept. of Computer Science, École Polytechnique(计算机科学系, 巴黎综合理工学院)

专题命中 指令微调 :prompting(title);LLM(abstract,abstract_cn);language model(abstract);pretraining(abstract)

AI总结 本文提出CLIP-AUTT,通过动作单元提示实现测试时个性化,提升细粒度视频情绪识别的鲁棒性和个性化能力。

Comments ECCV, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01846 2026-07-03 cs.AI 新提交 85%

CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training

CLAP:领域智能体后训练的闭环训练、评估与发布控制

Fangfei Li, Chenyang Zhao, Long Wang, Feng Tian, Zhiyue Zheng, Lv Guo

机构 * MatrixOrigin(矩阵起源)

专题命中 指令微调 :post-training(title,abstract);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 提出CLAP闭环方法,通过数据验证、奖励/KL诊断、离线门控和应用链回放,在制造场景中评估后训练效果,发现仅部分批次提升且存在KL风险,支持集成循环管理。

Comments 6 pages, 1 figure. Accepted to CRAE 2026; to appear in SPIE Proceedings. Best Poster Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01927 2026-07-03 cs.CL cs.AI 新提交 82%

TUDUM: A Turkish-Thinking Reasoning Pipeline for Qwen3.5-27B

TUDUM:面向Qwen3.5-27B的土耳其语思维推理流水线

Baran Bingol, Bahaeddin Turkoglu

机构 * Department of Artificial Intelligence and Data Engineering(人工智能与数据工程系) Faculty of Engineering(工程学院) Ankara University(安卡拉大学)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出TUDUM流水线,通过SFT和GRPO强化学习将Qwen3.5-27B适配为土耳其语思维模型,使推理过程本身使用土耳其语,而非仅输出本地化答案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01470 2026-07-03 cs.AI 新提交 81%

World Feedback for Clinical Agents: Diagnosing RL in FHIR Environments

临床智能体的世界反馈:在FHIR环境中诊断强化学习

Ananya Mantravadi, Harshit Rajgarhia, Prasanna Desikan, Abhishek Mukherji

机构 * Centific Global Solutions, Inc.(Centific全球解决方案公司)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.AI

AI总结 针对临床协议执行任务,审计发现MedAgentBench存在静默完成上限,构建MAB-v3后训练Qwen3-8B,揭示能力上限和格式知识障碍是RL性能瓶颈,提出决策/格式知识/查找分类法并给出SFT注入代码、RL学习条件逻辑的修复方案。

详情

展开后加载摘要…

URL PDF HTML 收藏