arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11359 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 929 篇

2607.09005 2026-07-13 physics.geo-ph 新提交 50%

Benchmarking Universal Machine Learning Force Fields for Molecular Dynamics of Lunar Regolith Minerals

用于月球风化层矿物分子动力学的通用机器学习力场基准测试

Ziyu Huang, Ken-ichi Nomura

专题命中 指令微调 :foundation model(abstract)

AI总结 研究对六个通用机器学习力场模型用于月球矿物分子动力学模拟进行基准测试,通过多种方式评估结构保真度,测试羟基化表面,还进行性能基准测试,为模型应用提供初步基准并明确未来关键方向。

Comments 14 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06553 2026-07-10 cs.CV 新提交 50%

From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models

从 RGB 生成到密集场读出:使用文本到图像模型进行像素空间密集预测

Zanyi Wang, Xin Lin, Haodong Li, Dengyang Jiang, Yijiang Li

机构 * UCSD(加州大学圣地亚哥分校) HKUST(香港科技大学)

专题命中 指令微调 :pretraining(abstract)

AI总结 研究利用文本到图像模型进行像素空间密集预测,提出ReChannel方法,保留DiT输入分布的VAE编码器,去掉目标侧解码器,用任务LoRA调整,通过线性头映射令牌到像素空间补丁,在多个密集预测任务上表现出色,比对比方法更准确快速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07529 2026-07-09 cs.GT 新提交 50%

FedMark-FM: Auditable, Risk-Adjusted Data Markets for Federated Foundation-Model Adaptation

FedMark-FM:用于联邦基础模型适配的可审计、风险调整数据市场

Phat T. Tran-Truong, Xuan-Bach Le, Minh Nhat Nguyen

专题命中 指令微调 :foundation model(abstract)

AI总结 研究联邦基础模型适配中激励机制问题,提出FedMark-FM框架,将客户端视为工件卖家,用S3Val估计贡献,转换支付惩罚不良行为,经多任务评估表现出色,证明管道有序估值独特性,能在一定规模下保留专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07195 2026-07-09 cs.CV 新提交 50%

DiffCVE: Diffusion-based Compressed Video Enhancement

DiffCVE:基于扩散的压缩视频增强

Wenqiang Xiao, Wenzhuo Ma, Junxi Zhang, Zhenzhong Chen

机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感信息工程学院)

专题命中 指令微调 :prompting(abstract)

AI总结 针对严重压缩视频感知质量增强难题,提出DiffCVE方法。设计CPDC分支联合建模,引入CDSP机制与CPWF模块,利用编码先验及条件提示等,经实验验证该方法能有效提升感知质量,尤其在严重压缩时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05625 2026-07-08 cs.CV 新提交 50%

Cross-Contextual Vision-Language Adaptation with LoRA for Personalized Severe Adverse Event Detection in Clinical Wound Monitoring

基于LoRA的跨上下文视觉语言适配用于临床伤口监测中的个性化严重不良事件检测

Aditi Naiknaware, Jian Sun, Aminreza Khandan, Shengyang Huang, Sean Dow, Bijan Najafi, Salimeh Sekeh

机构 * San Diego State University(圣地亚哥州立大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 指令微调 :language model(abstract)

AI总结 研究针对临床伤口监测中严重不良事件检测问题,提出基于双流LoRA框架及跨上下文融合机制的多模态框架,结合多种方法识别个性化严重不良事件并捕捉愈合动态,在相关实验中展现良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06305 2026-07-08 astro-ph.IM 新提交 50%

Exploring Image-Text Alignment for Radio Galaxy Morphologies

探索射电星系形态的图像-文本对齐

Erica Lastufka, Mariia Drozdova, Svyatoslav Volosynovskiy

专题命中 指令微调 :language model(abstract)

AI总结 研究射电星系图像与文本描述的对齐,利用MiraBest数据集及SigLIP-2模型,经特定提示生成描述并评估。结果显示基于描述的星系分类与图像类似,微调改善局部连贯性,此为射电星系形态研究提供新方法。

Comments Accepted at the AI in Science (AIS) Conference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02708 2026-07-07 cs.CV 新提交 50%

When Does Resolution Help a Frozen Backbone? Global Attention at Resolution Predicts Scalable Adaptation for Camouflaged and Marine Animal Segmentation

分辨率何时有助于冻结的主干网络?分辨率下的全局注意力预测伪装和海洋动物分割的可扩展适应性

Tyler Rust, Chandra Kambhamettu

机构 * University of Delaware(特拉华大学) University of South Florida(南佛罗里达大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 研究适应冻结视觉基础模型进行细粒度分割时主干网络选择的影响,通过控制实验建立主干网络应用全局注意力与分辨率、低秩适配器效果的关系模式,特定主干网络在多数据集上表现优。

Comments 9 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02559 2026-07-07 cs.CV 新提交 50%

How many labels do you need? A decision framework for cross-habitat marine species recognition

你需要多少标签?跨栖息地海洋物种识别的决策框架

Alzayat Saleh, Mostafa Rahimi Azghadi

机构 * College of Science and Engineering, James Cook University(詹姆斯·库克大学科学与工程学院) Centre for AI and Data Science Innovation, James Cook University(詹姆斯·库克大学人工智能与数据科学创新中心)

专题命中 指令微调 :foundation model(abstract)

AI总结 提出跨海洋栖息地转移视觉系统时标记工作量与识别准确性权衡的决策框架,用五个数据集等评估四个模型及策略,发现少量标记图像即可,可据此规划标记工作。

Comments 29 pages, 12 figures, 4 tables. Includes supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02158 2026-07-03 cs.CV 新提交 50%

Efficient PEFT Methods with Adaptive Checkpointing for Vision Models and VLMs on Resource Constrained Consumer-GPUs

面向资源受限消费级GPU的视觉模型与VLM的高效PEFT方法及自适应检查点技术

Altay Toktassyn, Jurn-Gyu Park

机构 * Department of Computer Science, Nazarbayev University(计算机科学系,纳扎尔拜耶夫大学)

专题命中 指令微调 :language model(abstract)

AI总结 本文在2GB VRAM限制下,比较了五种PEFT方法在Transformer和Mamba视觉骨干上的表现,并提出了自适应梯度检查点算法,在CIFAR-100和DTD上评估了准确率、训练时间、能耗及多目标指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00338 2026-07-02 cs.CV 新提交 50%

DroneFINE: Domain-Aware Parameter-Efficient Fine-Tuning of Vision-Language Detectors for Drone Images

DroneFINE: 面向无人机图像的视觉-语言检测器的域感知参数高效微调

Ke Wu, Yanan Zhang, Yingjie Gao, Wenhao Li, Chenyu Zhou, XinZhu Ma, Jiaxin Chen, Di Huang

机构 * National College for Excellent Engineers, Beihang University, Beijing, China(北京航空航天大学优秀工程师学院) School of Computer Science and Engineering, Beihang University, Beijing, China(北京航空航天大学计算机科学与工程学院) School of Computer Science and Information Engineering, Hefei University of Technology, Hefei, China(合肥工业大学计算机科学与信息工程学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室) Innovation Center for Intelligent System Cognition and Decision-Making, Beijing, China(智能系统认知与决策创新中心) Information Science Academy of China Electronics Technology Group Corporation, Beijing, China(中国电子科技集团有限公司信息科学研究院)

专题命中 指令微调 :language model(abstract)

AI总结 针对无人机图像与视觉语言模型预训练数据之间的域差异,提出包含HyperAdapter和SemanticGate的域感知参数高效微调方法,在减少可训练参数的同时达到与全微调相当的性能。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31258 2026-07-01 cs.CV 新提交 50%

WarpHammer: Densifying Scene Warps with 3D Object Priors for Extreme View Synthesis

WarpHammer: 利用3D物体先验稠密化场景扭曲以实现极端视角合成

Michael Green, Gavriel Habib, Dvir Samuel, Tal Berkovitz Shalev, Issar Tzachor, Rami Ben-Ari, Or Litany

机构 * OriginAI, Israel(OriginAI,以色列) NVIDIA(英伟达) Technion(以色列理工学院)

专题命中 指令微调 :foundation model(abstract)

AI总结 针对投影条件新视角合成在大轨道运动下扭曲稀疏导致生成失败的问题,提出无需训练的WarpHammer框架,通过引入3D生成先验的物体显式重建来补充缺失前景并遮挡不应可见的背景点,恢复外观和相机线索,并首次支持融合外部辅助物体视图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27708 2026-06-29 cs.CV 新提交 50%

ZooClaw-FashionSigLIP2: Distilled Fine-tuning for Robust Fashion Retrieval

ZooClaw-FashionSigLIP2:用于鲁棒时尚检索的蒸馏微调

Siqiao Xue, Chunxue Xu

专题命中 指令微调 :foundation model(abstract)

AI总结 提出ZooClaw-FashionSigLIP2,通过全微调加知识蒸馏和权重插值,解决基础视觉语言模型适应时尚检索时的泛化损失问题,在多个基准上超越LoRA和大模型。

Comments ZooClaw Team

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24214 2026-06-24 cs.CV 新提交 50%

MorVess: Morphology-Aware Pulmonary Vessel Segmentation Network

MorVess: 形态感知的肺血管分割网络

Fuyou Mao, Yifei Chen, Beining Wu, Lixin Lin, Jinnan Dai, Zhiling Li, Yilei Chen, Yaqi Wang, Hao Zhang, Yan Tang, Huiyu Zhou, Feiwei Qin

机构 * Central South University(中南大学) Tsinghua University(清华大学) Hangzhou Dianzi University(杭州电子科技大学) University of Leicester(莱斯特大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 提出MorVess框架,结合可微几何先验与大模型适应,通过联合预测血管掩膜、距离图和厚度图,提升肺血管分割的拓扑完整性和小血管恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24175 2026-06-24 cs.CV 新提交 50%

Tri-Efficient Transfer Learning for Point Cloud Videos

点云视频的三效迁移学习

Yiding Sun, Dongxu Zhang, Jihua Zhu, Haozhe Cheng, Zhengqiao Li, Pengcheng Li, Chaowei Fang, Yonghao Dong, Lin Chen

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件学院) School of Information and Communication Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院) SIGS, Tsinghua University(清华大学深圳国际研究生院)

专题命中 指令微调 :foundation model(abstract)

AI总结 提出PoinTriE框架,通过伪运动轨迹合成、几何-运动对偶网络和时空侧网络,实现数据、参数和内存三方面高效的点云视频迁移学习,在动作识别和语义分割任务上取得新最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21736 2026-06-23 cs.CV 新提交 50%

Adversarial Domain Prompt Tuning and Generation for Single Domain Generalization

对抗域提示调优与生成用于单域泛化

Zhipeng Xu, De Cheng, Xinyang Jiang, Nannan Wang, Dongsheng Li, Xinbo Gao

机构 * Xidian University(西安电子科技大学) Microsoft Research Asia(微软亚洲研究院) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 提出渐进式对抗提示调优框架,利用预训练扩散模型生成多样域风格图像,实现单域泛化,性能超越现有方法。

Comments 12 pages, 6 figures, accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22234 2026-06-23 cond-mat.mtrl-sci cond-mat.mes-hall 新提交 50%

Fine-Tuned Machine-Learned Interatomic Potentials for Structural and Vibrational Properties of Twisted 2D Materials

用于扭曲二维材料结构和振动特性的微调机器学习原子间势

Viet-Anh Tran, Viet-Hung Nguyen, Wei Chen, Gian-Marco Rignanese, Jean-Christophe Charlier

专题命中 指令微调 :foundation model(abstract)

AI总结 通过微调通用原子基础模型,开发了适用于扭曲二维材料(如双层石墨烯、h-BN和MoS2)的机器学习原子间势,准确模拟了原子重构和莫尔声子谱,与实验吻合。

Comments 35 pages, 14 figures, Supplementary Materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17296 2026-06-17 cs.CV 新提交 50%

Pareto LoRA: Mitigating Modality Imbalance in Unified Multimodal Models via Pareto-Optimal Gradient Integration

Pareto LoRA:通过帕累托最优梯度集成缓解统一多模态模型中的模态不平衡

Xiwen Wei, Mark Nutter, Madhusudhanan Srinivasan, Radu Marculescu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Advanced Micro Devices, Inc.(超威半导体公司)

专题命中 指令微调 :instruction tuning(abstract)

AI总结 针对统一多模态模型在LoRA微调中语言梯度主导优化导致图像生成质量下降的问题,提出帕累托最优梯度集成策略Pareto LoRA,通过调节梯度方向和强度平衡文本与图像目标,在CoMM基准上显著提升图像感知质量达44.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16993 2026-06-16 cs.CV 新提交 50%

DreamX-World 1.0: A General-Purpose Interactive World Model

DreamX-World 1.0:通用交互式世界模型

DreamX Team, Yancheng Bai, Rui Chen, Xiangxiang Chu, Rujing Dang, Hao Dou, Bingjie Gao, Qiwen Gu, Siyu Hong, Jiachen Lei, Geng Li, Jifan Li, Ruimin Lin, Qingfeng Shi, Bingze Song, Lei Sun, Jing Tang, Ruitian Tian, Jun Wang, Jiahong Wu, Pengfei Zhang, Shen Zhang, Jiashu Zhu

机构 * DreamX Team(DreamX团队)

专题命中 指令微调 :instruction tuning(abstract)

AI总结 提出通用交互式文图生视频世界模型DreamX-World 1.0,通过E-PRoPE相机控制、因果强制自回归生成、记忆条件场景持久化和事件指令微调,实现可控长时程生成,在多项指标上超越现有方法。

Comments Project page: https://amap-ml.github.io/DreamX_World, Code: https://github.com/AMAP-ML/DreamX-World

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16756 2026-06-16 cs.CV 新提交 50%

3D Classification of Paramagnetic Rim Lesions in Multiple Sclerosis via Asymmetric QSM-FLAIR Modeling

多发性硬化症中顺磁性边缘病变的3D分类:基于非对称QSM-FLAIR建模

Veronica Pignedoli, Giacomo Boffa, Nicoletta Noceti, Matilde Inglese, Francesca Odone, Matteo Moro

机构 * MaLGa, DIBRIS, University of Genova(热那亚大学) DINOGMI, University of Genova(热那亚大学) IRCCS Azienda Ospedaliera Metropolitana(IRCCS大都会医院)

专题命中 指令微调 :pretraining(abstract)

AI总结 提出一种3D多模态深度学习框架,利用非对称QSM-FLAIR建模对多发性硬化症中的顺磁性边缘病变进行自动分类,通过自监督预训练和对比正则化提升有限数据下的鲁棒性,在88名患者队列中验证了有效性。

Comments 10 pages, 3 figures, accepted at MICCAI 2026. Github link: https://github.com/veronicapignedoli/FRODO

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15861 2026-06-16 cs.CV 新提交 50%

Object Tokens as a Bridge Between Segmentation and Visual Question Answering in Robotic Surgery

对象标记作为机器人手术中分割与视觉问答的桥梁

Yiping Li, Ronald de Jong, Romy van Jaarsveld, Franco Badaloni, Gino Kuiper, Jelle Ruurda, Josien Pluim, Marcel Breeuwer

机构 * Department of Biomedical Engineering, Eindhoven University of Technology(埃因霍温理工大学生物医学工程系) Department of Electrical Engineering, Eindhoven University of Technology(埃因霍温理工大学电气工程系) Department of Surgery, University Medical Center Utrecht(乌得勒支大学医学中心外科)

专题命中 指令微调 :language model(abstract)

AI总结 提出统一框架,联合像素级分割与视觉问答,通过VLM生成对象标记引导答案预测和分割掩码,在RAMIE和EndoVis18数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14699 2026-06-15 cs.CV cs.GR cs.RO 新提交 50%

Instruct-Particulate: Scaling Feed-Forward 3D Object Articulation with Kinematic Control

Instruct-Particulate: 基于运动学控制的可扩展前馈式3D物体关节化

Ruining Li, Yuxin Yao, Matt Zhou, Chuanxia Zheng, Christian Rupprecht, Joan Lasenby, Shangzhe Wu, Andrea Vedaldi

机构 * University of Oxford(牛津大学) University of Cambridge(剑桥大学) Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :language model(abstract)

AI总结 提出Instruct-Particulate模型,通过运动学规范(部件描述、连接性、关节类型等)指导3D网格的关节分割和运动参数预测,利用异构数据集(15万+物体)训练,实现跨类别和AI生成网格的泛化。

Comments Project page: https://instruct-particulate.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11636 2026-06-11 cs.RO 新提交 50%

SAFER-Nav: Enhancing Safety for Visual Robot Navigation via Segmentation-Aware Fine-Tuning

SAFER-Nav: 通过分割感知微调增强视觉机器人导航的安全性

Geonyeong Ko, Giung Lee, Changjoo Nam

机构 * Dept. of Electronic Engineering, Sogang University(西江大学电子工程系) Dept. of Computer Science, Rice University(莱斯大学计算机科学系) Vertical Labs, Co., Ltd.(Vertical Labs 有限公司)

专题命中 指令微调 :foundation model(abstract)

AI总结 提出SAFER-Nav方法,通过分割感知微调将障碍物边界和可通行空间结构直接融入导航策略,降低碰撞频率并保持目标到达性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10464 2026-06-10 eess.AS 新提交 50%

GC-LoRA: Gated Convolutional LoRA for Parameter-Efficient Acoustic Adaptation

GC-LoRA:用于参数高效声学适应的门控卷积LoRA

Natarajan Balaji Shankar, Zilai Wang, Kaiyuan Zhang, Mohan Shi, Abeer Alwan

专题命中 指令微调 :foundation model(abstract)

AI总结 提出GC-LoRA适配器架构,通过注入Conformer风格的局部卷积处理到预训练Transformer编码器中,高效捕捉局部声学依赖,在多种声学失配领域实现高达10.9%的词错误率降低。

Comments Accepted for publication at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10488 2026-06-10 cs.CV 新提交 50%

5% > 100%: Flatness Preference is All You Need for Multimodal Parameter-Efficient Fine-Tuning

5% > 100%: 平坦性偏好是您进行多模态参数高效微调所需的一切

Yifan Zhu, Can Lin, Hangjie Yuan, Zixiang Zhao, Pengfei Zhang, Tao Feng, Zhonghong Ou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学) ETH Zürich(苏黎世联邦理工学院) Anhui University of Science and Technology(安徽理工大学) Tsinghua University(清华大学) State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)

专题命中 指令微调 :preference optimization(abstract)

AI总结 揭示参数高效微调方法中普遍存在的平坦性偏好,即少量尖锐维度主导泛化,并提出FlatPO方法优化这些维度以提升泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 494 篇

2606.13940 2026-06-15 cs.CL 新提交 94%

Can Post-Training Turn LLMs into Good Medical Coders? An Empirical Study of Generative ICD Coding

后训练能否使LLM成为优秀的医学编码员?生成式ICD编码的实证研究

Ziqing Wang, Weihao Li, Shijie Chen, Yuan Luo, Kaize Ding

机构 * Northwestern University(西北大学)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);SFT(summary_cn,abstract);post-training(title,abstract);large language model(abstract)

AI总结 通过对比提示、监督微调和强化学习(GRPO及新提出的PHI课程)在ICD编码任务上的表现,发现后训练(尤其是SFT和GRPO)能显著提升生成式LLM的编码性能,提示评估瓶颈在于模型适应而非生成范式本身。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09735 2026-06-09 cs.CL 新提交 94%

The Neutral Mask: How RLHF Provides Shallow Alignment while Leaving Partisan Structure Intact in a Large Language Model

中性面具:RLHF如何提供浅层对齐而保留大语言模型中的党派结构

Wendy K. Tam

机构 * Vanderbilt University(范德堡大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) National Center for Supercomputing Applications(国家超级计算应用中心)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究RLHF对Llama 3.1 8B党派倾向的影响,发现RLHF仅压缩党派信号方差以实现中性输出,而非移除党派结构,且特征级操控可绕过对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10462 2026-08-12 cs.CL 新提交 93%

Calibrating Post-Training Feature Shifts for LLM Data Contamination Detection

校准用于大语言模型数据污染检测的训练后特征偏移

Zhen Yang, Mengqi Wang, Gengda Zhao, Mo Zhou, Jianwei Wang, Wenjie Zhang

机构 * The University of New South Wales(新南威尔士大学)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对训练后处理导致的LLM数据污染检测中特征偏移问题,提出CalibDCD校准框架,经实验可提升现有检测器的AUC和TPR@5%FPR指标。

Comments 14 pages, 7 figures. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09605 2026-08-11 cs.IR cs.AI 新提交 93%

TSPORec: Token Selection via Preference Optimization for LLM-Based Sequential Recommendation

TSPORec:基于偏好优化的 token 选择的 LLM 序列推荐

Wenqiao Zhu, Chao Xu, Haipang Wu, Ji Liu

专题命中 后训练与偏好优化 :LLM(title,title_cn);preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出 TSPORec 方法,通过三阶段流程与新型代理奖励选择信息 token,在提升 LLM 序列推荐性能的同时降低计算成本,实验显示其较基线方法性能提升最高 31.25%、效率提升最高 63.4%。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26583 2026-06-26 cs.CE 新提交 93%

Preference Optimization Drives Monoculture in LLM Prediction Markets

偏好优化导致LLM预测市场中的单一文化

James Begin, Brendan Gho, Suman Muppavarapu, Tyson Tsay, Atharva Mohan, Afnan Shaik, Ruizhe Li, Vasu Sharma, Archana Vaidheeswaran

专题命中 后训练与偏好优化 :LLM(title,title_cn);preference optimization(title,abstract);SFT(abstract,abstract_cn)

AI总结 研究发现,使用直接偏好优化(DPO)微调的LLM代理在预测市场中产生高度相关的错误,导致集体预测能力远低于独立代理数量,且该现象由偏好优化驱动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13430 2026-07-16 cs.CL 新提交 93%

Exploring Post-Training Alignment of Small Language Models for Biomedical Data-to-Text Generation: A Case Study of Medication Leaflet

探索用于生物医学数据到文本生成的小语言模型的训练后对齐:以药品说明书为例

Xi Yang, Guodong Liu, Chuqin Li, Fan Wu, Ergin Soysal, Min Jiang, Xing He, Jiang Bian, Yi Guo, Shams Zaman, Thomas Fuchs, Todd Sanger, Yonghui Wu

专题命中 后训练与偏好优化 :language model(title,abstract);small language model(title,abstract);post-training(title,abstract);SFT(abstract,abstract_cn)

AI总结 该研究对生物医学数据到文本生成任务训练小语言模型的方法进行比较分析,在药品说明书数据集上用基于Qwen的SLMs探索多种训练后方法,通过整理数据评估模型,结果显示对齐后的SLMs性能优异,GRPO跨数据集性能最稳健。

Comments 10 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏