arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-11 至 2026-08-11 共收录 772 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 59 篇

2510.21891 2026-08-11 cs.CL cs.AI cs.LG stat.ME stat.ML 版本更新 80%

Embedding Trust: Semantic Isotropy Predicts Nonfactuality in Long-Form Text Generation

嵌入信任:语义各向同性预测长文本生成中的非事实性

Dhrupad Bhardwaj, Julia Kempe, Tim G. J. Rudner

机构 * New York University(纽约大学) University of Toronto(多伦多大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出通过语义各向同性(单位球面上归一化文本嵌入的均匀程度)评估LLMs生成长文本的可信度,其方法无需标注数据等,在多领域仅用少量样本预测非事实性的表现优于现有信号。

Comments Published in Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09521 2026-08-11 cs.AI 新提交 79%

One Adapter Pair per Model: A Universal Activation Interface for Language Models

每个模型一个适配器对:语言模型的通用激活接口

Su-Hyeon Kim, Jiwan Mun, Yo-Sub Han

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本研究提出通用激活总线框架,为兼容语言模型提供通用激活接口,每个模型配备轻量级适配器对,可实现激活工具跨模型共享与复用,为可复用工具建立稳定的激活契约。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09124 2026-08-11 cs.AI 新提交 79%

ChronoState: Hidden Elapsed-Time Conditioning for Temporal-State Action Selection in Frozen-Backbone Language Models

ChronoState:用于冻结骨干语言模型中时间-状态动作选择的隐式流逝时间条件

Sam Siavoshian, Omar Ramadan, Amir K. Saeed, Benjamin A. Johnson, Amin Mohamed El-Amin Diab, Benjamin M. Rodriguez

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 该研究提出 ChronoState 基准,证实冻结骨干语言模型可在直接监督下将隐式流逝时间与符号状态组合,但其泛化性有限,且性能不及提示注入时间戳基线。

Comments Submitted to SPIE Defense and Commercial Sensing 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28181 2026-08-11 cs.CL 版本更新 79%

When Confidence Misleads: Suffix Anchoring and Anchor-Proximity Confidence Modulation for Diffusion Language Models

当置信度误导时:扩散语言模型的后缀锚定与锚邻近置信度调制

Jungwon Park, Jimyeong Kim, Jungmin Ko, Nojun Kwak, Wonjong Rhee

机构 * RICS(智能研究学院) AIIS(人工智能研究所) IPAI(人工智能研究所) Department of Intelligence and Information(智能与信息系) Daegu Gyeongbuk Institute of Science and Technology(大邱庆州市科学技术院)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 针对扩散语言模型中置信度误导导致生成不完整或过早解码的问题,提出后缀锚定与锚邻近置信度调制方法,无需训练即可提升完全非自回归解码性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08060 2026-08-11 cs.CV 新提交 78%

ZOMP: Zeroth-Order Multi-Modal Prompt Tuning for Vision-Language Models

ZOMP:面向视觉-语言模型的零阶多模态提示调优

Sajjad Ghiasvand, Yifan Yang, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * UC Santa Barbara(加州大学圣巴巴拉分校)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出ZOMP方法,通过跨模态低秩重参数化等技术,在仅前向传递的条件下高效调优CLIP模型,在13个基准上优于现有无反向传播的提示调优方法,泛化能力更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09880 2026-08-11 cs.CV cs.LG 新提交 77%

Financial Numerical Prediction and Allocation as Token Generation

金融数值预测与分配:以 token 生成的方式实现

Xu Ouyang, Moontae Lee

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.LG

AI总结 本研究提出 FinATOM 框架,通过因果语言模型的 token 生成实现金融数值预测与 ETF 分配,在多组测试中显著提升了夏普比率与累计收益,验证了该方法的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28533 2026-08-11 cs.CL 版本更新 77%

GraphWalker: Agentic Knowledge Graph Question Answering via Synthetic Trajectory Curriculum

GraphWalker: 通过合成轨迹课程实现基于知识图谱的代理问答

Shuwen Xu, Yao Xu, Jiaxiang Liu, Chenhao Yuan, Wenshuo Peng, Jun Zhao, Kang Liu

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 指令微调 :SFT(abstract,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 GraphWalker通过自动化轨迹合成和分阶段微调解决知识图谱问答中的探索与泛化问题,提升轻量强化学习性能,在CWQ和WebQSP上取得最优效果。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08815 2026-08-11 cs.LG 新提交 74%

Distilling Vision-Language Models for Robust Traffic Sign Perception in Autonomous Vehicles

用于自动驾驶汽车鲁棒交通标志感知的视觉-语言模型蒸馏

Pedram MohajerAnsari, Amir Salarpour, Mert D. Pesé

机构 * Clemson University(克莱姆森大学)

专题命中 指令微调 :language model(title);分类 cs.LG

AI总结 本研究提出LAMDA框架,通过冻结OpenCLIP文本编码器构建原型库监督视觉特征,在GTSRB和LISA数据集上,可同时提升TSR模型对三类物理攻击的鲁棒性且不降低干净准确率。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08118 2026-08-11 cs.AI cs.LG cs.SC math.CO 新提交 73%

Neurosymbolic Discovery of Algebraic Graph Constructions

代数图构造的神经符号发现

David Seka, Stefan Szeider

机构 * TU Wien(维也纳技术大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对仅提供原始图数据无法揭示其结构性质的问题,提出基于通用大语言模型与SageMath的神经符号智能体,可自动发现代数图构造,在100个高度对称图基准上全部成功,还找到Bernhart-Kainen可散度猜想的最小反例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26368 2026-08-11 cs.CL cs.AI 版本更新 73%

Diagnosing Fine-Grained Inconsistency Classification in Financial Disclosure Text

金融披露文本中的细粒度不一致分类诊断

Aman Kumar, Lasitha Vidyaratne, Dipanjan D Ghosh, Arnab Chakrabarti, Ahmed K Farahat

机构 * Hitachi America, Ltd(美国日立公司)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对金融披露文本的细粒度不一致分类问题,在SBID-FD基准上对比多种模型,发现紧凑型监督编码器效率较高,证据定位是关键瓶颈,需同时提升证据提取与类别推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09125 2026-08-11 cs.CL cs.LG 版本更新 73%

LogicIF: Towards Complex Logic Instruction Following

复杂逻辑指令生成

Mian Zhang, Shujian Liu, Sixun Dong, Ming Yin, Yebowen Hu, Xun Wang, Simin Ma, Song Wang, Sathish Reddy Indurthi, Haoyun Deng, Zhiyu Zoey Chen, Kaiqiang Song

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Independent Researcher(独立研究者) Duke University(杜克大学) University of Central Florida(佛罗里达大学中央分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出LogicIFGen和LogicIFEval,用于生成和评估复杂逻辑指令,揭示了当前LLMs在复杂指令跟随上的不足。

Comments COLM 2026 Acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07565 2026-08-11 cs.CL cs.AI 版本更新 73%

Expert-Guided Multimodal Fusion for Unified Emotion and Sentiment Analysis

通过专家引导的多模态融合与大语言模型的统一框架实现情绪识别与情感分析

Jiaqi Qiao, Xinran Li, Yifan Lyu, Xiujuan Xu, Liu Yu

机构 * School of Software, Dalian University of Technology, China(软件学院,大连理工大学,中国)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EGMF框架,通过专家引导的多模态融合与大语言模型结合,实现情绪识别与情感分析的统一处理,提升跨语言鲁棒性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07565 2026-08-11 cs.CV cs.AI 新提交 70%

What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems

下一步编辑什么:对话系统中视觉对齐的图像编辑后续建议

Zhijing Zhang, Jinpeng Yu, Xin Song, Bingnan Li, Chuyue Li, Changhui Du, Xiaolin Fang, Jiaming Liu, Ruihua Huang

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务单元) Southeast University(东南大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对对话系统的图像创作场景,提出三阶段多模态推荐框架,经测试可降低视觉不一致率并显著提升推荐相关指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06233 2026-08-11 cs.AI 版本更新 70%

Demonstrating TOFFEE: A Learned System for Synthesizing Data Agent Trajectories at Scale

展示TOFFEE:一个大规模合成数据代理轨迹的学习系统

Ziting Wang, Yin Li, Zuhao Yang, Xiuchang Li, Jiale Bai, Gao Cong

机构 * Nanyang Technological University(南洋理工大学) Huawei(华为) Industrial and Commercial Bank of China Limited(中国工商银行)

专题命中 指令微调 :LLM(abstract);SFT(abstract);分类 cs.AI

AI总结 针对现有数据代理难以适应新环境的问题,提出TOFFEE系统,通过蒙特卡洛树搜索等方法,能从给定数据环境合成高质量数据代理轨迹,可用于监督微调与上下文学习,还展示了系统框架、界面及工作流程与应用场景。

Comments Accepted to VLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12705 2026-08-11 cs.LG 版本更新 70%

Early Data Exposure Improves Robustness to Subsequent Fine-Tuning

早期数据暴露提高对后续微调的鲁棒性

Lawrence Feng, Gaurav R. Ghosal, Jacob Mitchell Springer, Ziqian Zhong, Aditi Raghunathan

机构 * Department of Computer Science(计算机科学系) Cranberry-Lemon University(Cranberry-Lemon 大学) Department of Computational Neuroscience(计算神经科学系) University of the Witwatersrand(沃茨沃斯兰德大学)

专题命中 指令微调 :pretraining(abstract);post-training(abstract);分类 cs.LG

AI总结 本文研究了上游训练策略如何影响模型在后续微调中的鲁棒性,发现早期数据暴露能提升模型在微调后的表现,而传统方法如回放和dropout在后续微调中提供补充增益。

Comments Published at COLM 2026. Project website: https://ar-forum.github.io/earlyexposure-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09834 2026-08-11 cs.CL cs.LG 新提交 62%

RA-FinBERT: Rule-aware LoRA adaptation for low-resource financial sentiment classification

RA-FinBERT:面向低资源金融情感分类的规则感知LoRA适配

Fan Zhang, Jiaming Li

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出规则感知FinBERT(RA-FinBERT),将LoRA与VADER衍生特征结合,仅增1024个参数,在金融情感分类任务中较基线模型准确率、宏F1值及中性类召回率均显著提升,适配低资源场景。

Comments 12 pages, 6 figures, 2 tables. Fan Zhang and Jiaming Li are co-first authors. Corresponding author: Jiaming Li

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09819 2026-08-11 cs.LG cs.CL 新提交 62%

Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA

Macaron-V1:面向具备自我改进与LoRA混合能力的开放持续学习

Mind Lab, :, Vin Bo, Asher Cai, Jingwei Cao, Song Cao, Vic Cao, Amelia Chen, Andrew Chen, Kaijie Chen, Cleon Cheng, Steven Chiang, Kaixuan Fan, Hera Feng, Huan Feng, Arthur Fu, Jun Gao, Pyke Han, Nolan Ho, Ori Hong, Hailee Hou, Piers Hua, Charles Huang, Miles Jiang, Nora Jiang, Yuyi Jiang, Qiuyu Jin, Fancy Kong, Kuss Koo, Jaron Lee, Andrew Lei, Alexy Li, Dawn Li, Lucian Li, Ray Li, Ricardo Li, Smith Li, Theo Li, Allen Lin, Elliot Lin, Fan Lin, Chen Ling, Kairus Liu, Kieran Liu, Logan Liu, Neo Liu, Xiang Liu, Yuxin Lu, Maeve Luo, Pony Ma, Verity Niu, Cole Qiao, Guian Qiu, Vince Qu, Sentry, Niko Song, Vincent Wang, Bo Wu, Rio Yang, Evelyn Ye, Fiona Ye, Ina Ye, Regis Ye, Josh Ying, Atlas Zeng, Danney Zeng, Salmon Zhan, Anya Zhang, Di Zhang, Mia Zhang, Sueky Zhang, Wei Zhao, Ada Zhou, Adrian Zhou, Yuhua Zhou, Juno Zhu, Murphy Zhuang

专题命中 指令微调 :post-training(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出Macaron-V1开放智能体模型家族,结合MoL架构与递归自我改进机制,经多基准评估验证其有效性,为开放持续学习提供新方案。

Comments 49 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07749 2026-08-11 cs.CV cs.AI cs.LG 新提交 62%

LoRSA: Toward Generalizable Parameter-Efficient Fine-Tuning for Biomedical Downstream Tasks

LoRSA:面向生物医学下游任务的可泛化参数高效微调方法

Saed Moradi, Benyamin Ghojogh, M. Hadi Sepanj, Yimin Yang, Ashirbani Saha

机构 * McMaster University(麦克马斯特大学) University of Waterloo(滑铁卢大学) Western University(西安大略大学)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LoRSA框架,联合学习两类低秩分量实现生物医学视觉模型的参数高效微调,在乳腺密度分类任务中显著提升了模型对未见医学影像域的泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08896 2026-08-11 cs.AI 新提交 57%

From Manuals to Maintenance: Fine-Tuning MedGemma for Multi-Modal Imaging System Support in Low-Resource Settings

从手册到维护:在低资源场景中微调MedGemma以提供多模态成像系统支持

Bernes Lorier Atabonfack, Zion Kongbi Nfo, Ahmed Tahiru Issah, Tolulope Olusuyi, Clemence Ingabire, Mohammed Hardi Abdul Baaki, Mawuli Deku, Abdulrazaq Zubair, Alyasaa Anas, Raymond Confidence, Maruf Adewole, Udunna C. Anazodo

机构 * Carnegie Mellon University Africa(非洲卡内基梅隆大学) IngenziAI(因根齐人工智能公司) Federal University of Health Sciences Azare(阿扎雷联邦健康科学大学) University of Maiduguri Teaching Hospital(迈杜古里大学教学医院) Lawson Health Research Institute(劳森健康研究所) University of Pennsylvania(宾夕法尼亚大学) McGill University(麦吉尔大学)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI

AI总结 针对中低收入国家医疗设备维护难题,研究人员构建INGENZI_DatasetV1数据集,用QLoRA微调MedGemma-4b-it模型,使维修问答指标大幅提升,为低资源场景AI辅助医疗维护奠定基础。

Comments Accepted at the AFRICAI 2026 Workshop, a satellite event at MICCAI 2026. To appear in Springer Lecture Notes in Computer Science (LNCS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08219 2026-08-11 cs.CV cs.AI 新提交 57%

VTO: Visual Tool Orchestration for Video Anomaly Detection

VTO:面向视频异常检测的可视化工具编排

Rui Wang, Yeteng Wu, Xianling Zhang, Mengshi Qi

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学) School of Digital Media & Design Art(数字媒体与设计艺术学院)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI

AI总结 针对视频异常检测中传统方法泛化差、多模态智能体工具编排难的问题,提出过程监督强化学习框架VTO,结合VAD-Tool工具集,在工具调度上较基线提升10.2%。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09223 2026-08-11 cs.CV 新提交 50%

PatchHead: Learning Spatial Patch Evidence for Generalizable AI-Generated Image Detection

PatchHead:学习空间块证据以实现可泛化的AI生成图像检测

Shengbo Qi, Hongyi Fang, Benjia Zhou, Rui Mao

专题命中 指令微调 :foundation model(abstract)

AI总结 针对AI生成图像检测器泛化能力差的问题,提出保留DINO块token二维结构的PatchHead,仅优化少量参数,在9个跨数据集基准上表现优异,提升了检测准确率并降低了域差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08867 2026-08-11 cs.CV 新提交 50%

Zero-Shot Traffic Accident Detection via a Coarse-to-Fine VLM-Tracking Pipeline

基于粗到细VLM跟踪流水线的零样本交通事故检测

Dipit Saha, Shah Mohammad Abdul Mannan, Mohammad Raihan Rashid, Ruwad Naswan, Ahnaf Tahmid

机构 * Bangladesh University of Engineering and Technology(孟加拉工程技术大学)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出一种无需训练的双通粗到细流水线,结合Qwen3-VL-32B-Instruct、YOLO11x与BoT-SORT,在零样本约束下于ACCIDENT @ CVPR基准测试中实现22%相对优势,达成0.504的三方调和均值得分。

Comments Accepted at the AUTOPILOT Workshop, CVPR 2026, Denver, CO

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08336 2026-08-11 cs.CV 新提交 50%

Circuit Fine-Tuning for Compute-Efficient Transformer Adaptation

面向计算高效的Transformer适配的电路微调

Uri Z. Kialy, Gil Ben-Artzi

专题命中 指令微调 :language model(abstract)

AI总结 提出电路微调(CFT)框架,通过电路发现选择ViT待微调子图,仅微调该子图,可大幅降低训练FLOPs与时间,在多类视觉任务上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07981 2026-08-11 cs.CV 新提交 50%

Distilling Physical Priors into Streaming World Models

将物理先验知识蒸馏为流式世界模型

Liangliang Zhao, Junying Wang, Danni Yang, Yifan Chang, Bin Fu, Yu Qiao, Bowen Zhou, Yihao Liu

专题命中 指令微调 :pretraining(abstract)

AI总结 本文提出PhyS三阶段框架,构建120K物理交互数据集,经微调、蒸馏及在线强化学习结合TCR方法,提升流式世界模型的物理一致性,在PhysicsIQ等基准上取得显著性能提升。

Comments 9 pages, 7 figures. Project page: https://lyongo.github.io/PhyS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07596 2026-08-11 cs.RO cs.CV 新提交 50%

LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding

LIRA:面向视觉-语言-动作解码的局部跨层信息路由

Zhewei Zhang, Puyue Wang, Guanren Qiao, Yijie Weng, Jiawei Hu, Guo Li, Lujia Wang, Junyan Wang, Tao Gu, Hongliang Lu, Guiliang Liu, Hong Jia, Xinhu Zheng

专题命中 指令微调 :language model(abstract)

AI总结 LIRA是面向VLA模型的局部跨层信息路由机制,通过深度感知路由VLM特征,在多机器人操作基准及真实场景中提升了动作预测性能与分布偏移下的鲁棒性。

Comments 9 pages, 4 figures. Code and model checkpoints will be released upon acceptance of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21041 2026-08-11 eess.IV cs.CV 版本更新 50%

Efficient Fine-Tuning of DINOv3 Pretrained on Natural Images for Atypical Mitotic Figure Classification

针对非典型分裂细胞图分类的、在自然图像上预训练的DINOv3的高效微调

Guillaume Balezo, Raphaël Bourgade, Hana Feki, Lily Monnier, Matthieu Blons, Alice Blondel, Etienne Decencière, Albert Pla Planas, Thomas Walter

机构 * Mines Paris, PSL University, Center for Computational Biology(巴黎 Mines 大学计算生物学中心) Mines Paris, PSL University, Center for Mathematical Morphology(巴黎 Mines 大学数学形态学中心) Sanofi(桑福有限公司) Institut Curie, PSL University(Curie 机构,巴黎 Mines 大学) INSERM, U1331 Computational Oncology(INSERM,U1331 计算肿瘤学) Department of Pathology, University Hospital of Nantes(南特大学医院病理学系)

专题命中 指令微调 :pretraining(abstract)

AI总结 本研究针对MIDOG 2025非典型分裂细胞图分类任务,采用低秩适配微调仅130万参数的DINOv3-H+,结合数据增强与领域加权Focal Loss,最终获挑战赛测试集第一名。

Comments 11 pages, 4 figures. Challenge report for MIDOG 2025 (Task 2: Atypical Mitotic Figure Classification). Published in LNCS

Journal ref Mitotic Figure Detection and Atypia Classification in Whole Slide Images, Lecture Notes in Computer Science, vol. 16519, pp. 15-25, Springer, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 28 篇

2608.09605 2026-08-11 cs.IR cs.AI 新提交 93%

TSPORec: Token Selection via Preference Optimization for LLM-Based Sequential Recommendation

TSPORec:基于偏好优化的 token 选择的 LLM 序列推荐

Wenqiao Zhu, Chao Xu, Haipang Wu, Ji Liu

专题命中 后训练与偏好优化 :LLM(title,title_cn);preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出 TSPORec 方法,通过三阶段流程与新型代理奖励选择信息 token,在提升 LLM 序列推荐性能的同时降低计算成本,实验显示其较基线方法性能提升最高 31.25%、效率提升最高 63.4%。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08058 2026-08-11 cs.CY 新提交 93%

Representational Equality in Cross-country Value Simulation: A Systematic Analysis of Large Language Models

跨国价值观模拟中的表征平等:对大型语言模型的系统分析

Xiaowen Jian, Xinyi Mou, Daisong Gong, Chen Qian, Huimin Chen, Maosong Sun

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)

AI总结 本研究分析59国的LLM跨国价值观模拟,发现富裕技术先进国家人群模拟更准确,且两种干预路径的准确率提升未必带来表征平等,为构建更具包容性的LLM模拟提供指导。

Comments Accepted for publication in Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07786 2026-08-11 cs.AI cs.LG 新提交 92%

Who Built This Model? Tracing LLM Lineage via Spectral Fingerprints in Weight Space

谁构建了这个模型?通过权重空间中的光谱指纹追踪大语言模型(LLM)谱系

Yiwei Chen, Bingqi Shang, Sijia Liu

机构 * Michigan State University(密歇根州立大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本研究提出几何指纹框架,通过权重空间的光谱能量和子空间对齐分析,实现对110余个开源权重LLM对的谱系区分,为模型溯源提供稳健可解释的信号。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09217 2026-08-11 cs.LG cs.AI 新提交 91%

Beyond Solvability: Task Learnability as a Static Prior for LLM RL Post-Training

超越可解性:任务可学习性作为大语言模型强化学习后训练的静态先验

Ting Zhou, Zhenqing Ling, Daoyuan Chen, Qianli Shen, Yilun Huang, Ying Shen, Yaliang Li

机构 * Sun Yat-Sen University(中山大学) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出TrajVal估计任务可学习性,将其作为静态先验用于LLM的RL后训练任务采样,可提升数据效率并与在线调度方法互补。

详情

展开后加载摘要…

URL PDF HTML 收藏