arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-24 至 2026-07-24 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 18 篇

2603.11838 2026-07-24 cs.CL q-fin.GN 版本更新 92%

DatedGPT: Preventing Lookahead Bias in Large Language Models with Time-Aware Pretraining

DatedGPT:通过时间感知预训练防止大语言模型中的前瞻性偏差

Yutong Yan, Raphael Tang, Zhenyu Gao, Wenxi Jiang, Yao Lu

机构 * Department of Finance, CUHK Business School, The Chinese University of Hong Kong(香港中文大学商学院金融系,香港中文大学) Centre for Artificial Intelligence, University College London(伦敦大学学院人工智能中心)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);pretraining(title);post-training(abstract)

AI总结 DatedGPT通过时间感知预训练和指令微调,防止大语言模型中的前瞻性偏差,确保模型知识受限于数据截止年份,并在基准测试中表现出竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20456 2026-07-24 cs.CL cs.AI 新提交 91%

Learn2Zinc: Fine-tuning Small Language Models for Text-to-Model Translation in MiniZinc

Learn2Zinc:微调小型语言模型以实现MiniZinc中的文本到模型翻译

Serdar Kadioglu, Karthik Uppuluri

机构 * AI Center of Excellence, Fidelity Investments(富达投资卓越人工智能中心) Department of Computer Science, Brown University(布朗大学计算机科学系)

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 研究针对小型语言模型在MiniZinc文本到模型翻译的难题,提出跨模型错误引导方法,收集语法错误构建训练数据集微调模型,提升执行准确率至98%,虽语法可学但约束推理仍具挑战,且开源相关资源供后续研究。

Comments CP 2026 Workshop on LLMs meet Constraint Solving

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20430 2026-07-24 cs.CL cs.AI 新提交 90%

LLM-INSTRUCT at UZH Shared Task 2026: Constraint-Aware Retrieval and Selective Debate for Paragraph-Level Argument Mining

LLM-INSTRUCT在UZH 2026共享任务中的应用:用于段落级论证挖掘的约束感知检索和选择性辩论

Phuong Huu Vu Tran, Long Minh Vo, Son Nguyen Minh Le, Hoang Van

机构 * Vietnamese-German University(越南-德国大学) RMIT University Vietnam(皇家墨尔本理工大学越南分校) VANGIA INNOVATIONS(VANGIA创新公司)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文介绍了在UZH 2026共享任务中用于段落级论证挖掘的获胜系统LLM-INSTRUCT,通过元数据感知检索、约束解码等方法缩小决策空间,提高了准确性和提交稳健性,在官方排行榜上取得优异成绩。

Comments Accepted to the 13th Workshop on Argument Mining (ArgMining 2026) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20537 2026-07-24 cs.LG cs.AI 新提交 90%

ReliableTableQA:How Much Supervision Does Reliability Annotation Need?

可靠表格问答:可靠性标注需要多少监督?

Huei-Chung Hu, Hsin-Tai Wu, Koyo Kobayashi

机构 * DOCOMO Innovations, Inc.(都科摩创新公司) NTT DOCOMO, Inc.(日本电报电话公司都科摩)

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 研究提出ReliableTableQA框架训练LLM标注表格问答结果统计可靠性,贡献分类法、数据管道及监督量研究。发现小的模式分层SFT集效果显著,GRPO在SFT不足时才有用,重新界定可靠性标注为数据效率问题,明确强化微调效果。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23672 2026-07-24 cs.AI 版本更新 88%

Teaching LLMs String Matching, Backtracking, and Error Recovery to Deduce Bases and Truth Tables for the Combinatorially Exploding Bit Manipulation Puzzles

教LLM字符串匹配、回溯与错误恢复:为组合爆炸的位操作谜题推导基和真值表

Prateek Agnihotri, Sanchit Jain, Prabhat Agnihotri, Aditya Prasad, Shubham Jain

机构 * NVIDIA

专题命中 指令微调 :LLM(title_cn,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种新方法,通过字符串相似性、结构化搜索和自主错误恢复,避免复杂布尔逻辑,解决位操作谜题中的组合爆炸问题,实现96%以上验证准确率。

Comments 22 pages, 4 figures, 2 tables. 7th Place Solution for the NVIDIA Nemotron Model Reasoning Challenge (Kaggle)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19337 2026-07-24 cs.CL cs.CV 版本更新 86%

Token-Level Entropy Reveals Demographic Disparities in Large Language Models

Token级熵揭示语言模型中的群体统计差异

Messi H. J. Lee

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 通过测量零温度下全词汇香农熵,发现黑裔名字比白裔名字产生更高的首token熵,且女性名字比男性名字产生更低的熵和更同质的输出,种族和性别效应可加,指令微调未减弱种族差距,显式群体标签探测无显著种族效应。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21279 2026-07-24 cs.CL 新提交 85%

A Unified Moral-Value Dataset for Instruction Tuning

用于指令微调的统一道德价值数据集

Zhaohui Zeng, Florian Mai

机构 * RWTH Aachen(亚琛工业大学) University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉玛尔机器学习与人工智能研究所)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对大语言模型与人类价值观对齐问题,构建统一道德价值数据集用于指令微调,通过合并现有数据集并转换格式而成,实验表明其结合通用任务数据集训练可保持性能,为对齐研究提供资源。

Comments Accepted at the 4th International Workshop on Value Engineering in AI (VALE 2026), co-located with IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20511 2026-07-24 cs.AI 新提交 85%

SiGMA: Sign-Guided Merging and Adaptation for Multimodal Continual Instruction Tuning

SiGMA:用于多模态持续指令微调的符号引导合并与适配

Keonhee Park, Gunhee Kim

机构 * Seoul National University(首尔国立大学)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多模态持续指令微调中存在的问题,提出SiGMA框架,通过训练时符号引导自适应调优、推理时符号引导合并减轻负面干扰,在相关基准实验中显著减少干扰且性能优于现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20444 2026-07-24 cs.CL cs.AI 新提交 84%

Confidently Deceptive: How Confidence Amplifies the Risk of LLM Deception

自信的欺骗:信心如何放大语言模型欺骗的风险

Ali Asad, Stephen Obadinma, Anshul Pattoo, Wenxuan Zhang, Xiaodan Zhu

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型欺骗问题,通过多种方式衡量信心,发现其会产生高信心欺骗性回答,错位微调加剧问题,模型能识别自身欺骗性输出却不避免,指出自信的欺骗是独特风险,需综合评估欺骗、信心与意识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30997 2026-07-24 cs.AI 版本更新 79%

A Three-Phase Foundation Model for Tax-Aware Personalized Portfolio Management

面向税务感知的个性化投资组合管理的三阶段基础模型

Ramin Pishehvar

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI

AI总结 提出三阶段深度强化学习系统,通过自监督跨资产编码器、MoE策略网络和LoRA个性化层,解决金融RL中标的锁定、单目标优化和静态用户模型三大局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20581 2026-07-24 cs.CR cs.AI 新提交 70%

Geometric Configurations of Perturbed Jailbreak Prompts

受扰动越狱提示的几何配置

Lynn Delcon, Andres Algaba, Vincent Ginis

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究Qwen和Llama系列小权重模型中受扰动越狱输入的内部表示,选两个表示空间,在拒绝主导答案集中两空间均无行为超平面,仅特定模型的个别token与合规答案有关联。

Comments 21 pages, 9 figures, 7 tables, 2nd Workshop on Safe AI (SafeAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20472 2026-07-24 cs.AI 新提交 70%

Robust Critics: Defending LLMs Against Multi-Turn Attacks

鲁棒评论家:防御大语言模型免受多轮攻击

Roman Belaire, Arunesh Sinha, Pradeep Varakantham

专题命中 指令微调 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型在多轮攻击下的安全问题,提出对话评论家引导采样(DCGS)框架,通过推断用户意图、建模为马尔可夫决策过程并学习价值和遗憾评论家来生成回复,在多个数据集上评估优于基线和前沿模型,还能迁移提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20515 2026-07-24 cs.CV 版本更新 67%

S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence

S-Agent:空间工具使用激发空间智能推理

Yalun Dai, Hao Li, Shulin Tian, Runmao Yao, Yuhao Dong, Fangzhou Hong, Zhaoxi Chen, Fangfu Liu, Tao Wang, Kim-Hui Yap, Ziwei Liu

机构 * NTU(南洋理工大学) THU(清华大学) ByteDance(字节跳动) NWPU(西北工业大学)

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 提出S-Agent空间工具使用智能体范式,通过时空证据积累和层次化工具集,将VLM作为语义规划器,实现连续多视图图像和视频的空间推理,在无训练下提升开源和闭源VLM性能,并基于S-300K轨迹微调得到紧凑空间智能体S-Agent-8B。

Comments Project Page : https://Ropedia.github.io/S-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21595 2026-07-24 cs.CV cs.AI cs.LG 新提交 62%

3D-Aware VLMs with Implicit and Explicit Geometries

具有隐式和显式几何的3D感知视觉语言模型

Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Ran Xu, Shijian Lu, Gongjie Zhang

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) HuPan Lab(湖畔实验室)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对多数2D视觉输入的VLM处理3D任务困难的问题,提出VLM-IE3D框架,通过引入隐式和显式几何令牌及3D感知适配器,融合几何表示与视觉线索,在多种3D任务中表现优异。

Comments Accepted by ECCV 2026, Open Sourced

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20460 2026-07-24 cs.CL cs.AI 新提交 62%

Instruct-FD: Can Your Full-Duplex Speech System Follow Turn-Taking Instructions?

Instruct-FD:你的全双工语音系统能遵循轮流发言指令吗?

Yuzhi Tang, Wentao Ma, Xiling Zhao, Ahmad Salimi, Sepehr Harfi Moridani, Dongming Shen, Jixuan Wang, Abdulrahman Abdulrazzag, Murdock Aubry, Yu-Hua Chen, Daniel Lee, Jaewon Lee, Jonah Mackey, Silin Meng, Nicholas Stranges, Chenxu Xiong, Hao Yu, Yi Zhu, Mu Li, Alex Smola

机构 * Boson AI(玻色子人工智能公司)

专题命中 指令微调 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究全双工语音系统在明确指令下的轮流发言行为,引入Instruct-FD基准,开发相关工具,通过对六个先进系统测试发现遵循指令的轮流管理有差距,为构建适应性全双工对话系统指明关键方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21356 2026-07-24 cs.LG 新提交 57%

Emergent Misalignment Recruits a Pre-existing Persona Subspace

新兴的不一致性招募了预先存在的角色子空间

Mohammed Suhail B Nadaf

机构 * Qwen Team(通义团队)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 研究新兴不一致现象,通过从冻结模型提取角色子空间发现其在微调前就存在,微调第一步提升不一致幅度,投影子空间可防广泛不一致,注入子空间会致模型不一致,多种编辑无效,传播不良数据增加不一致。

Comments 108 pages (19 pages main text, 13 appendices), 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21417 2026-07-24 cs.CV 新提交 50%

Towards Privacy-Preserving Federated Prompt Tuning under Data Heterogeneity: A Subspace-Decomposed Expert Approach

面向数据异构性下的隐私保护联邦提示调优:一种子空间分解专家方法

Yuhua Wang, Xiaodong Li, Yihao Guo, Yuxiang Jia, Qinnan Zhang, Yifan Sun, Hainan Zhang, Yongxin Tong, Zhiming Zheng

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Center for the Applied Statistics, School of Statistics, Renmin University of China(中国人民大学统计学院应用统计中心) School of Computer Science & Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) School of Software, Beihang University(北京航空航天大学软件学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

专题命中 指令微调 :language model(abstract)

AI总结 研究针对数据异构性下的隐私保护联邦提示调优问题,提出FedSEPT方法,采用子空间分解专家建模及实例感知专家融合技术,在11个异构基准实验中,于相同隐私约束下,该方法在局部适配和全局泛化间实现更好权衡。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20900 2026-07-24 cs.CV 新提交 50%

DINO-VPT: Hierarchical Visual Prompt Tuning for Joint Physical-Digital Face Anti-Spoofing

DINO-VPT:用于联合物理-数字人脸反欺骗的分层视觉提示调整

Pierre Gallin-Martel, Mika Feng, Koichi Ito, Takafumi Aoki

机构 * Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院)

专题命中 指令微调 :language model(abstract)

AI总结 研究针对人脸反欺骗需求,提出DINO-VPT轻量级仅视觉框架,利用分层视觉提示调整,通过提示路由网络动态注入提示,无需多模态融合,在基准测试中比现有方法准确率更高,证明合理架构能达最优性能。

Comments accepted to IJCB2026

详情

展开后加载摘要…

URL PDF HTML 收藏