arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-23 至 2026-07-23 共收录 221 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 13 篇

2412.10924 2026-07-23 cs.CL cs.AI 91%

Tokens, the oft-overlooked appetizer: Large language models, the distributional hypothesis, and meaning

Tokens,常被忽视的开胃菜:大语言模型、分布假说和意义

Julia Witte Zimmerman, Denis Hudon, Kathryn Cramer, Alejandro J. Ruiz, Calla Beauregard, Ashley Fehr, Mikaela Irene Fudolig, Bradford Demarest, Yoshi Meke Bird, Milo Z. Trujillo, Christopher M. Danforth, Peter Sheridan Dodds

机构 * Computational Story Lab(计算故事实验室) Vermont Complex Systems Institute(佛蒙特复杂系统研究所) University of Vermont(佛蒙特大学) Department of Computer Science(计算机科学系) St. Michael’s College(圣米歇尔学院) Communication Media and Marginalization Lab(传播媒体与边缘化实验室) Northeastern University(东北大学) Department of Mathematics & Statistics(数学与统计学系)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 研究探讨大语言模型中令牌化对认知的影响,指出分布假说足以实现人类样语言性能,并提出改进令牌化技术以减少偏见和提升语义理解。

Comments Accepted at IC2S2 2026 and SLSA @ 4S 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19992 2026-07-23 cs.CL cs.AI cs.DL cs.HC 新提交 88%

TINY_SCHILLER: A Drop-In German Drama Corpus for Small Language Models

TINY_SCHILLER:用于小语言模型的即插即用德语戏剧语料库

Mark Schutera

机构 * Duale Hochschule Baden-Württemberg Ravensburg(巴登-符腾堡双元制应用技术大学 Ravensburg)

专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对德语文学文本在小语言模型相关应用的空白,提出Tiny_schiller语料库,经特定处理,可通过单文件和一行代码让小语言模型接触德语文学文本,填补了相关研究和应用的空白。

Comments 5 pages. Dataset: https://huggingface.co/datasets/mrkschtr/tiny_schiller ; Code: https://github.com/schutera/tiny_schiller

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16900 2026-07-23 cs.AI 版本更新 86%

Environment-free Synthetic Data Generation for API-Calling Agents

用于 API 调用智能体的无环境合成数据生成

Seanie Lee, Sanjoy Chowdhury, Chao Jiang, Cheng-Yu Hsieh, Ting-Yao Hu, Alexander T Toshev, Oncel Tuzel, Raviteja Vemulapalli

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对训练 API 调用 LLM 智能体数据收集瓶颈问题,提出无环境合成数据生成方法,利用 LLMs 生成任务、响应等,经评判器过滤轨迹,在相关基准上评估,结果表明此方法可有效训练智能体,是实用可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20346 2026-07-23 cs.CE physics.flu-dyn 新提交 86%

IteraSim RAG: A Multi-Stage Retrieval-Augmented Agentic Back-End for OpenFOAM-Based Computational Fluid Dynamics

IteraSim RAG:基于OpenFOAM的计算流体动力学的多阶段检索增强智能后端

Pratyush Kumar

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对OpenFOAM配置CFD案例的难题,提出IteraSim RAG。通过LLM扩展查询、多种融合与重排策略及多智能体分工协作,结合规范知识层。在28个案例基准测试中表现良好,能完成配置、诊断修复问题,还公布相关内容以保障可重复性。

Comments 40 pages, 7 figures, 5 tables. Submitted to Computer Physics Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00462 2026-07-23 cs.CV cs.AI 版本更新 81%

LatentLens: Revealing Highly Interpretable Visual Tokens in LLMs

LatentLens: 揭示大语言模型中高度可解释的视觉标记

Benno Krojer, Shravan Nayak, Oscar Mañas, Vaibhav Adlakha, Desmond Elliott, Siva Reddy, Marius Mosbach

机构 * University of Cambridge(剑桥大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出 LatentLens 方法,通过将视觉标记与文本语料库中的上下文标记表示进行最近邻匹配,实现视觉标记的可解释性,发现大多数视觉标记在各层均具有可解释性。

Comments ICML 2026 (Camera Ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19524 2026-07-23 cs.LG cs.AI cs.DC 新提交 81%

SynPre-FL: Synthetic data-driven pretraining integrated Federated Learning training framework

SynPre-FL:合成数据驱动的预训练集成联邦学习训练框架

Akarsh K Nair, Muhammad Arifur Rahman, Nicholas Shopland, Andy Burton, Jun He, Yuan Shen, David Baldwin, Emma O'Dowd, Amna Burzic, Mufti Mahmud, David J. Brown

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对联邦学习在临床风险预测中面临的问题及局限,提出SynPre-FL框架,结合合成EHR生成与合成预训练联邦学习,通过潜在自动编码器扩散模型等技术,提升非IID条件下预测的稳健性、可扩展性与可解释性。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20251 2026-07-23 cs.CL 新提交 79%

Exposure is Optional: Learning Unlike Coordination in Language Models

曝光非必需:语言模型中学习不同类别的并列结构

Jiamu Luo, Shane Steinert-Threlkeld

机构 * University of Washington(华盛顿大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 研究语言模型中不同类并列结构习得是否需直接曝光,用过滤语料库训练GPT-2模型,发现无需直接曝光,模型能泛化处理,还揭示了模型处理方式及可从同类并列结构学习,助力理解语言模型结构表示。

Comments 13 pages, 6 tables, 2 figures, to submit to TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20310 2026-07-23 q-bio.NC 新提交 75%

Capturing Inner Experience At Scale: An AI Interviewer Co-Developed with the Founder of a Landmark Phenomenological Method

大规模捕捉内心体验:与一种具有里程碑意义的现象学方法的创始人共同开发的人工智能访谈者

Jona Carmon, Clara Bersch, Charles Fernyhough, Russell T. Hurlburt, Simone Kühn

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究聚焦于主观体验研究中深度与规模的权衡问题,核心方法是将描述性经验抽样法转化为人工智能访谈者的推理架构,主要贡献是开发出首个基于既定方法研究内心体验的人工智能访谈者及相关平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19771 2026-07-23 cs.LG cs.AI 新提交 73%

An Isotropy-Preserving Spectral Cap for Muon: Theory and Three Case Studies

用于μ子的各向同性保持谱帽:理论与三个案例研究

Jiachun Li

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究μ子和相关矩阵符号优化器对权重矩阵的影响,提出基于尺度不变性假设的统一框架及轻量级“谱帽”,通过三个案例研究表明谱帽可增加各向同性并防止失败,验证损失基本不变,结果为初步的。

Comments Preliminary Report; Larger scale experiments ongoing; Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27396 2026-07-23 cs.SE cs.LG 版本更新 70%

Test-Input Generation for Tensor Programs: What Actually Finds Kernel Bugs

张量程序测试输入生成:什么真正发现内核错误

Dipankar Sarkar

机构 * Arizona State University(亚利桑那州立大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 通过GPU模拟器模糊测试,比较七种测试生成策略在26个操作上的效果,发现边界形状采样在错误召回率(78%)和假阳性率(0%)上表现最佳。

Comments 8 pages, 1 figure, LNCS format. Companion paper: arXiv:2606.20128

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10216 2026-07-23 cs.CL 版本更新 70%

The Impact of Editorial Intervention on Detecting Native Language Traces

编辑干预对检测母语痕迹的影响

Ahmet Yavuz Uluslu, Mark Gales, Kate Knill, Gerold Schneider

机构 * University of Cambridge(剑桥大学) University of Zurich(苏黎世大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了编辑干预对母语识别鲁棒性的影响,发现深层母语特征在轻微编辑中仍能保持,而流畅性编辑和改写会显著降低识别性能。

Comments KONVENS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19718 2026-07-23 cs.CL 新提交 57%

Lightweight Person-Place Relation Extraction from Historical Newspapers with Dependency Graphs and Proximity Features

利用依存图和邻近特征从历史报纸中进行轻量级人物-地点关系提取

Mlen-Too Wesley

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 研究从历史报纸中提取人物-地点关系,构建文档级图,提取实体对特征,用小型模型分类。在官方评估中取得一定成绩,发现最小字符距离重要,且文档分组交叉验证对避免数据泄漏、保证结果可靠至关重要。

Comments 19 pages, 4 figures. Accepted at CLEF 2026 HIPE Shared Task. To appear in CEUR Workshop Proceedings (CEUR-WS.org)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02402 2026-07-23 cs.CV 版本更新 50%

Show Me Examples: Inferring Visual Concepts from Image Sets

展示示例:从图像集合中推断视觉概念

Nick Stracke, Kolja Bauer, Stefan Andreas Baumann, Miguel Angel Bautista, Josh Susskind, Björn Ommer

机构 * Munich Center for Machine Learning(慕尼黑机器学习中心) Apple(苹果公司)

专题命中 预训练与数据 :language model(abstract)

AI总结 提出VICIS任务评估视觉语言模型从图像集合中推断共享概念的能力,并设计训练框架与架构,使模型能提取概念嵌入并生成与查询一致的新图像。

Comments for code, view https://github.com/CompVis/set-learner

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 22 篇

2606.28445 2026-07-23 cs.SD cs.AI cs.CL cs.LG 版本更新 92%

LoRA-Tuned Large Language Models for Dementia Detection via Multi-View Speech-Derived Features

基于多视角语音特征的LoRA微调大语言模型用于痴呆检测

Jonghyeon Park, Olivier Jiyoun Jung, Myungwoo Oh

机构 * NAVER Cloud(NAVER云) Division of Communication and Media, Ewha Womans University(通信与媒体系,成均馆大学)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LoRA微调LLM,通过统一提示整合ASR转录、话语主题、时间流畅度和音韵序列四种语音特征,实现多视角推理,在ADReSSo上F1达90.14%。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19523 2026-07-23 cs.CL 新提交 91%

When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play

当推理缩小行动范围:大语言模型游戏中的多样性崩溃

Junyi Sha, Renfei Tan, David Simchi-Levi

机构 * Institute for Data, Systems, and Society(数据、系统与社会研究所)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型游戏中监督微调对行为多样性的影响,发现推理模式生成常抑制行动多样性,标准SFT会致过早多样性崩溃,行动增强可部分缓解,指出窄支持模仿是策略崩溃源,SFT中保持行动支持对维持探索行为很重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19604 2026-07-23 cs.CL cs.LG 新提交 88%

Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models

基于超网络的大语言模型知识注入的缩放定律

Nischay Dhankhar, Dos Baha, Abulhair Saparov

机构 * Nace AI(Nace人工智能公司) Purdue University(普渡大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型训练时知识注入问题,核心方法是用超网络生成LoRA适配器,主要贡献是发现超网络注入能力随规模变化规律,能可靠进行分布外泛化,为训练时适应提供新基础及缩放定律。

Comments Preprint, 22 pages, 14 figures. Dataset collection available at https://huggingface.co/collections/nace-ai/hypernetwork-datasets

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19608 2026-07-23 cs.CL 新提交 88%

Task Competence Is Not Instruction Following: Evaluating Instruction-Conflicting Behavior in Small Language Models

任务能力并非遵循指令:评估小语言模型中的指令冲突行为

Mahdiyeh Farajidizaji, Vatsal Raina

机构 * Khajeh Nasir Toosi University of Technology(哈杰·纳西尔·图西理工大学) Apta AI, Spark AI Research(阿普塔人工智能公司,星火人工智能研究院)

专题命中 指令微调 :language model(title,abstract);small language model(title);instruction tuning(abstract);分类 cs.CL

AI总结 研究小语言模型在指令冲突时的行为,通过跨任务设计,用标准准确率等指标评估指令微调的Qwen模型,发现任务能力提升不自动带来可靠行为控制,任务能力与指令遵循是不同能力,仅报标准准确率会掩盖问题。

Comments 12 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18232 2026-07-23 cs.CL 版本更新 87%

It's Not What You Say, It's How You Say It: Evaluating LLM Responses to Expressions of Belief

重要的不是你说了什么,而是你怎么说:评估大语言模型对信念表达的回应

Kevin Du, Clara Kümpel, Michelle Wastl, Alex Warstadt

机构 * ETH Zürich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) UC San Diego(加州大学圣地亚哥分校)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究用户信念表达形式对大语言模型的影响,引入基于语言维度的类型学,生成可控查询对,评估不同架构、规模和训练阶段的16个LLMs,发现响应行为差异及能显著说服模型的特定信念表达,揭示语言框架对模型情境整合的影响。

Comments Published at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19674 2026-07-23 cs.CR cs.AI cs.LG 新提交 86%

FedLSG: LLM-Enhanced Semantic Calibration for Federated Graph Backdoor Defense

FedLSG:用于联邦图后门防御的大语言模型增强语义校准

Chenyu Zhou, Yabin Peng, Wei Huang, Kunlin Li, Shuaishuai Zhang, Xinyuan Miao

机构 * Southeast University(东南大学) Purple Mountain Laboratories(紫金山实验室) Institute of AI for Industries(人工智能产业研究院) Chinese Academy of Sciences(中国科学院)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对联邦图神经网络易受后门攻击问题,提出FedLSG框架,将大语言模型集成防御,通过图与行为到文本的转换及轻量级师生架构,在不损图完整性时显著提升对后门攻击的抵抗力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19408 2026-07-23 cs.LG 新提交 83%

Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning

语言模型微调中基于奖励感知的进化策略种群规模缩放

Sung Cho, Gyubin Han

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究在大语言模型微调中,进化策略种群规模缩放与奖励设计及归一化的关系。通过实验发现交叉熵与二元奖励微调种群规模结论差异大,主要因奖励设计和归一化,禁用归一化可改进小种群模型表现,揭示小种群失败可能是实现问题而非内在限制。

Comments 15 pages, 2 figures. Accepted at the 4th HiLD (High-dimensional Learning Dynamics) Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06487 2026-07-23 cs.LG cs.AI 版本更新 82%

ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking

ArenaRL: 通过基于比赛的相对排名扩展强化学习以应对开放性智能体

Qiang Zhang, Boli Chen, Fanrui Zhang, Ruixue Ding, Shihang Wang, Qiuchen Wang, Yinfeng Huang, Haonan Zhang, Rongxiang Zhu, Pengyong Wang, Ailin Ren, Xin Li, Pengjun Xie, Jiawei Liu, Ning Guo, Jingren Zhou, Zheng-Jun Zha

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 ArenaRL通过基于比赛的相对排名机制,提升开放性智能体在复杂任务中的表现,实现效率与精度的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20301 2026-07-23 cs.LG cs.CL 新提交 79%

The Blessing of Dimensionality: How Near-Orthogonality in High-Dimensional Spaces Explains Temporal Portability

维度的祝福:高维空间中的近正交性如何解释时间可移植性

Abigail Woodring, Adrian Chan, Rana Muhammad Shahroz Khan, Sukwon Yun, Chau-Wai Wong, Tianlong Chen

机构 * NC State University(北卡罗来纳州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨PortLLM在持续预训练中LoRA补丁的长期时间可移植性及有效性。通过对Mistral、Gemma和Qwen基础模型进行实证研究,并提供理论分析,发现其可移植性持久,高维向量近正交性是关键,还展示了损失景观几何视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20270 2026-07-23 cs.CL 新提交 77%

Which Values Do LLMs Confuse? A Schwartz-Based Recognition Study

大语言模型混淆了哪些价值观?基于施瓦茨的识别研究

Andrei Chetvergov, Stepan Ukolov, Timofei Sivoraksha, Alexander Evseev, Mikhail Solovev, Valeriia Kuschenko, Maria Chistyakova, Sergey Bolovtsov

机构 * Ivannikov Institute for System Programming of the Russian Academy of Sciences(俄罗斯科学院伊万尼科夫系统编程研究所) Russian Presidential Academy of National Economy and Public Administration(俄罗斯总统国民经济与公共管理学院)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究大语言模型对施瓦茨十个基本价值观的识别,通过俄语情境文本评估 21 个指令微调的模型运行,分析准确率、混淆情况等,推动结合精确准确率、排序恢复和有向错误分析的价值识别评估。

Comments 14 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09767 2026-07-23 cs.SD cs.CL eess.AS 版本更新 77%

UtterTune: LoRA-Based Target-Language Pronunciation Edit and Control in Multilingual Text-to-Speech

UtterTune:基于LoRA的多语言文本到语音中目标语言发音编辑与控制

Shuhei Kato

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究提出UtterTune轻量级方法,用于适配多语言TTS系统。利用低秩适应,在零样本设置下对目标语言日语实现音素级发音控制,保持自然度和说话者相似度,经评估证实该方法有效。

Comments 7 pages. Corrects the accent-correctness evaluation to the crowdsourced listening test (v3 inadvertently reported the earlier author-scored results), and adds a note on the precedence of the proposed token-based pronunciation-control method relative to a subsequent technical report, together with links to the released code, training/evaluation data, LoRA weights, and audio samples

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19399 2026-07-23 cs.LG cs.AI cs.CV 新提交 73%

Leveraging Offline Supervision for Efficient and Generalizable Reinforcement Learning in Large-Scale Vision-Language-Action Models

在大规模视觉-语言-动作模型中利用离线监督实现高效且通用的强化学习

Dmitriy Poyarkov, Aleksei Staroverov, Aleksandr I. Panov

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究在大规模视觉-语言-动作模型中,通过将离线监督纳入强化学习,结合离线与在线训练优点,提升训练效率。经实验验证,该混合方法在保持强大分布外能力的同时,所需训练预算减半,实现效率与性能双赢。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20785 2026-07-23 cs.AI cs.LG 版本更新 73%

Fara-1.5: Scalable Learning Environments for Computer Use Agents

Fara-1.5:面向计算机使用智能体的可扩展学习环境

Ahmed Awadallah, Sahil Gupta, Yash Lara, Yadong Lu, Hussein Mozannar, Akshay Nambi, Zach Nussbaum, Yash Pandya, Aravind Rajeswaran, Corby Rosset, Alexey Taymanov, Luiz do Valle, Vibhav Vineet, Spencer Whitehead, Andrew Zhao

机构 * Microsoft(微软)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出FaraGen1.5数据流水线,结合真实网站与合成环境生成训练数据,通过三个互补验证器评分,训练出Fara1.5系列模型,在浏览器使用基准上达到新最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05518 2026-07-23 cs.CR cs.AI 版本更新 70%

Matching Ranks Over Probability Yields Truly Deep Safety Alignment

概率匹配排名实现真正深度的安全对齐

Jason Vega, Gagandeep Singh

机构 * Siebel School of Computing and Data Science(塞比尔计算与数据科学学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究开源大语言模型安全问题,针对预填充攻击及相关防御,提出排名辅助预填充(RAP)攻击,又通过匹配令牌排名提出PRESTO方法,提升了模型在RAP攻击下的安全性,为安全开源模型发展助力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20389 2026-07-23 cs.CV 新提交 67%

PercepCap: Video Captioner with Structured Spatio-Temporal Perception

PercepCap:具有结构化时空感知的视频字幕生成器

Yifan Xu, Zihao Wang, Zhixiao Wang, Jiaming Zhang, Yichun Yang, Desen Meng, Yuanxing Zhang, Pengfei Wan, Limin Wang

机构 * Nanjing Univerisity(南京大学) Kuaishou Technology(快手科技) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 研究视频字幕生成问题,提出PercepCap框架,遵循感知-描述生成链,设计两阶段训练策略及相关数据构建方法,在评估中优于基线,提升视频字幕生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19354 2026-07-23 cs.AI 新提交 57%

FormulaSPIN: Self-Play Fine-Tuning for Natural Language to Spreadsheet Formula Generation

FormulaSPIN:用于自然语言到电子表格公式生成的自博弈微调

Cy Xie

专题命中 指令微调 :SFT(abstract);分类 cs.AI

AI总结 研究自然语言到电子表格公式生成问题,提出FORMULASPIN自博弈框架,利用公式生成优势及双人博弈实现迭代自我改进,引入ExecVote提高准确性,实验证明其性能达最优,凸显自博弈解决稀缺数据任务的潜力。

Comments 15 pages,7 figures, 14 tables. Accepted to ACL 2026 Main Conference Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02533 2026-07-23 cs.RO cs.LG 57%

HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models

HMVLA:超几何多模态融合用于视觉-语言-动作模型

Kun Wang, Xiao Feng, Mingcheng Qu, Tonghua Su

机构 * Harbin Institute of Technology(哈尔滨工业大学) Chongqing Research Institute of HIT(重庆HIT研究 institute) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 HMVLA通过在双曲空间中融合视觉、语言和动作信息,提升多模态语义对齐的效率和准确性。

Comments 5 pages,5 figures,ICASSP

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏