arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-22 至 2026-07-22 共收录 251 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 20 篇

2607.18266 2026-07-22 cs.AI 新提交 88%

Structured Synthetic Reasoning Data for Arithmetic Fine-Tuning of Small Language Models

用于小型语言模型算术微调的结构化合成推理数据

Jake O'Grady, Effirul Ramlan

机构 * University of Galway(戈尔韦大学) School of Computer Science(计算机科学学院)

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);分类 cs.AI

AI总结 研究小型语言模型多步算术推理困难问题,通过生成结构化合成推理数据并结合LoRA在消费硬件上微调Qwen3模型,提高了模型在GSM8K等基准测试上的准确率和迁移效果,证明低成本合成数据设计可改善小型语言模型算术适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18293 2026-07-22 cs.LG cs.CL 新提交 82%

One Student, Many Teachers: Multi-Task On-Policy Distillation via Soft-Prompt Privileged Context

一个学生,多个教师:通过软提示特权上下文进行多任务在线策略蒸馏

Yingzi Ma, Zichen Zhu, Ming Jiang, Chaowei Xiao

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学) Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究提出一种多任务在线策略蒸馏方法,教师与学生仅通过可学习软提示区分,在骨干冻结时训练特定任务教师。单任务变体训练参数少且效果好,多任务变体保持通用能力基准同时实现最佳总体平均水平。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06409 2026-07-22 cs.CR 版本更新 82%

VENOMREC: Cross-Modal Interactive Poisoning for Targeted Promotion in Multimodal LLM Recommender Systems

VENOMREC: 多模态交互性污染用于多模态大语言模型推荐系统中的定向推广

Guowei Guan, Yurong Hao, Jiaming Zhang, Tiantong Wu, Fuyao Zhang, Tianxiang Chen, Longtao Huang, Cyril Leung, Wei Yang Bryan Lim

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract)

AI总结 VENOMREC通过跨模态交互性污染技术,在多模态大语言模型推荐系统中实现定向推广,有效提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06471 2026-07-22 cs.CL cs.AI cs.LG 版本更新 80%

PRISP: Privacy-Safe Few-Shot Personalization via Lightweight Adaptation

PRISP:通过轻量级适配实现隐私安全的少样本个性化

Junho Park, Dohoon Kim, Taesup Moon

机构 * Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) ASRI/INMC/IPAI/AIIS, Seoul National University(ASRI/INMC/IPAI/AIIS,首尔国立大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型个性化中数据、资源和隐私问题,提出PRISP框架,利用文本到LoRA超网络生成参数,结合少样本用户数据优化,减少计算开销并消除隐私风险,相比先前方法性能更强。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18958 2026-07-22 cs.CV cs.AI 新提交 79%

Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model

用于增强大型视觉语言模型鲁棒性的对偶对抗微调

Sibo Wang, Jie Zhang, Shiguang Shan, Xilin Chen, Wen Gao

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 针对大型视觉语言模型视觉输入易受攻击且现有防御方法缺乏通用性的问题,提出对偶对抗微调框架,通过联合优化视觉和语义监督信号增强模型鲁棒性,实验证明该方法在多任务对抗鲁棒性评估中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18283 2026-07-22 cs.LG cs.AI cs.CV 新提交 76%

FedCC: A Low-Resource Federated Adaptation of Foundation Models for Robust Corpus Callosum localization in Fetal Ultrasound Images

FedCC:用于胎儿超声图像中胼胝体稳健定位的基础模型低资源联邦适应

Alessandro Di Matteo, Sara Moccia, Giuseppe Rizzo, Gianpaolo Grisolia, Ricciarda Raffaelli, Lorenzo Vasciaveo, Francesco D'Antonio, Maria Chiara Fiorentino

机构 * unich(那不勒斯费德里克二世大学)

专题命中 指令微调 :foundation model(title);分类 cs.AI、cs.LG

AI总结 针对胎儿超声图像中胼胝体定位难题,提出FedCC框架,集成冻结的DINOv2主干与轻量级YOLO检测头,并引入LoRA模块。在多中心数据集上评估,该框架性能出色,减少了可训练参数与通信成本,迈向可临床部署的胎儿神经超声AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18718 2026-07-22 eess.AS 新提交 75%

Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering

DCASE 2026任务5总结:音频相关问答

Haolin He, Renhe Sun, Zheqi Dai, Xingjian Du, Chunyat Wu, Zining Liang, Zhengxi Liu, Jiahe Lei, Runbang Wang, Jiayi Zhou, Mingru Yang, Xiquan Li, Yun Chen, Xie Chen, Zhiyao Duan, Weiqiang Wang, Mark D. Plumbley, Jian Liu, Qiuqiang Kong

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 DCASE 2026任务5聚焦音频相关问答,用音频依赖过滤管道构建评估集。比赛分两轨道,众多团队参与。成均馆大学团队取得较好成绩,还分析了常见构建模块、测试方法及各系统普遍遗漏的项目。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05493 2026-07-22 cs.CL cs.AI cs.MA 版本更新 73%

LinguistAgent Technical Report: A Reflective Multi-Model Platform for Automated Linguistic Annotation

LinguistAgent: 一个用于自动化语言标注的反思多模型平台

Bingru Li

机构 * University of Birmingham(伯明翰大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LinguistAgent通过反思多模型架构实现自动化语言标注,采用双代理工作流程模拟同行评审,支持多种标注范式并提供实时评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18271 2026-07-22 cs.AI 新提交 70%

Using LLMs for Explainable, Data-Driven Insight Generation from Time Series

使用大语言模型从时间序列中生成可解释的、数据驱动的见解

Ria Mundhra, Gustavo Sato dos Santos, Michael Benedikt

机构 * University of Oxford(牛津大学) Vortexa

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对时间序列预测中解释生成难且易幻觉的问题,提出领域无关框架,含提取解释因素、基于证据生成解释及可扩展评估三组件,经案例研究验证,该框架能大规模实现有根据的解释生成,无需特定领域微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19737 2026-07-22 cs.CL 版本更新 70%

XCOMPS: A Multilingual Benchmark of Conceptual Minimal Pairs

XCOMPS:概念最小对的多语言基准测试

Linyang He, Ercong Nie, Sukru Samet Dindar, Arsalan Firoozi, Adrian Florea, Van Nguyen, Corentin Puffay, Riki Shimizu, Haotian Ye, Jonathan Brennan, Helmut Schmid, Hinrich Schütze, Nima Mesgarani

机构 * Columbia University(哥伦比亚大学) Munich Center for Machine Learning(慕尼黑机器学习中心) LMU Munich(慕尼黑大学) University of Michigan(密歇根大学) KU Leuven(根特大学)

专题命中 指令微调 :instruction tuning(abstract);prompting(abstract);分类 cs.CL

AI总结 介绍多语言概念最小对数据集XCOMPS,通过多种方式评估LLMs多语言概念理解,比较不同模型发现LLMs对低资源语言概念理解弱,指令微调与知识蒸馏有不同效果,形态复杂语言理解分数低。

Comments Accepted at SIGTYP 2025: https://aclanthology.org/2025.sigtyp-1.9/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18570 2026-07-22 cs.CL cs.AI 新提交 62%

For What Reason? Interpreting Models' Encoding of Causation and Antithesis

出于什么原因?解释模型对因果关系和对立关系的编码

Abhidip Bhattacharyya, Shira Wein

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of South Florida(南佛罗里达大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究指令微调的Transformer模型对英语话语关系的编码,聚焦因果和对立关系。通过下一个token预测任务及可解释性技术,发现早期层在序列中间做预测,中层接近末尾确定决策,部分层有答案偏好,揭示话语推理的不对称表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00429 2026-07-22 cs.CL cs.LG cs.MA 版本更新 62%

Node-as-Agent: Graph Agentic Network

节点即智能体:图智能体网络

Minghao Guo, Xi Zhu, Qingyue Jiao, Xiujin Liu, Haochen Xue, Chong Zhang, Shuhang Lin, Jingyuan Huang, Ziyi Ye, Yongfeng Zhang

机构 * Rutgers University(罗格斯大学) University of Liverpool(利物浦大学) Fudan University(复旦大学)

专题命中 指令微调 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 研究针对图神经网络不能处理节点信息不平衡及忽略全局语义关系的局限,提出检索增强图智能体网络ReaGAN,赋予节点自主决策能力,通过智能体规划和局部 - 全局检索实现自适应消息传播,在少样本设置下性能优异。

Comments 11 pages, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19339 2026-07-22 cs.CV 新提交 50%

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

OmniReasoner:通过原生工具使用进行长音频-视频推理

Yu Chen, Caorui Li, Ziyu Xiong, Yidong Wang, Mingqi Gao, Shuman Liu, Biao Liu, Chunfeng Yang, Anxiang Zeng, Haibo Zhang, Chaofan Chen

专题命中 指令微调 :post-training(abstract)

AI总结 针对长音频-视频推理难题,OmniReasoner提出工具使用后训练框架,通过监督微调与强化学习让全模态语言模型学会调用放大工具,利用TimeAnchor保持时间参数一致性,借助时间增强数据引擎实现可训练,提升了答案准确性与时间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 11 篇

2606.08076 2026-07-22 cs.CL cs.AI cs.CY 版本更新 92%

"I understand your perspective": LLM Persuasion through the Lens of Communicative Action Theory

“我理解你的观点”:通过交往行动理论视角看LLM的说服与谄媚

Esra Dönmez, Agnieszka Falenska

机构 * Institute for Natural Language Processing, University of Stuttgart(斯图加特大学自然语言处理研究所) Interchange Forum for Reflecting on Intelligent Systems, University of Stuttgart(斯图加特大学智能系统反思交流论坛)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究基于哈贝马斯的交往行动理论,通过模拟Reddit讨论,发现LLM能有效传达言外之意(如建立信任),其谄媚策略与观点改变强相关,且人类更偏好LLM生成的论证。

Journal ref Findings of the Association for Computational Linguistics: ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16410 2026-07-22 cs.CL cs.AI 版本更新 91%

PlotTwist: A Creative Plot Generation Framework with Small Language Models

PlotTwist: 一种利用小语言模型的创意情节生成框架

Abhinav Thorat, Ravi Kolla, Jyotin Goel, Madhav Kataria, Niranjan Pedanekar

机构 * Sony Research India(索尼印度研究院)

专题命中 后训练与偏好优化 :language model(title,abstract);small language model(title,abstract);large language model(abstract);preference optimization(abstract)

AI总结 PlotTwist通过结构化框架使小语言模型生成高质量前提条件情节,优于大型模型,且在多个叙事质量维度上表现优异。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18258 2026-07-22 cs.AI 新提交 90%

S2T-RLHF: Hierarchical Credit Assignment for Stable Preference-Based RLHF

S2T-RLHF:基于稳定偏好的强化学习从人类反馈中的分层信用分配

Wei Chen, Guanghui Zhu, Yafei Li, Limin Wang, Yihua Huang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Computer Science and Artificial Intelligence, Zhengzhou University(郑州大学计算机科学与人工智能学院)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);分类 cs.AI

AI总结 研究基于偏好奖励模型的RLHF训练不稳定问题,提出分层信用分配的粒度感知原则,引入S2T-RLHF框架,先在句子间分配奖励,再在句内细化,无需重新训练模型,实验证明该方法提高了训练稳定性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18304 2026-07-22 cs.LG 新提交 85%

TD-DPO: Difference-Aware Preference Optimization for Mitigating Sycophancy in Clinical Autism Intervention Dialogue

TD-DPO:用于减轻临床自闭症干预对话中谄媚行为的差异感知偏好优化

Shuzhong Lai, Junhong Lai, Chenxi Li, Qing Zhou, Haifeng Li, Gang Pan, Lin Yao, Yueming Wang

机构 * Nanhu Brain-Computer Interface Institute(南湖脑机接口研究所) MOE Frontiers Science Center for Brain and Brain-Machine Integration, Zhejiang University(浙江大学脑与脑机融合教育部前沿科学中心) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Children’s Hospital Zhejiang University School of Medicine(浙江大学医学院附属儿童医院) State Key Laboratory of Brain-Machine Intelligence(脑机智能技术国家重点实验室) Department of Neurobiology, Affiliated Mental Health Center and Hangzhou Seventh People’s Hospital, Zhejiang University School of Medicine(浙江大学医学院附属精神卫生中心和杭州市第七人民医院神经生物学系)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对大语言模型在自闭症干预对话中的谄媚问题,提出最小编辑数据增强策略及令牌级差异直接偏好优化方法,通过加权差异令牌、降权共享令牌抑制背景漂移,经实验验证该方法能在减轻谄媚与保留干预能力间达较好平衡。

Comments commited to EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18476 2026-07-22 cs.CL cs.AI cs.LG 新提交 85%

Structured Output Collapses Answer Diversity Across 44 Language Models

结构化输出会削弱44种语言模型的答案多样性

Tapan Parikh

机构 * Cornell Tech(康奈尔理工学院)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究语言模型在特定格式要求下答案多样性变化,通过对44个模型进行31个类别提示实验,发现结构化输出使答案收敛、多样性降低,存在寄存器梯度,揭示了模型对不同格式的响应差异及对答案多样性的影响。

Comments 12 pages, 1 figure. Companion to the One-Word Census (arXiv:2607.12796). Code, data, and interactive explorer: https://github.com/tap2k/modelun/tree/main/studies/structured

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19243 2026-07-22 cs.CL cs.AI 新提交 82%

Inference-Time Steering for Cross-Lingual Factual Consistency in LLMs

大语言模型中跨语言事实一致性的推理时引导

Alexander Manev

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);prompting(abstract)

AI总结 研究大语言模型跨语言事实不一致问题,评估零样本上下文引导、CAA、DPO四种干预策略,通过实验发现角色提示是最强干预方式,CAA对配置敏感,DPO适配器收益窄且可转移性低,表明跨语言不一致部分是选择问题,简单干预可能更优。

Comments 8 pages (21 in total), 2 figures, 4 tables. Original manuscript for a Guided Research project conducted at the Technical University of Munich, detailing the complete methodology, full data pipeline, and comprehensive experimental results. A related, condensed subset of this work was subsequently adapted and published at the StereACuLT 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19331 2026-07-22 cs.LG cs.AI 新提交 73%

ISO: An RLVR-Native Optimization Stack

ISO:一种原生 RLVR 的优化栈

Hanqing Zhu, Wenyan Cong, Zhizhou Sha, Sagnik Mukherjee, Xinyuan Song, David González-Martínez, Xiaoxia Wu, Yuandong Tian, Shiwei Liu, David Z. Pan, Zhangyang "Atlas" Wang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) UIUC(伊利诺伊大学香槟分校) Emory University(埃默里大学) Together AI(联合人工智能公司) Recursive Superintelligence Inc(递归超级智能公司) ELLIS Institute Tübingen(图宾根埃利斯研究所)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究 RLVR 中缺失的优化层,提出等谱优化(ISO)框架,包括离线的 ISO-Merger 和在线的 ISO-Optimizer。通过光谱继承,在推理和编码任务中,用更少训练步骤提高准确率,为 RLVR 优化层问题提供了具体解决方案。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19313 2026-07-22 cs.LG cs.AI 新提交 73%

Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information

脱离上下文的广义信赖域策略优化算法:利用特权信息学习解决难题

Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi

机构 * Meta AI Columbia University(哥伦比亚大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究利用特权信息解决强化学习难题,提出脱离上下文的广义信赖域策略优化算法(OC - GRPO),通过引导展开和重要性校正目标避免训练不匹配,在标准数学推理基准上比普通GRPO有显著提升且成本低。

Comments 24 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18470 2026-07-22 cs.LG cs.AI 新提交 73%

RRPO: Reference-Relative Policy Optimization with Stratified Conditional Rollouts

RRPO:基于分层条件展开的参考相对策略优化

Yuxin Xiong, Xunyi Jiang, Rohan Surana, Xintong Li, Sheldon Yu, Nikki Lijing Kuang, Ryan A. Rossi, Jingbo Shang, Tong Yu, Julian McAuley, Junda Wu

机构 * University of California San Diego(加利福尼亚大学圣地亚哥分校) Adobe Research(Adobe研究院)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究提出RRPO,通过参考相对对比比较推广GRPO。用分层条件展开构建锚集,训练投影头定义对比优势,在策略优化中评估。不依赖任务真实验证器,在多种设置下有竞争力,优于弱监督基线,监督微调后有额外收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19044 2026-07-22 cs.LG 新提交 70%

Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation

采用具有可验证奖励的强化学习进行分子生成

Mingxuan Ouyang, Hao Lan, Wanyu Lin

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究利用大语言模型进行分子生成时面临的问题,提出LLMol框架,采用监督学习与强化学习结合的两阶段训练范式,引入RLVR及GRPO算法,有效处理多种分子设计任务,实验证明其性能优于现有方法。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17913 2026-07-22 cs.AI 版本更新 57%

Learning, Reasoning, Refinement: A Framework for Kahneman's Dual-System Intelligence in GUI Agents

学习、推理、优化:GUI 智能体中卡尼曼双系统智能的框架

Jinjie Wei, Jiyao Liu, Lihao Liu, Ming Hu, Junzhi Ning, Mingcheng Li, Weijie Yin, Junjun He, Xiao Liang, Chao Feng, Dingkang Yang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑启发式智能科学技术研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Amazon(亚马逊) Shanghai Innovation Institute(上海创新研究院) ByteDance Douyin Content Group(字节跳动抖音内容部)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 针对 GUI 智能体存在依赖试错决策、评估指标简单等问题,提出 CogniGUI 框架,结合全解析器引擎和 GRPO 基础智能体,实现自适应学习,经实验验证其在新基准测试中优于现有方法。

Comments Withdrawn due to ongoing technical improvements. The work requires further refinement and additional experiments to meet our quality standards. A revised version will be submitted in the future

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 11 篇

2510.19299 2026-07-22 cs.AI cs.MA cs.SI 版本更新 90%

Learning to Make Friends: Coaching LLM Agents toward Emergent Social Ties

学习交朋友:引导大语言模型智能体形成新兴社会关系

Philipp J. Schneider, Lin Tian, Marian-Andrei Rizoiu

机构 * EPFL Lausanne, Switzerland(洛桑联邦理工学院) University of Technology Sydney(悉尼技术大学)

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究LLM智能体能否再现人类在线行为社会动态及相关机制。提出多智能体LLM模拟框架,设计行为奖励函数,经实验发现引导后的智能体形成稳定互动与社会关系,为研究LLM群体集体动态建立测试平台。

Comments NeurIPS 2025 Workshop: Scaling Environments for Agents (SEA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03691 2026-07-22 cs.SE cs.AI cs.LG 版本更新 90%

Don't Blame the Large Language Model: How Agent Harness Evolution Shapes Coding Agent Quality

不要责怪大语言模型:脚手架演化如何塑造编码代理质量

Oussama Ben Sghaier, Hao Li, Bram Adams, Ahmed E. Hassan

机构 * Queen’s University Canada(加拿大女王大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究编码代理中脚手架演化对其质量的影响。通过固定模型、仅改变脚手架,对Qwen Code CLI的35个连续版本进行评估,追踪质量波动与开发模式及架构组件的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18727 2026-07-22 cs.PL cs.AR 新提交 86%

Formal Verification of an Out-of-Order Multiprocessor against an In-Order Weak-Memory ISA

针对顺序弱内存ISA的乱序多处理器形式验证

Janggun Lee, Jeehoon Kang

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对顺序弱内存ISA的乱序多处理器验证问题,核心方法是设计核心规范并分两步证明,主要贡献是首次实现此类形式验证,借助核心规范简化证明,且利用LLM代理自动编写证明。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18241 2026-07-22 cs.AI 新提交 85%

BatchDAG: LLM-Planned Execution Graphs for Scalable Ad-Hoc Analysis Over Enterprise Data

BatchDAG:用于企业数据上可扩展即席分析的大语言模型规划执行图

Anupreet Walia

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对企业数据跨实体分析问题,提出BatchDAG系统,大语言模型生成操作DAG,经确定性引擎评估。通过实体感知批处理优化,减少大语言模型调用。实验显示其质量高、溯源性好,能高效处理查询,是通用编排层替代手工工作流程。

Comments 9 pages, 2 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17545 2026-07-22 cs.AI 版本更新 85%

Retain or Consolidate? Budget-Dependent Operator Selection for Language Agent Memory

保留还是合并?语言智能体记忆中依赖预算的算子选择

Qingcan Kang, Mingyang Liu, Shixiong Kai, Kaichao Liang, Zhentao Tang, Yuqi Cui, Tao Zhong, Mingxuan Yuan

专题命中 长上下文与记忆 :language agent(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究语言智能体记忆中预算依赖的算子选择问题,核心方法是将算子效用分解,用离线抽象安全机制实现,主要贡献是通过实验揭示在不同预算下保留和合并策略的适用情况及算子效果差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19257 2026-07-22 cs.CL cs.AI 新提交 85%

Prompt Design at Scale: How Format, Instruction Count, and Context Length Shape Instruction Adherence and Hallucination in Large Language Models

大规模提示设计:格式、指令数量和上下文长度如何影响大语言模型中的指令遵循和幻觉

Netanel Eliav

机构 * Machine Human Intelligence Lab (MHIL)(机器人类智能实验室)

专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 研究大语言模型提示设计中格式、指令数量和上下文长度对指令遵循及幻觉的影响,通过在合成语料库上的两个控制实验评估五个模型,揭示了不同因素下的表现及规律,还发布了相关工具和结果。

Comments 21 pages, 6 figures. Code and data: https://github.com/iNetanel/veyrabench

详情

展开后加载摘要…

URL PDF HTML 收藏