arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-26 至 2026-06-26 共收录 270 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 67 篇

2507.03122 2026-06-26 cs.IR cs.CL cs.LG 73%

Federated Learning for ICD Classification with Lightweight Models and Pretrained Embeddings

基于轻量模型和预训练嵌入的ICD分类联邦学习

Binbin Xu, Gérard Dray

机构 * EuroMov Digital Health in Motion, Univ. Montpellier, IMT Mines Ales(EuroMov数字健康运动、蒙彼利埃大学、IMT Mines Ales)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了使用MIMIC-IV数据集中的临床笔记进行多标签ICD代码分类的联邦学习可行性与性能,提出了一种结合冻结文本嵌入和简单多层感知机分类器的轻量级可扩展流程,展示了在分布式医疗环境中隐私保护和部署高效的替代方案。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06890 2026-06-26 cs.LG cs.AI q-bio.QM 73%

LLMs for Drug-Drug Interaction Prediction: A Comprehensive Comparison

基于大语言模型的药物-药物相互作用预测:全面比较

Gabriele De Vito, Filomena Ferrucci, Athanasios Angelakis

机构 * Software Engineering (SeSa) Lab(软件工程(SeSa)实验室) University of Salerno(萨勒诺大学) Department of Epidemiology and Data Science(流行病学与数据科学系) Amsterdam UMC Locatie AMC(阿姆斯特丹大学医学中心(AMC)) Amsterdam Public Health Research Institute(阿姆斯特丹公共卫生研究院) University of Amsterdam(阿姆斯特丹大学) University of Amsterdam Data Science Center(阿姆斯特丹大学数据科学中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文比较了多种大语言模型在药物-药物相互作用预测中的性能,发现经过微调的模型在预测灵敏度和准确性上优于传统方法,展示了LLMs在捕捉复杂分子相互作用模式方面的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13955 2026-06-26 cs.CL cs.AI cs.CY 73%

Guided Persona-based AI Surveys: Can we replicate personal mobility preferences at scale using LLMs?

引导式基于人设的AI调查:能否利用LLMs在大规模上复制个人移动偏好

Ioannis Tzachristas, Santhanakrishnan Narayanan, Constantinos Antoniou

机构 * Chair of Transportation Systems Engineering, TUM School of Engineering and Design, TUM, Germany(交通系统工程教授、技术大学工程与设计学院、技术大学、德国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨LLMs生成人工调查的潜力,通过'人设'结合现实数据,有效捕捉德国个人移动偏好中的复杂依赖关系,为交通规划提供可扩展、低成本的数据生成方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27334 2026-06-26 cs.AI 新提交 70%

Language-Based Digital Twins for Elderly Cognitive Assistance

基于语言的数字孪生用于老年人认知辅助

Mohammad Mehdi Hosseini, Mohammad H. Mahoor, Hiroko H. Dodge

机构 * Ritchie School of Engineering and Computer Science, University of Denver(丹佛大学里奇工程与计算机科学学院) Department of Neurology, Massachusetts General Hospital, Harvard Medical School(哈佛医学院麻省总医院神经内科)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出基于大语言模型的数字孪生框架,通过风格测量和上下文元数据模拟老年人对话行为,并引入多条件变分自编码器评估保真度和认知一致性,实现非侵入式认知健康监测。

Comments Accepted and published in the Proceedings of the ACM International Conference on PErvasive Technologies Related to Assistive Environments (PETRA 2026). The final published version is available through the ACM Digital Library

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27247 2026-06-26 cs.LG 新提交 70%

RSPC: A Benchmark for Modeling Stress and Psychiatric Conditions in Digitally Mediated Relationships using Psychiatrist Annotations

RSPC:使用精神科医生标注对数字媒介关系中的压力和精神病状况进行建模的基准

Parmitha Vangapandu, Sai Ganesh Mokkapati, Sathwik Narkedimilli, MSVPJ Sathvik, Timothy Liu, Simon See, Johannes C. Eichstaedt

机构 * Indian Institute of Information Technology Dharwad(印度信息技术学院达尔瓦德分校) Keshav Memorial College of Engineering(克沙夫纪念工程学院) National University of Singapore(新加坡国立大学) University of Birmingham(伯明翰大学) NVIDIA, Singapore(英伟达(新加坡)) Stanford University(斯坦福大学) INSEAD(欧洲工商管理学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出RSPC基准,包含精神科医生标注的Reddit帖子,用于多标签障碍分类、关系触发检测和阶段预测,发现模型能力差异及焦虑与关系不确定性的关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27027 2026-06-26 cs.CR cs.AI 新提交 70%

ShareLock: A Stealthy Multi-Tool Threshold Poisoning Attack Against MCP

ShareLock: 针对MCP的隐蔽多工具阈值投毒攻击

Liwei Liu, Tianzhu Han, Zijian Liu, Zishu Dong, Na Ruan

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出ShareLock框架,利用Shamir阈值方案将恶意指令分散到多个工具描述中,实现隐蔽性和容错性,平均攻击成功率超90%。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26857 2026-06-26 cs.AI 新提交 70%

LCAi: Life Cycle Assessment with big data fusion and retrieval-augmented generation-assisted interpretation

LCAi: 基于大数据融合与检索增强生成辅助解释的生命周期评估

Georgios Tsironis, Juan D. Medrano-Garcia, Gonzalo Guillen-Gosalbez

机构 * Institute for Chemical and Bioengineering, Department of Chemistry and Applied Biosciences, ETH Zürich(苏黎世联邦理工学院化学与应用生物科学系化学与生物工程研究所) NCCR Catalysis(瑞士国家研究能力中心催化研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种视角条件检索增强生成框架,通过多视角检索与受控合成,在AI辅助生命周期评估中实现结构化解释,减少幻觉风险并保持跨领域多样性。

Comments 23 pages, 14 figures, 6 tables. Includes Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26836 2026-06-26 cs.AI 新提交 70%

The Capability Frontier: Benchmarks Miss 82% of Model Performance

能力前沿:基准测试遗漏了82%的模型性能

Bradley Fowler, Ryan Smith, Daniel Thi Graviet, William Myers, Joshua Greaves, Narmeen Fatimah Oozeer, Antía García, Philip Quirke, Amirali Abdullah, Fazl Barez, Shriyash Kaustubh Upadhyay

机构 * Martian University of Oxford(牛津大学) ThoughtWorks

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出能力前沿概念,通过帕累托前沿量化多模型多生成下的最佳性能,纠正单模型单次评估偏差,在16个基准上实现82%性能提升和85%成本降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26552 2026-06-26 cs.CV cs.AI 新提交 70%

Perception, Verdict, and Evolution: Hindsight-Driven Self-Refining Forensics Agent for AI-Generated Image Detection

感知、判断与进化:基于事后洞察的自优化取证智能体用于AI生成图像检测

Yangjun Wu, Keyu Yan, Yu Liu, Jingren Zhou, Fei Huang, Rong Zhang, Zhou Zhao, Fei Wu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ForeAgent框架,采用感知-判断架构融合多视图线索,并引入事后洞察驱动的自优化策略,通过采样-反思-进化范式持续提升检测能力,在多个基准上达到最优性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26518 2026-06-26 cs.AI 新提交 70%

NeuraDock Visual Cognitive Load Agent Tutorial: A Quality-Gated Open-Source EEG Workflow for Alpha Dynamics and Real-Time Applications

NeuraDock 视觉认知负荷代理教程:面向 Alpha 动态与实时应用的质量门控开源 EEG 工作流

Zhiyuan Xu, Yueqing Dai, Junling Li, Junwen Luo

机构 * Shanghai Pulse Element Intelligent Technology Co., Ltd. (NeuraDock)(上海脉元智能科技有限公司(NeuraDock))

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出 NeuraDock Agent 开源 EEG 代理,通过质量门控工作流实现 Alpha 动态分析和视觉认知负荷实时应用,弥合离线与在线分析差距。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12716 2026-06-26 cs.CL 新提交 70%

Does AI Reviewer See the Full Picture? Attacking and Defending Multimodal Peer Review

AI审稿人是否看到全貌?攻击与防御多模态同行评审

Xinyu Zhao, Rana Muhammad Shahroz Khan, Zhen Xu, Zhen Tan, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对AI同行评审易受多模态对抗攻击的问题,提出PaperGuard基准,包含多领域数据集、统一攻击套件和基于分块嵌入搜索的实用防御方法。

Comments Accepted to ICML 2026, Project Page: https://paper-guard.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27376 2026-06-26 cs.CV 新提交 67%

Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards

Ask, Solve, Generate: 通过自一致性奖励实现自我进化的统一多模态理解与生成

Ritesh Thawkar, Shravan Venkatraman, Omkar Thawakar, Abdelrahman Shaker, Fahad Khan, Hisham Cholakkal, Salman Khan, Rao Muhammad Anwer

专题命中 评测与基准 :post-training(abstract);prompting(abstract)

AI总结 提出一个自我进化的训练框架,通过内部角色(提议者、求解者、生成者)和自一致性信号,无需人工标注或外部奖励模型,同时提升统一多模态模型的理解与生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27264 2026-06-26 cs.CV 新提交 67%

CORTEX: A Structured Reasoning Benchmark for Trustworthy 3D Chest CT MLLMs

CORTEX:用于可信3D胸部CT多模态大语言模型的结构化推理基准

Hashmat Shadab Malik, Anees Ur Rehman Hashmi, Numan Saeed, Muzammal Naseer, Salman Khan, Christoph Lippert

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Hasso Plattner Institute(哈索·普拉特纳研究所) Khalifa University(哈利法大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出CORTEX基准,通过四阶段诊断推理轨迹和阶段级评估协议,为3D胸部CT多模态大语言模型提供结构化监督与验证,包含76,177个验证推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27146 2026-06-26 cs.RO 新提交 67%

PhysReflect-VLA: Physical Feasibility and Self-Reflective Regulation for Reliable Vision-Language-Action Policies

PhysReflect-VLA:面向可靠视觉-语言-动作策略的物理可行性与自反思调节

Jiayu Yang, Tao Yang, Weijun Li, Xiang Chang, Fei Chao, Changjing Shang, Qiang Shen

机构 * Xiamen University(厦门大学) Aberystwyth University(阿伯里斯特威斯大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出PhysReflect-VLA框架,通过物理可行性评估和结构化自反思增强VLA策略,在闭环控制中实现稳定多阶段操作,平均成功率提升5.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26602 2026-06-26 cs.CV 新提交 67%

DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues

DiCoBench: 通过差异性和共性视觉线索进行多图像细粒度感知的基准测试

Geng Li, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出DiCoBench,一个包含765个样本的高分辨率多图像基准,通过差异性和共性视觉线索评估多模态大模型的细粒度感知能力,发现顶尖模型与人类准确率(98.3%)差距显著。

Comments Accepted by ECCV 2026. Project page with code: https://github.com/PKU-ICST-MIPL/DICO_Bench_ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26533 2026-06-26 cs.RO 新提交 67%

OSC2Runner: OpenSCENARIO 2.x Compliant High-Fidelity AV Simulation in CARLA

OSC2Runner: 在CARLA中实现符合OpenSCENARIO 2.x的高保真自动驾驶仿真

Thoshitha Gamage, Lasanthi Gamage

机构 * Southern Illinois University Edwardsville(南伊利诺伊大学爱德华兹维尔分校) Webster University(韦伯斯特大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出OSC2Runner框架,通过多遍转译器架构将OpenSCENARIO v2.x DSL原生映射到CARLA,实现确定性行为树执行,解决现有仿真中的时空漂移和延迟问题。

Comments Accepted at 26th IEEE International Conference on Software Quality, Reliability, and Security (QRS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26524 2026-06-26 cs.CR 新提交 67%

VIGIL: Runtime Enforcement of Behavioral Specifications in AI Agent Skills

VIGIL:AI代理技能中行为规范的运行时执行

Ying Li, Yanju Chen, Hongbo Wen, Bosi Zhang, Hanzhi Liu, Peiran Wang, Yu Feng, Yuan Tian

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出VIGIL框架,通过符号策略语言将自然语言规范转化为SMT约束,实现代理系统跨技能行为策略的运行时监控,检测违规召回率>95%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27282 2026-06-26 cs.LG 新提交 57%

How Good Can Linear Models Be for Time-Series Forecasting?

线性模型在时间序列预测中能有多好?

Lang Huang, Jinglue Xu, Luke Darlow

机构 * Sakana AI, Tokyo, Japan(Sakana AI,日本东京) National Institute of Informatics, Japan(日本国立信息学研究所)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 通过调整预处理(上下文长度、归一化、正则化、数据增强)而非扩大模型规模,Ridge回归在8个基准上超越Transformer、MLP和CNN,挑战了“更大容量带来更高精度”的假设。

Comments Project page: https://sakanaai.github.io/SearchCast/ 17 pages, 10 figures, and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27215 2026-06-26 cs.AI 新提交 57%

Vulnerability of Natural Language Classifiers to Evolutionary Generated Adversarial Text

自然语言分类器对进化生成的对抗文本的脆弱性

Manjinder Singh, Alexander E. I. Brownlee, Mohamed Elawady

机构 * University of Stirling(斯特灵大学) University of Strathclyde(斯特拉斯克莱德大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出GAversary混合遗传算法,仅利用模型logit输出作为黑盒,通过GloVe嵌入改进词替换的语义相似性,在多个基准数据集上显著降低目标模型准确率(最佳从76.8%降至5.8%),但扰动词数约为对比方法的两倍。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27187 2026-06-26 cs.CV cs.CL 新提交 57%

HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models

HarmVideoBench:大型多模态模型中有害视频理解的基准测试

Jiajun Wu, Haoyu Kang, Yining Sun, Jiacheng Hou, Heng Zhang, Danyang Zhang, Zhenjun Zhao, Haochi Zhang, Leixin Sun, Eric Hanchen Jiang, Yushan Li, Ruiyu Li, Mengkai Huang, Yan Gao, Xu Zhang, Guancheng Wan

机构 * Central South University(中南大学) Tsinghua University(清华大学) South China Normal University(华南师范大学) ByteDance Inc(字节跳动公司) University of Zaragoza(阿拉维达大学) CosmosMind Wuhan University(武汉大学) University of California, Los Angeles(加州大学洛杉矶分校) Southeast University(东南大学) Tencent(腾讯公司) Nankai University(南开大学) Supermicro Computer Inc(Supermicro计算机公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出HarmVideoBench,一个包含1379个视频和4137道选择题的多层次诊断基准,从三个维度评估模型对有害视频的深层理解,并引入BCR方法将宏平均准确率从61.7%提升至84.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26923 2026-06-26 cs.CL 新提交 57%

GAVEL: Grounded Caption Error Verification and Localization

GAVEL:基于视觉定位的标题错误验证与定位

Zixian Gao, Atsushi Hashimoto, Kuniaki Saito

机构 * OMRON SINIC X Corporation(欧姆龙SINIC X公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出GAVEL任务,联合解决图像-文本对的验证、解释和定位问题,构建数据集和基准,监督基线在定位和解释指标上持续改进。

Comments conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26535 2026-06-26 cs.CV cs.AI 新提交 57%

From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP

从幻觉到扎根:通过CRISP诊断视觉空间智能

Zhixing Li, Yinan Yu

机构 * Chalmers University of Technology(查尔姆斯理工大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 提出CRISP诊断范式,通过一致性评估解耦感知与推理,揭示闭源模型存在度量估计不准确和未利用隐式结构表示的问题,开源模型则受限于多跳组合推理能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26443 2026-06-26 cs.RO cs.AI cs.CV 新提交 57%

WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation

WatchAct: 行为引导的机器人操作基准

Baiqi Li, Ce Zhang, Yu Fang, Yue Yang, Shangzhe Li, Mingyu Ding, Gedas Bertasius

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出WatchAct基准,通过人类行为视频与指令配对,评估机器人对观察行为的推理能力,涵盖事件解析、程序推理、意图推断和情景记忆四个认知维度,实验显示现有系统性能远低于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27317 2026-06-26 cs.CV cs.RO 新提交 50%

OctoSense: Self-Supervised Learning for Multimodal Robot Perception

OctoSense: 多模态机器人感知的自监督学习

Anthony Bisulco, Jeremy Wang, Kostas Daniilidis, Randall Balestriero, Pratik Chaudhari

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出OctoSense传感器平台和数据集,通过“晚融合”掩码自编码器实现多模态自监督学习,在多种退化条件下鲁棒预测光流、深度、语义分割和自运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27036 2026-06-26 cs.RO 新提交 50%

RelAfford6D: Relational 6D Affordance Graphs for Constraint-Driven Robotic Manipulation

RelAfford6D:用于约束驱动机器人操作的关系型6D可操作图

Guodong Zhang, Qichen He, Wenyuan Xie, Shaokai Wu, Yanbiao Ji, Qiuchang Li, Bayram Bayramli, Yue Ding, Hongtao Lu

机构 * School of Computer Science, Shanghai Jiaotong University(上海交通大学计算机科学学院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出RelAfford6D框架,通过构建关系型6D可操作图将语义指令转化为SE(3)位姿约束,并利用运动学约束求解实现零样本操作,在仿真和真实环境中优于数据驱动方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05219 2026-06-26 cs.HC 版本更新 50%

Conversational AI increases political knowledge as effectively as self-directed internet search

对话式AI在提高政治知识方面与自主网络搜索同样有效

Lennart Luettgau, Hannah Rose Kirk, Kobi Hackenburg, Jessica Bergs, Henry Davidson, Henry Ogden, Divya Siddarth, Saffron Huang, Christopher Summerfield

专题命中 评测与基准 :prompting(abstract)

AI总结 研究探讨对话式AI在政治信息获取中的使用情况及其对政治知识的影响,发现其效果与自主搜索相当,表明公众正越来越多地依赖AI获取政治信息。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 36 篇

2606.27205 2026-06-26 cs.SE 新提交 90%

Smaller Models, Unexpected Costs: Trade-offs in LLM Quantization for Automated Program Repair

更小的模型,意外的代价:LLM量化在自动程序修复中的权衡

Fernando Vallecillos-Ruiz, Giordano d'Aloisio, Max Hort, Luca Traini, Antinisca Di Marco, Leon Moonen

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract)

AI总结 研究LLM量化在自动程序修复中的效果,发现量化虽减少内存但增加推理时间和能耗,且修复问题集差异大,权衡受模型架构和任务复杂度影响。

Comments Accepted for publication in the Research Papers Track of the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), 14-18 September 2026, Benevento, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26277 2026-06-26 cs.IR cs.AI cs.CE cs.CL cs.LG 新提交 90%

From Clicks to Intent: Cross-Platform Session Embeddings with LLM-Distilled Taxonomy for Financial Services Recommendations

从点击到意图:基于LLM提炼分类法的跨平台会话嵌入用于金融服务推荐

Dianjing Fan, Yao Li, Kyaw Hpone Myint, Dwipam Katariya, Alexandre G. R. Day, Pranab Mohanty, Giri Iyengar

机构 * Capital One

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对金融服务中网页匿名浏览与移动端登录行为差异导致的意图信号利用不足问题,提出自监督Transformer编码会话嵌入与LLM提炼分类法生成可解释标签的双用途框架,在移动端首页排序和用户转化预测任务上显著提升性能。

Comments Dianjing Fan and Yao Li equally contributed to this work. 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26105 2026-06-26 cs.CL cs.AI cs.LG 新提交 90%

Context Recycling for Long-Horizon LLM Inference

长程LLM推理的上下文回收

Derek Thomas

机构 * Independent Researcher(独立研究员)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ContextForge系统,通过结构化查询生成、外部记忆检索和受控合成实现上下文回收,在15轮对话基准中减少令牌消耗并保持回答质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18195 2026-06-26 cs.CL 新提交 90%

Learning from the Self-future: On-policy Self-distillation for dLLMs

从自我未来学习:面向扩散LLM的在线自蒸馏

Yifu Luo, Zeyu Chen, Haoyu Wang, Xinhao Hu, Yuxuan Zhang, Zhizhou Sha, Shiwei Liu

机构 * Tsinghua University(清华大学) Technical University of Munich(慕尼黑工业大学) Nanyang Technological University(南洋理工大学) University of British Columbia(不列颠哥伦比亚大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) ELLIS Institute Tubingen(ELLIS蒂宾根研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tubingen AI Center(蒂宾根人工智能中心)

专题命中 效率与部署 :SFT(summary_cn,abstract);LLM(title_cn);large language model(abstract);language model(abstract)

AI总结 提出首个面向扩散大语言模型的在线自蒸馏框架d-OPSD,通过自我生成答案作为后缀条件实现从自我未来经验学习,并将监督从词元级转向步骤级,在推理基准上以约10%的优化步骤超越RLVR和SFT基线。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏