arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1309 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1309 篇

2603.22872 2026-07-03 cs.CV 版本更新 80%

ForeSea: AI Forensic Search with Multi-modal Queries for Video Surveillance

ForeSea:面向视频监控的多模态查询AI取证搜索

Hyojin Park, Yi Li, Janghoon Cho, Sungha Choi, Jungsoo Lee, Taotao Jing, Shuai Zhang, Munawar Hayat, Dashan Gao, Ning Bi, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 针对监控视频中多模态查询与时间定位难题,提出ForeSea系统,采用三阶段即插即用流程,结合跟踪、多模态嵌入和视频LLM,在ForeSeaQA基准上准确率提升3.1%,时间IoU提升10.1%。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28517 2026-07-02 cs.HC 版本更新 80%

Drag, Infer, Reproject: Grounding LLMs through Spatial Interaction for Image Clustering

拖拽、推断、重投影:通过空间交互为图像聚类的LLM基础

Yang Liu, Xuxin Tang, Jiahao Xu, Chris North

专题命中 评测与基准 :LLM(title_cn);large language model(abstract);language model(abstract)

AI总结 提出CriterionSI方法,利用大语言模型从用户拖拽交互中推断聚类标准,并引导重投影,实现渐进式标准对齐的图像聚类布局。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04080 2026-06-30 cs.IR 版本更新 80%

Caption Injection for Optimization in Generative Search Engine

生成搜索引擎中的标题注入用于优化

Xiaolu Chen, Jie Bao, Haojie Wu, Zhen Chen, Yong Liao

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Caption Injection,一种多模态G-SEO方法,通过提取图像标题并注入文本内容,提升生成搜索中的主观可见性,实验表明其在G-EVAL指标下优于文本-only基线。

Comments 24 pages, 4 figures, ECML PKDD 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13890 2026-06-29 cs.HC 版本更新 80%

Workshop Paper: An empirical study to understand how students use ChatGPT for writing essays and how it affects their ownership

研讨会论文:一项关于学生如何使用ChatGPT撰写论文及其如何影响论文所有权的实证研究

Andrew Jelson, Sang Won Lee

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 通过用户研究记录学生与ChatGPT的交互过程,分析查询与回复,探讨AI辅助写作对写作教育和评估的影响。

Comments 5 pages, 2 figures, submitted and accepted to ACM CHI Workshop In2Writing in 2024, Please see full paper at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19652 2026-06-29 cs.CR 版本更新 80%

A Plug-and-Play Method for Improving Imperceptibility and Capacity in Practical Generative Text Steganography

一种提高实用生成式文本隐写术不可感知性和容量的即插即用方法

Kaiyi Pang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出FreStega方法,通过重构语言模型概率分布,在自回归生成隐写文本时动态调整token概率,同时提升不可感知性和容量(容量提升15.41%),无需牺牲文本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14837 2026-06-23 cs.CV 版本更新 80%

DamageArbiter: A Multimodal Arbitration Framework for Disaster Damage Assessment from Street-View Imagery

DamageArbiter:一种基于街景图像进行灾害损伤评估的多模态仲裁框架

Yifan Yang, Lei Zou, Wenjing Gong, Kani Fu, Zongrong Li, Siqin Wang, Bing Zhou, Heng Cai, Hao Tian

机构 * organization= Department of Geography, Texas A\&M University , city= College Station , country= USA organization= Department of Landscape Architecture \& Urban Planning, Texas A\&M University , city= College Station , country= USA organization= Department of Industrial Systems Engineering, University of Florida , city= Gainesville , country= USA organization= Spatial Sciences Institute, University of Southern California , city= Los Angeles , country= USA organization= Department of Geography Sustainability, University of Tennessee , city= Knoxville , country= USA

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出DamageArbiter多模态仲裁框架,通过轻量级逻辑回归元分类器仲裁单模态与多模态模型预测分歧,在2556张街景图像上将准确率提升至75.85%,MCC达0.6188,并将过度自信误差从70.58%降至16.45%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22222 2026-06-18 cs.IR cs.MA 版本更新 80%

TWICE: Modeling the Temporal Evolution of Personalized User Behavior via Event-Driven Agents

TWICE:通过事件驱动代理建模个性化用户行为的时间演化

Bingrui Jin, Kunyao Lan, Baihan LI, Mengyue Wu

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出TWICE框架,结合结构化用户画像、事件驱动记忆模块和两阶段工作流,利用LLM模拟用户行为的时间演化,在Twitter数据集上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04799 2026-06-09 cs.CR 版本更新 80%

Maris: A Formally Verifiable Privacy Policy Enforcement Paradigm for Multi-Agent Collaboration Systems

Maris:一种用于多智能体协作系统的形式化可验证隐私策略执行范式

Jian Cui, Zichuan Li, Chi Wang, Luyi Xing, Xiaojing Liao

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对多智能体协作系统(MACS)中敏感数据泄露风险,提出一种基于引用监视器的隐私增强开发范式Maris,通过嵌入消息流控制机制实现细粒度数据保护,并在AutoGen和LangChain框架中实现,实验表明其能有效缓解数据泄露威胁且保持高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11012 2026-06-09 cs.SE 版本更新 80%

Beyond Accuracy: Behavioral Dynamics of Agentic Multi-Hunk Repair

超越准确率:智能体多块修复的行为动力学

Noor Nashid, Daniel Ding, Keheliya Gallaba, Ahmed E. Hassan, Ali Mesbah

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 研究LLM驱动的编码智能体在多块缺陷修复中的行为,通过404个多块bug的1616条修复轨迹分析定位、修复准确率、回归行为及操作动力学,发现修复准确率随bug分散度和复杂度下降,且失败修复消耗更多资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10196 2026-06-09 cs.LG cs.AI 版本更新 80%

Large Models for Time Series and Spatio-Temporal Data: A Survey and Outlook

时间序列与时空数据的大模型:综述与展望

Ming Jin, Yaxuan Kong, Yuxuan Liang, Chaoli Zhang, Siqiao Xue, Xue Wang, James Zhang, Yi Wang, Haifeng Chen, Xiaoli Li, Vincent S. Tseng, Yu Zheng, Lei Chen, Hui Xiong, Shirui Pan, Qingsong Wen

机构 * Griffith University(格里菲斯大学) University of Oxford(牛津大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Zhejiang Normal University(浙江师范大学) Ant Group(蚂蚁集团) Alibaba Group(阿里巴巴集团) Deloitte Service LLP(德勤服务有限责任公司) The University of Hong Kong(香港大学) NEC Laboratories America(NEC美国实验室) A*STAR National Yang Ming Chiao Tung University(阳明交通大学) JD Technology(京东科技) Squirrel Ai Learning

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 综述了面向时间序列和时空数据的大模型,按数据类型、模型类别、范围和应用领域分类,总结了通用与领域专用模型,并整理了相关资源与开放问题。

Comments Accepted by ACM Computing Surveys; 35 Pages; Github Repo: https://github.com/qingsongedu/Awesome-TimeSeries-SpatioTemporal-LM-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01856 2026-08-17 cs.AI 版本更新 79%

EchoChange: A Diffusion Language Model with Dual Pass Remasking for Factual Remote Sensing Disaster Change Captioning

EchoChange:用于事实性遥感灾害变化描述的双遍重掩蔽扩散语言模型

Dongwei Sun, Bowen Yao, Yujie Zhang, Pei Liu, Jing Yao, Xiangyong Cao

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 针对现有遥感灾害变化描述方法的级联事实错误问题,提出EchoChange扩散语言模型,经实验在RSCC基准上优于各类基线

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11941 2026-08-14 cs.AI 版本更新 79%

OEIS Open: How many conjectures can language models turn into theorems?

OEIS Open:语言模型能将多少个猜想转化为定理?

Tom Adamczewski

机构 * Epoch AI

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本研究构建OEIS Open基准,发现配备最少工具的语言模型在适中预算下可自主解决部分OEIS未解决数学猜想,访问大量数学文献或复杂智能体循环未提升其性能。

Comments 26 pages, 6 figures. Code: https://github.com/epoch-research/LeanOpenProblems, results: https://github.com/epoch-research/LeanOpenProblems-results

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06718 2026-08-14 cs.CL 版本更新 79%

Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation

音频语言模型是否使用副语言证据?用于响应评估的反事实审计

Kevin Miller, Arjun Chandra, Venkatesh Saligrama

机构 * Boston University(波士顿大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 该研究针对用作语音转语音系统评判者的音频语言模型,提出反事实审计方法,发现其评判可靠性常被对比成功高估,需结合行为审计而非仅准确率评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25497 2026-08-14 cs.CV cs.AI 版本更新 79%

A Distributional Robustness Margin For Pathology Foundation Models

超越计数:病理学基础模型的分布稳健性余量

Clément Grisi, Jeroen van der Laak, Geert Litjens

机构 * Radboud University Medical Center(拉德堡德大学医学中心)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 研究病理学基础模型受非生物学变异影响的问题,提出交叉混杂稳健性余量(CRoMa),通过直接比较距离评估模型稳健性,将其重塑为队列范围的余量分布,为模型选择和稳健性评估提供原则基础。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06200 2026-08-14 astro-ph.SR astro-ph.IM cs.AI 版本更新 79%

StarEmbed: Benchmarking Time Series Foundation Models on Astronomical Observations of Variable Stars

StarEmbed:在变星天文观测上对时间序列基础模型进行基准测试

Weijian Li, Hong-Yu Chen, Nabeel Rehemtulla, Ved G. Shah, Dongho Kim, Dennis Wu, Qinjie Lin, Adam A. Miller, Han Liu

机构 * Department of Computer Science, Northwestern University(计算机科学系,西北大学) Center for Foundation Models and Generative AI, Northwestern University(基础模型与生成AI中心,西北大学) NSF – Simons AI Institute for the Sky (SkAI)(国家科学基金会-斯隆人工智能天文研究所(SkAI)) Department of Physics and Astronomy, Northwestern University(物理与天文学系,西北大学) Center for Interdisciplinary Exploration and Research in Astrophysics (CIERA)(天文学跨学科探索与研究中心(CIERA)) Department of Statistics and Data Science, Northwestern University(统计与数据科学系,西北大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 StarEmbed首次在变星天文观测上对时间序列基础模型进行基准测试,展示了TSFMs在天文任务中的优越性能和泛化能力。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11729 2026-08-14 cs.CV cs.LG 版本更新 79%

SpaRRTa: A Synthetic Benchmark for Evaluating Spatial Intelligence in Visual Foundation Models

SpaRRTa:用于评估视觉基础模型空间智能的合成基准

Turhan Can Kargin, Wojciech Jasiński, Adam Pardyl, Bartosz Zieliński, Marcin Przewięźlikowski

机构 * AGH University of Krakow(克拉科夫AGH大学) IDEAS NCBR

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 SpaRRTa通过评估视觉基础模型的空间推理能力,揭示其在不同空间任务中的表现差异,旨在推动更高效的空间意识视觉模型发展。

Comments Project page is available at https://sparrta.gmum.net/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02587 2026-08-11 cs.SE cs.LG 版本更新 79%

The Moving Target: A Longitudinal Audit of Trust-Benchmark Score Drift Across Open-Source Chat LLM Release Lines

移动目标:对开源聊天语言模型十二个检查点的可信度漂移进行纵向审计

Zhichao Fan, Yanhang Li, Zexin Zhuang, Xian Sun, Yingshuo Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南方 Methodist 大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

AI总结 通过对四个开源版本系列在多提示模板下的信任基准测试,发现相邻版本间存在显著漂移,结论是发布线的信任分数应重新测量,而非沿用,应作为检查点相关的日期化工件报告。

Comments 6 pages, 1 figure; accepted at IEEE ICMLA 2026; title, presentation, and formatting revised from v1; empirical results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13138 2026-08-06 cs.SE cs.CR cs.LG 版本更新 79%

A Comprehensive Evaluation of Code Language Models for Security Patch Detection

以代码为中心的漏洞修复提交检测:一个统一的基准和实证研究

Nils Loose, Joseph Bienhüls, Kristoffer Hempel, Felix Mächtle, Thomas Eisenbarth

机构 * University of Lübeck(吕贝克大学) University of Lübeck Institute for IT Security(吕贝克大学信息安全部)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本文通过统一框架评估了基于代码语言模型的漏洞修复提交检测,发现仅依赖代码变更无法让模型获得可转移的安全相关代码理解,且在去除提交信息后,增加内过程语义上下文也无法使模型关注代码变更,性能受数据分布和时间分割影响显著。

Comments Accepted at ASE26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23690 2026-08-05 cs.CV cs.CL 版本更新 79%

HomeSafeBench: Benchmarking Embodied Vision-Language Models in Free-Exploration Home Safety Inspection

HomeSafeBench:面向自由探索式家庭安全检查的具身视觉-语言模型基准

Jiashu Yao, Haoyu Wen, Siyuan Gao, Yuhang Guo, Zeming Liu, Heyan Huang

机构 * Beijing Institute of Technology(北京理工大学) Beihang University(北京航空航天大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 研究针对家庭安全隐患检查需求构建HomeSafeBench基准,提出CueBack数据构建方法,微调4B规模VLM使分布外测试集F1值显著提升,缩小了与人类检查员的性能差距。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14896 2026-08-04 cs.SE cs.AI cs.MA 版本更新 79%

StructureClaw: Traceable LLM Agents and an Executable Benchmark for Structural Engineering Workflows

StructureClaw:用于结构工程工作流程的可追溯大语言模型智能体及可执行基准测试

Sizhong Qin, Yi Gu, Yao Jiang, Ao Cai, Changjian Zhou, Shaoxuan Shuai, Jiachang Wang, Tianhao Shen, Yueqiang Li, Xinhao Li, Li Zeng, Yueshi Chen, Dachen Gao, Genrong Xu, Wenjie Liao, Xinzheng Lu

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 针对结构工程请求评估中难以验证完整证据链的问题,提出StructureClaw及可执行基准测试StructureClaw-Bench,通过工件中心评估提高成功率,发现交互式和多模态评估的挑战,为评估改进结构工程智能体提供更严格基础。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00848 2026-08-04 cs.CL 版本更新 79%

MetaHOPE: A Metaphor-Oriented Evaluation Framework for Analysing MT and LLM Translation Errors

MetaHOPE:面向隐喻的评估框架用于分析机器翻译和大语言模型翻译错误

Jiahui Liang, Lifeng Han

机构 * Centre for Linguistics, Humanities, Leiden University(莱顿大学人文学院语言学中心) LIACS, Leiden University(莱顿大学LIACS) BDS, Leiden University Medical Centre(莱顿大学医学中心BDS)

专题命中 评测与基准 :LLM(title,abstract_cn);分类 cs.CL

AI总结 提出MetaHOPE框架,基于错误严重性标注隐喻翻译错误,通过人工标注语料评估GoogleMT、GPT5.4和Hunyuan-7b在英汉互译中的表现,并构建双语平行资源。

Comments To appear in the Proceedings of the 9th International Conference on Natural Language and Speech Processing (ICNLSP 2026), Trento, Italy, September 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14322 2026-08-04 cs.AI 版本更新 79%

TeachArena: Are Language Agents Ready for Realistic Teaching Work?

代理是否准备好教学?一个多阶段基准用于现实世界教学工作流程

Zixin Chen, Peng Liu, Rui Sheng, Haobo Li, Jianhong Tu, Xiaodong Deng, Kashun Shum, Dayiheng Liu, Huamin Qu

机构 * Hong Kong University of Science and Technology(香港科技大学) Qwen Team, Alibaba Group(阿里集团通义实验室)

专题命中 评测与基准 :language agent(title,abstract);分类 cs.AI

AI总结 本文提出EduAgentBench基准,用于评估教学代理的全面能力,发现当前模型在教学任务中的表现有限,但仍为开发未来教学代理提供了测量基础。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23332 2026-08-03 cs.LG 版本更新 79%

AllocBench: Measuring Online Tool Allocation Capability in LLM Agents

AlloBench:测量大语言模型智能体中的在线工具分配能力

Daniel Wang, Andrew Xu

机构 * Sea12 Technologies(Sea12科技公司) Yale University(耶鲁大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

AI总结 研究测试大语言模型智能体在固定预算下的在线工具分配能力,通过配对基准测试发现前沿模型在抽象框架中表现近乎最优,但在脚本编写中失败,确定了各模型失败模式,还表明开源Qwen模型在抽象分配上有推广,在线工具分配是重要能力边界。

Comments 24 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18529 2026-08-03 cs.HC cs.AI 版本更新 79%

EduPanel: A Three-Agent LLM Judge for Teaching Videos -- Reliability, Complementarity, and Human Trust Calibration

EduPanel:用于教学视频的三智能体大语言模型评判器——可靠性、互补性和人类信任校准

Jia-Kai Dong, Yi-Cheng Lin, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NTU Artificial Intelligence Center of Research Excellence(NTU人工智能卓越研究中心)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 针对教学视频教学质量评估需求,提出基于评分标准、以学习者为条件的EduPanel大语言模型评判器,通过专门智能体分解评估,经多项分析实现高可靠性,能辅助教育评估,提高评分准确性且让专家可检测不可靠输出。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19261 2026-07-31 cs.CV cs.AI 版本更新 79%

PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image

PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试

Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peking Union Medical College Hospital(北京协和医院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23442 2026-07-30 cs.CL 版本更新 79%

Do LLM Debates Repeat Arguments Differently Across Languages?

大语言模型辩论在不同语言中重复论点的方式是否不同?

Huiqian Lai

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 研究大语言模型辩论在不同语言中重复论点的差异,用“先验论点相似度”方法,发现在多语言嵌入模型中中文与英文有正向差距,该差距在多种条件下持续,多样性提示未显著缩小差距,建议多语言辩论评估衡量论证发展并报告缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07544 2026-07-28 cs.AI 版本更新 79%

From Pixels to Prompts: Vision-Language Models

从像素到提示:视觉-语言模型

Khang Nhat Hoang Vo

机构 * MBZUAI

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文探讨了视觉-语言模型的发展历程,旨在提供清晰的认知框架,帮助读者理解该领域的核心概念和应用,而非罗列所有数据集和模型变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27660 2026-07-28 cs.AI 版本更新 79%

From Context to Skills: Can Language Models Learn from Context Skillfully?

从上下文到技能:语言模型能否从上下文中熟练学习?

Shuzheng Si, Haozhe Zhao, Yu Lei, Qingyi Wang, Dingwei Chen, Zhitong Wang, Zhenhailong Wang, Kangyang Luo, Zheng Wang, Gang Chen, Fanchao Qi, Minjia Zhang, Maosong Sun

机构 * THU(清华大学) DeepLang AI UIUC(伊利诺伊大学香槟分校) FDU(福建大学) CUHK(香港中文大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 提出Ctx2Skill框架,通过多智能体自博弈和跨时间回放机制,自动从上下文中发现、提炼和选择技能,提升语言模型在复杂上下文中的学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08379 2026-07-27 cs.AI 版本更新 79%

DeepFeature: LLM-Empowered Context-aware Feature Generation for Wearable Biosignals

DeepFeature: 基于迭代上下文感知的可穿戴生物信号特征生成

Kaiwei Liu, Yuting He, Bufang Yang, Mu Yuan, Chun Man Victor Wong, Ho Pong Andrew Sze, Zhenyu Yan, Hongkai Chen

机构 * The Chinese University of Hong Kong(香港中文大学) The Education University of Hong Kong(香港教育大学) Hong Kong Applied Science and Technology Research Institute(香港应用科学和技术研究院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 DeepFeature是一种基于大语言模型的上下文感知特征生成框架,通过多源特征生成机制和迭代特征细化过程,提升可穿戴生物信号的特征提取效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11149 2026-07-24 cs.AI 版本更新 79%

The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation

隐藏的足迹:使存储成为大语言模型智能体评估的头等指标

Chenglin Yu, Hongquan Gui, Ying Yu, Tao Zeng, Ming Li

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究大语言模型智能体运行后磁盘持久数据评估问题,引入AgentFootprint基准测试,通过序列化感知度量套件测量多方面指标,解决测量陷阱,给出不同配置差异及存储优化结果,确立持久存储为资源指标。

Comments 17 pages, 5 figures; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏