arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-21 至 2026-07-21 共收录 490 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 110 篇

2603.16011 2026-07-21 cs.SE cs.AI cs.CL 版本更新 87%

FormulaCode: Evaluating Agentic Optimization on Large Codebases

FormulaCode: 评估在大规模代码库上进行代理优化

Atharva Sehgal, James Hou, Akanksha Sarkar, Ishaan Mantripragada, Swarat Chaudhuri, Jennifer J. Sun, Yisong Yue

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) California Institute of Technology(加州理工学院) Cornell University(康奈尔大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 FormulaCode是一个评估大型真实代码库上代理优化能力的基准,包含957个从科学Python仓库挖掘出的性能瓶颈,配以专家撰写的补丁和平均264.6个社区维护的性能工作负载,揭示了前沿LLM代理在多目标优化上的重大挑战。

Comments ICML Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18108 2026-07-21 cs.CR 新提交 87%

GARAGE: Characterizing the Automation Boundary in LLM-based Attack Graph Generation

GARAGE:基于大语言模型的攻击图生成中自动化边界的特征描述

Daekwon Pi, Sangho Lee, Young Hun Lee, Huy Kang Kim

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 研究针对现代车辆安全CTI合成难题,提出GARAGE框架,通过RAG技术将碎片化CTI转化为特定领域知识库用于攻击图生成,经实验验证能准确转移安全知识,还可作为TARA支持工具提供性价比分析以指导在各LLM层级部署。

Comments 22 pages, 10 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02792 2026-07-21 cs.LG cs.NE 版本更新 86%

From Heuristic Selection to Automated Algorithm Design: LLMs Benefit from Strong Priors

从启发式选择到自动化算法设计:LLMs受益于强先验

Qi Huang, Furong Ye, Ananta Shahane, Thomas Bäck, Niki van Stein

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出利用基准算法引导LLM优化,提升黑箱优化在pbo和bbob基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17979 2026-07-21 cs.LG cs.AI 新提交 86%

Harness Engineering for LLM-Driven GPU Kernel Generation

用于大语言模型驱动的GPU内核生成的工具工程

Yue Shui, Chenyu Ma, Hangfei Xu, Shengzhao Wen, Yanpeng Wang

机构 * Baidu, Inc.(百度公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 在MLSys 2026 FlashInfer竞赛中,针对NVIDIA Blackwell B200 GPU,提出以工具为中心的大语言模型驱动的GPU内核优化系统,分离评估工具与优化控制器,利用Codex等生成候选内核,实验显示优化后平均延迟加速显著,且代理辅助内核效果更佳。

Comments 24 pages, 6 figures. Extended technical report on our submission to the MLSys 2026 FlashInfer AI Kernel Generation Contest. Code: https://github.com/syhya/mlsys26-flashinfer-contest

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16215 2026-07-21 cs.AI cs.CL cs.SE 新提交 86%

RAIL Guard: Closing the Evaluation-to-Remediation Gap in Responsible AI for LLM Agents

RAIL Guard:弥合大语言模型智能体负责任人工智能中评估与修复的差距

Sumit Verma, Pritam Prasun, Pritish Kumar

机构 * Responsible AI Labs(负责任人工智能实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型智能体评估与修复差距问题,提出RAIL Guard闭环负责任人工智能管道,在多维度评估输出并迭代修复。实验表明其闭环修复收敛率高,能减少不安全执行,还区分了可修复与结构维度问题,系统开源。

Comments 15 pages, 10 figures, 4 tables. Code: https://github.com/Responsible-AI-Labs/rail-score-sdk (Python). Benchmark: https://huggingface.co/datasets/responsible-ai-labs/rail-guard-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18086 2026-07-21 cs.AI 新提交 86%

Judge-dependent safety gains and model-specific helpfulness costs of evidence-sufficiency prompting in clinical LLMs

临床大语言模型中证据充分性提示的依赖判断的安全增益和特定模型的有用性成本

Koyar Afrasyab

专题命中 评测与基准 :prompting(title);LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 研究临床大语言模型中证据充分性提示的安全增益及有用性成本,通过在公共数据基准中让四个模型用标准提示和包装器回答问题,发现安全增益有方向和幅度差异且依赖评判者,同时存在模型特定的有用性成本。

Comments https://github.com/KAVentures/clinical-evidence-sufficiency-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01549 2026-07-21 cs.CL cs.SE 版本更新 85%

Octopus: On-device language model for function calling of software APIs

章鱼:用于软件API函数调用的设备端语言模型

Wei Chen, Zhiyuan Li, Mingyuan Ma

机构 * Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 研究利用设备端大语言模型调用软件API,通过编译数据集微调不同参数模型,提升其API交互能力,提出条件掩码技术和新基准,经微调的Octopus模型在API调用上性能超GPT-4,推动自动化软件开发和API集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18144 2026-07-21 cs.LG cs.AI cs.CL 新提交 85%

Do Language Models Dream of Binding Molecules? Benchmarking LLMs under Spatial Constraints

语言模型能否设计出结合分子?在空间约束下对语言模型进行基准测试

Thomas MacDougall, Maksim Kuznetsov, Roman Schutski, Rim Shayakhmetov, Maxim Malkov, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

专题命中 评测与基准 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨通用语言模型在3D分子设计中应对复杂空间约束的能力,引入3D - Fit评估策略,发现语言模型虽落后于先进方法,但有潜力同时处理多种空间约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12281 2026-07-21 cs.CV 版本更新 85%

Cognitive-YOLO: LLM-Driven Architecture Synthesis from First Principles of Data for Object Detection

认知YOLO:基于数据第一性原理的大语言模型驱动的架构合成用于目标检测

Jiahao Zhao

机构 * Xi’an University of Posts and Telecommunications(西安邮电大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对通用目标检测算法在垂直场景的问题,认知YOLO利用大语言模型与自主智能体协作,构建“分析-合成-编译”管道,合成轻量级模型,显著压缩参数数量,在mAP@0.5:0.95上表现良好,平衡了模型紧凑性和特征表示能力。

Comments 11 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18147 2026-07-21 eess.SY cs.AI cs.SY 新提交 84%

LLMs and Agentic AI Systems for Smart Grids: A Tutorial on Architectures and Applications

用于智能电网的大语言模型和智能AI系统:架构与应用教程

Daniela Rojas, Abdulwahab Albassam, Aidan G. Leung, Jett Ngo, Ryan Luo, Peter R. Quawas, Junpyung Kim, Kangkai Liang, Mansi Nanavati, Jonathan Mai, Meng-Chi Tsai, Yun-Tong Tsai, Yize Chen, Yuanyuan Shi

机构 * Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣迭戈分校电气与计算机工程系) Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究智能电网中LLMs和智能AI系统,提出基于求解器的设计原则,通过提示策略等构建模块及四个案例研究实例化该原则,比较不同方案,还提出四组评估框架,明确了各部分分工。

Comments 28 pages, 11 figures, 6 tables; plus supplementary material. Review/tutorial article

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17765 2026-07-21 cs.LG cs.AI cs.DB 新提交 84%

FIFA World Cup 2026 as a Contamination-Free Benchmark for LLM Forecasting Agents: Four Models, a Bookmaker, and 104 Matches

2026年国际足联世界杯作为语言模型预测代理的无污染基准:四个模型、一个博彩公司和104场比赛

Jiacheng Ding, Cong Guo, Jason Xu

机构 * University of Memphis(孟菲斯大学) QuantaInsight(量子洞察)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 介绍WC2026-Agents基准和数据集,用于评估大语言模型作为世界杯预测代理。四个前沿模型对104场比赛运行相同循环,与博彩市场数据配对。揭示模型预测虽有相同首选,但在决策质量等方面差异大,可衡量校准等方面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22328 2026-07-21 cs.LG cs.AI cs.CE 版本更新 84%

FETS Benchmark: Foundation Models Enable Scalable and Generalizable Energy Time Series Forecasting

FETS基准:基础模型在能源时间序列预测中优于数据集特定的机器学习

Marco Obermeier, Marco Pruckner, Florian Haselbeck, Andreas Zeiselmair

机构 * Julius-Maximilians-Universität Würzburg, Modeling and Simulation Lab(乌尔姆-马克斯·普朗克大学,建模与仿真实验室) Weihenstephan-Triesdorf University of Applied Sciences, Smart Farming(魏因施泰因-特里尔夫应用科学大学,智能农业) Weihenstephan-Triesdorf University of Applied Sciences, Digital Energy Transition(魏因施泰因-特里尔夫应用科学大学,数字能源转型)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文通过FETS基准展示了基础模型在能源时间序列预测中优于传统机器学习方法,揭示了基础模型在不同数据集和场景下的优越性能及应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11945 2026-07-21 cs.LG cs.AI cs.MA 84%

AutoSurrogate: An LLM-Driven Multi-Agent Framework for Autonomous Construction of Deep Learning Surrogate Models in Subsurface Flow

AutoSurrogate:一种基于LLM的多智能体框架,用于自主构建地下流深度学习代理模型

Jiale Liu, Nanzhe Wang

机构 * School of Physics and Astronomy, The University of Edinburgh(物理与天文学学院,爱丁堡大学) Institute of GeoEnergy Engineering, School of Energy, Geoscience, Infrastructure and Society, Heriot-Watt University(地球能源工程研究所,能源、地质科学、基础设施与社会学院,赫瑞斯泰大学) Subsurface Energy Transition and Innovation Centre, Heriot-Watt University(地下能源转型与创新中心,赫瑞斯泰大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 AutoSurrogate通过自然语言指令使非ML专家能构建高质量地下流代理模型,利用多智能体协作完成数据分析、架构选择、超参数优化和质量评估,实现自动化代理模型构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17211 2026-07-21 cs.SE 新提交 83%

Prefactory: Automated Discovery and Application of Library-Adoption Refactorings

Prefactory:库采用重构的自动发现与应用

Islem Bouzenia, Michael Pradel

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract)

AI总结 研究如何自动进行库采用重构。核心方法是用 LLM 合成搜索启发式方法,收集元数据和词汇生成检测器找候选函数,排序后用 LLM 生成重构并验证。主要贡献是在 PrefactoryBench 上表现优于基线,产生多个经测试验证的重构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16646 2026-07-21 cs.SE cs.AI 新提交 83%

Falsification-Based Verification of LLM-Generated Optimization Models: Sound Test Batteries and Their Detection Limits

基于证伪的大语言模型生成优化模型验证:可靠的测试组及其检测极限

Haifeng Li, Mo Hai

机构 * School of Information, Central University of Finance and Economics(信息学院,中央财经大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型生成优化模型的验证问题,基于证伪理论开发测试组,通过求解器调用测试候选模型,实验证实该测试组可靠,能检测多种错误,误报率低,再现可检测性模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16442 2026-07-21 cs.CV cs.CL cs.CR 新提交 83%

One Modality to Forget Them All: Enhancing Cross-Modal Unlearning in Vision-Language Models

一种模态遗忘一切:增强视觉语言模型中的跨模态遗忘

Sudharshan Balaji, Yili Ren, Guangjing Wang, Yimin Chen, Ning Wang

机构 * University of South Florida(南佛罗里达大学) University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 研究视觉语言模型中跨模态遗忘转移问题,通过对三种架构研究发现其不对称不完整。提出CrossInf策略,聚焦关键transformer块遗忘,减少转移差距,提升鲁棒性,经人工评估验证,还用CKA分析浅层遗忘。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26548 2026-07-21 cs.CR cs.LG 版本更新 83%

SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?

SEC-bench Pro:语言模型能解决长周期软件安全任务吗?

Hwiwon Lee, Jiawei Liu, Dongjun Kim, Wubing Xia, Ziqi Zhang, Chunqiu Steven Xia, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :language model(title);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出SEC-bench Pro基准,通过三阶段流程构建包含V8和SpiderMonkey共183个已验证漏洞的测试集,评估前沿语言模型在长周期漏洞狩猎任务中的表现,发现最高成功率仅48.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06197 2026-07-21 cs.CL cs.AI 版本更新 82%

Improving Answer Extraction in Context-based Question Answering Systems Using LLMs

利用大语言模型改进基于上下文的问答系统中的答案提取

Hafez Abdelghaffar, Ahmed Alansary, Ali Hamdi

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对现有问答系统在复杂或模糊查询下答案提取不准确的问题,提出基于微调预训练大语言模型的方法,在SQuAD1.1数据集上取得ROUGE-L 86.84%、BLEU 28.24%、BERTScore 95.38%的高性能。

Comments 7 pages, IMSA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03061 2026-07-21 cs.LG cs.AI math.ST stat.ME stat.ML stat.TH 版本更新 82%

Evaluating LLMs When They Do Not Know the Answer: Statistical Evaluation of Mathematical Reasoning via Comparative Signals

评估LLMs在不知道答案时的性能:通过比较信号进行数学推理的统计评估

Zihan Dong, Zhixian Zhang, Yang Zhou, Can Jin, Ruijia Wu, Linjun Zhang

机构 * Rutgers University(罗格斯大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种统计高效的方法,通过结合标准结果与成对比较信号,提升LLM数学推理能力评估的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18084 2026-07-21 cs.AI cs.CL cs.LG 新提交 82%

WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting

世界杯竞技场:语言模型和深度研究代理在足球预测上的细粒度评估

Zhaokai Wang, Tianlin Gui, Jiayuan Rao, Shangzhe Di, Yihong Tang, Dingli Liang

机构 * Shanghai Jiao Tong University(上海交通大学) McGill University(麦吉尔大学) University College London(伦敦大学学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 介绍世界杯竞技场这一语言模型和深度研究代理的动态基准,用于足球预测。模型赛前接收证据或自行搜索信息进行多项预测,赛后与实际结果对比。通过多指标评估104场比赛和13个系统,展示不同模型表现及与基线对比情况,且新赛程可添加用于评估未来模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11254 2026-07-21 cs.IR 82%

MIRA: An LLM-Assisted Benchmark for Multi-Category Integrated Retrieval

MIRA:一个基于大语言模型的多类别集成检索评估基准

Mehmet Deniz Türkmen, Suchana Datta, Dwaipayan Roy, Daniel Hienert, Philipp Mayr, Derek Greene

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出MIRA基准,通过真实用户查询构建,支持多类别跨领域检索评估,利用大语言模型生成主题描述和相关性评估,降低测试集生成成本。

Comments Accepted to SIGIR 2026. Resource Paper. 8 pages, 2 figures. DOI:10.1145/3805712.3808614

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), 2026, pp. 3426-3433

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18116 2026-07-21 cs.AI cs.CV cs.GR cs.MA cs.MM 新提交 81%

SGA: Plug&Play Geometric Verification for Educational Video Synthesis

SGA:用于教育视频合成的即插即用几何验证

Lopez Jhon, Hinojosa Carlos, Ghanem Bernard

机构 * Universidad Industrial de Santander(桑坦德工业大学) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对教育视频合成中空间正确性和视觉清晰度难题,提出符号几何智能体SGA,通过拦截代码、提取场景图及针对性优化提升质量,引入MVQS,实验显示其在多配置下有效提升了视觉质量分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16200 2026-07-21 cs.AI 新提交 81%

Deterministic Replay for AI Agent Systems

人工智能代理系统的确定性重放

Rasheed Mudasiru

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究人工智能代理系统不确定性问题,提出agrepl框架,通过MITM代理拦截外部交互并序列化,在隔离环境重放,形式化执行模型,经实验验证重放保真度高且延迟大幅降低,以Go实现并开源。

Comments 9 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13705 2026-07-21 cs.AI cs.SE 版本更新 81%

AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities

AgentCompass:用于智能体能力的统一评估基础设施

Kai Chen, Zichen Ding, Jiaye Ge, Shufan Jiang, Mo Li, Qingqiu Li, Zehao Li, Zonglin Li, Tianhao Liang, Shudong Liu, Zerun Ma, Zixin Shang, Wenhui Tian, Zun Wang, Liwei Wu, Zhenyu Wu, Jun Xu, Bowen Yang, Dingbo Yuan, Qi Zhang, Songyang Zhang, Peiheng Zhou, Dongsheng Zhu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型演变成自主智能体后评估基础设施分散的问题,提出AgentCompass,通过围绕三个独立组件组织评估过程,具备容错异步运行时和轨迹分析工具,支持多基准测试,为智能体研究提供可扩展、可重复的基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00594 2026-07-21 cs.AI 版本更新 81%

Agent psychometrics: Task-level performance prediction in agentic coding benchmarks

代理心理测量:在代理编码基准中的任务级性能预测

Chris Ge, Daria Kryvosheieva, Daniel Fried, Uzay Girit, Kaivalya Hariharan

机构 * Massachusetts Institute of Technology(麻省理工学院) Fulcrum Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出了一种基于任务级性能预测的代理编码基准评估框架,结合IRT理论与任务特征,区分LLM和支架能力,以更准确预测未见基准和组合的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18063 2026-07-21 cs.CR cs.AI cs.LG 新提交 81%

Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM Agent Security

自适应对手:用于大语言模型智能体安全的多轮、多大语言模型基准测试

Devina Jain, David Hartmann, Chuan Li

机构 * Lambda

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出针对无记忆大语言模型防御者的自适应多轮攻击的21场景基准测试,通过观察防御者响应灵活调整攻击。介绍了不同攻击轮次成功率,汇集多个前沿攻击者大语言模型的情况,还指出不同防御者弱点差异及场景排名不一致性,并发布了相关基准测试及数据集。

Comments Second Workshop on Agents in the Wild: Safety, Security, and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10781 2026-07-21 cs.CL cs.AI 81%

Can Language Model Moderators Improve the Health of Online Discourse?

语言模型调解者能否改善在线讨论的健康状况?

Hyundong Cho, Shuai Liu, Taiwei Shi, Darpan Jain, Basem Rizk, Yuyang Huang, Zixun Lu, Nuan Wen, Jonathan Gratch, Emilio Ferrara, Jonathan May

机构 * Department of Computer Science and Information Sciences Institute University of Southern California(计算机科学系和信息科学研究所 南加州大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了语言模型作为对话调解员的效果,发现其能提供具体公平的反馈,但难以提升用户尊重与合作水平。

Comments 9 pages, NAACL 2024 Main

Journal ref Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18181 2026-07-21 cs.CL cs.SE 新提交 79%

VEHBench: A Stage-Local Diagnostic Benchmark for LLM-Assisted Vibration Energy Harvester Design

VEHBench:用于大语言模型辅助振动能量采集器设计的阶段局部诊断基准测试

Depeng Su, Yuyu Luo, Guobiao Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 研究针对无电池物联网中振动能量采集器设计,引入VEHBench基准测试,评估大语言模型在耦合物理设计不同阶段的表现,通过763个任务及四个设计角色测试,发现模型能力依赖阶段,为评估、选择等工程大语言模型提供阶段感知基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17758 2026-07-21 cs.LG 新提交 79%

Towards Reliable Zero-Shot Crowd Forecasting: Evaluating Time Series Foundation Models for Special Event Pedestrian Forecasting

迈向可靠的零样本人群预测:评估用于特殊活动行人预测的时间序列基础模型

Ziteng Li, Yanan Xin, Tina Comes, Serge Hoogendoorn

机构 * Delft University of Technology (TU Delft)(代尔夫特理工大学) German Aerospace Center (DLR)(德国航空航天中心)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 研究特殊活动行人预测问题,采用预训练时间序列基础模型进行零样本概率预测,以SAIL2025事件为案例评估两个模型,为人群管理者明确零样本预测可靠的时机,助力特殊活动人群管理的运营决策。

Comments 9 pages, 7 figures, 5 tables. Accepted for presentation at IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22259 2026-07-21 cs.LG 版本更新 79%

Tabular Foundation Models Can Do Survival Analysis

表格基础模型也能进行生存分析

Da In Kim, Wei Siang Lai, Kelly W. Zhang

机构 * Department of Computing, Imperial College London(帝国理工学院计算机系) Department of Mathematics, Imperial College London(帝国理工学院数学系)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于分类的框架,通过将生存分析转化为二分类问题,使表格基础模型能够无需显式训练即可进行生存分析,并在多个数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏