arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2611 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2611 篇

2608.07490 2026-08-11 cs.HC cs.AI 新提交 85%

Experience-Sensitive Game Learning: A Behavioral Study of Humans and Language Agents

经验敏感型游戏学习:人类与语言智能体的行为研究

Yingying Guo, Zhuoxuan Ju, Ruibo Ming, Ruicheng Feng, Jinjin Gu

专题命中 评测与基准 :language agent(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究构建经验敏感型游戏学习框架,通过交互式游戏及相关指标分析人类与自进化语言智能体的游戏决策行为,发现人类会稳定转向全局策略,而自进化智能体的行为转变仍有局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05960 2026-08-07 cs.CV cs.AI 新提交 85%

Big, Bright, or Invisible: A Frozen-Feature Benchmark of 3D CT Foundation Models

大的、明亮的还是不可见的:3D CT基础模型的冻结特征基准测试

Maulik Chevli, Johannes Brandt, Rickmer Braren, Daniel Rueckert, Philip Müller

机构 * Technical University of Munich (TUM)(慕尼黑工业大学(TUM)) TUM University Hospital(慕尼黑工业大学医院) Imperial College London(伦敦帝国理工学院) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) UKE Hamburg(汉堡大学医院)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);prompting(abstract);分类 cs.AI

AI总结 本研究对10个冻结CT编码器开展基准测试,发现性能主要取决于异常的对比度与空间范围,小型低对比度病变仍是挑战,需区域或病变级预训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04899 2026-08-06 cs.CL 新提交 85%

Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification

基于大语言模型的分类置信度估计中的评估缺陷与稀疏性限制

Elena Merdjanovska, Omar Zaidan, Andreas Rücklé

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学) Amazon(亚马逊公司)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究指出 LLM 分类置信度估计中 verbalization 方法存在稀疏性缺陷,AUARC 评估的插值选择会影响排名,提出 verbalization logprobs 方法可解决稀疏性并提升 AUARC 且无额外推理成本。

Comments Published at Findings of ACL 2026

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 33424-33435

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03884 2026-08-05 cs.CV cs.CL 新提交 85%

BanglaWild: An In-the-Wild Bengali Scene Text Recognition Benchmark for OCR and Vision-Language Models

BanglaWild:面向OCR和视觉-语言模型的野外孟加拉语场景文本识别基准

Sadab Shiper, Tawsif Tashwar Dipto, Mir Md Inzamam, Eshat Tanzeem

专题命中 评测与基准 :language model(title);LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 研究发现现有孟加拉语场景文本识别基准的不足,推出含2535张图像的BanglaWild基准,评估15个VLMs和3个OCR系统等,揭示视觉误识别为主要错误来源等结论,代码数据将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03071 2026-08-05 cs.AI 新提交 85%

Getting the Parameters Right: A Difficulty-Graded Benchmark and Probe-Guided Training for LLM Tool Calls

参数优化:面向大语言模型工具调用的难度分级基准与探测引导训练

Guoyao Yu, Xiaoqing Sun, Ziqi Huang, Shaojing Fan, Zhongyi Zhang, Xiaomeng Hu, Xiaobo Xue, Yangyang Shi, Xiong Xiao, Yang Song, Biao Lyu, Rong Wen, Xing Li, Qinming He, Shunming Zhu, Zhenguang Liu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型工具调用参数填写关注度不足的问题,提出含PBT和PGR的探测引导框架,发布ParamBench基准,使5个开放模型在多基准上的参数生成平均精确匹配率从19.7%升至59.6%。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02444 2026-08-04 cs.AI 新提交 85%

ParEvalLayer: When Partial LLM-Agent Evaluations Support a Decision

ParEvalLayer:当部分大语言模型智能体评估支持决策时

Wei-Jung Huang, Bonan Shen

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究提出ParEvalLayer决策层,可基于部分任务结果判断LLM智能体比较结论,部分基准仅需15%-25%任务结果即可得出与完整评估一致的决策。

Comments Accepted at the 2026 ACM International Conference on AI-ML Systems (AIMLSystems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02171 2026-08-04 cs.AI 新提交 85%

From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents

从分析到综合:个性化大语言模型智能体中的隐式行为对齐基准测试

Jiajia Song, Bobo Li, Haiwen Yi, Zibo Ji, Meishan Zhang, Hao Fei, Min Zhang, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) University of Toronto(多伦多大学) University of Minnesota Twin Cities(明尼苏达大学双城分校) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) University of Oxford(牛津大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对大语言模型智能体的个性化问题,构建了IBA-Bench基准,提出IBA-Agent框架,实验显示其可在九类场景中提升隐式行为对齐效果,但有效个性化仍是重大挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00102 2026-08-04 cs.AI cs.MA 新提交 85%

Can LLM Agents Price Competitively? A Dynamic Multi-Attribute Auction Benchmark for Agentic Commerce

大语言模型智能体能否进行竞争性定价?面向智能体商务的动态多属性拍卖基准

Shimaa Ahmed, Yiwei Cai, Mohsen Minaei, Rahul Rachuri

机构 * Visa Research(维萨研究院)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究推出动态多属性拍卖基准Bazaar,测试11个前沿LLM智能体的定价能力,发现其在客户获取与利润表现上存在差异,需求冲击下排名变化,最强智能体仅获不到三分之一最优利润,显示仍有提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24588 2026-07-28 cs.AI 新提交 85%

SIREN: Towards End-to-End Extreme-Weather Early Warning with Experience-Grounded LLM Agents

SIREN:借助基于经验的大语言模型智能体实现端到端极端天气预警

Hang Ni, Weijia Zhang, Fan Liu, Mengqian Lu, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) The World Sustainable Development Institute(世界可持续发展研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究借助大语言模型智能体实现端到端极端天气预警。开发了包含多任务问答实例的SIREN-Bench基准,发现现有框架差距后,构建基于经验的SIREN框架,结合多种技术,实验证明其在预警程序和预警链上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22898 2026-07-28 cs.SE cs.CL 新提交 85%

AssumptionMiner: Extracting, Tracing, and Revising Implicit Assumptions in LLM Code Generation

假设挖掘器:在大语言模型代码生成中提取、追踪和修正隐式假设

Jie "JW" Wu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究LLMs代码生成中隐式假设问题,提出AssumptionMiner框架,能生成显式假设层并实现针对性代码再生。通过新基准测试评估,结果显示该框架提升了代码生成的透明度与可控性。

Comments 20 pages, 6 figures, 9 tables. Submitted to IEEE Transactions on Software Engineering. Replication package: https://doi.org/10.5281/zenodo.21535058

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22588 2026-07-28 cs.AI cs.DC 新提交 85%

ParBench: A Benchmark for Reliable Evaluation of LLM Parallel Code Translation

ParBench:用于可靠评估大语言模型并行代码翻译的基准测试

Samyak Jhaveri, Erel Kaplan, Tom Yotam, Le Chen, Tomer Bitan, Niranjan Hasabnis, Gal Oren

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型并行代码翻译缺乏可靠评估方法的问题,提出ParBench基准框架,通过声明性规范评估,涵盖多开源套件与跨API翻译方向,经源增强测试,揭示了当前并行代码翻译存在的如方向不对称等障碍。

Comments 57 pages, 22 figures, 11 tables; includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19506 2026-07-23 quant-ph cs.AI 新提交 85%

Hybrid LLM-Guided Search for Quantum Reservoir Architecture Design

用于量子储层架构设计的混合大语言模型引导搜索

Krishna Bhatia, Gautami Sanjay Naik

机构 * QuantumAI Lab, Fractal Analytics India(量子AI实验室,Fractal Analytics印度)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究量子储层计算架构设计问题,提出基于模拟器的基准测试\method,比较五种策略,其中\hybrid策略表现出色,在多任务中优于随机搜索,证明生成模型嵌入混合搜索循环可作高级控制器。

Comments 4 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11414 2026-07-14 cs.CL 新提交 85%

Confidently Wrong: Detecting Hallucinations in Financial Question Answering from LLM Internal States

自信地犯错:从大语言模型内部状态中检测金融问答中的幻觉

Richard Zhe Wang

机构 * St. John Fisher University(圣约翰费舍尔大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究金融应用中LLMs自信却错误答案(自信幻觉)的检测,通过在残差流训练线性探测器并在FinQA和TAT-QA基准评估,发现探测器检测幻觉优势明显,可作为经济高效分类机制用于高风险金融应用答案审查。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10112 2026-07-14 cs.CR cs.AI 新提交 85%

Minionese: Comprehensive Benchmark and Mechanistic Study of Multilingual LLM Safety

Minionese:多语言大语言模型安全性的综合基准测试与机理研究

Chigozirim Ifebi, Brent Kong, Ayushi Mehrotra

机构 * California Institute of Technology(加州理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多语言大语言模型安全对齐问题,引入涵盖多种语言、资源层级和扰动类型的Minionese基准测试及几何机理分析,发现不同攻击类型漏洞特征不同,指出仅英语安全评估不足,需考虑多因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07895 2026-07-10 cs.CL 新提交 85%

Scalable and Culturally Specific Stereotype Dataset Construction via Human-LLM Collaboration

通过人机协作构建可扩展的特定文化刻板印象数据集

Weicheng Ma, John Guerrerio, Soroush Vosoughi

机构 * Dartmouth(达特茅斯学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对大语言模型刻板印象研究多集中于英语语境的问题,引入人机协作标注框架构建西班牙语刻板印象数据集EspanStereo,验证框架有效性,揭示各国刻板行为差异,该框架可扩展用于多语言,拓宽了刻板印象分析范围并奠定跨文化偏见评估基础。

Comments Weicheng Ma, John Guerrerio: equal contribution; published in EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05704 2026-07-08 cs.LG cs.CV 新提交 85%

LLM-Driven Neural Network Generation with Same-Family Architecture Guidance: Disentangling Transfer and Adaptation

基于同家族架构指导的大语言模型驱动神经网络生成:区分迁移与适应

Kabir Dev Paul Baghel, Radu Timofte, Dmitry Ignatov

机构 * University of Würzburg(维尔茨堡大学) Computer Vision Lab, CAIDAS(计算机视觉实验室,CAIDAS)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究利用同家族强源模型改进弱目标模型,提出源引导候选生成协议,在CIFAR - 10和SVHN AlexNet等数据集上实验,结果表明该协议能显著提高准确性,且大语言模型是适应性改进而非复制,家族级分析有积极信号。

Comments 10 pages, 1 figure, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04329 2026-07-07 cs.AI 新提交 85%

HAS-Bench: Evaluating LLM-Based Human-Agent Systems under Configurable Human Participation

HAS-Bench:在可配置人类参与下评估基于大语言模型的人机系统

Yaozu Wu, Wei-Chieh Huang, Jizhou Guo, Dongyuan Li, Renhe Jiang, Henry Peng Zou, Chunyu Miao, Shanghao Li, Weizhi Zhang, WeiWei Ye, Yankai Chen, Meng Zhang, Xue Liu, Philip S. Yu

机构 * The University of Tokyo(东京大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) MBZUAI McGill University(麦吉尔大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 介绍基于图的HAS-Framework框架,在此基础上HAS-Bench在多方面可配置人类参与下评估人机系统,测量任务结果与协作行为,实验表明人类参与可提升任务完成等,但收益取决于参与方式等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04072 2026-07-07 cs.SE cs.AI quant-ph 新提交 85%

Benchmarking API Drift in LLM-Generated Quantum Code Across Successive SDK Versions

跨连续软件开发工具包版本对大语言模型生成的量子代码中的 API 漂移进行基准测试

Mohammad Arif Rasyidi, Syahirul Faiz

机构 * Department of Computer Science(计算机科学系) Khalifa University(卡利法大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型生成的量子代码能否可靠适配特定 SDK 版本(API 漂移问题),引入量子 API 漂移基准,以 Qiskit 为例评估 17 个模型,揭示版本对齐是量子代码生成评估新维度及 API 漂移恢复情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00309 2026-07-02 cs.SD cs.CL cs.HC eess.AS 新提交 85%

A Text-Steerable Instrument for Sketching Procedural Soundscapes via Language Models

一种通过语言模型驱动文本可操控的草图式程序化声景乐器

Prabal Gupta

机构 * Rama Labs(Rama实验室)

专题命中 评测与基准 :language model(title);LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 提出一种实时音乐界面,将自然语言场景描述转化为可演化的程序化声景,通过直接参数调整实现细粒度控制,并采用三种可互换后端生成连贯音频流。

Comments 10 pages, 7 figures, 2 tables. Accepted to the International Conference on New Interfaces for Musical Expression (NIME 2026), London, UK. Supplementary material included as an appendix. Code and demo: https://github.com/prabal-rje/latentscore

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31470 2026-07-01 cs.AI 新提交 85%

CLOUDADV: Decision-Aligned Instance Sizing with Zero-Shot Foundation Models under Drift

CLOUDADV: 漂移下基于零样本基础模型的决策对齐实例大小调整

Jack Bell, Giacomo Carfi, Gerlando Gramaglia, Andrea Simioni, Daniele Fontani, Vincenzo Lomonaco

机构 * University of Pisa(比萨大学) Independent Researcher(独立研究员) Sintra Consulting Limited(Sintra咨询有限公司) Luiss University(路易斯大学)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出CLOUDADV系统,结合零样本时间序列预测与有界推荐生成,在非平稳云环境中实现决策对齐的实例大小调整,通过参考推荐和成本节约评估,在7个生产VM案例中实现52.9%成本节省。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23285 2026-06-23 cs.CL cs.SD 新提交 85%

On the Effect of Segmentation Width and Cluster Size on Speech Resynthesis and Continuation in Generative Spoken Language Models

分割宽度和聚类大小对生成式口语语言模型中语音合成与延续的影响

Shunsuke Kando, Wataru Nakata, Shinnosuke Takamichi, Yusuke Miyao

机构 * The University of Tokyo(东京大学) Keio University(庆应义塾大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究使用离散语音表示在不同比特率下进行语音合成与延续的性能,发现较低比特率仍能生成可理解自然的语音,且延续质量稳定,表明传统设置可能冗余。

Comments Accepted to Interspeech2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18190 2026-06-17 cs.CR cs.LG 新提交 85%

Multi-Source Cybersecurity Logs: An ATT&CK-Labeled Dataset and SLM Evaluation

多源网络安全日志:一个ATT&CK标记数据集及小语言模型评估

Abir Ashab Niloy, Ahmed Ryan, Imamul Hossain Rafi, Md Erfan, Md Rayhanur Rahman

机构 * Windows endpoints(Windows终端)

专题命中 评测与基准 :SLM(title,abstract_cn);language model(abstract);small language model(abstract);分类 cs.LG

AI总结 为解决多阶段网络攻击检测中缺乏带ATT&CK技术标签的多源日志数据集问题,构建了包含870个会话(70个攻击、800个良性)和约230万事件的多源日志数据集,并基于该数据集微调三个小语言模型,在分块分类任务上准确率从约8%提升至90%-97%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14388 2026-06-15 cs.LG 新提交 85%

A Low-Rank Subspace Analysis of LLM Interventions

LLM干预的低秩子空间分析

Angira Sharma, Christian Schroeder de Witt, Philip Torr, Anisoara Calinescu, Jialin Yu

机构 * University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 提出诊断框架,将行为建模为激活空间中的低秩子空间,发现干预一个行为会不对称地影响其他行为,效果与子空间重叠和决策子空间角度相关。

Comments Mechanistic Interpretability Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13247 2026-06-12 cs.AI 新提交 85%

EPIG: Emotion-Based Prompting for Personalised Image Generation

EPIG:基于情感提示的个性化图像生成

Emna Othmen, Mohamed Yassine Landolsi, Lotfi Ben Romdhane

机构 * MARS Research Lab LR17ES05, ISITCom, University of Sousse(苏塞大学ISITCom学院MARS研究实验室LR17ES05)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出EPIG方法,利用心理学效价-唤醒模型在提示层面增强情感表达,无需训练即可控制生成图像的唤醒度,在10个多样化提示上平均唤醒误差降低14%-17%。

Comments Submitted to arXiv. 20 pages, 4 figures. Work on emotion-based prompt engineering for text-to-image diffusion models with applications in personalized image generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13380 2026-06-12 quant-ph cs.AI 新提交 85%

An LLM System for Autonomous Variational Quantum Circuit Design

用于自主变分量子电路设计的大语言模型系统

Kenya Sakka, Wataru Mizukami, Kosuke Mitarai

机构 * Center for Quantum Information and Quantum Biology(量子信息与量子生物学中心) The University of Osaka(大阪大学) Graduate School of Engineering Science(工学研究科)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一个基于大语言模型的自主代理框架,通过迭代设计量子电路,在量子特征映射和变分量子本征求解器任务中取得优于或媲美现有方法的性能。

Comments 63 pages, 19 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09435 2026-06-09 cs.CL 新提交 85%

MUDIDI: A Two-Stage Framework for Multilingual Dictionary Digitization with Language Models

MUDIDI:一种基于语言模型的多语言词典数字化两阶段框架

David Setiawan, Temuulen Khishigsuren, Milind Agarwal, Pagnarith Pit, Aso Mahmudi, Ekaterina Vylomova

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院) Melbourne School of Psychological Sciences, The University of Melbourne(墨尔本大学墨尔本心理科学学院) LILT

专题命中 评测与基准 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL

AI总结 提出MUDIDI两阶段框架,结合语言模型实现多语言词典数字化,在字符识别、标记保留和词条分割上优于现有OCR和视觉语言模型,并发布30本公共领域词典的标注数据集。

Comments 9 pages, preprint, submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07978 2026-06-09 cs.CL 新提交 85%

MechLens: Late Crystallization of Factual Knowledge Explains Intervention Effectiveness in Language Models

MechLens:事实知识的晚期结晶解释语言模型中的干预有效性

Xueping Gao

机构 * Alibaba Cloud(阿里云)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);language model(title);分类 cs.CL

AI总结 本文发现LLM中的事实知识在最后层突然“结晶”,而非逐层涌现,并基于此提出结晶引导的干预原则,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06881 2026-06-08 cs.LG 新提交 85%

GlucoFM-Bench: Benchmarking Time-Series Foundation Models for Blood Glucose Forecasting

GlucoFM-Bench:血糖预测的时间序列基础模型基准测试

Baiying Lu, Zhaohui Liang, Ryan Pontius, Shengpu Tang, Temiloluwa Prioleau

机构 * Department of Computer Science(计算机科学系) Dartmouth College(达特茅斯学院) Emory University(埃默里大学) Quantitative Biomedical Sciences(定量生物医学科学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出GlucoFM-Bench基准,评估8种时间序列基础模型与监督深度学习模型在15个糖尿病数据集上的血糖预测性能,发现预训练模型在零样本和少样本场景表现优异,但全样本下轻量LSTM仍最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10475 2026-08-12 cs.AI cs.CL cs.GT 新提交 85%

Evaluating Rational Contracting in Natural Language

评估自然语言中的理性缔约

Bhavyesh Sajja, Max Kleiman-Weiner, Roger Zimmermann, Tan Zhi-Xuan

专题命中 评测与基准 :LLM(summary_cn,abstract);language agent(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对自然语言缔约的评估缺口,构建理性框架并开发ContractSim评估套件,发现当前LLM智能体在高不确定性下缔约及执行协议存在不足,为相关智能体设计指明改进方向。

Comments 9 pages, 5 figures, 2 tables (Appendix: 34 pages, 6 figures, 9 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08822 2026-08-11 cs.AI cs.CL 新提交 85%

Automated Generation of Complexity-Validated Decision Scenarios Using Large Language Models

利用大语言模型自动生成经复杂度验证的决策场景

Abdalla Doleh, Toni Somers, Ratna Babu Chinnam

机构 * Wayne State University(韦恩州立大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本研究针对手动生成决策场景的缺陷,开发了基于大语言模型的自动化流水线,生成并验证了4238个多领域场景,证实其具备良好心理测量学特性,可用于AI系统认知评估。

Comments 38 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏