arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2707 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2707 篇

2608.06663 2026-08-10 cs.CL 新提交 79%

The Horizon Gap: Planning, Memory, Execution, Training, and Evaluation for Long-Horizon LLM Agents

视界差距:长视界大语言模型智能体的规划、记忆、执行、训练与评估

Mingguang Chen, Licheng Wang, Bo Qu

机构 * DeepGrounding(深地研究机构) AlphaAvatar(阿尔法 Avatar 公司)

专题命中 评测与基准 :LLM(title);language model(abstract);分类 cs.CL

AI总结 本文提出长视界大语言模型智能体存在的视界差距,调研1547篇相关论文,厘清长视界等属性,分析领域应对措施并提出开放测量问题。

Comments 39 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06361 2026-08-07 cs.AI 新提交 79%

The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping

低频陷阱:视频语言模型在简单事件记录上的失败

Sarvesh Baskar, Zikui Cai, Shayan Shabihi, Anirudh Satheesh, Muhammad R. Islam, Udari Madhushani Sehwag, Tom Goldstein, Furong Huang

专题命中 评测与基准 :language model(title);prompting(abstract);分类 cs.AI

AI总结 该研究提出基于轨迹的参数化分析方法,发现视频语言模型Gemini 3.6 Flash在高数量、高频率事件计数上表现极差,额外帧和提示策略难以解决问题,推动视频评估转向时间推理故障诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04975 2026-08-06 cs.SE cs.AI 新提交 79%

SciCode-Verified: How Benchmark Defects Underestimated the Scientific-Coding Ability of Language Models

SciCode-Verified:基准缺陷如何低估了语言模型的科学编码能力

Sihan Hu, Lyuhan Huang, Youjin Deng, Kun Chen

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 该研究发现SciCode基准存在大量缺陷,导致语言模型科学编码能力被低估,修正后重新评估显示模型准确率大幅提升,瓶颈在于评估工具而非模型能力。

Comments 47 pages, 2 figures, 6 tables. Project repository: https://github.com/flyingwagner/scicode-verified

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04792 2026-08-06 cs.LG 新提交 79%

Above-ground Biomass Estimation with Geospatial Foundation Models

基于地理空间基础模型的地上生物量估算

Ghjulia Sialellia, Linus Scheibenreif, Jan Dirk Wegner, Konrad Schindler

机构 * ETHZ(苏黎世联邦理工学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文构建地理空间基础模型用于全球地上生物量估算的综合基准,发现预计算嵌入产品表现优异,基于AlphaEarth Foundations嵌入训练的模型性能优于当前最优的监督模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00608 2026-08-04 cs.LG 新提交 79%

From field-scale to large-scale spectral libraries: Tabular foundation models in soil spectroscopy

从田间尺度到大规模光谱库:土壤光谱学中的表格基础模型

Viacheslav Barkov, Jonas Schmidinger, Robin Gebbers, Martin Atzmueller

机构 * Osnabrück University(奥斯纳布吕克大学) Leibniz Institute for Agricultural Engineering and Bioeconomy (ATB)(莱布尼茨农业工程与生物经济研究所) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 该研究针对土壤光谱预测难题,对比多种模型与降维方法,发现结合偏最小二乘潜在变量的表格基础模型TabPFN在田间及大规模光谱库任务中表现最优,为光谱校准模型选择提供了循证指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29445 2026-08-03 cs.CV cs.AI 新提交 79%

QR-Structured Thermal Triggers for Targeted Semantic Attacks on Infrared Vision-Language Models

用于红外视觉语言模型定向语义攻击的QR结构化热触发装置

Xiang Chen, Yingying Zhao, Chao Li, Jiaju Han, Ben Zhang, Ang Li, Jiahuan Long, Yiwei Wei, Jiujiang Guo, Chengyin Hu

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本研究提出QR-STT框架,作为隐蔽黑盒攻击手段,可定向操控IR-VLMs的语义对齐,其扰动还能跨任务迁移,凸显了对该类攻击进行鲁棒性评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28007 2026-07-31 cs.CV cs.AI 新提交 79%

Beyond Classification: Pathology Foundation Models as Detection Encoders for Mitotic Figures

超越分类:病理学基础模型作为有丝分裂图的检测编码器

Sweta Banerjee, Alireza Teimoury, Nils Porsche, Alexandra K. Stoll, Viktoria Weiss, Niklas Hargarter, Jonas Ammeling, Thomas Conrad, Christoph Stroblberger, Christopher Kaltnecker, Robert Klopfleisch, Christof A. Bertram, Katharina Breininger, Marc Aubreville

机构 * Flensburg University of Applied Sciences(弗伦斯堡应用科学大学) University of Veterinary Medicine, Vienna(维也纳兽医大学) Freie Universität Berlin(柏林自由大学) Technische Hochschule Ingolstadt(英戈尔施塔特应用技术大学) Medical University of Vienna(维也纳医科大学) Julius-Maximilians-Universität Würzburg(维尔zburg大学) Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡弗里德里希-亚历山大大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 本研究将多种病理学基础模型作为骨干网络,结合不同类型检测器在MIDOG++和TUPAC16数据集上验证其用于有丝分裂图检测的性能,发现H-optimus-0和Virchow模型表现具竞争力,相关代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25814 2026-07-29 cs.CL cs.CR 新提交 79%

Evaluation of Adversarial Robustness in Arabic Language Models

阿拉伯语语言模型中的对抗鲁棒性评估

Anwar Alajmi, Ayed Salman, Imtiaz Ahmad

机构 * Kuwait University(科威特大学) College of Business Studies, Public Authority of Applied Education and Training(应用教育与培训公共管理局商业研究学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 研究评估五个先进阿拉伯语语言模型在不同攻击下的鲁棒性,探索对抗训练防御技术,发现不同攻击对模型准确率影响各异,对抗训练提升了整体弹性,但面对字符级噪声仍有挑战,凸显了当前防御策略在阿拉伯语中的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24810 2026-07-29 cs.AI eess.IV 新提交 79%

RRS-10K: A Multitask Vision-Language Model Benchmark for Rare Remote Sensing Image Interpretation

RRS-10K:用于罕见遥感图像解释的多任务视觉语言模型基准测试

Yuqiao Lai, Jiancheng Qi, Fei Wang, Yuxin Liu, Kun Li, Ye Chen, Yan Gao, Yanyan Wei

机构 * Laboratory of Intelligent Language Processing, National University of Defense Technology(国防科技大学智能语言处理实验室) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) United Arab Emirates University(阿联酋大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 针对视觉语言模型在罕见遥感图像解释能力不足的问题,提出RRS-10K基准测试,含军事遥感图像及问答对,构建时引入干扰项过滤策略,评估多个模型,揭示其性能弱点,为开发更可靠的遥感视觉语言模型提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24763 2026-07-29 cs.AI 新提交 79%

CaRE Compute-aware Remasking Evaluation Protocol for Masked Diffusion Language Models

用于掩码扩散语言模型的计算感知重掩码评估协议

Yash Shah, Abhijit Chakraborty, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) MongoDB(MongoDB公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究针对掩码扩散语言模型评估标准不完善的问题,提出计算感知评估框架CaRE,通过标准化函数评估实际数量等方法审核重掩码策略,应用于多种模型和数据集,揭示了温度、计算匹配等因素对评估的影响,发布相关内容确保评估可重复可比。

Comments updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24707 2026-07-28 cs.AI cs.CV cs.DB 新提交 79%

ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams

ERUnderstand:在结构化实体关系图上评估视觉语言模型

Ali Ansari, Yasmin Mohammadi, Farnoush Nili, Parsa Esmaeilkhani, Longin Jan Latecki, Eduard Dragut

机构 * Temple University(天普大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究针对实体关系图仅为图像限制AI辅助数据库工程的问题,引入ERUnderstand基准测试。通过对2960个图表及标准化表示评估视觉语言模型,发现常见元素恢复良好,但特定元素性能差,推理增强模型可提升性能,为评估多模态理解提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22658 2026-07-28 cs.AI cs.SD eess.AS 新提交 79%

StanceBench: A Benchmark for Audio LLM-Based Interpersonal Stance Evaluation from Speech

StanceBench:一个基于音频大语言模型的语音人际立场评估基准

Yuzhe Wang, Thomas Thebaud, Jennifer Hu, Jesús Villalba-Lopez, Venkatesh Ravichandran, Georgi Tinchev, Najim Dehak, Laureano Moro-Velázquez

机构 * Johns Hopkins University(约翰斯·霍普金斯大学) Amazon AGI(亚马逊通用人工智能公司) Amazon Research(亚马逊研究院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究基于音频大语言模型的语音人际立场评估,引入StanceBench基准,通过Seamless Interaction语料库规范评估,明确9个立场维度,报告大语言模型评判的多项指标,指出不同立场的判断难易及特点。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22600 2026-07-28 cs.AI 新提交 79%

Chart Deception in Vision-Language Models: From Vulnerability to Mitigation

视觉语言模型中的图表欺骗:从漏洞到缓解

Ridwan Mahbub, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Mizanur Rahman, Mir Tafseer Nayeem, Enamul Hoque

机构 * York University(约克大学) University of Alberta(阿尔伯塔大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究视觉语言模型对图表欺骗的鲁棒性,引入VisDeception基准和欺骗分数,发现模型易受影响,提出推理时多智能体缓解框架,揭示可靠性差距,确立相关评估及推理方向以开发更可信的视觉分析VLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22520 2026-07-27 cs.AI 新提交 79%

The Regression Tax: Decomposing Why Skills Help and Hurt LLM Agents

回归税:剖析技能对大语言模型智能体产生帮助和伤害的原因

Darshan Tank, Baran Nama

机构 * Sentient Labs(森蒂恩实验室)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究剖析大语言模型智能体中技能产生帮助和伤害的原因,通过对比实验区分回归和残余失败两种结果,识别出回归的三个原因,发现现有技能过度强调程序指导,指出应分解技能净效应评估,还识别出应避免的回归模式及可靠性的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22264 2026-07-27 cs.LG 新提交 79%

Autoregressive EHR Foundation Models with Multimodal Inputs

具有多模态输入的自回归电子健康记录基础模型

Yuxuan Liu, Joshua Placidi, Jinpei Han, Alfred John Balston, Marek Rei, A. Aldo Faisal

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 研究在自回归电子健康记录基础模型中纳入多模态的方法,通过特定模态潜在压缩和门控交叉注意力框架,研究压缩单模态序列及预训练编码器选择对性能的影响,实验表明精心设计架构及临床评估的必要性。

Comments 5 pages excluding references and supplements, 2 figures and 2 tables, Proceedings of the Workshop on Structured Data for Health at the 43rd International Conference on Machine Learning, Seoul, South Korea

Journal ref ICML2026 workshop on Structured Data for Health (SD4H)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19383 2026-07-23 stat.AP cs.LG 新提交 79%

Trend strength predicts when generative foundation models win: a power-controlled benchmark, a mechanism, and an actionable selection rule

趋势强度预测生成式基础模型何时获胜:功率控制基准、机制及可操作的选择规则

Ahmed Cherif

机构 * National School of Computer Sciences (ENSI), University of Manouba, Manouba, Tunisia(突尼斯曼努巴大学计算机科学国家学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 研究预训练生成式基础模型,通过功率控制研究、受控合成实验等得出结果,表明其优势与趋势强度有关,趋势强度可作为先验指标指导基础模型部署,还记录了校准不足。

Comments 12 pages, 6 figures. Code and per-forecast data released

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20194 2026-07-23 cs.LG 新提交 79%

OLEDLM: A Unified Language Model for OLED Molecular Design

OLEDLM:用于OLED分子设计的统一语言模型

Fukang Wen, Yuchong Tang, Jingyuan Li, Beichen Wang, Yixuan Jiang, Xiaoyi Jiang, Yaxuan Liu, Shunyu Wang, Zuoqiang Shi, Yi Zhu, Yanan Zhu, Pipi Hu

机构 * Tsinghua University(清华大学) Beijing Institute of Mathematical Sciences and Applications(北京应用数学科学研究院) Wuhan University(武汉大学) Shenzhen MSU-BIT University(深圳莫斯科国立大学与北京理工大学联合大学) MathonAI Team(MathonAI团队)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 研究针对OLED分子设计面临的挑战,提出基于因果语言模型的逆分子设计框架,采用多阶段策略,经基础模型建立、属性预测器微调、强化学习等,最终能有效探索OLED化学空间,生成新候选物。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19400 2026-07-23 cs.LG q-bio.GN 新提交 79%

Predictive single cell foundation model for gene regulation and aging with privacy-preserving tabular learning

用于基因调控和衰老的具有隐私保护表格学习的预测性单细胞基础模型

Jiayuan Ding, Jianhui Lin, Ziyang Miao, Nils Mechtel, Shiyu Jiang, Yixin Wang, Zhaoyu Fang, Jorge D. Martin-Rufino, Chen Weng, Reuben Saunders, Weize Xu, Jonathan S. Weissman, Min Li, Jiliang Tang, Wei Ouyang, Yuancheng Ryan Lu, Xiaojie Qiu

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 研究针对单细胞数据独特表格结构及隐私问题,提出用联邦学习设计的Tabula模型,开发Chiron平台。该模型在下游基准测试表现出色,揭示调控逻辑,提名年轻化因子,推动单细胞基础建模发展,迈向隐私保护虚拟细胞。

Comments 98 pages, 4 main figures, and 15 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19381 2026-07-23 cs.LG 新提交 79%

Air Quality Arena: A Large-Scale Multi-Region Ground Monitoring Dataset and Benchmark for Air Quality Forecasting with Time-Series Foundation Models

空气质量竞技场:一个大规模多区域地面监测数据集以及基于时间序列基础模型的空气质量预测基准

Rishi Bharadwaj, Manik Gupta, Pandarasamy Arjunan

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 研究针对现有空气质量预测基准不足,提出空气质量竞技场(AQA),它是含多国多污染物的数据集及基准。通过在11个模型和基线测试,表明时间序列基础模型是有效零样本预测器,表现最佳的模型采用跨模态架构,AQA已公开发布。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19375 2026-07-23 cs.CY cs.AI 新提交 79%

Economic Evaluations of Language Models

语言模型的经济评估

Alexander Wan, Stephane Hatgis-Kessell, Tomás Aguirre, Percy Liang, Rishi Bommasani

机构 * Stanford University(斯坦福大学) University of São Paulo(圣保罗大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究语言模型在经济价值任务上的表现,通过EconEvals开源套件评估,结合真实用户查询与合成数据,成本低且覆盖度好,还引入暴露度量估计时间节省情况,发现当前模型有潜力但存在使用滞后及隐私等瓶颈,引入基础设施推断其对劳动力市场的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19366 2026-07-23 cs.AI 新提交 79%

Geometry-Guided Constraint Learning for LLM Safety Classification

用于大语言模型安全分类的几何引导约束学习

Fumiaki Uehara, Koo Imai, Masato Tsutsumi, Keigo Kansa, Sora Usui, Yuki Kobiyama

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究大语言模型安全分类,利用稀疏自动编码器特征提取解决安全多面体中约束数量调整问题,在Qwen3.5 - 9B上对部分类别K = 2最优,准确率达96 - 99%,基于几何观点引入锥约束并经三阶段训练稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19356 2026-07-23 cs.AI 新提交 79%

NEXUS: Structured Runtime Safety for Tool-Using LLM Agents

NEXUS:工具使用型大语言模型智能体的结构化运行时安全

Elias Hossain, Md Mehedi Hasan Nipu, Tasfia Nuzhat Ornee, Rajib Rana, Niloofar Yousefi

机构 * University of Central Florida(中佛罗里达大学) North South University(南北大学) University of Southern Queensland(南昆士兰大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究工具使用型大语言模型智能体运行时安全问题,提出NEXUS结构化计划安全监控器,结合多种方法进行分级升级。在多个基准测试中表现出色,如合成基准测试F1分数达0.949等,还具有低延迟、低开销特点,相关成果已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18826 2026-07-22 cs.CR cs.AI 新提交 79%

Cross-Agent Campaign Attribution: Linking Asynchronous Attacks Across LLM Agents

跨智能体活动归因:关联大语言模型智能体间的异步攻击

SangJin Park, Myungsub Choi, Jineok Kim, Minseung Kang

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究跨大语言模型智能体的异步攻击归因问题,提出异步归因指纹向量($A^2FV$)协议,构建SCD-v1基准,实验表明$A^2FV$在活动关联上表现良好,确立跨智能体活动归因作为保护大语言模型智能体的独特评估层。

Comments 22 pages, 5 figures. Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18659 2026-07-22 cs.CR cs.AI cs.MA 新提交 79%

Broken Gates: Re-evaluating Web Bot Defenses in the Age of LLM Agents

破碎的大门:在大语言模型代理时代重新评估网络机器人防御

Behzad Ousat, Nikita Turkmen, Lalchandra Rampersaud, Dillan Bailey, Amin Kharraz

机构 * Florida International University(佛罗里达国际大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究在大语言模型代理时代网络机器人防御的有效性,通过系统测量研究评估基于交互式挑战与非交互式信任的防御对商业验证码解决服务和大语言模型代理的弹性,发现非交互式防御安全边界在环境层,影响机器人管理系统设计评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18261 2026-07-22 cs.AI 新提交 79%

When JSON Is Not Enough: Semantic Reliability of Schema-Constrained LLM Ordering Agents

当JSON不足够时:模式约束的大语言模型排序代理的语义可靠性

Yin Li

机构 * University of Birmingham(伯明翰大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究大语言模型代理作事务编译器时JSON模式等结构化输出的语义可靠性问题,引入OrderBench基准,通过对四个开放模型测试发现模式有效输出仍有语义错误率,强调结构化输出是必要接口层,不能替代域验证和故障封闭执行。

Comments 7 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18255 2026-07-22 cs.AI 新提交 79%

Semantic Cooperative Games for Contribution Attribution in LLM-Based Multi-Agent Systems

基于大语言模型的多智能体系统中用于贡献归因的语义合作博弈

Pengyi Jiang, Xiaoguang Zhu, Quanyan Zhu

机构 * New York University(纽约大学) University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 针对基于大语言模型的多智能体系统贡献归因问题,提出语义合作博弈框架,定义语义夏普利值,介绍单轨迹算法SLIC,在特定基准测试中大幅降低计算成本,在多角色工作流程中表现良好,为复杂系统提供快速、无反事实且可解释的归因方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18181 2026-07-21 cs.CL cs.SE 新提交 79%

VEHBench: A Stage-Local Diagnostic Benchmark for LLM-Assisted Vibration Energy Harvester Design

VEHBench:用于大语言模型辅助振动能量采集器设计的阶段局部诊断基准测试

Depeng Su, Yuyu Luo, Guobiao Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 研究针对无电池物联网中振动能量采集器设计,引入VEHBench基准测试,评估大语言模型在耦合物理设计不同阶段的表现,通过763个任务及四个设计角色测试,发现模型能力依赖阶段,为评估、选择等工程大语言模型提供阶段感知基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17758 2026-07-21 cs.LG 新提交 79%

Towards Reliable Zero-Shot Crowd Forecasting: Evaluating Time Series Foundation Models for Special Event Pedestrian Forecasting

迈向可靠的零样本人群预测:评估用于特殊活动行人预测的时间序列基础模型

Ziteng Li, Yanan Xin, Tina Comes, Serge Hoogendoorn

机构 * Delft University of Technology (TU Delft)(代尔夫特理工大学) German Aerospace Center (DLR)(德国航空航天中心)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 研究特殊活动行人预测问题,采用预训练时间序列基础模型进行零样本概率预测,以SAIL2025事件为案例评估两个模型,为人群管理者明确零样本预测可靠的时机,助力特殊活动人群管理的运营决策。

Comments 9 pages, 7 figures, 5 tables. Accepted for presentation at IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14167 2026-07-17 cs.SE cs.AI 新提交 79%

Structured Feedback Improves Repair in an LLM Agent Loop

结构化反馈改进大语言模型智能体循环中的修复

Jaideep Ray, Ankit Goyal

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究大语言模型智能体验证与调用接口问题,提出VeriHarness代码控制智能体循环。通过比较原始诊断与含失败位置等信息的反馈,发现含三个字段反馈能大幅提升成功率,多数增益源于可接受替代方案,JSON语法本身对修复无显著作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13477 2026-07-16 cs.SD cs.CL eess.AS 新提交 79%

Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation

大型音频语言模型语音评估中协议级捷径的审计

Joonyong Park, David M. Chan, Yuki Saito, Hiroshi Saruwatari

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 研究大型音频语言模型语音评估中协议级捷径,通过对三种部署协议审计发现多个LALM依赖此类捷径,如特征蓝图评判中错误标签影响准确率,拼接A/B比较有固定选择倾向,强调联合评估模型与协议及用匹配探针评估的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏