arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-22 至 2026-07-22 共收录 251 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 63 篇

2607.18983 2026-07-22 cs.CL cs.AI cs.HC 新提交 84%

AutoJourn: Multi-Perspective Summarisation, Bias Detection and Bias Neutralisation for LLM-Generated News in Automated Journalism

AutoJourn:自动新闻中基于大语言模型生成的新闻的多视角摘要、偏差检测与偏差中和

Himel Ghosh, Ahmed Mosharafa, Georg Groh

机构 * Technical University of Munich(慕尼黑工业大学) Sapienza University of Rome(罗马第一大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AutoJourn系统旨在应对自动新闻中多视角新闻生成及偏差问题,通过整合提示工程与检索增强等,产生多样视角集,经多视角摘要模块和偏差分析套件,实现不同视角提取、平衡摘要生成及偏差检测与中和,评估显示其优于基线且保持内容保真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05554 2026-07-22 cs.CL cs.AI 版本更新 84%

Prompt Robustness Is Task-Dependent: Comparing Objective and Belief-Style Questions in LLM Evaluation

提示鲁棒性取决于任务:在大语言模型评估中比较客观和信念风格问题

Sadia Kamal, Arefa Patwary, Anthony Marchiafava, Sagnik Ray Choudhury, Atriya Sen

机构 * Oklahoma State University(俄克拉荷马州立大学) University of North Texas(北德克萨斯大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型评估中提示鲁棒性,比较客观与主观问题,在多个数据集上评估四个模型家族,通过多种提示更改及特定方程分析,发现提示鲁棒性取决于问题类型、提示变化和模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24592 2026-07-22 cs.CV 版本更新 83%

GH-ESD: Grounded Hypothesis-Driven Error Slice Discovery for Instance-Level Vision Tasks

GH-ESD:基于假设驱动的实例级视觉任务错误切片发现

Wei Zhang, Chaoqun Wang, Zixuan Guan, Ping Sheng Kao, Pengfei Zhao, Peng Wu, Sifeng He

机构 * Apple(苹果公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract)

AI总结 提出GH-ESD框架,通过LLM生成假设与视觉语言模型验证,在实例级任务中自动发现空间关系错误切片,并构建GESD基准,显著提升检测和分割任务的错误切片发现精度。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18819 2026-07-22 cs.CV 新提交 82%

In-Context Learning for Wound Classification with Small Multimodal Language Models

使用小型多模态语言模型进行伤口分类的上下文学习

George Martvel, Oskar Gustafsson, John Pavia, Ernst Ahlberg

机构 * Jönköping University(延雪平大学) Halmstad University(哈尔姆斯塔德大学) Mölnlycke Health Care(墨尼克医疗保健公司) Centre for Reliable Machine Learning, Royal Holloway, University of London(伦敦大学皇家霍洛威学院可靠机器学习中心)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract)

AI总结 研究评估小型多模态语言模型能否通过基于检索的上下文学习为伤口分类提供免训练替代方案,使用两个数据集和多种方法实验,结果显示查询条件下的上下文学习效果较好,Qwen 3.5 27B搭配kNN+MMR表现最佳,该方法可实现适应性伤口图像分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18665 2026-07-22 cs.AI 新提交 81%

SciHazard: A Benchmark for Measuring Scientific Safety Risks with Decomposed Harm Scoring

SciHazard:一种通过分解危害评分来衡量科学安全风险的基准

Chunxiao Li, Yuan Xiong, Lijun Li, Tianyi Du, Wenlong Zhang, Lei Bai, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大型语言模型可能传播有害科学知识的问题,引入SciHazard基准及评估框架,含多学科问题。开发分解评估程序计算DeHarm-Score,经专家验证和模型测试,显示该方法能有效衡量风险,还发现深度研究代理存在安全盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18252 2026-07-22 cs.AI cs.NE 新提交 81%

MILP-Evo: Closed-Loop Fully Automatic Design of MILP Solvers

MILP-Evo:混合整数线性规划求解器的闭环全自动设计

Jinbiao Nie, Kewei Feng, Xiaoyuan Zhang, Shan Yin, Zizhuo Wang, Bin Dong

机构 * BUPT(北京邮电大学) BZA(未提及具体中文名,推测可能是某个机构简称) BIT(北京理工大学) CUHK-Shenzhen(香港中文大学(深圳)) PKU(北京大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究能否将MILP求解器逻辑自动设计为LLM引导的闭环搜索,提出闭环程序演化框架,通过PySCIPOpt实现,在割集选择器和分支规则联合设计上实例化,输出可检查修改部署的组件,在多基准测试中发现有竞争力的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18246 2026-07-22 cs.AI cs.SE 新提交 81%

Phionyx: A Deterministic AI Runtime Architecture with Structured State Management and Pre-Response Governance

Phionyx:一种具有结构化状态管理和响应前治理的确定性人工智能运行时架构

Ali Toygar Abak

机构 * Phionyx Research(Phionyx研究公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究提出Phionyx确定性人工智能运行时架构,源于Echoism框架,以治理为先。通过结构化状态向量实现确定性状态演化,集成三层架构。实验验证其在单实例部署中可降低计算开销、提高数据保留率,还介绍了架构及实验证据,分布式或多租户部署待后续研究。

Comments 27 pages, 4 figures, 5 tables. Reference implementation, reproducibility pack, and evaluation artifacts available via GitHub (https://github.com/halvrenofviryel/phionyx-research) and Zenodo (DOI: 10.5281/zenodo.20027534)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06936 2026-07-22 cs.AR cs.AI cs.MA 版本更新 81%

Bridging the Last Mile of Circuit Design: PostEDA-Bench, a Hierarchical Benchmark for PPA Convergence and DRC Fixing

跨越电路设计的最后一英里:PostEDA-Bench,一个用于PPA收敛和DRC修复的分层基准

Pengju Liu, Nuo Xu, Jinwei Tang, Yu Cao, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出PostEDA-Bench分层基准,包含145个任务,覆盖DRC修复和PPA优化,实验发现现有LLM代理在复杂DRC推理和多目标PPA优化上表现不佳,视觉增强可提升DRC性能,权衡推理是PPA多目标瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13024 2026-07-22 cs.CL 版本更新 81%

Tears or Cheers? Benchmarking LLMs via Culturally Elicited Distinct Affective Responses

眼泪还是欢呼?通过文化诱发的差异情感反应基准测试LLMs

Chongyuan Dai, Yaling Shen, Zihan Gao, Jia Li, Yishun Jiang, Yaxiong Wang, Liu Liu, Zongyuan Ge, Jinpeng Hu

机构 * Hefei University of Technology(合肥工业大学) Monash University(墨尔本大学) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CEDAR基准,通过文化诱发的差异情感反应评估LLMs,揭示语言一致性和文化契合度之间的脱节,展示文化根植的情感理解仍是模型的重大挑战。

Comments ACL 2026 SAC Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18454 2026-07-22 cs.LG cs.AI 新提交 81%

Estimating Rare Events in Language Models with Proper Evaluation

用适当评估估计语言模型中的罕见事件

Nikita Y. Parulekar, Anqi Liu

机构 * Johns Hopkins University(约翰·霍普金斯大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究语言模型中罕见事件概率估计难题,提出梯度激活自适应多级分裂方法及移位幂布雷格曼损失,通过实验揭示偏差 - 方差权衡,强调估计器与部署上下文匹配,确立激活空间为易处理域。

Comments 37 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18305 2026-07-22 cs.LG cs.AI 新提交 81%

The Information Shadow: Measuring Structural Limits on What Language Models Can Learn

信息阴影:衡量语言模型学习的结构限制

Priyansh Srivastava, Romit Chatterjee

机构 * Sirena Ai(Sirena人工智能公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究语言模型学习的结构限制,引入信息阴影概念,包含语言无法表达的结构等三类。通过语言压缩残差等探针测试,揭示不同类型限制,发布探针套件并探讨其对基准设计等方面的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11945 2026-07-22 cs.CL cs.LG 版本更新 81%

Belief-reality separation lives in routing over a shared value slot in language models

信念与现实的分离存在于语言模型中共享值槽的路由中

Oliver Steele, Jiangtao Wen, Yuxing Han

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究语言模型中信念与现实分离的位置,核心方法是通过通用值槽和查询位置路由器,表明其基于两个可分离机制处于两个位置,结果在三种架构及多个模型家族成立,深入研究了信念 - 现实轴且该格式在多语境共享。

Comments 21 pages, 6 figures, 6 tables. v2: cite the released Mental Spaces Corpus (dataset DOI); switch to ACL bibliography style; minor copy-editing. No change to results

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06931 2026-07-22 cs.CV cs.AI cs.CL 81%

Measuring Social Bias in Vision-Language Models with Face-Only Counterfactuals from Real Photos

通过真实照片生成面部-only反事实来衡量视觉语言模型中的社会偏见

Haodong Chen, Qiang Huang, Jiaqi Zhao, Qiuping Jiang, Xiaojun Chang, Jun Yu

机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) School of Information Science and Engineering, Ningbo University(宁波大学信息科学与工程学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过真实照片生成面部-only反事实来评估视觉语言模型中的社会偏见,构建了FOCUS数据集和REFLECT基准,发现严格视觉控制下仍存在种族性别差异,强调了反事实审计和任务设计的重要性。

Comments 18 pages, 18 figures, and 3 tables

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 39963-39987, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18121 2026-07-22 cs.CL cs.AI 版本更新 81%

Saving the legacy of Hero Ibash: Evaluating Four Language Models for Aminoacian

拯救伊巴什英雄的遗产:评估四种用于氨基语的语言模型

Yunze Xiao, Yiyang Pan

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究评估四种前沿语言模型在氨基语中的表现,审视其在文本生成等方面的适应性等,揭示低资源语言中模型性能见解,为自然语言处理未来发展奠基,推动语言模型在类似语言环境中应用。

Comments arXiv admin note: This submission has been withdrawn due to violation of arXiv policies for acceptable submissions

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19211 2026-07-22 cs.CY 新提交 80%

Do LLMs Ask the Right Questions? Evaluating GPT-Generated Surveys as Instruments for Measuring Social Attitudes

大语言模型提出的问题正确吗?评估GPT生成的调查问卷作为衡量社会态度的工具

Tina Behzad, Wenbo Li, Reuben Kline, Klaus Mueller

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究对比GPT生成的调查问卷和既定调查基线在三个社会领域的情况,发现GPT生成的问卷与人工设计工具能捕捉相同主要态度划分,但有差异,适合探索性和大规模分析,可补充专家设计工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18254 2026-07-22 cs.AI cs.LG cs.PL 新提交 80%

Cross-Dialect Generalization Without Retraining: Benchmarks and Evaluation of Schema-Derived Constrained Decoding for MLIR

无需重新训练的跨方言泛化:MLIR 的模式派生约束解码基准测试与评估

Plawan Kumar Rath

机构 * Meta

专题命中 评测与基准 :SLM(abstract,abstract_cn);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究在 MLIR 中能否用从方言操作定义规范派生的推理时先验替代梯度适应,发布跨三种方言的基准测试集,构建三层模式派生约束栈,实验表明在部分方言上新模式能让模型在速度和验证有效率上超越其他模型,并发布相关资源。

Comments 27 pages (9 main + bibliography + appendix), 9 figures, 9 tables. Code, benchmarks, and reproducibility Docker image at https://github.com/plawanrath/slm-to-mlir-constrained-emitter

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18826 2026-07-22 cs.CR cs.AI 新提交 79%

Cross-Agent Campaign Attribution: Linking Asynchronous Attacks Across LLM Agents

跨智能体活动归因:关联大语言模型智能体间的异步攻击

SangJin Park, Myungsub Choi, Jineok Kim, Minseung Kang

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究跨大语言模型智能体的异步攻击归因问题,提出异步归因指纹向量($A^2FV$)协议,构建SCD-v1基准,实验表明$A^2FV$在活动关联上表现良好,确立跨智能体活动归因作为保护大语言模型智能体的独特评估层。

Comments 22 pages, 5 figures. Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18659 2026-07-22 cs.CR cs.AI cs.MA 新提交 79%

Broken Gates: Re-evaluating Web Bot Defenses in the Age of LLM Agents

破碎的大门:在大语言模型代理时代重新评估网络机器人防御

Behzad Ousat, Nikita Turkmen, Lalchandra Rampersaud, Dillan Bailey, Amin Kharraz

机构 * Florida International University(佛罗里达国际大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究在大语言模型代理时代网络机器人防御的有效性,通过系统测量研究评估基于交互式挑战与非交互式信任的防御对商业验证码解决服务和大语言模型代理的弹性,发现非交互式防御安全边界在环境层,影响机器人管理系统设计评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18261 2026-07-22 cs.AI 新提交 79%

When JSON Is Not Enough: Semantic Reliability of Schema-Constrained LLM Ordering Agents

当JSON不足够时:模式约束的大语言模型排序代理的语义可靠性

Yin Li

机构 * University of Birmingham(伯明翰大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究大语言模型代理作事务编译器时JSON模式等结构化输出的语义可靠性问题,引入OrderBench基准,通过对四个开放模型测试发现模式有效输出仍有语义错误率,强调结构化输出是必要接口层,不能替代域验证和故障封闭执行。

Comments 7 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18255 2026-07-22 cs.AI 新提交 79%

Semantic Cooperative Games for Contribution Attribution in LLM-Based Multi-Agent Systems

基于大语言模型的多智能体系统中用于贡献归因的语义合作博弈

Pengyi Jiang, Xiaoguang Zhu, Quanyan Zhu

机构 * New York University(纽约大学) University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 针对基于大语言模型的多智能体系统贡献归因问题,提出语义合作博弈框架,定义语义夏普利值,介绍单轨迹算法SLIC,在特定基准测试中大幅降低计算成本,在多角色工作流程中表现良好,为复杂系统提供快速、无反事实且可解释的归因方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14480 2026-07-22 cs.CL 版本更新 79%

Lower-Resource, Higher Scores: Language Bias in LLM Evaluators

语言模型评估器在不同语言间存在偏差

Ej Zhou, Lucas Resck, Zheng Hui, Anna Korhonen

机构 * University of Cambridge(剑桥大学) Language Technology Lab(语言技术实验室)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 研究发现语言模型评估器在多语言环境中存在偏差,不同语言评分差异显著,与语言资源水平相关,成对准确率无法检测到这些偏差,还探究了资源少的语言得分高的原因,揭示了语言层面的结构错位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12985 2026-07-22 cs.AI 版本更新 79%

SENTINEL: A Multi-Level Formal Framework for Safety Evaluation of Foundation Model-based Embodied Agents

SENTINEL:面向基础模型基于具身代理的安全性评估多级形式框架

Simon Sinong Zhan, Philip Wang, Yao Liu, Yiyan Peng, Zinan Wang, Qineng Wang, Zhian Ruan, Xiangyu Shi, Xinyu Cao, Frank Yang, Zhenyang Ni, Kangrui Wang, Ruohan Zhang, Huajie Shao, Manling Li, Qi Zhu

机构 * Northwestern University, USA University of Southern California, USA College of William \& Mary

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 SENTINEL通过形式时序逻辑多级验证框架,系统性评估基础模型具身代理在模拟环境中的物理安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19077 2026-07-22 cs.CV 新提交 78%

Context-structured Video Anomaly Detection with Large Vision-Language Models

基于大型视觉语言模型的上下文结构视频异常检测

Dongjun Kim, Changjae Oh, Andrea Cavallaro, Jeonghoon Mo

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究视频异常检测难题,提出CSI-VAD方法,将视频分解为环境、对象、时间三个上下文并分别推理,免训练且不依赖文本提示和数据集调整,实验证明该方法优于基线并具竞争力。

Comments Accepted at AVSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16667 2026-07-22 cs.CV 版本更新 78%

Look Again Before You Abstain:Budgeted Conformal Evidence Acquisition for Reliable Vision-Language Model

在放弃之前再看一眼:预算约束下的共形证据获取用于可靠的视觉-语言模型

Jian Xu, Yanning Wu, Delu Zeng, John Paisley, Qibin Zhao

机构 * South China University of Technology(华南理工大学) RIKEN Center for Advanced Intelligence Project(RIKEN先进智能研究中心) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 针对视觉-语言模型幻觉问题,提出预算约束共形证据获取(BCEA)方法,通过三级决策(回答、放弃或获取额外视觉证据)在有限计算预算下控制幻觉率,并恢复有限样本保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11899 2026-07-22 cs.CV 版本更新 78%

Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models

阅读还是忽略?视觉语言模型中排版攻击鲁棒性和文本识别的统一基准

Futa Waseda, Shojiro Yamabe, Daiki Shiono, Kento Sasaki, Tsubasa Takahashi

机构 * Turing Inc.(Turing公司) The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究院) Tohoku University(东北大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究大型视觉语言模型排版攻击鲁棒性和文本识别问题,引入RIO-VQA任务及RIO-Bench基准,发现目标中心防御的权衡,提出数据驱动防御基线,提升模型在两方面的性能,凸显现有鲁棒性范围与现实需求的错位。

Comments Accepted at ECCV 2026. The project page is available at: https://turingmotors.github.io/rio-vqa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10386 2026-07-22 cs.CV 版本更新 78%

PoseIDON: 6DoF Pose Estimation with Foundation Model Features for Marine Sediment Burial Mapping

PoseIDON:利用基础模型特征进行海洋沉积物掩埋测绘的6自由度姿态估计

Jerry Yan, Chinmay Talegaonkar, Nicholas Antipa, Eric Terrill, Sophia Merrifield

机构 * Marine Physical Laboratory, Scripps Institution of Oceanography(Scripps海洋研究所物理实验室) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 研究针对海底物体掩埋深度估计难题,提出PoseIDON计算机视觉管道,结合基础模型特征与多视图摄影测量,从ROV视频估计物体姿态和海底方向,经实验验证,平均误差约10厘米,可实现可扩展非侵入测绘,支持污染场地环境评估。

Journal ref ISPRS Journal of Photogrammetry and Remote Sensing 239 (2026) 928-942

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06374 2026-07-22 cs.CL 版本更新 77%

Evaluating Style-Personalized Text Generation: Challenges and Directions

评估风格个性化文本生成:挑战与方向

Anubhav Jangra, Bahareh Sarrafzadeh, Silviu Cucerzan, Adrian de Wynter, Sujay Kumar Jauhar

机构 * Columbia University(哥伦比亚大学) Microsoft(微软公司) The University of York(约克大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究风格个性化文本生成面临的挑战,通过提出的风格判别基准评估常用指标,发现多样评估指标集成效果更佳,为可靠评估该文本生成提供指导。

Comments Accepted to the 5th GEM workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13144 2026-07-22 cs.SE 版本更新 75%

A Grey Literature Review of AI-Native Applications

人工智能原生应用的灰色文献综述

Lingli Cao, Shanshan Li, Ying Fan, Danyang Li, Chenxing Zhong

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 该研究通过灰色文献综述,整合多方见解,识别出人工智能原生应用的定义特征、关键质量属性与典型技术栈等,揭示其核心支柱,为全面理解该应用提供了系统认识,还首次提出双层工程蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19259 2026-07-22 cs.LG cs.AI 新提交 73%

Benchmarking Generalization in Financial Statement Fraud Detection: robust evaluation and novel tasks

财务报表欺诈检测中的泛化基准测试:稳健评估与新任务

Guy Stephane Waffo Dzuyo, Gaël Guibon, Christophe Cerisara, Luis Belmar-Letelier

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对财务报表欺诈检测中现有方法性能估计不现实的问题,提出利用大语言模型整合结构化与非结构化数据的框架,通过新基准任务评估,构建公开数据集,该方法在新任务中性能最佳,凸显文本数据和稳健评估的价值。

Comments Accepted at FinLLM@IJCAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19209 2026-07-22 cs.CY cs.AI cs.LG 新提交 73%

Assessment in Team Problem-Solving Exercises in Computing Education

计算教育中团队问题解决练习的评估

Valdemar Švábenský, Jan Vykopal, Sukrit Leelaluk, Pavel Čeleda, Fumiya Okubo, Atsushi Shimada

机构 * Faculty of Informatics(信息学院) Masaryk University(马萨里克大学) Center for ICT Infrastructure(信息与通信基础设施中心) Yamaguchi University(山阳大学) Kyushu University(九州大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究计算教育中团队问题解决练习的评估方法,通过比较聚类和大语言模型,利用原始数据集与教师评分对比,发现聚类有效可靠、计算要求低,GPT-5.2误差低,相关方法已集成到开源平台,还共享了数据和工具。

Comments Full paper accepted for the main track of the IEEE FIE 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏