arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 806 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 806 篇

2608.01640 2026-08-04 cs.SE cs.AI 新提交 62%

AI-assisted Script Management for Requirements Elicitation Interviews

AI辅助的需求启发访谈脚本管理

Anmol Singhal, Paulo Carvalho, Travis Breaux

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文提出结合业务目标的AI辅助脚本生成与实时主题追踪、按需跟进问题生成的需求启发工作流,准实验显示其脚本质量更高、访谈表现更优,为需求启发提供了AI辅助支架。

Comments 12 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29383 2026-08-03 cs.LG cs.DC cs.SE 新提交 62%

Exploring Block Anomaly Detection In HDFS Log Data Analysis

HDFS日志数据分析中的块异常检测探索

WenYang Zhong, Tutut Herawan

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG、cs.SE

AI总结 本研究针对HDFS日志人工异常检测复杂枯燥的问题,提出结合LLM-BiLSTM模型与Kafka流式管道的检测方案,实现HDFS块异常的快速准确检测。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28666 2026-08-03 cs.CL cs.LG 新提交 62%

The Checking Problem: What must be true before AI ships in a regulated firm

核查问题:受监管企业在AI产品交付前必须满足什么条件

Prerit Ahuja

专题命中 工作流自动化 :workflow(abstract);分类 cs.CL、cs.LG

AI总结 本文研究受监管金融服务领域AI项目停滞的机制,通过多模型多配置实验发现,AI工作流价值更多取决于人类审核量,而非正确率,且审核负担可通过样本外估算测量。

Comments 10 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27955 2026-07-31 cs.DL cs.AI cs.CL cs.IR 新提交 62%

SciSchema.org: A Multidisciplinary Collection of Schemas for Structured Scientific Process Descriptions

SciSchema.org:用于结构化科学过程描述的多学科模式集合

Jennifer D'Souza, Sameer Sadruddin, Anisa Rula, Ana Bossler, Andrés Fullana, Enric Bas, Syed Ather, Defne Circi, Anlan Chen, L. Catherine Brinson, Alyssa Columbus, George Demetriou, Dongjun Jeong, Tarun Kumar, Frank Krüger, Sascha Genehr, Kai Budde-Sagert, Anamaria Leonescu, Francesco Lodola, Chiara Florindi, Gagana Balasubramanya Murthy, Samson Oluwapelumi Olagbile, Nazia Riasat, Yan Sha, Kevin Shen, Shaokai Yang

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 SciSchema.org发布首个多学科科学过程模式集合,采用人在回路模式挖掘工作流构建,支持科学领域结构化标注等多项应用。

Comments 25 pages, 9 figures, Submitted for peer review to Nature Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23696 2026-07-28 cs.AI cs.LG 新提交 62%

Offline-to-Online Creative Optimization with Generative Models and Adaptive Testing

基于生成模型和自适应测试的离线到在线创意优化

Kevin Lee, Benjamin Letham, Zhiyuan Jerry Lin, Elodie Samson, Eric Onofrey, Poppy Zhang, Shawndra Hill, Eytan Bakshy

机构 * University of Michigan(密歇根大学) Meta

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 研究如何利用历史A/B测试数据,通过性能驱动的离线到在线工作流程,用预测模型指导生成测试广告位候选创意,经实验验证该方法能有效提升创意参与度,为创意优化提供设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22688 2026-07-28 cs.AI cs.CL 新提交 62%

Co-Harness: Co-Evolving Harnesses and Model Weights for LLM Agents

协同控制:大语言模型智能体的控制与模型权重协同进化

Zhengyu Chen, Teng Xiao, Huaisheng Zhu, Yige Yuan, Luan Zhang, Jingang Wang

专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究针对训练后智能体优化问题,提出协同控制框架,交替优化控制与模型参数。通过基于大语言模型的控制批评家分析失败轨迹并提出更新,再用改进控制生成的轨迹微调模型,案例研究显示该方法能提升智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22428 2026-07-27 cs.HC cs.AI cs.LG cs.MM 新提交 62%

Unboxing Diffusion Models for the Arts: Interactive Model Bending and Practice-Based Explainability

剖析艺术领域的扩散模型:交互式模型调整与基于实践的可解释性

Ahmed M. Abuzuraiq, Philippe Pasquier

机构 * School of Interactive Arts and Technology, Surrey, Canada(交互艺术与技术学院,英国苏城)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨创意实践中可解释人工智能,提出以实验和干预为中心的方法,通过集成模型调整和交互界面到工作流程,经对Stable Diffusion 1.5分析,助艺术家理解模型组件对生成图像的影响,让大型模型成为创意材料。

Comments Under review for "Explainable AI for the Arts" (N. Bryan-Kinns, Ed.), Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21117 2026-07-24 cs.LG cs.AI 新提交 62%

GlucoTune: A Unified Framework for Blood Glucose Preprocessing, Forecasting, and Benchmarking in Diabetes

GlucoTune:糖尿病血糖预处理、预测及基准测试的统一框架

Davide Marelli, Giorgia Rigamonti, Mirko Paolo Barbato, Paolo Napoletano

机构 * Department of Informatics, Systems and Communication, University of Milano-Bicocca(米兰比可卡大学信息、系统与通信系)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 GlucoTune框架解决糖尿病血糖数据预处理等缺乏标准流程与评估协议问题,通过可配置管道实现可重复预处理,提供统一接口和基准测试排行榜,集成数据集,经实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18256 2026-07-22 cs.AI cs.LG 新提交 62%

PEARL: Solver-in-the-Loop Interactive Optimization Modeling from Natural Language

PEARL:基于自然语言的循环求解器交互式优化建模

Hongliang Lu, Zhong Li, Yuxuan Chen, Yuan Lan, Fan Zhang, Zaiwen Wen

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 研究旨在解决优化建模问题,提出PEARL系统,通过在循环中使用Python执行和数学编程求解器,学习优化策略,在多轮工具集成设置下提升求解率,在优化建模任务中表现优于强大基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17427 2026-07-21 cs.LG cs.CL q-fin.CP 新提交 62%

Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families

删除并非手术刀:拒绝移除对不同模型家族决策倾向的非目标效应

Aleksander Fafuła

机构 * huihui-ai(慧慧人工智能)

专题命中 工作流自动化 :agent(abstract);分类 cs.CL、cs.LG

AI总结 研究“无审查”开放权重模型中删除模型拒绝方向的操作影响,以21600个不确定性决策为探针,对比两个专家混合模型家族的基础与删除模型,发现有多种效应,还发现污染渠道,表明部署此类模型得到的是不同决策者。

Comments 11 pages, 5 figures, 4 tables. Preregistered. Data and code: https://github.com/oleczek/paper-abliteration-not-a-scalpel ; dataset DOI: 10.5281/zenodo.21314839

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13189 2026-07-16 cs.CL cs.AI 新提交 62%

RAGthoven at SemEval-2026 Task 1: A Multi-Stage Pipeline Walks Into a Benchmark and Barely Clears the Bar

RAGthoven参加SemEval-2026任务1:一个多阶段管道进入基准测试且勉强达标

Marek Šuppa, Viktória Ondrejová, Lucia Ganajová, Gregor Karetka, Daniel Skala

机构 * Comenius University in Bratislava(布拉迪斯拉发的夸美纽斯大学) Cisco Systems(思科系统公司) Zaitra s.r.o.(扎伊特拉有限公司) NaiveNeuron(天真神经元)

专题命中 工作流自动化 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 介绍用于SemEval-2026任务1子任务A的RAGthoven系统,它将幽默文本生成分解为多阶段LLM管道,经多次实验优化,最终配置用RAG增强规划器,还评估两种智能变体,虽工具调用预算增加,但在英语样本上未超非智能管道,在三种语言中与基线并列第一,显示语言相关回报递减。

Comments SemEval-2026 Task 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13078 2026-07-16 cs.CR cs.AI cs.LG 新提交 62%

Operational Evidence Gaps for LLMs in Fraud Detection and Trust-and-Safety Workflows

大语言模型在欺诈检测和信任与安全工作流程中的操作证据差距

Keyur Gabani

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 研究LLMs用于欺诈检测等信任与安全工作流程时的操作证据差距。通过对相关操作源编码调查发现证据失衡,欺诈任务部分大但缺乏关键证据。贡献了FORTE框架和部署证据清单,确定支持LLMs部署所需研究。

Comments 22 pages, 3 figures, 6 tables. Ancillary files include the evidence matrix, search note, and numeric claim check

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11981 2026-07-15 cs.CL cs.AI 新提交 62%

Evaluating Nonuniform Dependability Across Response Conditions: A Conditional Generalizability Framework Illustrated in Automated Essay Scoring

评估跨响应条件的非均匀可靠性:自动作文评分中的条件可推广性框架

Yi Gui

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究针对自动作文评分中跨响应条件非均匀可靠性评估问题,引入含三个部分的条件可推广性框架,通过比较分析与经验扫描、依熵分层等,以限时L2写作自动评分验证,提供了评估非均匀可靠性的可移植工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11364 2026-07-14 cs.LG cs.AI cs.MM 新提交 62%

BackgroundMellow: A Multi-Modal Cohesive Framework for Narrative-Driven Rich Cinematic Soundscape Generation

BackgroundMellow:一种用于叙事驱动的丰富电影音效生成的多模态凝聚框架

Ajitesh Jamulkar, Aritra Hazra

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡拉格布尔分校)

专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.LG

AI总结 多模态AI中为文本叙事生成电影音效困难,BackgroundMellow框架将其视为编排与信号处理问题,通过主 - 专家架构、Tango2模型、背景音乐检索器及NLP模块实现,经实验验证在时间同步等方面有效。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09094 2026-07-13 cs.CL cs.AI 新提交 62%

PRecG: Legal Precedent Retrieval with Graph Neural Networks and Rhetorical Role Segmentation

PRecG:基于图神经网络和修辞角色分割的法律先例检索

Devanshu Verma, Vasudha Bhatnagar, Vikas Kumar, Balaji Ganesan

机构 * University of Delhi(德里大学) IBM Research(IBM 研究院)

专题命中 工作流自动化 :planning(abstract);分类 cs.AI、cs.CL

AI总结 研究法律先例检索问题,提出PRecG管道,通过基于句子修辞角色分解文档、构建知识图、学习聚合实体上下文表示等步骤,分层学习法律判决对的表示来计算相似度,经实验验证其有效性。

Comments 23 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07974 2026-07-10 cs.CL cs.AI 新提交 62%

A Multi-cluster Boundary Learning Method for Out-of-Scope Intent Detection via MiniLM Embedding

一种基于MiniLM嵌入的多簇边界学习方法用于检测超出范围的意图

Yihong Xu, Mingyu Kang, Linyuan Lü

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 针对意图检测中超出范围意图检测的挑战,提出基于MiniLM嵌入的多簇边界学习方法,在单类分类工作流程中检测超出范围意图,实验表明该方法性能最优,所用MiniLM能更好适应相关要求。

Comments To submit

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07094 2026-07-09 cs.SE cs.AI 新提交 62%

MetaConfigurator: AI-Assisted RDF Authoring from JSON Data

MetaConfigurator:从JSON数据实现AI辅助的RDF创作

Felix Neubauer, Mahdi Jafarkhani, Kenichi Endo, Jürgen Pleiss, Benjamin Uekermann

机构 * Institute for Parallel and Distributed Systems, University of Stuttgart(并行与分布式系统研究所,斯图加特大学) Institute of Polymer Chemistry, University of Stuttgart(聚合化学研究所,斯图加特大学) Institute of Biochemistry, University of Stuttgart(生物化学研究所,斯图加特大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 提出一个集成AI辅助的RML映射、SPARQL查询和知识图谱可视化的Web界面,将JSON等结构化数据转换为RDF,并以MOF合成实验数据验证其有效性。

Comments Submitted as post-proceedings for the deRSE26 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05842 2026-07-08 cs.SE cs.AI cs.CR 新提交 62%

Beyond Refusal: A Same-Lineage Study of Aligned and Abliterated LLMs for Vulnerability Analysis

超越拒绝:用于漏洞分析的对齐和消除拒绝的大语言模型的同谱系研究

Mingchen Li, Meikang Qiu, Zifan Peng, Heng Fan, Song Fu, Junhua Ding, Yunhe Feng

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 研究大语言模型辅助软件安全中,同谱系模型的安全状态(对齐或消除拒绝)对软件安全工作流程防御效用的影响,通过比较不同模型在多方面的表现,发现评估应综合考量模型响应、响应正确性及输出在工程流程中的可操作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02873 2026-07-07 cs.SE cs.AI cs.CR 新提交 62%

Determinants and Limits of LLM Security-Tool Orchestration: A Study with HexStrike-AI

大语言模型安全工具编排的决定因素与限制:基于HexStrike-AI的研究

Romain Gerard, Assmaa Zeghaider, Yan Guo

机构 * University of Science and Technology of China(中国科学技术大学) Suzhou Institute for Advanced Research(苏州研究院)

专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.SE

AI总结 以HexStrikeAI为测试平台,通过评估系统、诊断故障并改进,运行多类挑战,发现驱动客户端是固定模型的首要因素,整体解决率提升,剩余故障受推理或环境限制,还讨论了编排器评估及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16337 2026-07-07 cs.AI cs.HC cs.LG 新提交 62%

Medical Heuristic Learning: An LLM-Driven Framework for Interpretable and Auditable Clinical Decision Rules

医学启发式学习:一个用于可解释和可审计临床决策规则的LLM驱动框架

Wei Xu, Ke Yang, Gang Luo, Keli Zheng, Lingyan Hu, Jing Wang, Kefeng Li

机构 * Centre for Artificial Intelligence Driven Drug Discovery, Macao Polytechnic University(人工智能驱动药物发现中心,澳门理工学院) Key Laboratory of Short-Range Radio Equipment Testing and Evaluation, Ministry of Industry and Information Technology Terahertz Science Application Center (TSAC), Beijing Institute of Technology(工业和信息化部短距离无线电设备测试与评估重点实验室,太赫兹科学应用中心(TSAC),北京理工大学) Department of Critical Care Medicine, Yantai Yuhuangding Hospital, Qingdao University(重症医学科,烟台友谊医院,青岛大学) Faculty of Education, The University of Hong Kong(教育学院,香港大学) College of Information Engineering, Dalian University(信息工程学院,大连大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出医学启发式学习(MHL),利用LLM驱动的工作流优化确定性可执行决策系统,生成可解释、可审计的Python决策规则,在医学数据集上达到与最先进方法相当的性能,并支持小样本和高度不平衡场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31311 2026-07-01 cs.HC cs.AI cs.LG 新提交 62%

From Idea to Prototype in an Afternoon: Scaffolded, AI-Assisted Rapid VA Prototyping

从想法到原型只需一个下午:脚手架式、AI辅助的快速可视化分析原型设计

Gennady Andrienko, Natalia Andrienko

机构 * Fraunhofer Institute IAIS(弗劳恩霍夫智能分析与信息系统研究所)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文通过案例展示,结合工作流语言和AI助手,将可视化分析原型的开发时间从数月缩短至一个下午,并总结了脚手架设计、知识注入和使用方式的三点经验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28002 2026-06-29 cs.CL cs.AI eess.AS 新提交 62%

Dialogue to Detection: A Multimodal Hybrid NLP Pipeline for Insurance Fraud Detection

对话到检测:用于保险欺诈检测的多模态混合 NLP 流水线

Muhammad Shakeel Akram, Amal Htait, Abdul Hamid Sadka, Emma Meisingseth, Karishma Jaitly

机构 * Aston University(阿斯顿大学) Domestic & General

专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出一种合成多模态框架,结合ASR、NER、LLM-RAG和说话人嵌入,通过规则风险评分检测保险欺诈中的叙述复用、结构不一致和跨案件语音重复。

Comments 10 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27973 2026-06-29 cs.CL cs.AI 新提交 62%

From Black-Box to Clinical Insight: A Multi-Stage Explainable Framework for Speech-Based Cognitive Impairment Detection

从黑盒到临床洞察:用于语音认知障碍检测的多阶段可解释框架

Yasaman Haghbin, Sina Rashidi, Ali Zolnour, Fatemeh Taherinezhad, Ali Fartoot, Hossein Azadmaleki, James M Noble, Maryam Dadkhah, Maryam Zolnoori

机构 * Independent Researcher(独立研究者) Columbia University(哥伦比亚大学) Chalmers University of Technology(查尔姆斯理工大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 提出多阶段可解释框架,结合SHAP、语言学特征和LLM推理,将黑盒Transformer预测转化为临床叙事,在NIA PREPARE基准上F1=72.11%,医生评估显示与患者认知特征高度一致,SUS评分82/100。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25525 2026-06-25 cs.SE cs.AI 新提交 62%

The impact of artificial intelligence on enterprise software user roles

人工智能对企业软件用户角色的影响

Isabel Unger, Elizangela Valarini, Martin Schrepp, Nina Hollender, Gabriela Rocha, Erik Bertram

机构 * SAP SE(SAP股份有限公司) Fresenius Hochschule Heidelberg(海德堡弗里森纽斯大学)

专题命中 工作流自动化 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 本研究通过专家访谈和参与式研讨会,探讨AI如何改变SAP BTP平台上的用户角色,发现日常任务自动化、人机协作增强及对代理型AI系统的依赖增加,并指出现有角色框架需适应这些变化。

Comments 18 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24119 2026-06-24 cs.LG cs.CL 新提交 62%

When Top-1 Fails: Calibrating LoRA Monitors for Masked Diffusion LMs

当Top-1失败时:为掩蔽扩散LM校准LoRA监控器

Lucky Verma, Pratik Yadav

机构 * Independent Researcher(独立研究员) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 工作流自动化 :workflow(abstract);分类 cs.CL、cs.LG

AI总结 针对离散扩散语言模型微调中top-1 argmax作为崩溃预警的零精度问题,提出使用最大LoRA梯度范数作为参数侧信号,在LLaDA族上实现0.68精度和0.79 F1分数,并建议每族DLM校准阈值。

Comments 14 pages, 3 figures. Code and result artifacts: https://github.com/lucky-verma/top1-fails-dlm-lora-monitors

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23757 2026-06-24 cs.LG cs.AI 新提交 62%

Synergizing Physically Constrained MCMC and Chemical-Informed Gaussian Processes for Reaction Network Discovery

协同物理约束MCMC与化学信息高斯过程进行反应网络发现

Runzhe Liu, Zihao Wang, Wenbo Yang, Shengyang Tao

机构 * State Key Laboratory of Fine Chemicals, Frontier Science Center for Smart Materials, Dalian University of Technology, Dalian, 116024, China(精细化学品国家重点实验室,智能材料前沿科学中心,大连理工大学,大连,116024,中国) Dalian Key Laboratory of Intelligent Chemistry, CR Belt and Road Joint Laboratory on Intelligent Chemistry and Advanced Materials of Liaoning Province, School of Chemistry, Dalian University of Technology, Dalian, 116024, China(大连智能化学重点实验室,辽宁省“一带一路”智能化学与先进材料联合实验室,化学学院,大连理工大学,大连,116024,中国) Academy of Interdisciplinary Studies, The Hong Kong University of Science and Technology, Clear Water Bay, Kowloon, Hong Kong(交叉学科研究院,香港理工大学,清水湾,九龙,香港)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出PC-MCMC-CIGP灰箱工作流,结合尖峰-板拓扑采样、硬守恒与热力学筛选及化学信息高斯过程残差模型,用于反应网络发现与实验设计,在H2+Br2基准和苯乙烯环氧化反应上验证了其区分机理和优化产量的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20976 2026-06-23 cs.LG cs.AI 新提交 62%

Detecting Satellites in Radio-Frequency Data via Semi-Supervised Learning

通过半监督学习检测射频数据中的卫星

Cade W. Trotter, Maksim E. Eren, Justin C. Holmes, J. Brent Parham, David Ewing, Boian S. Alexandrov, Gian Luca Delzanno

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室) MIT Lincoln Laboratory(麻省理工学院林肯实验室)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出结合非负矩阵分解与自动模型确定(NMFk)、专家引导聚类解释和分类器预测的半监督工作流,用于卫星监测中的射频检测与分类,减少对大量标注数据的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17507 2026-06-17 cs.AI cs.SE 新提交 62%

LLM-as-Judge in Education: A Curriculum-Grounded Marking Pipeline

教育中的LLM作为评判者:基于课程标准的评分流水线

Xiwei Xu, Chen Wang, Jacky Jiang, Phil Yang, Qian Fu, Mohan Dhall, Wenjie Zhang, Liming Zhu

机构 * NSW Department of Education(新南威尔士州教育部) South Australian Department for Education(南澳大利亚州教育部) OC Selective exam preparation platform(OC精英考试备考平台) Studitory: HSC preparation platform(Studitory: HSC备考平台)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 提出一种基于课程标准的可配置LLM评判流水线,用于高利害考试评分,通过整合授权课程工件和评分指南,提高评分一致性、透明度和与官方实践的契合度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12616 2026-06-12 cs.AI cs.CL 新提交 62%

PersonaDrive: Human-Style Retrieval-Augmented VLA Agents for Closed-Loop Driving Simulation

PersonaDrive: 面向闭环驾驶模拟的人类风格检索增强VLA智能体

Mahmoud Srewa, Praneetsai Iddamsetty, Mohammad Abdullah Al Faruque, Salma Elmalaki

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出PersonaDrive流水线,通过检索风格指令下的人类驾驶演示来调节视觉-语言-动作(VLA)驾驶智能体,实现闭环模拟中多样化的非自车智能体行为,无需针对每种风格重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11769 2026-06-11 cs.AI cs.LG 新提交 62%

When Do Data-Driven Systems Exhibit the Capability to Infer?

数据驱动系统何时展现出推理能力?

Maximilian Poretschkin, Tabea Naeven

机构 * Fraunhofer Institute for Intelligent Analysis and Information Systems (IAIS)(弗劳恩霍夫智能分析与信息系统研究所) University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习和人工智能研究所)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 针对欧盟AI法案中推理能力定义模糊的问题,基于统计学习理论提出分级框架,通过信用评分案例展示如何判断系统是否具备推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏