arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-17 至 2026-07-17 共收录 250 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 46 篇

2607.15254 2026-07-17 cs.AI cs.HC 新提交 57%

teLLMe Why (Ain't Nothing but a Jam): Exploratory Causal Analysis of Urban Driving Data

告诉我为什么(不过是一场拥堵):城市驾驶数据的探索性因果分析

Qiwei Li, Jorge Ortiz

机构 * Rutgers University(罗格斯大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究城市驾驶数据因果问题,提出teLLMe系统,结合多种方法从结构化事件表出发,通过模式感知大语言模型映射问题,返回‘因果卡片’总结相关内容,能揭示合理关系,用于假设生成和专家推理。

Comments Accepted at the NeurIPS 2025 Workshop on UrbanAI. 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15253 2026-07-17 cs.IR cs.CL 新提交 57%

Bridge Evidence: Static Retrieval Utility Does Not Predict Causal Utility in Multi-Step Agentic Search

桥梁证据:静态检索效用无法预测多步智能体搜索中的因果效用

Debayan Mukhopadhyay, Utshab Kumar Ghosh, Shubham Chatterjee

机构 * University of Calcutta(卡塔克大学) Missouri University of Science and Technology(密苏里科技大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 研究智能体检索中静态检索效用与因果效用的差异,通过在HotpotQA上用ReAct风格智能体实验,比较原始与反事实运行得CTU分数,发现两者近乎独立,约三分之一文档为桥梁文档,还确定了相关机制,指出优化静态相关性无法带来因果有用性。

Comments Preprint; extended version in preparation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14735 2026-07-17 cs.CL 新提交 57%

CoTu at EXACT 2026: Neuro-Symbolic Reasoning for Transparent Educational QA

CoTu在EXACT 2026中的应用:用于透明教育问答的神经符号推理

Quoc-Khang Tran, Minh-Thien Nguyen, Phu-An Thai, Xuan-Tung Bui, Truong-Thanh Ma, Nguyen-Khang Pham

机构 * Can Tho University(芹苴大学) Tay Do University(西原大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 EXACT 2026竞赛要求用最多8B参数的自托管模型解决教育问答问题。CoTu团队开发神经符号思维程序管道,结合Z3编码、数值Python等,经答案类型路由等方法,在物理任务中获满分,决赛技术得分最高,总体第三,证明小模型也能实现可验证推理。

Comments The 2nd International XAI Challenge for Transparent Educational Question-Answering @ IEEE IJCNN 2026 Competition

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14582 2026-07-17 cs.AI 新提交 57%

MathCoPilot: An Interactive System for Human-AI Symbiotic Paradigm of Mathematical Research

MathCoPilot:一种用于数学研究的人机共生范式的交互式系统

Junjie Zhang, Jiayu Liu, Wenbin Liu, Zhenya Huang, Doudou Wang, Yan Jiang, Leiye Xu, Tao Xiong, Wen Huang, Qi Liu, Guoping Hu, Enhong Chen, Mengping Zhang, Xiangdong Ye

机构 * University of Science and Technology of China(中国科学技术大学) School of Mathematical Sciences, University of Science and Technology of China(中国科学技术大学数学科学学院)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究提出MathCoPilot这人机共生的数学研究系统,统一三项核心能力。通过它在特定子集和定理上比较四个大语言模型,发现当前模型处理本科问题成功率高,但在特定领域定理上仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13501 2026-07-17 cs.AI 版本更新 57%

LOTAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search Reasoning

LAPO:多轮搜索推理中自生成过程奖励的留一回合归因

Qiang Zhu, Jiajun Wu, Longyi Wang

机构 * Zhejiang University(浙江大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究多轮搜索推理中强化学习依赖终端结果奖励的问题,提出基于反向留一回合归因的LAPO方法,无需额外模型,在七个问答数据集上取得较好成绩,证明策略追溯归因能为多轮搜索智能体提供有效过程监督。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15255 2026-07-17 cs.CV 新提交 50%

HoloGeo: Mitigating Landmark Bias in Geo-localization via Evidence-Driven Reasoning

HoloGeo:通过证据驱动推理减轻地理定位中的地标偏差

Pengcheng Zhou, Xuanyu Liu, Yanchen Yin, Bobo Li, Shengqiong Wu, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) Shandong University of Science and Technology(山东科技大学) University of Oxford(牛津大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 研究针对视觉语言模型地理定位易受地标偏差影响的问题,提出证据驱动推理框架HoloGeo,借助高质量数据集,通过多维度奖励实现平衡关注与联合推理,经实验验证其在多个数据集上能有效减轻地标偏差,提升地理定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14586 2026-07-17 cs.RO 新提交 50%

SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation

SoftNav:将3D场景令牌注入视觉语言模型以进行具身导航

Yi Wu, Junjie An, Xiao Liu, Yiqun Zhou, Yuechen Wu, Xiaoqing Guan, Shuyang Yu, You Wang, Guang Li

机构 * Zhejiang University(浙江大学) Shandong University(山东大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 研究针对具身导航中3D场景理解与导航推理协同问题,提出SoftNav方法,通过轻量级投影仪将3D连续表示作为软令牌注入VLM隐藏空间,在HM3D-OVON上超越先前方法,且能零样本转移到其他场景,弥合表征差距实现可转移导航。

Comments 8 pages, 6 figures. Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14238 2026-07-17 math.CO cs.DM cs.DS math.PR 新提交 50%

Online Beck--Fiala Down to Logarithmic Sparsity

在线Beck--Fiala问题降至对数稀疏度

Dylan J. Altschuler, Konstantin Tikhomirov

专题命中 推理与问题求解 :prompting(abstract)

AI总结 研究将离线Beck--Fiala猜想有效性扩展到\(d\geq\log(T)^{1 + o(1)}\),通过结合在线Komlós问题相关思想的在线算法最小化前缀差异,解决了Spencer设定下在线向量平衡问题,且该结果本质最优。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05754 2026-07-17 cs.RO 版本更新 50%

Safe-Night VLA: Seeing the Unseen via Thermal-Perceptive Vision-Language-Action Models for Safety-Critical Manipulation

Safe-Night VLA: 通过热感知视觉-语言-动作模型看见未见事物以实现安全关键操作

Dian Yu, Qingchuan Zhou, Bingkun Huang, Majid Khadiv, Zewen Yang

机构 * Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑机器人与机器智能研究所(MIRMI),技术大学慕尼黑(TUM))

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 Safe-Night VLA通过整合热感知技术,实现了安全关键操作中的非可见领域感知与稳健执行。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 61 篇

2607.14109 2026-07-17 cs.CL cs.AI 新提交 93%

Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation

简单性悖论:揭穿关于大语言模型评估中提示和数据集的神话

Inder Preet, Shuxin Lin, Dhaval Patel

专题命中 评测与基准 :LLM(title,summary_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型评估中提示和数据集相关问题,通过对8种提示技术在10个MCQA数据集上的实证研究,发现基线提示常优于复杂技术,还研究了相关关键现象,表明LLM评估社区或使提示工程过复杂,存在性能差距,为模型改进提供机会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00923 2026-07-17 cs.LG 版本更新 90%

Addressing Benchmarking Gaps in Large Language Models for Health and Medicine with Dynamic Red-Teaming

超越基准:动态、自动和系统化的红队代理用于可信的医疗语言模型

Jiazhen Pan, Bailiang Jian, Paul Hager, Yundi Zhang, Che Liu, Friederike Jungmann, Hongwei Bran Li, Julian Canisius, Chenyu You, Junde Wu, Jiayuan Zhu, Fenglin Liu, Yuyuan Liu, Niklas Bubeck, Moritz Knolle, Chen, Chen, Christian Wachinger, Zhenyu Gong, Cheng Ouyang, Georgios Kaissis, Benedikt Wiestler, Daniel Rueckert

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) University of Oxford(牛津大学) TUM University Hospital(慕尼黑技术大学医院) Imperial College London(伦敦帝国理工学院) Harvard Medical School(哈佛医学院) Stony Brook University(史泰兹布鲁克大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University of Sheffield(谢菲尔德大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出DAS红队框架,通过动态压力测试揭示医疗语言模型在鲁棒性、隐私、偏见和幻觉方面的潜在风险,发现高静态基准性能与低动态可靠性之间的'基准差距'。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14118 2026-07-17 cs.CL cs.SE 新提交 90%

Budgeted Subset Refinement for Execution-Aware LLM Research Ideation

用于执行感知大语言模型研究构思的预算子集优化

Micah Zhang

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对LLMs生成研究想法存在的问题,引入预算子集优化策略,在统一共享候选池评估中对比不同策略效果,发现随机k优化是低成本基线,多样性感知的MMR - k优化权衡最佳,表明LLM研究构思系统应作为预算支持分配系统评估。

Comments 18 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25031 2026-07-17 cs.AI 版本更新 90%

From Stateless to Situated: Building a Psychological World for LLM-Based Agents

从无状态到情境化:构建基于LLM的情感支持心理世界

Boning Zhao, Yutong Hu, Xinnuo Li

机构 * Tandon School of Engineering New York University New York, USA College of Arts \& Science New York University New York, USA

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LEKIA 2.0架构,通过分离认知层与执行层,构建可持续更新的情境结构,提升多轮交互中的稳定性与可控性,实现31%的改进。

Comments Accepted by WAICA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14816 2026-07-17 cs.SE cs.AI 新提交 89%

Large Language Models for Code Generation from Multilingual Prompts: A Curated Benchmark and a Study on Code Quality

用于从多语言提示生成代码的大语言模型:一个精心策划的基准测试和对代码质量的研究

Saima Afrin, Alessandro Midolo, Camilo Escobar-Velásquez, Mario Linares-Vásquez, Weiyuan Ding, Bowen Xu, Massimiliano Di Penta, Antonio Mastropaolo

机构 * University of Catania(卡塔尼亚大学) North Carolina State University(北卡罗来纳州立大学) University of Sannio(萨尼奥大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究多语言提示对代码生成的影响,通过460个Python和Java编码任务,将英文提示翻译成多种语言并评估生成代码,发现英文提示非最佳,提示语言影响因编程语言和大语言模型而异,提供多语言基准测试及见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08877 2026-07-17 cs.AI 89%

Quantifying the Accuracy and Cost Impact of Design Decisions in Budget-Constrained Agentic LLM Search

量化预算约束下代理LLM搜索中的准确性与成本影响

Kyle McCleary, James Ghawaly

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究探讨了预算约束下代理LLM搜索中搜索深度、检索策略和完成预算对准确性和成本的影响,并提供了可重复的评估方法和实验结果。

Comments Accepted in 2026 Language Resources and Evaluation Conference (LREC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09653 2026-07-17 cs.CL cs.AI 88%

The Heap: A Contamination-Free Multilingual Code Dataset for Evaluating Large Language Models

The Heap:一个无污染的多语言代码数据集,用于评估大型语言模型

Jonathan Katzy, Razvan Mihai Popescu, Arie van Deursen, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 The Heap是一个无污染的多语言代码数据集,用于公平评估大型语言模型,覆盖57种编程语言并去重以减少数据清洗需求。

Comments Camera-ready. Accepted to FORGE 2025 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14108 2026-07-17 cs.CL cs.AI cs.SE 新提交 88%

Eta Given Delta: Defining LLM Tool Efficiency With Marginal Tool Utility

给定增量的埃塔:用边际工具效用定义大语言模型工具效率

Nyx Iskandar

机构 * Foam(泡沫)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 研究提出用于评估LLM智能体轨迹中工具调用率的工具效率及边际工具效用指标,用LLM-as-a-Judge确定边际工具效用符号,区别于间接测效率的 prior work,直接测效率,为LLM评估研究及相关工程做贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14099 2026-07-17 cs.CL cs.AI cs.CV 新提交 86%

Just Keep Prompting: Evaluating Repetitive Socratic Prompting in VLMs

只需持续提示:评估视觉语言模型中的重复苏格拉底式提示

Shayda Moezzi, Bishoy Galoaa, Lorena Genua, Taskin Padir, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 评测与基准 :prompting(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究视觉语言模型在反复提示下的稳定性,引入JKP多轮评估框架,用三种策略对模型提问,在STAR基准子集上评估GPT-4o、Gemini 2.5 Pro和Qwen3-VL-30B,发现重复提示利弊兼具且因模型而异,揭示了模型压力反应概况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17930 2026-07-17 cs.AI 版本更新 85%

How Inference Compute Shapes Frontier LLM Evaluation

推理计算如何塑造前沿LLM评估

Jessica McFadyen, Ole Jorgensen, Harry Coppock, Kevin Wei, Cozmin Ududec

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 通过控制推理计算量(如token预算、上下文压缩和重复提交)评估12个前沿语言模型,发现更大计算量显著提升性能,固定预算评估低估模型能力,且不同基准对推理扩展方法敏感。

Comments 34 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09822 2026-07-17 cs.SE cs.AI 85%

LLM-Based Agentic Systems for Software Engineering: Challenges and Opportunities

基于大语言模型的代理系统在软件工程中的应用:挑战与机遇

Yongjian Tang, Thomas Runkler

机构 * Siemens AG(西门子股份公司) Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了基于大语言模型的多代理系统在软件工程中的应用,分析了其挑战与未来研究方向。

Comments Accepted to GenSE 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14493 2026-07-17 cs.CR 新提交 85%

Context Contamination in LLM Analysis of Network Security Logs: Poison with Passive Prompt Injection and Mitigation Evaluation

网络安全日志的大语言模型分析中的上下文污染:通过被动提示注入进行中毒攻击及缓解评估

Rabimba Karanjai, Yang Lu, Hemanth Hegadehalli Madhavarao, Lei Xu, Weidong Shi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究网络安全日志大语言模型分析中的上下文污染问题(被动提示注入漏洞),提出LogInject框架评估威胁,通过实验得出攻击成功率等数据,引入上下文拼接技术,评估分层防御效果,揭示需深度防御架构和人工监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14957 2026-07-17 cs.AI 新提交 83%

Contextualized Early Detection of Online Firestorms: A Sequential LLM-Based Approach

在线风暴的情境化早期检测:一种基于序列语言模型的方法

Besim Shala, Peter Mandl, Andreas Humpe, Martin Häusl

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.AI

AI总结 研究在线风暴的早期检测,提出基于语言模型的检测系统,有回顾性分类和顺序处理两种模式,在Reddit数据集上实验,全局模式分类性能强,早期警告模式召回率高,证明语言模型可用于情境感知监测。

Comments 9 pages, 2 figures, 7 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14499 2026-07-17 cs.AI 新提交 83%

Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions

通过动态多轮交互对视觉语言模型进行情境化评估

Yijiang Li, Huiqi Zou, Bingyang Wang, Ziang Xiao

机构 * UC San Diego(加州大学圣地亚哥分校) Northeastern University(东北大学) Georgia Institute of Technology(佐治亚理工学院) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 研究多模态大语言模型现实有效性问题,提出CEDI框架,通过三方交互、多轮半结构化对话及多种策略评估,应用于视觉幻觉,发现能揭示更多接近实际情况的幻觉,凸显其对MLLMs能力评估的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14191 2026-07-17 cs.LG 新提交 83%

TEDDY: A Pediatric Foundation Model for Risk Forewarning from ICD-Coded Diagnostic Histories

TEDDY:一种基于ICD编码诊断历史的儿科风险预警基础模型

Matthew Brady Neeley, Jorge Botas, Johnathan Jia, Lin Yao, Daniel Palacios, Benjamin Choi, Zhandong Liu, Hyun-Hwan Jeong

机构 * Baylor College of Medicine(贝勒医学院)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);分类 cs.LG

AI总结 研究利用儿科电子健康记录训练TEDDY模型,对纵向诊断轨迹和就诊时间建模,在疾病发病预测任务中表现出色,能支持广泛、罕见疾病和长期风险预测,无需大规模人口数据或数十亿参数模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15202 2026-07-17 cs.AI cs.HC cs.MA cs.MM 新提交 81%

Self-Evolving Human-Centered Framework for Explainable Depression Symptom Annotation

用于可解释抑郁症症状标注的自我进化以人为中心框架

Hoang-Loc Cao, Van Pham, Truong Thanh Hung Nguyen, Phuc Truong Loc Nguyen, Phuc Ho, Veronica Whitford, Hung Cao

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对抑郁症标注质量瓶颈,提出结合大语言模型辅助与专家验证的自我进化标注框架,分三阶段运行,采用双记忆架构,能提高标注一致性和可解释性,减少人工修订,还输出多种信息实现可审计性。

Comments Accepted at IEEE International Conference on Omni-Layer Intelligent Systems (COINS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14167 2026-07-17 cs.SE cs.AI 新提交 79%

Structured Feedback Improves Repair in an LLM Agent Loop

结构化反馈改进大语言模型智能体循环中的修复

Jaideep Ray, Ankit Goyal

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究大语言模型智能体验证与调用接口问题,提出VeriHarness代码控制智能体循环。通过比较原始诊断与含失败位置等信息的反馈,发现含三个字段反馈能大幅提升成功率,多数增益源于可接受替代方案,JSON语法本身对修复无显著作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05268 2026-07-17 cs.CV cs.LG 版本更新 79%

Is the Geometry Doing the Work? An Operating-Point Audit of Hierarchy in Hyperbolic Vision-Language Models

几何在发挥作用吗?对双曲视觉-语言模型层次性的工作点审计

Jaeyoung Kim, Eunseok Kim, Dongsuk Jang

机构 * MADI

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本研究针对双曲视觉-语言模型是否利用其几何特性的问题,提出多组诊断指标审计三类主流模型,发现其实际未激活双曲径向/锥机制,层次性表现与几何特性无关。

Comments 48 pages, 5 figures, Under review at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29759 2026-07-17 cs.CV cs.AI 版本更新 79%

TSHA: A Benchmark for Visual Language Models in Trustworthy Safety Hazard Assessment Scenarios

TSHA:用于可信安全危害评估场景的视觉语言模型基准

Qiucheng Yu, Ruijie Xu, Mingang Chen, Jianfeng Dong, Xin Tan

机构 * City University of Hong Kong(香港城市大学) East China Normal University(华东师范大学) University of Western Australia(西澳大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Development Center of Computer Software Technology(上海计算机软件技术开发中心) Zhejiang Gongshang University(浙江工商大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出TSHA基准,通过81809个精心挑选的训练样本和1707个挑战性测试样本,评估视觉语言模型在复杂家庭安全场景中的鲁棒性和泛化能力,发现现有模型在安全危害评估中存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14524 2026-07-17 cs.AI cs.CL 新提交 79%

WrAFT: a Modularized Automated Writing Evaluation System for Argumentative Essays

WrAFT:一种用于议论文的模块化自动写作评估系统

Adnan Labib, Yixuan Huang, Jiahui Wu, John Maurice Gayed, Zheng Yuan, Qiao Wang

机构 * Department of Informatics, King’s College London(伦敦国王学院信息学系) Waseda University(早稻田大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Sheffield(谢菲尔德大学) Hosei University(法政大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究提出WrAFT这一用于议论文的模块化自动写作评估系统,通过模块化设计及评估多种大语言模型构建,在评分上达先进水平,人机评估反馈认可度高,且开发了公开免费的交互式用户界面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14349 2026-07-17 cs.CL cs.AI 新提交 79%

HABIB_TAZ at SemEval-2026 Task 11: Disentangling Formal Logic from Content via Synthetic Training and Multi-Objective Optimization

HABIB_TAZ参加SemEval-2026任务11:通过合成训练和多目标优化从内容中分离形式逻辑

Abdullah Shaikh, Zain Naqi, Taha Zahid, Sandesh Kumar, Abdul Samad

机构 * Dhanani School of Science & Engineering Habib University(哈比卜大学达纳尼科学与工程学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对SemEval-2026任务11,用基于三段论合成数据集微调的mDeBERTa-v3网络,结合多目标损失函数应对大语言模型形式推理受内容影响的问题,在多个子任务中取得优异成绩,还公开了数据集生成引擎和代码库。

Journal ref Proceedings of the 20th International Workshop on Semantic Evaluation (2026), pp. 1006-1014 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏