arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-28 至 2026-07-28 共收录 543 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 117 篇

2607.22653 2026-07-28 cs.AI 新提交 87%

Do Language Models Converge to Themselves? Recursive Self-Refinement as Textual Relaxation

语言模型会收敛到自身吗?递归自精炼作为文本松弛

Xuening Wu, Qianya Xu, Yanlan Kang, Zeping Chen, Yubin Liu, Shenqin Yin

机构 * Pfizer(辉瑞公司) University of California San Diego(加利福尼亚大学圣地亚哥分校) Institute for Medical Philosophy and Future Artificial Intelligence(医学哲学与未来人工智能研究所) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) Institute of Humanities and Social Science Data, Fudan University(复旦大学人文社会科学数据研究所)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI

AI总结 研究大语言模型递归自精炼工作流程的长期动态。通过生成精炼轨迹并分析多种指标,发现轨迹迅速饱和,编辑多在前几次迭代,确定性解码表现更好,平均编辑幅度呈指数松弛,收敛摘要有多种优势,支持动态系统观点并推动停止标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12993 2026-07-28 cs.CL 版本更新 87%

Tailored untruths: How personalisation challenges LLM safeguards

量身定制的虚假信息:个性化如何挑战大语言模型的安全防护

João A. Leite, João Luz, Silvia Gargova, Arnav Arora, Gustavo Sampaio, Ian Roberts, Carolina Scarton, Kalina Bontcheva

机构 * University of Sheffield(谢菲尔德大学) University of Copenhagen(哥本哈根大学) Big Data for Smart Society Institute (GATE)(大数据智能社会研究所(GATE)) University of São Paulo(圣保罗大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究LLMs针对特定角色生成虚假信息的情况,采用红队测试方法创建数据集,发现安全防护在多数情况下失效,各模型能有效定制输出,还揭示了特定语言和心理模式及安全防护有效性差异,凸显加强多语言安全防护的必要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22949 2026-07-28 cs.IR 新提交 87%

Beyond Exact Match: How Evaluation Methodology Dominates Model Choice in LLM-Based Product Attribute Extraction

超越精确匹配:评估方法如何在基于大语言模型的产品属性提取中主导模型选择

Ayush Dwivedi, Ashvi Soni

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究基于大语言模型的产品属性提取中评估方法的影响,通过在MAVE基准上对比两种模型的四种提示策略,用精确和模糊匹配评估预测并审计标签,发现评估方法产生的方差远超模型和提示策略选择,且基准有一定噪声率,得出评估方法和数据质量主导模型选择等结论。

Comments 9 pages, 3 figures, 8 tables. Preprint under review. Code available at https://github.com/a-dwivedi/llm-product-attribute-extraction

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10400 2026-07-28 cs.LG cs.AI math.OC stat.ML 版本更新 87%

Designing Service Systems from Textual Evidence

从文本证据设计服务系统

Ruicheng Ao, Hongyu Chen, Siyang Gao, Hanwei Li, David Simchi-Levi

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PP-LUCB算法,通过结合LLM代理评分与逆倾向加权残差,有效解决服务系统配置选择中的偏见问题,实现高置信度与低成本审计的平衡。

Comments This submission is withdrawn because it duplicates arXiv:2601.21471 by the same authors. The expanded manuscript was submitted as a new entry instead of as a replacement, so the same paper is now indexed twice. No results, proofs, or data are retracted. The current version is maintained as a replacement of arXiv:2601.21471, which readers should cite

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24174 2026-07-28 cs.CR 新提交 87%

Just Testing, Move Along: Evasion of LLM-based System Log Interpretation by Prompt Injection

只是测试,继续前进:通过提示注入规避基于大语言模型的系统日志解释

Max Landauer, Florian Skopik, Markus Wurzenberger, Franciszek Górski, Mateusz Krzysztoń

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型的系统日志解释中提示注入攻击问题,提出评估框架,利用真实攻击日志痕迹创建对抗示例,证明攻击可致恶意日志误分类,且LLMs解释含对抗指标可用于检测攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23515 2026-07-28 cs.RO 新提交 87%

LEACL: LLM-Enhanced Automatic Curriculum Learning for Reinforcement Learning in Long-Horizon Manipulation Tasks

LEACL:用于长时程操作任务强化学习的大语言模型增强自动课程学习

Faraz Heravi, James Ouyang, Zifan Xu, Arjun Kumar, Yoonchang Sung, Peter Stone

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Nanyang Technological University(南洋理工大学) Sony AI(索尼人工智能)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对长时程操作任务强化学习挑战,提出LEACL框架,结合大语言模型与自动课程学习,用大语言模型分解任务并生成规范,由自动课程学习算法仅依稀疏奖励信号指导学习,在相关任务上取得更好渐近性能。

Comments 8 pages, 4 figures, Published in the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21799 2026-07-28 cs.CL cs.CY 版本更新 86%

Agentic Evaluation of Copyright Law Compliance

版权法合规性的智能体评估

Zheng Hui, Doni Bloomfield, Noam Kolt

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究LLM智能体版权法合规性评估问题,通过引入Copyright - Bench基准,由网站开发等商业任务组成,含提示变化与时间压力,对比智能体与人类基线,发现智能体存在选择版权作品及违规率受偏好和压力影响等情况。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24688 2026-07-28 cs.DB cs.CL cs.LG 新提交 86%

Beyond Scale and Generation: Understanding Language Model-based Entity Matching

超越规模和生成:理解基于语言模型的实体匹配

Zeyu Zhang, Xue Li, Iacer Calixto, Paul Groth, Sebastian Schelter

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究基于语言模型的实体匹配,通过控制因子研究Qwen3家族的多种架构、变体和大小,评估跨数据集可迁移性与计算成本,明确模型变体对双编码器的关键作用,以及不同匹配器架构性能差异因素,推动相关研究与基准设计发展。

Comments 12 pages, 6 figures, 7 tables. Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24339 2026-07-28 cs.AI cs.CL 新提交 86%

Gubernaut: A Deterministic Homeostatic Controller for Affect-Regulated LLM Agents, Validated Across Independent Model Families

Gubernaut:用于情感调节的大语言模型代理的确定性稳态控制器,在独立模型家族中得到验证

Dushyant Sharma

机构 * Gubernaut Research(Gubernaut研究)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型代理的故障模式,提出Gubernaut认知控制器,通过在四个前沿模型上预注册的评估协议验证,该控制器能使模型更平静,有恢复特征等机制,附带可重判记录及预注册故障模式。

Comments 26 pages, 7 figures, 3 tables. Data, transcripts, and analysis scripts: https://github.com/thegubernaut/Gubernaut_Validation Project page: https://gubernaut.com (archived at https://doi.org/10.5281/zenodo.21303518)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23710 2026-07-28 cs.CR cs.AI cs.HC cs.LG cs.MA 新提交 86%

The Illusion of Secure LLM Code: Closing the Security Gap via Iterative Reprompting

安全大语言模型代码的幻觉:通过迭代重新提示缩小安全差距

Ishpuneet Singh, Shreyas Mahajan, Gurjot Singh, Maninder Singh

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究大语言模型集成到软件开发中自主生成安全认证代码的能力,通过双模式评估框架结合四种提示策略评估五个AI编码助手,发现当前助手不能默认生成安全应用,企业部署需转向持续、标准驱动的验证管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24588 2026-07-28 cs.AI 新提交 85%

SIREN: Towards End-to-End Extreme-Weather Early Warning with Experience-Grounded LLM Agents

SIREN:借助基于经验的大语言模型智能体实现端到端极端天气预警

Hang Ni, Weijia Zhang, Fan Liu, Mengqian Lu, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) The World Sustainable Development Institute(世界可持续发展研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究借助大语言模型智能体实现端到端极端天气预警。开发了包含多任务问答实例的SIREN-Bench基准,发现现有框架差距后,构建基于经验的SIREN框架,结合多种技术,实验证明其在预警程序和预警链上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22898 2026-07-28 cs.SE cs.CL 新提交 85%

AssumptionMiner: Extracting, Tracing, and Revising Implicit Assumptions in LLM Code Generation

假设挖掘器:在大语言模型代码生成中提取、追踪和修正隐式假设

Jie "JW" Wu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究LLMs代码生成中隐式假设问题,提出AssumptionMiner框架,能生成显式假设层并实现针对性代码再生。通过新基准测试评估,结果显示该框架提升了代码生成的透明度与可控性。

Comments 20 pages, 6 figures, 9 tables. Submitted to IEEE Transactions on Software Engineering. Replication package: https://doi.org/10.5281/zenodo.21535058

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22588 2026-07-28 cs.AI cs.DC 新提交 85%

ParBench: A Benchmark for Reliable Evaluation of LLM Parallel Code Translation

ParBench:用于可靠评估大语言模型并行代码翻译的基准测试

Samyak Jhaveri, Erel Kaplan, Tom Yotam, Le Chen, Tomer Bitan, Niranjan Hasabnis, Gal Oren

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型并行代码翻译缺乏可靠评估方法的问题,提出ParBench基准框架,通过声明性规范评估,涵盖多开源套件与跨API翻译方向,经源增强测试,揭示了当前并行代码翻译存在的如方向不对称等障碍。

Comments 57 pages, 22 figures, 11 tables; includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23505 2026-07-28 cs.NE 新提交 85%

Benchmarking Zero-Shot LLM-Generated Parent Selection in Genetic Programming for Symbolic Regression

用于符号回归的遗传编程中零样本大语言模型生成的亲本选择基准测试

Hengzhe Zhang, Qi Chen, Bing Xue, Wolfgang Banzhaf, Mengjie Zhang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究符号回归遗传编程中零样本大语言模型生成亲本选择算子,在标准框架内对八个模型进行基准测试,比较不同模型生成算子在多个回归基准上的表现,发现Claude Sonnet~4.6和Gemini~3.1 Pro表现出色,证明零样本合成是可行方法。

Comments Accepted at PPSN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23308 2026-07-28 cs.SE 新提交 85%

Towards LLM-assisted High-Quality Property Generation for Solidity Smart Contracts

迈向用于Solidity智能合约的大语言模型辅助的高质量属性生成

Muhammad Wahid, Shahzaib Khan, Mashhood Ali, Muhammad Hassan, Muhammad Naiman Jalil, Affan Rauf

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究利用大语言模型为Solidity智能合约生成高质量属性,通过变异测试衡量属性质量,评估多种提示技术,发现Gemini Pro 1.5结合提示链平均变异得分高,个别合约表现突出,显示大语言模型在属性生成上有潜力达专家水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23976 2026-07-28 cs.CL cs.AI 新提交 84%

Tag Questions and the Generational Reversal of Sycophancy Across 45 Language Models

标签问题与45种语言模型中谄媚现象的代际反转

Tapan Parikh

机构 * Cornell Tech(康奈尔科技)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究在语言模型决策问题中附加标签的效应,通过特定实验设置在45个模型上测量,发现效应范围广且随代际反转,定位了抗性来源,表明标签极性更关键,工具能从模型行为读出反谄媚训练情况。

Comments 18 pages, 4 figures. Data, code, and raw model replies: https://github.com/tap2k/modelun. Interactive explorer: https://tap2k.github.io/modelun/suggestibility/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23386 2026-07-28 cs.AI 新提交 83%

Confidently Wrong: Exception Chain Collapse in Frontier LLM Rule Evaluation

确信错误:前沿大语言模型规则评估中的异常链崩溃

Paul Simpson, John Kozak, Lisa Doake

机构 * Aethis

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究前沿大语言模型在规则评估中异常链崩溃问题,提出神经符号架构Aethis资格模块,通过多方面验证,将不确定性从推理边界转移到规范边界,且相关内容公开可重现。

Comments 43 pages, 9 figures. Working paper v3.13.0. Benchmark data, rule encodings and per-case result artefacts: https://github.com/Aethis-ai/confidently-wrong-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23089 2026-07-28 cs.AI cs.PL 新提交 83%

Compiler-Grounded Hierarchical Diagnosis for LLM-Based Triton Kernel Optimization

基于编译器的大语言模型Triton内核优化分层诊断

Dongjie Chen, Ping Zhao, Bohua Zhan, Yulong Wang, Shushu Chen, Liangjun Feng, Hao Zhou, Min Shen, Linmu Wang, Weijia Sheng, Xiangyu Wei, Weijie Ding, Jianhui Huang, Yaoqing Gao

机构 * Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型内核优化中编译器优化失败原因难揭示的问题,提出基于编译器的Triton内核分层优化框架,通过跨层诊断实现从模式分类到源级重写的优化,在Ascend NPU上显著加速Triton内核。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22951 2026-07-28 stat.ML cs.AI cs.LG 新提交 82%

Modeling Memory-Dependent Reliability of LLMs: A Hidden Markov Model

对大语言模型的记忆相关可靠性建模:一种隐马尔可夫模型

Robab Aghazadeh Chakherlou, Siddartha Khastgir, Peter Popov, Xingyu Zhao

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型可靠性评估,传统方法有局限。通过放宽独立任务结果假设,引入隐马尔可夫模型扩展分层贝叶斯框架,捕捉顺序依赖性,经实验证明忽略此依赖性会使可靠性估计过度自信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18443 2026-07-28 cs.HC cs.AI cs.CL cs.CY 版本更新 82%

From "Help" to Helpful: A Hierarchical Assessment of LLMs in Mental e-Health Applications

从‘帮助’到‘有用’:对LLMs在心理健康电子服务中的分层评估

Philipp Steigerwald, Jens Albrecht

机构 * Technische Hochschule Nürnberg – Georg Simon Ohm(纽伦堡技术大学——格奥尔格·西蒙·欧姆学院)

专题命中 评测与基准 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了11种LLM在生成德国咨询邮件主题行中的表现,发现德国微调能提升性能,同时探讨了心理健康AI部署中的隐私、偏见和问责制等伦理问题。

Comments Accepted for the Springer CCIS post-proceedings of ICT4AWE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22885 2026-07-28 cs.CR 新提交 82%

ReCon: A Resource-Constrained Benchmark for LLM-Based Cybersecurity Compliance Across Ingestion and Retrieval Pipelines

ReCon:用于跨摄取和检索管道的基于大语言模型的网络安全合规性的资源受限基准测试

Rohit Negi, Rishik Jain, Soumyo V Chakarborty, Amit Negi, Sandeep K Shukla

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 研究政府、企业和机构网络安全合规问题,利用无需GPU和高内存的大语言模型进行合规检查任务基准测试,实验证明低资源大语言模型在政策文件合规检查中可提供良好一致性/准确性。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20492 2026-07-28 cs.LG cs.AI cs.CL 版本更新 82%

PhantomFill: When the Form Demands an Answer, Language Models Invent One

幻影填充:当表单需要答案时,语言模型会编造一个

Rana Muhammad Usman

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究语言模型在表单填充时的表现,发现表单格式会致其产生幻觉,通过实验展示不同模型在不同格式要求下的编造情况,发布幻影填充基准,测试一行模式代码修复方法,揭示模型在格式压力下诚实性受影响的问题。

Comments 12 pages, 6 figures. Benchmark, 4,500+ raw model outputs, and a schema linter: https://github.com/ranausmanai/phantomfill

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22824 2026-07-28 physics.med-ph cs.AI cs.CV 新提交 81%

Agentic Autoresearch for CT Reconstruction

用于CT重建的智能自动研究

Andreas Maier, Lucas Kachelriess, Siming Bayer, Yixing Huang, Yan Xia, Amber Simpson, Moritz Zaiss

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究CT重建方法比较难题,利用大语言模型智能体构建智能循环,独立实现、调整并基准测试26种方法,重组为紧凑求解器,发现理想数据排名无法预测现实噪声下表现,噪声会颠倒排名,重新训练可恢复部分排名,强调基准测试需考虑多种现实因素。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18770 2026-07-28 cs.IR cs.AI 版本更新 81%

Agentic Graph Retrieval-Augmented Generation for Auditable Commercial Registry Analysis

代理图RAG:利用协作AI导航无结构财务数据

Arthur Capozzi, Dirk Helbing

机构 * Computational Social Science ETH Zürich(计算社会科学 ETH 瑞士 Zurich) Computational Social Science, ETH Complexity Science Hub Zürich(计算社会科学 ETH 复杂性科学中心 Zurich) ETH Complexity Science Hub Zürich, Switzerland(ETH 复杂性科学中心 Zurich 瑞士) Vienna, Austria(维也纳 奥地利)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出了一种协作代理图RAG框架,用于专家分析商业登记数据。通过构建Neo4j知识图谱,结合确定性节点摄入、LLM提取弱节点以及确定性身份解析和去重,提升了多跳、时间相关和实体中心的查询能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06550 2026-07-28 cs.CR cs.AI 版本更新 81%

SkillSieve: A Hierarchical Triage Framework for Detecting Malicious AI Agent Skills

SkillSieve:一种用于检测恶意AI代理技能的分层分流框架

Yinghan Hou, Zongyou Yang

机构 * Department of Earth Science and Engineering(地球科学与工程系) Imperial College London(帝国理工学院伦敦分校) Department of Computer Science(计算机科学系) University College London(伦敦大学学院) Lingban Technology Co., Ltd.(灵伴科技有限公司) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出SkillSieve三层检测框架,通过启发式评分、LLM子任务分析和多LLM陪审团辩论,高效检测恶意AI代理技能,在390个技能基准上达到F1=0.920。

Comments 10 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24507 2026-07-28 cs.LG cs.AI 新提交 81%

UNIFUSION: Adapting Autoregressive Language Models into Discrete Diffusion under a Unified Reverse-Rate Objective

统一融合:在统一反向速率目标下将自回归语言模型适配到离散扩散

Xiaoyi Jiang, Jingyuan Li, Yixuan Jiang, Wei Liu, Yi Zhu, Zuoqiang Shi, Pipi Hu

机构 * Tsinghua University(清华大学) Beijing Institute of Mathematical Sciences and Applications(北京数学科学与应用研究院) Wuhan University(武汉大学) MathonAI(未知(暂未找到合适中文翻译))

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究旨在将预训练的自回归语言模型适配到均匀噪声扩散。通过建立不同模型间联系并推导转换,提出UNIFUSION方法。经实验评估,该方法能改善生成困惑度与单字熵权衡,在相同规模模型中多项指标表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12796 2026-07-28 cs.CL cs.AI cs.CY 版本更新 81%

The One-Word Census: Answer-Choice Conformity Across 44 Language Models

单字普查:44种语言模型中的答案选择一致性

Tapan Parikh

机构 * Cornell Tech(康奈尔科技)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究44种语言模型在单字选择上的一致性,用31个单轮提示词刻画,通过答案选择惊讶度评分,发现一致性程度高但模型间有差异且有结构,还对比了与人类规范差异,所有数据公开。

Comments 19 pages, 5 figures. Data, prompts, and code: https://github.com/tap2k/modelun

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05515 2026-07-28 cs.AI cs.CL cs.CV 版本更新 81%

LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal LEGO Assembly Assistants

乐高协同构建器:探索用于多模态乐高组装助手的细粒度视觉语言建模

Haochen Huang, Yue Su, Xin Sun, Moonisa Ahsan, Mohammad Aliannejadi, Irene Viola, Zhaochun Ren, Chuang Yu, Aneta Lisowska, Artem Belopolsky, Koen Hindriks, Pablo Cesar, Junxiao Wang, Jiahuan Pei

机构 * Vrije University of Amsterdam University of Amsterdam Centrum Wiskunde \& Informatic University of Amsterdam National Institute of Informatics Centrum Wiskunde \& Informatic Centrum Wiskunde \& Informatic Leiden University University College London Vrije University of Amsterdam Centrum Wiskunde \& Informatica Technische Universiteit Delft Guangzhou University Vrije University of Amsterdam Centrum Wiskunde \& Informatic

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对视觉语言模型理解多模态组装指令的挑战,提出乐高协同构建器基准,引入统一框架评估多个VLMs及推理模型,发现物体检测性能高但细粒度场景理解和状态检测有挑战,还发布相关资源助力未来研究。

Comments This version has been accepted by ICMI 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22642 2026-07-28 cs.AI cs.CL cs.LG cs.MA cs.SE 新提交 80%

CRAFT: Learn the Schema, Execute the Plan

CRAFT:学习模式,执行计划

Aakash Kolekar, Sahika Genc, Shahriar Shariat, Bunyamin Sisman, Tibor Mezi, Barbara Poblete, Shree Vandana Kachroo, Calvin Chi, Parth Parmar, Ari Singer, Prayaas Jain, Cindy Barker, Benoit Dumoulin

机构 * Amazon Advertising Foundations(亚马逊广告基金会) Amazon Web Services Agentic AI(亚马逊网络服务代理人工智能)

专题命中 评测与基准 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究企业编码代理将自然语言分析请求转换为可执行代码时的问题,提出两阶段训练后方法 CRAFT,先进行模式剥离的 PLAN 监督微调,再用执行形状的强化学习,评估显示其在多方面有提升并减少负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14718 2026-07-28 cs.DB cs.HC 版本更新 80%

Natural Language Interfaces for Databases: What Changes for SQL-Literate Users?

数据库的自然语言接口:对用户有何改变?

Panos Ipeirotis, Haotian Zheng

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 研究比较基于GPT-4o的NLIDB SQL-LLM与传统SQL平台Snowflake,发现接口改变工作类型非工作量,SQL-LLM用户查询速度快但准确性低,熟悉SQL的参与者转向自然语言后仍有验证负担。

Comments 26 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏