arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-01 至 2026-07-01 共收录 348 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 79 篇

2606.31630 2026-07-01 cs.LG 新提交 89%

Calibration, Not Compilation: Detecting and Repairing Misspecified Probabilistic Programs Written by Language Models

校准,而非编译:检测和修复语言模型编写的错误指定概率程序

Jian Xu, Delu Zeng, John Paisley, Qibin Zhao

机构 * RIKEN iTHEMS RIKEN AIP South China University of Technology(南方科技大学) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出用贝叶斯工作流(后验预测检查、模拟校准等)作为验证器,检测和修复LLM编写的概率程序中的统计错误,在检测(AUC 0.97)和修复(显著优于单元测试反馈)上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12164 2026-07-01 cs.CY cs.CL 版本更新 89%

The Language You Ask In: Language-Conditioned Ideological Divergence in LLM Analysis of Contested Political Documents

提问的语言:语言条件对LLM分析争议性政治文件时的意识形态分歧的影响

Oleg Smirnov

机构 * Microsoft(微软)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过俄语和乌克兰语语义等价提示,发现ChatGPT和Claude Opus在分析同一乌克兰公民社会文件时,输出出现系统性意识形态分歧,且分歧程度因模型而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31187 2026-07-01 cs.CV 新提交 88%

Learning to Deny: Action Denial in Multimodal Large Language Models

学习拒绝:多模态大语言模型中的动作否定

Raiyaan Abdullah, Shehreen Azad, Yogesh Singh Rawat

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出UCF101-AD基准测试,评估多模态大语言模型在强上下文线索下识别动作缺失的能力,发现模型倾向于肯定动作而非验证其真实性,并通过因果图CausalAct减少误报。

Comments Accepted to ECCV 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25747 2026-07-01 cs.SE 新提交 88%

CodeChat-Eval: Evaluating Large Language Models in Multi-Turn Code Refinement Dialogues

CodeChat-Eval:在多轮代码优化对话中评估大型语言模型

Guoxiang Guo, Kla Tantithamthavorn, Neelofar Neelofar, Yuanyuan Qi, Aldeida Aleti

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出CodeChat-Eval框架,通过动态指令选择算法构建多轮代码优化对话评估会话,发现LLMs在多轮优化中功能正确性显著下降(19.2%-69.2%),逻辑级优化和新增请求导致最大下降。

Comments Accepted by ICSME26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31314 2026-07-01 eess.SY cs.SY 新提交 87%

A Novel Method for Differential-Algebraic Dynamic Model Discovery in Power Systems: An LLM-Based Multi-Agent Collaborative Framework

一种电力系统微分代数动态模型发现的新方法:基于LLM的多智能体协作框架

Xinming Wang, Fan Tang, Yingli Wei, Yakun He, Zhe Liu, Ping Jiang, Haoyu Wu, Zihan Guo, Chao Shen

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 针对电力系统强非线性、多时间尺度耦合及黑箱控制逻辑导致的模型发现难题,提出基于大语言模型的多智能体协作框架,通过并行生成候选方程结构并联合恢复状态动态、代数约束和关键中间变量,在同步发电机和构网型逆变器案例中优于单智能体方法和传统符号回归。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31310 2026-07-01 cs.CL cs.MM 新提交 86%

LOPA: Enhancing Spoken Language Assessment via Latent Ordinal Prototype Alignment

LOPA:通过潜在序数原型对齐增强口语评估

Hong-Yun Lin, Fu-An Chao, Bi-Cheng Yan, Berlin Chen

机构 * National Taiwan Normal University(国立台湾师范大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出LOPA正则化器,在潜在空间施加序数几何先验,结合SALR自适应提取Whisper编码器多层表示,以0.361 RMSE媲美十亿参数系统,无需LLM微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22723 2026-07-01 cs.CL 新提交 86%

BLUEX v2: Benchmarking LLMs on Open-Ended Questions from Brazilian University Entrance Exams

BLUEX v2: 对巴西大学入学考试开放性问题的大语言模型基准测试

João Guilherme Alves Santos, Giovana Kerche Bonás, Thiago Laitz, Thales Sales Almeida, Helio Pedrini

机构 * UNICAMP(坎皮纳斯州立大学) Tropic AI Maritaca AI

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对葡萄牙语开放性问题评估的不足,提出BLUEX v2基准,包含巴西两所顶尖大学第二阶段入学考试的395道题,采用LLM-as-a-judge评估21个模型,发现数学推理和图像理解是最难的能力维度。

Comments 15 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19501 2026-07-01 cs.AI cs.CL cs.LG q-fin.RM 新提交 86%

DeXposure-Claw: An Agentic System for DeFi Risk Supervision

DeXposure-Claw: 一个用于DeFi风险监管的智能体系统

Aijie Shu, Bowei Chen, Wenbin Wu, Cathy Yi-Hsuan Chen, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学) University of Glasgow(格拉斯哥大学) University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对DeFi监管中LLM智能体易误报的问题,提出DeXposure-Claw系统,通过图时间序列基础模型预测风险网络,结合确定性监控和置信度门控生成可审计监管票据,并构建六轴评估基准DeXposure-Bench,实验验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31470 2026-07-01 cs.AI 新提交 85%

CLOUDADV: Decision-Aligned Instance Sizing with Zero-Shot Foundation Models under Drift

CLOUDADV: 漂移下基于零样本基础模型的决策对齐实例大小调整

Jack Bell, Giacomo Carfi, Gerlando Gramaglia, Andrea Simioni, Daniele Fontani, Vincenzo Lomonaco

机构 * University of Pisa(比萨大学) Independent Researcher(独立研究员) Sintra Consulting Limited(Sintra咨询有限公司) Luiss University(路易斯大学)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出CLOUDADV系统,结合零样本时间序列预测与有界推荐生成,在非平稳云环境中实现决策对齐的实例大小调整,通过参考推荐和成本节约评估,在7个生产VM案例中实现52.9%成本节省。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17442 2026-07-01 cs.CV cs.AI 版本更新 85%

REMSA: Foundation Model Selection for Remote Sensing via a Constraint-Aware Agent

REMSA:通过约束感知代理进行遥感基础模型选择

Binger Chen, Tacettin Emre Bök, Behnood Rasti, Volker Markl, Begüm Demir

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学) U AI(5U AI) Technische Universität Berlin & BIFOLD(柏林工业大学 & BIFOLD)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出REMSA,一种基于结构化数据库RS-FMD的约束感知代理,通过自然语言查询自动选择遥感基础模型,结合元数据检索与上下文学习,在专家评估基准中优于多种基线。

Comments Code and data available at https://github.com/be-chen/REMSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30887 2026-07-01 cs.CL cs.AI cs.MA 新提交 85%

Training Therapeutic Judges and Multi-Agent Systems for Human-Aligned Mental Health Support

训练治疗性评判者与多智能体系统以实现人类对齐的心理健康支持

Mizanur Rahman, Abeer Badawi, Elahe Rahimi, Laleh Seyyed-Kalantari, Frank Rudzicz, Enamul Hoque, Elham Dolatabadi

机构 * York University(约克大学) Vector Institute(向量研究所) Connected Minds Dalhousie University(达尔豪斯大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一个框架,通过两阶段训练(TheraJudge评判者与TheraAgent多智能体系统)将治疗性响应生成转化为决策优化问题,显著提升心理健康LLM的治疗质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30790 2026-07-01 cs.CL cs.AI 新提交 85%

Indi-RomCoM: Code-Mixed Benchmark for Evaluating LLMs on Romanized Indic-English Instructions

Indi-RomCoM:评估LLM在罗马化印度语-英语混合指令上的基准测试

Avisha Das, Mihir Parmar, Mohana Ramnath, Pulkit Verma

机构 * Shiv Nadar University Chennai(金奈希夫·纳达尔大学) Google Cloud AI Research(谷歌云人工智能研究) IIT Madras(印度理工学院马德拉斯分校)

专题命中 评测与基准 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Indi-RomCoM基准,用于评估大语言模型在罗马化印度语-英语混合指令上的表现,涵盖7个任务、4种语言和3种混合强度,发现模型性能随混合密度增加而下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31213 2026-07-01 cs.CL cs.AI cs.LG 新提交 83%

Can LLMs Imagine Moral Alternatives Beyond Binary Dilemmas?

LLMs能否想象超越二元困境的道德替代方案?

Jongchan Choi, Nari Yang, Sung Soo Park, Jaemin Cho, Han Seoyoung, Haerin Shin, Jun-Hyung Park

机构 * Korea University(高丽大学) XenoStep AI Hankuk University of Foreign Studies(韩国外国语大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLMs在道德困境中缺乏替代方案想象能力的问题,提出MoralAltDataset数据集,通过引入妥协和重构替代方案,发现LLMs倾向于选择替代方案,且生成的替代方案在质量和伦理标准上优于人类。

Comments "23 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30810 2026-07-01 cs.SE 新提交 83%

Towards Knowledge Alignment in Code LLMs: Contrastive Unlearning for Evolving APIs

面向代码大语言模型的知识对齐:针对演化API的对比性遗忘

Huy Q. Tran, Dang H. Vu, Tuyen N. Dinh, Anh H. D. Nguyen, Anh N. H. Vu, Anh M. T. Bui, Phuong T. Nguyen

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出对比性遗忘方法CURE,在抑制废弃API的同时鼓励正确替代,使代码LLM适应演化库,实验表明该方法优于现有基线。

Comments The paper has been peer reviewed and accepted to the 42nd International Conference on Software Maintenance and Evolution (ICSME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31551 2026-07-01 cs.CL 新提交 83%

AutoTrainess: Teaching Language Models to Improve Language Models Autonomously

AutoTrainess: 教语言模型自主改进语言模型

Zhaojian Yu, Penghao Yin, Shuzheng Gao, Shilin He, Kai Cai, Xiao-Ping Zhang

专题命中 评测与基准 :language model(title,abstract);post-training(abstract);分类 cs.CL

AI总结 提出AutoTrainess智能体,通过外部化人类经验为工作流和约束,在PostTrainBench上超越CLI基线,平均得分从23.21提升至26.94。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30963 2026-07-01 cs.SE cs.AI 新提交 83%

Loc2Repair: A Framework for Evaluating the Impact of File-Level Issue Localization in Repo-Level LLM Repair

Loc2Repair:评估文件级问题定位在仓库级LLM修复中影响的框架

Mohammad Nour Al Awad, Sergey Ivanov

机构 * ITMO University(ITMO大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出Loc2Repair模块化评估框架,通过解耦定位与修复,在SWE-bench Verified上验证文件级定位能一致提升修复率(44.7%→49.1%)并降低平均耗时。

Comments To appear in the Proceedings of the Generative Code Intelligence Workshop (GeCoIn 2026), co-located with the 35th International Joint Conference on Artificial Intelligence (IJCAI-ECAI 2026), Bremen, Germany, August 15--17, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30775 2026-07-01 cs.CL cs.AI 新提交 82%

A Single Rewrite Suffices: Empirical Lessons from Production Skill Description Optimization

一次重写就足够:来自生产技能描述优化的经验教训

Yangqiaoyu Zhou, Mohammad Alqudah, Kwei-Herng Lai, Aaron Halfaker, Yingqi Xiong, Yaar Harari

机构 * Microsoft(微软)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 针对企业AI代理中技能描述重叠导致路由错误的问题,提出自动化优化管道,在9技能生产系统上达到与手动调优相当的F1值(79.2% vs 79.4%),并将每技能工程时间从120分钟降至3.8分钟。消融实验表明,仅用一次LLM重写即可获得大部分改进。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19047 2026-07-01 cs.CL cs.AI cs.IR 版本更新 82%

RARE: Redundancy-Aware Retrieval Evaluation Framework for High-Similarity Corpora

RARE:面向高相似性语料的冗余感知检索评估框架

Hanjun Cho, Jay-Yoon Lee

机构 * Allganize Seoul National University(首尔国立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 RARE通过分解文档为原子事实和增强LLM生成数据,构建更真实的基准,揭示当前评估体系无法捕捉的鲁棒性差距。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14251 2026-07-01 cs.CV 版本更新 82%

LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR

LightOnOCR: 一个用于最先进OCR的10亿参数端到端多语言视觉语言模型

Said Taghadouini, Adrien Cavaillès, Baptiste Aubertin

机构 * LightOn

专题命中 评测与基准 :language model(title,abstract);pretraining(abstract)

AI总结 提出1B参数的端到端多语言视觉语言模型LightOnOCR-2,通过大规模高质量蒸馏训练,在OlmOCR-Bench上达到最先进结果,模型大小仅为先前最佳模型的1/9,速度更快,并扩展了输出格式以预测嵌入图像的归一化边界框。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31745 2026-07-01 cs.CV cs.AI 新提交 81%

JL1-CC&QA: Extending the JL1-CD Benchmark with Change Captioning and Question Answering

JL1-CC&QA:扩展JL1-CD基准,增加变化描述和问答

Ziyuan Liu, Ruifei Zhu, Ouqiao Ma, Yuantao Gu

机构 * Department of Electronic Engineering, Beijing National Research Center for Information Science and Technology, Tsinghua University(清华大学电子工程系,北京信息科学与技术国家研究中心) Chang Guang Satellite Technology Co., Ltd. (CGSTL)(长光卫星技术股份有限公司) College of Communications Engineering, Army Engineering University of PLA(中国人民解放军陆军工程大学通信工程学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出JL1-CC&QA多任务基准,通过变化描述和问答扩展JL1-CD,利用吉林一号卫星图像和三级标注流程,推动遥感变化理解。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31461 2026-07-01 cs.AI cs.CE 新提交 81%

CSTrader: A Testbed for Language-Grounded Trading in a Community-Driven Virtual Asset Market

CSTrader: 社区驱动虚拟资产市场中基于语言的交易测试平台

Yao Shi, Kingfung Luo, Nan Tang, Yuyu Luo

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CSTrader多智能体框架,通过集成异构信号、技术分析、流动性、事件和反转情绪等智能体,在CS2皮肤市场实现语言到交易的映射,在波动期取得7.58%累计收益并控制风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30819 2026-07-01 cs.CR cs.AI 新提交 81%

AI-Generated PowerShell Malware: An Experimental Framework and Dataset

AI生成的PowerShell恶意软件:一个实验框架与数据集

Luciano Pianese, Vittorio Orbinato, Pietro Liguori, Roberto Natella

机构 * Gran Sasso Science Institute(格兰萨索科学研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出一个评估LLM生成PowerShell恶意软件的实验框架,包含动态分析沙箱和人工标注的真实恶意软件数据集,发现LLM生成的恶意软件与真实样本在触发OS恶意事件上高度相似。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30814 2026-07-01 cs.CL 新提交 81%

When Calibration Rankings Reverse: Accuracy-Controlled Evaluation for Fair Comparison of LLMs

当校准排名反转:面向LLM公平比较的精度控制评估框架

Zhichao Yang, Caiqi Zhang, Ruihan Yang, Chengzu Li, Nigel Collier, Deqing Yang

机构 * Fudan University(复旦大学) University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对全局校准指标因模型精度差异导致比较不公平的问题,提出ACE精度控制评估框架,通过实例对齐、分布对齐和候选对齐三种视角实现公平比较,发现原始指标下的优势在控制精度后大幅减弱,排名反转频繁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27154 2026-07-01 cs.AI 新提交 81%

OpenRCA 2.0: From Outcome Labels to Causal Process Supervision

OpenRCA 2.0:从结果标签到因果过程监督

Aoyang Fang, Yifan Yang, Jin'ao Shang, Qisheng Lu, Junjielung Xu, Rui Wang, Songhan Zhang, Yuzhong Zhang, Boxi Yu, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对现有根因分析数据集仅标注结果而忽略因果传播路径的问题,提出PAVE协议重建因果路径,构建OpenRCA 2.0基准,发现LLM在根因定位中因果验证不足的缺陷。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31407 2026-07-01 cs.CV cs.AI cs.CL 新提交 81%

Visual Semantic Entropy: Do Vision Language Models Recognize Visual Ambiguity?

视觉语义熵:视觉语言模型能否识别视觉模糊性?

Ta Duc Huy, Trang Nguyen, Townim Chowdhury, Ankit Yadav, Minh-Son To, Zhibin Liao, Johan W. Verjans, Vu Minh Hieu Phan

机构 * Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) Flinders University(弗林德斯大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对视觉语言模型在模糊输入下产生自信错误预测的问题,提出视觉语义熵(VSE),通过仅扰动图像并聚类生成答案的语义原型来量化不确定性,在五个模型和五个基准上达到最优。

Comments Accepted at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03981 2026-07-01 cs.LG cs.AI econ.EM 版本更新 81%

DeXposure-FM: A Time-series, Graph Foundation Model for Credit Exposures and Stability on Decentralized Financial Networks

DeXposure-FM:面向去中心化金融网络信用暴露与稳定性的时序图基础模型

Aijie Shu, Wenbin Wu, Gbenga Ibikunle, Fengxiang He

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出首个用于DeFi网络协议间信用暴露度量与预测的时序图基础模型DeXposure-FM,采用图表格编码器与多任务头,在4300+协议、602条区块链的数据上训练,优于现有方法,并支持宏观审慎监测与压力测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31744 2026-07-01 eess.SY cs.SY 新提交 80%

A Conversational Agentic Interface to Physics-Based Household Digital Twins for Residential Energy Decision Support

面向住宅能源决策支持的基于物理的家庭数字孪生对话代理接口

Costas Mylonas, Titos Georgoulakis, Magda Foti

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种对话代理框架,通过自然语言交互使基于物理的家庭能源模拟易于使用,结合家庭数字孪生与大型语言模型代理层,实现高可靠性的住宅能源决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31543 2026-07-01 cs.AI cs.CL cs.LG 新提交 80%

Modality-Driven Search with Holistic Trace Judging for ARC-AGI-2

基于模态驱动与整体轨迹判断的ARC-AGI-2求解方法

Johan Land

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对抽象推理中候选轨迹选择难题,提出模态驱动搜索生成多样化候选,并结合整体判断模型在长上下文中联合比较所有轨迹,在ARC-AGI-2上以低成本达到72.9%准确率,超越前沿模型。

Comments 37 pages, 4 figures; source code available at AGI" target="_blank" rel="noopener">https://github.com/beetree/ARC-AGI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31012 2026-07-01 cs.HC 新提交 80%

Evaluating Interactivity: Toward Automated Assessment of AI-Generated Explorable Explanations

评估交互性:迈向AI生成的可探索解释的自动化评估

Xiaozao Wang, Zhewei Wang, Hongyi Wen

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出EE-Eval框架,将交互性形式化为有限状态机,通过图度量和嵌入比较评估AI生成可探索解释的结构与语义相似性,优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30809 2026-07-01 cs.CV cs.RO 新提交 80%

GaussLite: Online Task-Conditioned 3D Gaussian Splatting for Real-Time Robotic Mapping

GaussLite:面向实时机器人建图的任务条件化3D高斯泼溅

Annika Thomas, Mason Peterson, Jonathan P. How

机构 * Aerospace Controls Laboratory, MIT(麻省理工学院航空航天控制实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出GaussLite,一种任务驱动的3DGS建图系统,通过自然语言任务规范调节表示密度,利用LLM解析器提取目标并实时生成像素级相关性掩码,在有限资源下实现实时建图,ROI PSNR提升约2.72 dB。

详情

展开后加载摘要…

URL PDF HTML 收藏