arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-29 至 2026-07-29 共收录 286 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 66 篇

2607.24893 2026-07-29 cs.CR cs.AI 新提交 83%

Early Detection of Distributed Backdoors in Multi-Agent LLM Systems: A Characterization Study

多智能体大语言模型系统中分布式后门的早期检测:一项特征研究

Diego Fernandez Arias, Dev Prashant Mistry, Ren Wang, Yibo Hu

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.AI

AI总结 研究多智能体大语言模型系统中分布式后门早期检测,构建分层多智能体系统实例,通过记录片段注入及载荷组装执行时间来检测。前缀检测器能较早标记多数成功攻击,部分检测器依赖表面线索,微调模型可减少线索去除后的损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25873 2026-07-29 cs.SE cs.AI 新提交 81%

How Do LLMs Read Bug Reports? An Empirical Study of Attention in LLMs for Automated Program Repair

大语言模型如何读取错误报告?基于大语言模型的自动程序修复中注意力的实证研究

Ramtin Ehsani, Irene Manotas, Saurabh Pujar, Luca Buratti, Preetha Chatterjee

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于大语言模型的自动程序修复中模型注意力模式,通过分析319个真实错误,探究其在错误报告各部分的分布、成功与失败修复的注意力差异及与开发者重视信息的比较,发现注意力分配错误是失败关键因素,为改进系统提供见解。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE) 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25681 2026-07-29 cs.AI 新提交 81%

Cognivia: A Cognitive Behavioral Therapy Copilot for Evidence-Based Mental Healthcare

Cognivia:用于循证心理保健的认知行为疗法辅助工具

Qi Chen, Siria Xiyueyao Luo, Jian Wang, Yuan Shi, Haocong Rao, Xuejiao Zhao

机构 * Sichuan University(四川大学) Southwest Petroleum University(西南石油大学) University of Groningen(格罗宁根大学) West China Hospital, Sichuan University(四川大学华西医院) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对认知行为疗法应用受限及大语言模型在心理健康应用存在的问题,提出Cognivia,通过整合权威文本、问答数据,运用多阶段提示等策略构建并微调模型,还提出评估框架,该模型经多种评估验证效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25400 2026-07-29 cs.AI 新提交 81%

COVENANT: Natural-Language Workflow Compilation for Aligned Agent Execution

COVENANT:用于对齐代理执行的自然语言工作流编译

Jincheng Wang, Min Zheng, Tao Wei

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型代理执行工作流指令时的未对齐问题,提出COVENANT架构,将指令转为工作流抽象语法树和控制流图,运行时控制器按要求检查提议并反馈。实验表明该方法大幅提升成功率、降低未对齐失败率,推动工作流可靠执行。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25045 2026-07-29 cs.AI eess.SP q-bio.NC 新提交 81%

CogEEGAgent: Toward Autonomous Cognitive EEG Analysis with Grounded Execution and Selection-Aware Verification

CogEEGAgent:通过基于执行和选择感知验证实现自主认知脑电图分析

Dengzhe Hou, Lingyu Jiang, Fangzhou Lin, Kazunori D Yamada

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究针对认知EEG分析需专业知识及选择多的问题,提出基于MNE-Python的CogEEGAgent代理,LLM解释意图,确定性组件验证控制,在基准测试等中表现良好,建立了有限自主性和可审计自动化框架。

Comments 16 pages, 5 figures, and 16 tables. The supplementary material is included in the same PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24782 2026-07-29 cs.AI 新提交 81%

Personalization, Personas, and Forecasting in Value Alignment

价值对齐中的个性化、角色设定与预测

James Wedgwood, Pratiksha Thaker, Neil Kale, Virginia Smith

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究探讨LLM行为受人类身份影响的方式,通过WVS测试不同框架的互换性,在多语言多国家问题上评估多个模型,发现提示框架是文化对齐的关键因素,不同框架效果有别,对齐增益集中在部分价值维度,制度信任等问题仍难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24754 2026-07-29 cs.HC cs.AI 新提交 81%

CARE-MH: Towards Unified, Reproducible, and Comparable Evaluation of Mental Health LLMs

CARE-MH:迈向心理健康语言模型的统一、可重现和可比评估

Asher Sprigler, Yixue Zhao, Yi Ding

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对心理健康语言模型评估难重现、难比较的问题,提出CARE-MH统一框架,通过重现分析现有基准,发现可重复性取决于模型稳定性,跨基准分歧源于指标定义差异,强调了标准化评估配置和共享指标定义的必要性。

Comments 39 pages, 22 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07195 2026-07-29 cs.SE cs.LG 版本更新 81%

Automated Modernization of Machine Learning Engineering Notebooks for Reproducibility

机器学习工程笔记本的自动化现代化进程以实现可重现性

Bihui Jin, Kaiyuan Wang, Pengyu Nie

机构 * University of Waterloo(滑铁卢大学) Google(谷歌公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 本文提出MLEModernizer,通过LLM驱动的框架自动化现代化工机器学习工程笔记本,以恢复其在不断变化的环境中的可重现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26000 2026-07-29 cs.LG cs.AI 新提交 81%

Empirical Evaluation of Out-Of-Distribution Performance of Tabular Foundation Models

表格基础模型的分布外性能实证评估

Malena Loza, David Chushig-Muzo, Eva Milara, Luis Bote-Curiel, Luis Estrada-Petrocelli, Felipe Grijalva

机构 * Colegio de Ciencias e Ingenierías, Universidad San Francisco de Quito (USFQ)(基多圣弗朗西斯科大学科学与工程学院) Rey Juan Carlos University(胡安·卡洛斯国王大学) Facultad de Ingeniería, Universidad Latina de Panamá(巴拿马拉丁大学工程学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究对九种表格基础模型进行分布外性能实证评估,涵盖多种策略与架构,用三个真实世界数据集测试。结果显示模型在分布变化下会退化,还存在可扩展性差距,扩展了表格数据分布外的基准,为高风险领域应用提供证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04569 2026-07-29 eess.SY cs.SY 版本更新 80%

LLMs for Agentic Home Energy Management

用于智能家庭能源管理的大语言模型

Sokipriala Jonah, Queen Moses, Abiola Babatunde, Michael Ajao-Olarinoye, Daniel Bammeke

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究家庭能源管理系统中,大语言模型智能体能否为多设备家庭能源调度提供自然语言接口。通过工具调用ReAct智能体及相关数据,对三个商业模型进行基准测试,结果显示模型表现各异,能实现高调度成功率和接近最优性。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25814 2026-07-29 cs.CL cs.CR 新提交 79%

Evaluation of Adversarial Robustness in Arabic Language Models

阿拉伯语语言模型中的对抗鲁棒性评估

Anwar Alajmi, Ayed Salman, Imtiaz Ahmad

机构 * Kuwait University(科威特大学) College of Business Studies, Public Authority of Applied Education and Training(应用教育与培训公共管理局商业研究学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 研究评估五个先进阿拉伯语语言模型在不同攻击下的鲁棒性,探索对抗训练防御技术,发现不同攻击对模型准确率影响各异,对抗训练提升了整体弹性,但面对字符级噪声仍有挑战,凸显了当前防御策略在阿拉伯语中的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24810 2026-07-29 cs.AI eess.IV 新提交 79%

RRS-10K: A Multitask Vision-Language Model Benchmark for Rare Remote Sensing Image Interpretation

RRS-10K:用于罕见遥感图像解释的多任务视觉语言模型基准测试

Yuqiao Lai, Jiancheng Qi, Fei Wang, Yuxin Liu, Kun Li, Ye Chen, Yan Gao, Yanyan Wei

机构 * Laboratory of Intelligent Language Processing, National University of Defense Technology(国防科技大学智能语言处理实验室) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) United Arab Emirates University(阿联酋大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 针对视觉语言模型在罕见遥感图像解释能力不足的问题,提出RRS-10K基准测试,含军事遥感图像及问答对,构建时引入干扰项过滤策略,评估多个模型,揭示其性能弱点,为开发更可靠的遥感视觉语言模型提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24763 2026-07-29 cs.AI 新提交 79%

CaRE Compute-aware Remasking Evaluation Protocol for Masked Diffusion Language Models

用于掩码扩散语言模型的计算感知重掩码评估协议

Yash Shah, Abhijit Chakraborty, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) MongoDB(MongoDB公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究针对掩码扩散语言模型评估标准不完善的问题,提出计算感知评估框架CaRE,通过标准化函数评估实际数量等方法审核重掩码策略,应用于多种模型和数据集,揭示了温度、计算匹配等因素对评估的影响,发布相关内容确保评估可重复可比。

Comments updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25340 2026-07-29 cs.AI cs.CL 新提交 79%

Cardiologent: Multi-Agent Clinical Decision Support for Patient-Level Arrhythmia Assessment, Urgency, and Management

Cardiologent:用于患者级心律失常评估、紧急情况和管理的多智能体临床决策支持

Sukju Oh, Moo-Yong Rhee, Jae-Sik Jang, Sukkyu Sun

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对患者级心律失常决策支持问题,提出多智能体系统Cardiologent,每个信号对应智能体基于测量特征读取数据,整合为心律概况并对照指南推理,经评估在多方面表现最佳,使决策可审核,向连续监测迈进。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25640 2026-07-29 cs.IR 新提交 78%

LLM-as-a-Judge for Evaluating System Responses in Conversational Music Recommendation

大语言模型作为评估对话式音乐推荐系统响应的评判器

Seungheon Doh, Bruno Sguerra, Sergio Oramas, Elena V. Epure, Juhan Nam

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究对话式音乐推荐系统中用大语言模型评估系统响应的可靠性,通过抽取会话、用四个指令微调的大语言模型生成候选响应,收集领域专家评分并分析,发现其与人工评估适度正相关且优于基线,还分析了性能随模型规模等的变化。

Comments Accepted for publication at the 20th ACM Conference on Recommender Systems (ACM-RecSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25572 2026-07-29 cs.CR 新提交 78%

Mapping CVEs to MITRE ATT&CK Techniques: A Curated Gold-Set Classifier and the Limits of LLM-Assisted Label Expansion

将通用漏洞披露(CVE)映射到MITRE ATT&CK技术:一个精心策划的黄金集分类器和大语言模型辅助标签扩展的局限性

Cédric Bonhomme, Alexandre Dulaunoy

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究从自由文本漏洞描述映射CVE到MITRE ATT&CK技术,训练多标签分类器提升召回率等指标。探讨大语言模型辅助标签扩展,发现其受评估噪声影响,无法可靠改进,分类器受标签质量而非数据集大小限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03831 2026-07-29 cs.CV 版本更新 78%

Universal Pansharpening Model

通用全分辨率融合基础模型

Hebaixu Wang, Jing Zhang, Haonan Guo, Di Wang, Jiayi Ma, Bo Du, Liangpei Zhang

机构 * School of Electronic Information, Wuhan University(武汉大学电子信息学院) School of Computer Science, Wuhan University(武汉大学计算机学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) Zhongguancun Academy(中关村学院)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 FoundPS是一种通用全分辨率融合基础模型,通过模态交错Transformer和潜在扩散桥梁模型实现跨传感器和场景的稳健融合,提升全分辨率融合的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25675 2026-07-29 cs.AI 新提交 77%

DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space

DecoEvo:文本空间中求解器与评分标准生成器技能的分数解耦协同进化

Jiangwang Chen, Zixin Song, Junlin Liu, Shuaiyu Zhou, Haiyan Wu, Haihan Shi, Chenxi Zhou, Hanqing Li, Xiao Yang, Da Zhu, Guanjun Jiang, Hai Wan, Xibin Zhao

机构 * Tsinghua University(清华大学) Qwen Business Unit of Alibaba(阿里巴巴的通义业务部) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究文本空间优化中现有方法瓶颈,提出DecoEvo方法,通过解耦目标协同进化求解器与评分标准生成器技能,不依赖黄金评分标准,在多基准和大语言模型主干上表现优异,有显著相对增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24766 2026-07-29 cs.AI 新提交 77%

Crystalis: Progressive Nucleation and Semantic Annealing for Coordinated Multi-View Visualization Generation

Crystalis:用于协同多视图可视化生成的渐进式成核与语义退火

Dazhen Deng, Zhaoping He, Xin Qian, Xiaotong Wang, Zi Ying, Yingcai Wu

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 研究针对大语言模型难以生成协同多视图可视化的问题,提出Crystalis框架,基于以查询为中心的CMV建模,通过渐进式成核和语义退火机制,在多任务基准测试中取得高成功率,且经用户研究验证了工作流程可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26024 2026-07-29 cs.HC cs.SD eess.AS 新提交 75%

LLM4OSC: Profile-Bound Natural Language Control with Deterministic Validation for Open Sound Control

LLM4OSC:用于开放声音控制的具有确定性验证的配置文件约束自然语言控制

Yuan-Yi Fan

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对开放声音控制中语言模型的问题,提出LLM4OSC本地优先架构,通过人工审核配置文件等方式进行验证等操作,在特定配置文件测试中后端表现良好,主张将提议-验证-发送和错误发送率作为关键指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25152 2026-07-29 cs.AI 新提交 74%

When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops

智能体循环何时会将停滞误认为进步?长期运行的自主语言模型智能体循环中的自我评估偏差与外部基础验证

Hyundoo Park, Byungho Choi

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 研究长期运行的自主智能体循环中自我评估偏差导致的“进步幻觉”问题,通过构建测试平台,控制评估者信息通道类型,发现自我报告无意义,带内评判者也有偏差,指出开放式目标需带外评估,强调评估者依据对结果的重要性。

Comments 23 pages. Preregistered pilot measurement study. Also deposited on Zenodo (concept DOI 10.5281/zenodo.21594735)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25933 2026-07-29 cs.CL cs.AI 新提交 73%

Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases

评估具有挑战性的真实世界临床病例中的多轮多模态诊断推理

Rui Yang, Weihao Xuan, Yi Lin, Zhuhan Bao, Jonathan Chong Kai Liew, Matthew Yu Heng Wong, Nicolás Lescano, Nikita R. Paripati, Emily Ling-Lin Pai, Jiarui Liu, Heli Qi, Heng-Jui Chang, Benny Kai Guo Loo, Huitao Li, Kunyu Yu, Yufan Wang, Chuan Hong, Shijian Lu, Douglas Teodoro, Naoto Yokoya, Ross Koppel, Mona Diab, Hua Xu, David W. Bates, Nan Liu, Yifan Peng

机构 * Center for Biomedical Data Science, Duke-NUS Medical School(生物医学数据科学中心,杜克 - 新加坡国立大学医学院) Duke-NUS AI + Medical Sciences Initiative, Duke-NUS Medical School(杜克 - 新加坡国立大学人工智能与医学科学计划,杜克 - 新加坡国立大学医学院) Department of Population Health Sciences, Weill Cornell Medicine(人口健康科学系,威尔康奈尔医学院) System Engineering, College of Engineering, Cornell University(系统工程,康奈尔大学工程学院) Graduate School of Frontier Sciences, The University of Tokyo(前沿科学研究生院,东京大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) Department of Biostatistics and Bioinformatics, Duke University(生物统计学与生物信息学系,杜克大学) Perelman School of Medicine, University of Pennsylvania(佩雷尔曼医学院,宾夕法尼亚大学) School of Clinical Medicine, University of Cambridge(临床医学学院,剑桥大学) Hospital of the University of Pennsylvania(宾夕法尼亚大学医院) Children’s Hospital of Philadelphia (CHOP)(费城儿童医院) Department of Anatomic Pathology and Laboratory Medicine, Hospital of the University of Pennsylvania(解剖病理学与检验医学系,宾夕法尼亚大学医院) Department of Pathology and Laboratory Medicine, University of California, San Francisco(病理学与检验医学系,加州大学旧金山分校) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有多模态大语言模型评估难以捕捉现实临床诊断复杂性的问题,开发ClinMM-Bench基准,用两级框架评估15个模型,发现专有模型诊断准确性最高,但各模型完全正确诊断比例有限,当前模型诊断推理有局限并明确了失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25485 2026-07-29 cs.AI cs.CL 新提交 73%

PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents

PatientAgentBench:一个用于评估面向患者的健康人工智能代理的基准框架

Korosh Vatanparvar, Ashutosh Joshi, Maria Xenochristou, Mohammad Abuzar Hashemi, Prasad Kasu, Deepak Bansal, Daniel Lopez-Martinez, Anchal Nema, Ramya Ganesan, Will Kimbrough, Alex Woody, Yadunandana Rao, Dilek Hakkani-Tur, Wilko Schulz-Mahlendorf

机构 * Amazon Health AI(亚马逊健康人工智能)

专题命中 评测与基准 :LLM(abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 研究面向患者的健康人工智能代理评估问题,核心方法是用PatientAgentBench框架,通过语言模型评审团在多维度评估,主要贡献是发现模型临床差距,发布可重复、经临床医生验证的评估标准助领域弥补差距。

Comments Code: https://github.com/amazon-science/PatientAgentBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24767 2026-07-29 cs.IR cs.AI cs.CL 新提交 73%

The Effect of Text Chunk Size on Retrieval-Augmented Generation Performance

文本块大小对检索增强生成性能的影响

German Garrido-Lestache Belinchon, Hugo Garrido-Lestache Belinchon

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究文本块大小对检索增强生成性能的影响,评估其与检索段数量如何影响生成质量和检索效果,通过比较配置,以更好理解文档分割对检索增强生成系统性能和效率的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25921 2026-07-29 cs.CV cs.AI 新提交 70%

Evaluating VLMs for Autonomous Agent-Driven Geometry Clipping Detection in Video Game QA

评估用于视频游戏QA中自主代理驱动的几何裁剪检测的视觉语言模型

Carlos Celemin, Benedict Wilkins, Adrián Barahona-Ríos, Saman Zadtootaghaj, Nabajeet Barman

机构 * Sony Interactive Entertainment(索尼互动娱乐)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 研究在代理驱动游戏QA中用VLMs检测几何裁剪异常,通过自定义代理收集视觉观察,自动注释提供标签,在零样本提示下对六个VLMs基准测试,分析对提示变体的敏感性,结果显示VLMs适合作多阶段QA管道的高召回候选过滤器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25648 2026-07-29 cs.CY cs.AI 新提交 70%

Why Public Service AI Governance Frameworks Risk Failing in the Age of General-Purpose AI: Lessons from Policing

为何公共服务人工智能治理框架在通用人工智能时代面临失败风险:来自警务领域的教训

Sam Relins, Daniel Birks

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究公共服务中通用人工智能治理框架面临的风险,以警务为例,指出其特性破坏安全条件,常用缓解措施失效,建议明确分类、技术简约、暂停部署并建立国家安全基础设施。

Comments Preprint; submitted for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25642 2026-07-29 cs.CV cs.CL 新提交 70%

Instruction-based Image Editing: A Survey on Data, Models, Evaluation, and Applications

基于指令的图像编辑:数据、模型、评估及应用综述

Xianghao Zang, Zijian Jiang, Jiarong Cheng, Qianrui Teng, Ying He, Yuxuan Mu, Chao Ban, Huayu Zhang, Lanxiang Zhou, Zerun Feng, Chi Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 综述基于指令的图像编辑研究,围绕任务定义、数据构建、模型架构、评估指标及商业应用五个维度展开,提出综合深度诊断基准,通过开源方案比较揭示优缺点,探讨未来研究方向以推动该领域发展。

Comments 33 pages, 7 figures, Vicinagearth

Journal ref Zang, X., Jiang, Z., Cheng, J. et al. Instruction-based image editing: a survey on data, models, evaluation, and applications. Vicinagearth 3, 3 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25218 2026-07-29 cs.AI 新提交 70%

Everyone is unique: Towards Behaviorally Heterogeneous Negotiation Dialogue Systems for Debt Collection

每个人都是独特的:迈向用于债务催收的行为异质性协商对话系统

Yuhang Yang, Kai Tang, Chao Ye, Haobo Wang, Qiqi Luo, Jinguang Zheng, Zhixin Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对债务催收场景中现有基准无法体现用户行为异质性的问题,提出DebtBench基准并开发DebtGPT代理,用16个先进LLMs实验,发现多数模型表现不佳,DebtGPT优于开源基线且性能与GPT-4o相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24856 2026-07-29 cs.CV cs.AI 新提交 70%

DisasterTD: Disaster Toponym Disambiguation Using Multimodal LLMs and Cross-View Geolocalization

DisasterTD:使用多模态大语言模型和跨视角地理定位的灾害地名消歧

Wenping Yin, Ziqi Liu, Naixia Mou, Weijia Li, Danfeng Hong, Hao Li

机构 * College of Geodesy and Geomatics, Shandong University of Science and Technology(山东科技大学测绘与地理信息学院) School of Environmental Science and Spatial Informatics, China University of Mining and Technology(中国矿业大学环境与测绘学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Automation, Southeast University(东南大学自动化学院) Department of Geography, National University of Singapore(新加坡国立大学地理系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对社交媒体图像地理参考模糊问题,提出DisasterTD框架,集成多模态大语言模型语义推理与跨视角地理定位,在飓风哈维数据集上评估,该方法优于基线,能有效进行细粒度灾害地理定位,提升不同距离下的定位准确率并减少误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10834 2026-07-29 cs.AI cs.CR 版本更新 70%

From Controlled to the Wild: Evaluation of Pentesting Agents for the Real-World

从受控到野性:对渗透测试代理的评估

Pedro Conde, Henrique Branquinho, Valerio Mazzone, Bruno Mendes, André Baptista, Nuno Moniz

机构 * Ethiack Coimbra(Ethiack科英布拉) Ethiack Porto(Ethiack波尔图) University of Notre Dame(北德克萨斯大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种评估AI渗透测试代理的新方法,通过验证漏洞发现而非任务完成,以更真实的方式比较代理性能,同时提供可复现的评估协议和标注数据。

详情

展开后加载摘要…

URL PDF HTML 收藏