arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-23 至 2026-07-23 共收录 221 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 54 篇

2607.19670 2026-07-23 cs.MA 新提交 89%

Same Game, Different Story: A Minimal Conservative Strategic Robustness Benchmark for Large Language Model Agents

相同博弈,不同故事:大语言模型智能体的最小保守战略稳健性基准

Seyed Pouyan Mousavi Davoudi, Alireza Amiri-Margavi, Amin Gholami Davodi, Hamidreza Hasani Balyani, Arshia Gharagozlou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究大语言模型智能体在战略环境中的可靠性,通过“相同博弈,不同故事”基准,以收益不变框架变化下行动分布不变性定义稳健性,经二次分析已发表数据得出社会关系框架会改变模型行为,应分别评估稳健性与能力。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19834 2026-07-23 cs.CL 新提交 88%

D2VBench: Benchmarking Large Language Models with Value Dilemmas in Daily Scenarios

D2VBench:在日常场景中使用价值困境对大语言模型进行基准测试

Siyi Hao, Yidi Cao, Linhao Yu, Yuqi Ren, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院TJUNLP实验室) The International Joint Institute of Tianjin University(天津大学国际联合研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对大语言模型输出价值含义评估问题,提出D2VBench基准,通过多阶段协作构建含10000个日常困境实例的数据集,采用混合评估范式,对八个主流模型全面评估,结果显示该基准可靠性和鲁棒性高,能反映模型价值一致性。

Comments 22 pages,11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19361 2026-07-23 cs.CL cs.AI 新提交 88%

Stateful Guardrails for Multi-Turn LLM Systems: A Conversational Risk Accumulation Framework

多轮大语言模型系统的有状态防护栏:一个对话风险累积框架

Sanjay Mishra, Divya Chukkapalli, Ganesh R. Naik

机构 * College of Medicine and Public Health, Flinders University(弗林德斯大学医学与公共卫生学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究多轮大语言模型系统的对话风险累积问题,提出会话层CRA框架,跟踪三个轨迹信号,提供评分方法,发布多个基准测试集及评估协议,重点在于分布内会话评分,为大语言模型安全防护提供新方法。

Comments 45 pages, 10 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19910 2026-07-23 cs.CV cs.HC 新提交 88%

MV-Bench: Benchmarking Multimodal Large Language Models for Coordinated Multi-View Interface Construction

MV-Bench:用于协同多视图界面构建的多模态大语言模型基准测试

Yue Zhao, Hongxu Liu, Feiyu Wang, Xiaoyu Yang, Tong Ge, Zhen Yang, Chao Wang, Qiong Zeng

机构 * Shandong Second Medical University(山东第二医科大学) Shandong University(山东大学) Bairong Inc.(百融云创科技股份有限公司) Ke Holdings Inc.(贝壳控股有限公司) School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) Shandong Provincial Key Laboratory of Computing-Network Integration, Shandong University(山东大学计算网络融合技术山东省重点实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究针对多模态大语言模型在协同多视图界面构建评估不足的问题,引入MV-Bench基准,通过多阶段管道转换规范为界面,评估五个模型,发现当前MLLMs虽能再现视觉外观,但在数据语义和交互逻辑生成上有限,迭代改进效果不佳。

Comments Submitted to IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20115 2026-07-23 cs.CL 新提交 87%

Understanding the Impact of Linguistic Realization Choices on LLM Stance with Causal Tracing

通过因果追踪理解语言实现选择对大语言模型立场的影响

Langchen Huang, Sebastian Padó, Franziska Weeber

机构 * Institute for Natural Language Processing, University of Stuttgart(斯图加特大学自然语言处理研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究语言结构对大语言模型立场的影响,以政治立场判断为案例,扩展数据集得六种重写类型,通过对四个模型实验及激活修补发现,中晚期解码器层尤其是最终提示位置的块输出,对恢复原立场分布有最强信号。

Comments KONVENS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19355 2026-07-23 cs.AI cs.CL cs.CY 新提交 87%

Information Discernment in Large Language Models

大语言模型中的信息辨别

Joshua Ashkinaze, Laura Kurek, Alina Faisal, Tongyuan Miao, Mariam Joseph, Ceren Budak, Eric Gilbert

机构 * University of Michigan(密歇根大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在与外部知识源结合时的信息辨别问题,提出Learn2Discern框架及基准,通过用户研究和大量模型试验发现模型在来源和真相辨别上存在问题,识别出简单干预措施,发布数据集和调查作为测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19682 2026-07-23 cs.SE 新提交 87%

Context Matters: Improving the Practical Reliability of LLM-Based Unit Test Generation

上下文很重要:提高基于大语言模型的单元测试生成的实际可靠性

Junjie Chen, Ziqi Wang, Lin Yang, Chen Yang, Xiao Chu, Jianyi Zhou, Guangtai Liang, Qianxiang Wang, Dong Wang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型的单元测试生成在实际应用中的问题,提出上下文感知工作流程CATGen,通过明确依赖、稳定框架、静态分析等改进设计,经评估在实际项目和基准测试中提升编译成功率与覆盖率,减少生成时间和消耗。

Comments 23 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20208 2026-07-23 cs.CL 新提交 86%

surprisal is Not a Theory

惊奇值并非一种理论

Andrés Buxó-Lugo, Aniello De Santo, Morgan Grobol, Ryan J. Hubbard, Cassandra L. Jacobs

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究指出惊奇值理论虽被视为计算层面解释,但大语言模型的发展未免除建模者相关表征决策,不加批判使用LLM - 惊奇值会模糊模型承诺,通过分析表明算法和架构选择影响语言模型概率计算,建议相关研究者重新评估概率互换做法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20265 2026-07-23 cs.CL cs.AI 新提交 86%

The Maskability Index: Predicting Task-Objective Alignment in Pretrained Language Models

可掩码性指数:预测预训练语言模型中的任务目标对齐

Ahmad Pouramini, Mahsa Afsharzadeh

机构 * Sirjan University of Technology(锡尔詹理工大学) Department of Computer Engineering(计算机工程系)

专题命中 评测与基准 :language model(title,abstract);pretraining(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究提出可掩码性指数(MI),用于评估知识关系适合的提示方式,通过掩码与未掩码模板的DepthRank分数差异计算。在ATOMIC2020基准上评估发现MI与下游生成性能正相关,有助于选择提示模板和策略提取预训练语言模型的关系知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19506 2026-07-23 quant-ph cs.AI 新提交 85%

Hybrid LLM-Guided Search for Quantum Reservoir Architecture Design

用于量子储层架构设计的混合大语言模型引导搜索

Krishna Bhatia, Gautami Sanjay Naik

机构 * QuantumAI Lab, Fractal Analytics India(量子AI实验室,Fractal Analytics印度)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究量子储层计算架构设计问题,提出基于模拟器的基准测试\method,比较五种策略,其中\hybrid策略表现出色,在多任务中优于随机搜索,证明生成模型嵌入混合搜索循环可作高级控制器。

Comments 4 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19528 2026-07-23 cs.CV cs.AI 新提交 83%

D3VL: Understanding Driving Scenes from 3D Time Series Data and Video with Language Models

D3VL:利用语言模型从3D时间序列数据和视频中理解驾驶场景

Heesang Han, A. Lynn Abbott, Abhijit Sarkar

机构 * Bradley Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工大学布拉德利电气与计算机工程系) Virginia Tech Transportation Institute(弗吉尼亚理工大学交通研究所) Sanghani Center for Artificial Intelligence and Data Analytics(桑哈尼人工智能与数据分析中心)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文针对自动驾驶中多模态大语言模型,提出D3VL框架,整合2D和3D时间序列数据,回答交通场景相关问题,在KITTI问答数据集上性能提升11%,并引入Waymo QA数据集扩展以评估模型在多样驾驶条件下处理3D和时间序列数据的能力。

Comments Accepted to IEEE IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05901 2026-07-23 cs.CL cs.AI 版本更新 82%

Reducing Hallucinations in Complex Question Answering using Simple Graph-based Retrieval-Augmented Generation (long version)

减少复杂问答中的幻觉:使用基于简单图的检索增强生成(长版)

Christopher J. Wedge, Joshua Stutter, Danny Dixon, Jacek Cała

机构 * National Innovation Centre for Data(数据创新研究中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出一种轻量级图结构支持的检索增强生成系统,通过结合向量搜索和图查询工具,在复杂问答任务中将幻觉答案数量减半,并显著提升事实正确性的精确率和召回率。

Comments 25 pages; expanded limitations section, corrected typos throughout and missing values in appendix table 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19795 2026-07-23 cs.SE 新提交 82%

Towards Automated Formal Verification of zkEVMs Using LLM-Guided Constraint Synthesis

使用大语言模型引导的约束合成实现zkEVM的自动化形式验证

Shichen Huang, Zhenghe Jiang, Yi Jiang, Ling-I Wu, Jingyang Li, Guoqiang Li

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract)

AI总结 研究针对zkEVM因实现错误可能破坏加密保证的问题,提出VeriSynth框架,通过大语言模型引导从Rust代码合成验证模型,采用混合范式及集成多种技术处理状态转换,在验证基准上错误检测率超90%,远超基线。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28787 2026-07-23 cs.IR cs.AI 版本更新 81%

Do Data Agents Need Semantic Metadata? A Comparative Study in Agentic Data Retrieval

智能体需要语义元数据吗?智能体数据检索的比较研究

Shiyu Chen, Tarfah Alrashed, Alon Halevy, Natasha Noy

机构 * Google(谷歌)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过对比基线智能体(搜索开放网络)与语义智能体(利用schema.org元数据)在数据检索中的表现,发现语义元数据在检索可操作数据时精度更高(整体精度高65.7%),而基线智能体覆盖更广但存在“最后一英里效用”失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20092 2026-07-23 cs.CV cs.AI cs.CL 新提交 81%

ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models

ENTRAP-VL:视觉语言模型中双上下文夹带的分类探测器

Karan Goyal, Afreen Hossain, Debojyoti Das, Vishal Bhutani

机构 * IIIT Delhi(德里信息技术学院) Dr. Ambedkar Institute of Technology(阿姆贝德卡尔技术学院) Heritage Institute of Technology(遗产技术学院) PwC(普华永道)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究视觉语言模型中上下文夹带现象,提出需构建分类结构化双模态工具。引入ENTRAP-VL数据集,含1500个项目,跨八类,分文本和视觉夹带流,提供工具、分类法及评估协议,助力社区严格研究该现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19449 2026-07-23 cs.LG cs.AI cs.CR 新提交 81%

Guardrails as Scapegoats: Auditing Unfaithful Safety Refusals in Tool-Augmented LLM Agents

作为替罪羊的护栏:审计工具增强型大语言模型智能体中不忠实的安全拒绝行为

Aarushi Singh

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究工具增强型大语言模型智能体安全拒绝行为审计问题,引入轻量级黑盒审计框架,将智能体响应分类。实验发现伪造行为占主导,不忠实安全拒绝行为在基线时少,增强安全语言会显著增加该行为,还提出检测方法及治理影响。

Comments 10 pages, 3 figures. Accepted at the ACM KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19383 2026-07-23 stat.AP cs.LG 新提交 79%

Trend strength predicts when generative foundation models win: a power-controlled benchmark, a mechanism, and an actionable selection rule

趋势强度预测生成式基础模型何时获胜:功率控制基准、机制及可操作的选择规则

Ahmed Cherif

机构 * National School of Computer Sciences (ENSI), University of Manouba, Manouba, Tunisia(突尼斯曼努巴大学计算机科学国家学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 研究预训练生成式基础模型,通过功率控制研究、受控合成实验等得出结果,表明其优势与趋势强度有关,趋势强度可作为先验指标指导基础模型部署,还记录了校准不足。

Comments 12 pages, 6 figures. Code and per-forecast data released

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20194 2026-07-23 cs.LG 新提交 79%

OLEDLM: A Unified Language Model for OLED Molecular Design

OLEDLM:用于OLED分子设计的统一语言模型

Fukang Wen, Yuchong Tang, Jingyuan Li, Beichen Wang, Yixuan Jiang, Xiaoyi Jiang, Yaxuan Liu, Shunyu Wang, Zuoqiang Shi, Yi Zhu, Yanan Zhu, Pipi Hu

机构 * Tsinghua University(清华大学) Beijing Institute of Mathematical Sciences and Applications(北京应用数学科学研究院) Wuhan University(武汉大学) Shenzhen MSU-BIT University(深圳莫斯科国立大学与北京理工大学联合大学) MathonAI Team(MathonAI团队)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 研究针对OLED分子设计面临的挑战,提出基于因果语言模型的逆分子设计框架,采用多阶段策略,经基础模型建立、属性预测器微调、强化学习等,最终能有效探索OLED化学空间,生成新候选物。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19400 2026-07-23 cs.LG q-bio.GN 新提交 79%

Predictive single cell foundation model for gene regulation and aging with privacy-preserving tabular learning

用于基因调控和衰老的具有隐私保护表格学习的预测性单细胞基础模型

Jiayuan Ding, Jianhui Lin, Ziyang Miao, Nils Mechtel, Shiyu Jiang, Yixin Wang, Zhaoyu Fang, Jorge D. Martin-Rufino, Chen Weng, Reuben Saunders, Weize Xu, Jonathan S. Weissman, Min Li, Jiliang Tang, Wei Ouyang, Yuancheng Ryan Lu, Xiaojie Qiu

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 研究针对单细胞数据独特表格结构及隐私问题,提出用联邦学习设计的Tabula模型,开发Chiron平台。该模型在下游基准测试表现出色,揭示调控逻辑,提名年轻化因子,推动单细胞基础建模发展,迈向隐私保护虚拟细胞。

Comments 98 pages, 4 main figures, and 15 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19381 2026-07-23 cs.LG 新提交 79%

Air Quality Arena: A Large-Scale Multi-Region Ground Monitoring Dataset and Benchmark for Air Quality Forecasting with Time-Series Foundation Models

空气质量竞技场:一个大规模多区域地面监测数据集以及基于时间序列基础模型的空气质量预测基准

Rishi Bharadwaj, Manik Gupta, Pandarasamy Arjunan

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 研究针对现有空气质量预测基准不足,提出空气质量竞技场(AQA),它是含多国多污染物的数据集及基准。通过在11个模型和基线测试,表明时间序列基础模型是有效零样本预测器,表现最佳的模型采用跨模态架构,AQA已公开发布。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19375 2026-07-23 cs.CY cs.AI 新提交 79%

Economic Evaluations of Language Models

语言模型的经济评估

Alexander Wan, Stephane Hatgis-Kessell, Tomás Aguirre, Percy Liang, Rishi Bommasani

机构 * Stanford University(斯坦福大学) University of São Paulo(圣保罗大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究语言模型在经济价值任务上的表现,通过EconEvals开源套件评估,结合真实用户查询与合成数据,成本低且覆盖度好,还引入暴露度量估计时间节省情况,发现当前模型有潜力但存在使用滞后及隐私等瓶颈,引入基础设施推断其对劳动力市场的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19366 2026-07-23 cs.AI 新提交 79%

Geometry-Guided Constraint Learning for LLM Safety Classification

用于大语言模型安全分类的几何引导约束学习

Fumiaki Uehara, Koo Imai, Masato Tsutsumi, Keigo Kansa, Sora Usui, Yuki Kobiyama

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究大语言模型安全分类,利用稀疏自动编码器特征提取解决安全多面体中约束数量调整问题,在Qwen3.5 - 9B上对部分类别K = 2最优,准确率达96 - 99%,基于几何观点引入锥约束并经三阶段训练稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19356 2026-07-23 cs.AI 新提交 79%

NEXUS: Structured Runtime Safety for Tool-Using LLM Agents

NEXUS:工具使用型大语言模型智能体的结构化运行时安全

Elias Hossain, Md Mehedi Hasan Nipu, Tasfia Nuzhat Ornee, Rajib Rana, Niloofar Yousefi

机构 * University of Central Florida(中佛罗里达大学) North South University(南北大学) University of Southern Queensland(南昆士兰大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究工具使用型大语言模型智能体运行时安全问题,提出NEXUS结构化计划安全监控器,结合多种方法进行分级升级。在多个基准测试中表现出色,如合成基准测试F1分数达0.949等,还具有低延迟、低开销特点,相关成果已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20241 2026-07-23 cs.CL cs.AI 新提交 79%

On the Systematic Challenges of Culturally Loaded Machine Translation: Dream of the Red Chamber as the Cultural Lens

论文化负载机器翻译的系统性挑战:以《红楼梦》为文化视角

Yiming Wang, Jiayuan Di

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) School of Foreign Languages, East China University of Science and Technology(华东理工大学外国语学院) Mejiro University(目白大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究以《红楼梦》构建数据集,系统探究基于大语言模型的机器翻译系统中文化负载翻译的挑战,揭示任务、人工评估及自动评估方面的问题,为文化导向的翻译研究提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19829 2026-07-23 cs.CR 新提交 78%

DARWIN: Evolving Jailbreak Adversary and Guardrail for LLM Safety Evaluation and Protection

达尔文:为大语言模型安全评估与保护演化越狱对手及防护措施

Weiwei Qi, Zefeng Wu, Zhilin Guo, Tianhang Zheng, Chaochao Lu, Liang He, Zhan Qin, Kui Ren

专题命中 评测与基准 :LLM(title,abstract)

AI总结 针对现有大语言模型安全评估与防御方法的静态局限,提出达尔文演化攻击-防御框架,含通过策略发现等扩展能力的达尔文攻击及从新对抗样本中迭代学习的达尔文防护,在攻击成功率和防御召回率上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04802 2026-07-23 cs.CV 版本更新 78%

VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?

VISTA-Bench: 视觉-语言模型是否真的能像纯文本一样理解可视化文本?

Qing'an Liu, Juntong Feng, Yuhao Wang, Xinzhe Han, Yujie Cheng, Yue Zhu, Haiwen Diao, Yunzhi Zhuge, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 VISTA-Bench通过对比纯文本和可视化文本问题,揭示了视觉-语言模型在处理可视化文本时的模态差距,发现模型在语义相同的情况下表现显著下降。

Comments 32 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24739 2026-07-23 cs.CV 版本更新 78%

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation

迈向医学数据的视觉-语言基础模型:越南语PET/CT报告生成的多模态数据集和基准

Huu Tien Nguyen, Dac Thai Nguyen, The Minh Duc Nguyen, Trung Thanh Nguyen, Thao Nguyen Truong, Huy Hieu Pham, Johan Barthelemy, Minh Quan Tran, Thanh Tam Nguyen, Quoc Viet Hung Nguyen, Quynh Anh Chau, Hong Son Mai, Thanh Trung Nguyen, Phi Le Nguyen

机构 * AI4LIFE, Hanoi University of Science and Technology, Vietnam(AI4LIFE,河内科学技术大学,越南) Nagoya University, Japan(名古屋大学,日本) AIST, Japan(日本国家先进工业技术研究院) VinUniversity, Vietnam(文园大学,越南) NVIDIA, USA(NVIDIA,美国) Griffith University, Australia(格里菲斯大学,澳大利亚) Hanoi Medical University, Vietnam(河内医学院,越南) Military Central Hospital, Vietnam(越南108中央军医院)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出了一种面向越南语医学数据的多模态数据集和基准,旨在解决医学影像领域中PET/CT数据不足和低资源语言代表性不足的问题。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17191 2026-07-23 cs.AI 版本更新 77%

Toward Anthropomorphic Dialogue: A Closed-Loop Framework for Human-Like Chat Generation, Evaluation, and Preference Alignment

迈向拟人化对话:一个用于类人聊天生成、评估和偏好对齐的闭环框架

Wentao Liu, Siyu Song, Xi Chen, Youjia Li, Xiaokun Wang, Min Ji, Ji Wang

机构 * Shanghai Institute of Innovation(上海创新研究院) East China Normal University(华东师范大学) University of Science and Technology of China(中国科学技术大学) Chabiyue (Shanghai) Information Technology Co., Ltd.(上海叉叉悦信息技术有限公司) Shanghai Tianyou Software Co., Ltd.(上海天游软件有限公司) Zhejiang Century Huatong Group Co., Ltd.(浙江世纪华通集团有限公司)

专题命中 评测与基准 :SFT(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 该研究提出AnthroDial闭环框架,将拟人化对话作为联合问题,结合角色调度运行时、可执行基准和训练后管道。在多场景基准上评估多个系统,结果显示共享行为维度时拟人化对话有益,不同方法提升了严格准确率。

Comments 17 pages, 2 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20087 2026-07-23 cs.CV 新提交 75%

Development of an automated, reliable, and clinically meaningful artificial intelligence (AI) tool for diagnosing cardiac disease from conventional cardiovascular magnetic resonance (CMR) images

开发一种用于从传统心血管磁共振(CMR)图像中诊断心脏病的自动化、可靠且具有临床意义的人工智能(AI)工具

Sina Amirrajab, Volker Vehof, Michael Bietenbeck, Nuriye Akyol, Redouane Bouras, Khuraman Isgandarova, Alexandru Zlibut, Philipp Stalling, Ali Yilmaz

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究旨在开发用于CMR图像心脏病诊断的AI工具,通过整合开源LLMs和预处理多模态数据,对三种视觉基础模型两阶段微调,在独立测试集上有高诊断性能,集成策略进一步提升准确性和鲁棒性,代码和模型权重公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19409 2026-07-23 cs.AI 新提交 70%

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance

FORCE-Bench:企业金融中智能代理人工智能的基准测试、数据集和评估工具

Wolfgang M. Pauli, Sarah Panda, Kidus Admassu, Said Bleik, Ademola Okerinde, Jeremy Reynolds

机构 * Microsoft Corporation(微软公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对智能代理在企业金融领域应用,提出FORCE-Bench基准测试,含251个专家注释查询,从八个维度评估三种任务类型,在特定设置下评估通用和专用代理,结果显示专用代理更可靠,相关资源开源助力企业金融环境应用。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏