arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-11 至 2026-08-11 共收录 772 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 60 篇

2608.07796 2026-08-11 cs.AI 新提交 70%

CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR

CliniCARE-Bench:电子健康记录中医疗推理的临床校准审计

Veronica Chatrath, Bryan Zhu, George Pu, Jingxuan Fan, Apaar Shanker, Varun Ursekar, Anahita Sharma, Jason Qin, Keqi Han, Soham Dinesh Tiwari, Soham Dan, Vijay Kalmath, Yuan Li, Daniel Yue Zhang, Chenguang Wang, Zainab Doctor, Zhijun Yin, Nigam H. Shah, Yuan Xue

机构 * Scale AI Emory University(埃默里大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Vanderbilt University Medical Center(范德堡大学医学中心) Stanford School of Medicine(斯坦福医学院) Stanford Health Care(斯坦福医疗保健系统) Clinical Excellence Research Center(临床卓越研究中心)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究推出首个面向部署的临床智能体基准CliniCARE-Bench,评估智能体对真实纵向电子健康记录的医疗推理,发现原始准确率夸大调查质量,无缺陷准确率更低且会重新排序排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07478 2026-08-11 cs.CV cs.CL 新提交 70%

PragyaDoc: A Universal Document Intelligence Framework for Multilingual Medical Document Understanding in Low-Resource Settings

PragyaDoc:低资源场景下多语种医学文档理解的通用文档智能框架

Jagpal Singh Jhala

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对低资源场景下多语种医学文档理解问题,提出PragyaDoc通用文档智能框架,采用四层流水线实现医学文档的多语种理解,解决了印度因语言差异导致的医学文档可及性障碍。

Comments 7 pages 4 images/figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07254 2026-08-11 cs.DL cs.AI 版本更新 70%

SCALE: Scientific Concept Aggregation via LLMs and Embeddings for Fine-Grained Taxonomy Extension

SCALE:基于大语言模型与嵌入的科学概念聚合,用于细粒度分类体系扩展

Daniele Raimondi, Feichi Lu, Oliver Grun, Mariia Eremina, Andrea Perlato

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SCALE是结合LLMs与嵌入的框架,在OpenAlex分类体系主题下新增科学概念层,将语义相关关键词组织为概念单元,为细粒度学术分类等提供基础。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05235 2026-08-11 cs.IR cs.AI 交叉投稿 70%

From Trajectories to Evidence: Auditable Experimental Records for Industrial Research Agents

从轨迹到证据:面向工业研究智能体的可审计实验记录

Zijie Zhuang, Changxin Lao, Pengbo Xu, Hanwen Xu, Ruochen Yang, Yingzhi He, Peng Zhang, Jiangxia Cao, Yusheng Huang, Guohong Mu, Jian Liang, Ruiming Tang, Shuang Yang, Zhaojie Liu, Wenwu Ou, Kun Gai

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对工业研究智能体的实验轨迹无法自动成为有效证据的问题,提出基于证据的框架,经实验验证该框架可生成可审计记录,且生成的候选方案相对基准实现了积极在线提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08844 2026-08-11 cs.CV 新提交 67%

Toward Mask Annotation-Free Surgical Instrument Segmentation from Endoscopic Images Using Text-Prompted Segment Anything Model 3 (SAM3)

基于文本提示的Segment Anything Model 3(SAM3)实现无掩码标注的内镜图像手术器械分割

Nakul Poudel, Richard Simon, Cristian A. Linte

机构 * Rochester Institute of Technology(罗切斯特理工学院)

专题命中 领域大模型 :language model(abstract);prompting(abstract)

AI总结 本文提出基于SAM3与微调Qwen的两阶段框架,无需标注即可实现内镜图像的手术器械实例级分割,在EndoVis数据集上性能优于直接使用SAM3,为无标注分割提供了新方向。

Comments Accepted at the Medical Image Understanding and Analysis (MIUA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08417 2026-08-11 cs.IR 新提交 67%

Personalized Communication Skills for Agentic Recommender Systems

面向智能体推荐系统的个性化沟通技能

Zongwei Wang, Min Gao, Guangyu Hu, Xinyi Gao, Junliang Yu

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 针对现有智能体推荐系统用户智能体视角狭窄的问题,提出AgentCom个性化沟通技能框架,通过「为什么-是什么-如何-谁」技能库及两种机制提升推荐性能,在三类推荐器中均有效。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02311 2026-08-11 econ.EM q-fin.RM q-fin.ST 版本更新 67%

AI Governance for Institutional Readiness in Finance

金融领域机构准备状态的AI治理

Irene Aldridge, Steve Krawciw

专题命中 领域大模型 :LLM(abstract,abstract_cn)

AI总结 针对金融领域智能体AI治理滞后于部署的问题,本文提出四层可计算AI治理框架,通过实证研究验证其有效性并给出90天实施序列,明确跨主体风险控制的可转移措施。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03240 2026-08-11 cs.SI cs.DL 版本更新 67%

Generalization and the Rise of System-level Creativity in Science

泛化与科学中系统级创造力的兴起

Hongbo Fang, James Evans

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 研究通过分析科学出版物的引用网络,发现科学贡献可分为基础、扩展和泛化三种功能类型,揭示了科学生产模式从学科内部转向学科间接口的趋势,揭示了数字知识基础设施驱动的科学结构重组。

Comments 125 pages, 60 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07195 2026-08-11 cs.CL cs.AI cs.CY cs.MA cs.SI 版本更新 62%

Multilingual Agent-Based World Modeling for Social Science

MASim:面向社会科学的多语言代理模拟

Xuan Zhang, Wenxuan Zhang, Anxu Wang, See-Kiong Ng, Yang Deng

专题命中 领域大模型 :language agent(abstract);分类 cs.CL、cs.AI

AI总结 MASim是一种多语言代理模拟框架,用于研究社会行为,通过多语言代理模拟公众意见和媒体影响,展现多语言模拟在社会科学中的重要性。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15941 2026-08-11 cs.LG cs.AI 版本更新 62%

iLTM: Integrated Large Tabular Model

iLTM:集成式大规模表格模型

David Bonet, Marçal Comajoan Cara, Alvaro Calafell, Daniel Mas Montserrat, Alexander G. Ioannidis

机构 * Stanford University(斯坦福大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, Berkeley(加州大学伯克利分校) École Polytechnique(巴黎高等理工学院)

专题命中 领域大模型 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 iLTM通过集成树派生嵌入、维度无关表示和超网络,提供了一个统一的表格学习框架,实现优于传统GBDT和深度表格模型的性能。

Comments Extended version of a paper accepted at KDD '26

Journal ref Proc. 32nd ACM SIGKDD Conf. on Knowledge Discovery and Data Mining, 2, 186-197 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09266 2026-08-11 cs.CV cs.LG 新提交 57%

Did the Grid Erase the Event? EndoClock for Auditing Medical World-Model Pipelines

网格是否抹去了事件?用于审计医疗世界模型流程的EndoClock

Yarin Udi, Tom Sharon-Shahak, Roee Masad, Dan Pri-Tal

机构 * Diastole Medical R&D(Diastole医疗研发机构)

专题命中 领域大模型 :pretraining(abstract);分类 cs.LG

AI总结 本研究针对医疗世界模型同步预处理可能抹去任务相关证据的问题,提出EndoClock审计方法及四分类法,以超声心动图为例验证其有效性,为医疗AI流程审计提供可执行方案。

Comments Accepted for publication at the 1st MICCAI Workshop on Medical World Models (MWM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09201 2026-08-11 cs.AI 新提交 57%

Signature-Guided Capacity Occupancy for Dense Expert Merging

签名引导的容量占用用于密集专家合并

Lingching Tung, Chi-Jui Kim, Beicheng Xu, Yuchen Wang, Bin Cui

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 针对密集专家合并的跨专家冲突容量分配等问题,提出SigMerge框架,在21种配对设置中优于三类基线合并方法,平均提升15.0%且获最佳平均排名。

Comments 31 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07946 2026-08-11 cs.DB cs.AI 新提交 57%

Metadata Reconstruction from Values Alone: Recovering Column Semantics in Undocumented Warehouses

仅从值进行元数据重构:在无文档数据仓库中恢复列语义

Mike Helwig

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 本研究提出Rosetta框架,结合确定性分析器与语言模型,在无文档数据仓库中仅从值恢复列语义,经BIRD、i2b2等数据集验证,提升了元数据恢复的准确率与覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07282 2026-08-11 cs.CV cs.LG 版本更新 57%

Compatibility of Face Embeddings Across Deep Neural Networks

人脸嵌入在不同深度神经网络模型间是否兼容?

Fizza Rubab, Yiying Tong, Arun Ross

机构 * Michigan State University(密歇根州立大学)

专题命中 领域大模型 :foundation model(abstract);分类 cs.LG

AI总结 研究探讨不同深度神经网络模型在人脸嵌入空间中的几何结构,发现低容量线性映射能显著提升跨模型人脸识别与验证性能,表明人脸身份编码的表征收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07066 2026-08-11 cs.CV cs.AI 版本更新 57%

PolypSteer: Counterfactual Endoscopic Synthesis via Training-Free Activation Steering

MedSteer: 通过无训练激活引导进行反事实内窥镜合成

Trong-Thang Pham, Loc Nguyen, Anh Nguyen, Hien V. Nguyen, Ngan Le

专题命中 领域大模型 :prompting(abstract);分类 cs.AI

AI总结 MedSteer通过无训练激活引导生成反事实内窥镜图像,提升医学影像数据增强效果

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09917 2026-08-11 cs.SI cs.HC 新提交 50%

WhichTok? Comparing Three TikTok Data Acquisition Tools

WhichTok?对比三种TikTok数据采集工具

Gayoung Jeon, Cameron Moy, Silvia Teliz, Cristina Monzer, Nicolette Alayon, Deen Freelon

专题命中 领域大模型 :prompting(abstract)

AI总结 本研究系统对比TikTok Research API、Pyktok和Apify三种数据采集工具,发现它们在话题标签等端点存在显著差异,仅用户端点结果一致,据此提出提升TikTok研究质量的相关建议。

Comments This paper has been accepted for the upcoming 21st International AAAI Conference on Web and Social Media (ICWSM'27)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08805 2026-08-11 cs.CV 新提交 50%

LASA: Language-and-Source-Anchored Alignment for Domain Generalized Semantic Segmentation

LASA:面向域泛化语义分割的语言与源锚定对齐

Jinhong Zhu, Weiqi Yan, Shengchuan Zhang, Liujuan Cao

机构 * Xiamen University(厦门大学)

专题命中 领域大模型 :language model(abstract)

AI总结 针对域泛化语义分割中传统方法损害特征完整性的问题,提出LASA框架,含三个协同组件,实验显示其性能优于现有最优方法。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08402 2026-08-11 cs.CV 新提交 50%

Agentic AI-powered flexible fiber-bundle endoscopy for high-resolution NIR-II fluorescence imaging in vivo

智能体驱动的柔性光纤束内窥镜用于体内高分辨率近红外二区(NIR-II)荧光成像

Yanzhao Shi, Yuanhua Liu, Sixin Xu, Wayne Jason Li, Yuyuan Chen, Danyang Xu, Zhisheng Wu, Hanze Yu, Ian Yu-Hong Wong, Simon Ying-Kit Law, Hongjie Dai, Liangqiong Qu, Feifei Wang

专题命中 领域大模型 :language model(abstract)

AI总结 该研究开发了AI驱动的柔性光纤束内窥镜平台,通过光学-计算协同设计及GAME流水线提升NIR-II成像分辨率,实现体内生物样本高分辨率成像,为临床转化奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04448 2026-08-11 cs.DL cs.CY 版本更新 50%

Has ACL Lost Its Crown? A Decade-Long Quantitative Analysis of Scale and Impact Across Leading AI Conferences

ACL还保持其王冠吗?一项十年长的规模和影响的定量分析,横跨顶级AI会议

Jianglin Ma, Ben Yao, Xiang Li, Yazhou Zhang

专题命中 领域大模型 :language model(abstract)

AI总结 本文通过十年实证分析,发现ACL在规模和影响方面仍优于其他顶级AI会议,揭示了会议扩张与学术影响增长之间的非线性关系。

Comments The authors have identified substantive issues in the current version that require substantial revisions to the analysis and interpretation. We are therefore withdrawing this version to avoid potential misunderstanding or inappropriate citation of its current findings

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 知识编辑与模型理解 42 篇

2608.04127 2026-08-11 cs.CV 版本更新 90%

Teaching Foundation Models to Read mmWave: Pose-Guided Kinematic Representation for Human Behavior Understanding

教基础模型阅读毫米波:用于人类行为理解的姿态引导运动学表示

Duo Zhang, Zhehui Yin, Zhiyun Yao, Haotong Qin, Xusheng Zhang, Hongliu Yang, Jianyu Sun, Junzhe Wang, Zizhou Fan, Michele Magno, Daqing Zhang

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);foundation model(title);large language model(abstract);language model(abstract)

AI总结 本研究提出雷达-语言模型mmMind,利用同步3D姿态监督训练,结合时空雷达编码器与LLM,构建含17.9小时数据的mmMind-Bench,在多项任务上优于现有基线。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08127 2026-08-11 cs.AI cs.LO cs.SE 新提交 90%

Improving Constraint Models with LLM Agents

用大语言模型智能体改进约束模型

Florentina Voboril, Stefan Szeider

机构 * TU Wien(维也纳技术大学)

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出一种基于LLM智能体的框架,通过迭代诊断修复改进约束模型,在9个组合优化问题的27个测试实例中多数表现优于原模型,部分问题求解速度提升超两个数量级,证明自主智能体方法可支持约束模型优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00898 2026-08-11 cs.CL cs.DL 版本更新 90%

Citation Grounding Measures the Oracle: Graph Coverage Determines Reported LLM Hallucination Rates in Law

引用溯源:通过法律引用图检测和减少LLM引用幻觉

Volodymyr Ovcharov

机构 * LEX AI LLC

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出引用溯源(CG)指标,利用乌克兰法院判决的引用图(1.008亿判决,5.02亿边)检测LLM法律引用幻觉,并通过CG-DPO方法(基于真实判决构建偏好对)减少幻觉,在100个法律查询上CG为0.791-0.873,幻觉率13-21%。

Comments 21 pages, 4 figures, 5 tables. Substantially revised: title, framing and several v1 results changed. Adds a coverage sweep and a separability analysis; corrects the DPO configuration, the density-accuracy correlation and the qualitative examples. Code and data: https://huggingface.co/datasets/overthelex/citation-grounding-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25921 2026-08-11 cs.CL cs.CR 版本更新 90%

One Word at a Time: Incremental Completion Decomposition Breaks LLM Safety

逐词进行:增量完成分解打破LLM安全

Samee Arif, Naihao Deng, Zhijing Jin, Rada Mihalcea

机构 * University of Michigan(密歇根大学) University of Toronto(多伦多大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出增量完成分解(ICD)策略,通过逐词生成恶意请求相关词来突破LLM安全机制,评估多种变体在多个基准测试中表现优异,并理论解释其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07625 2026-08-11 cs.AR cs.MA 新提交 88%

HINT: Toward an Executable Hardware-Intent Representation Layer for LLM-Driven RTL Generation

HINT:面向大语言模型驱动的RTL生成的可执行硬件意图表示层

Tairan Cheng, Yi Liu, Dongsheng Zuo, Zhengyuan Shi, Hongji Zhang, Xiangfei Hu, Maoshuo He, Hao Yan, Qiang Xu

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出HINT可执行硬件意图表示层,用于LLM驱动的RTL生成,在7个算子案例中全量生成合规可综合RTL,面积较人工实现及直接C2RTL结果显著降低,还验证了其在各类复杂设计中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03985 2026-08-11 cs.CR cs.AI 版本更新 88%

NeuroBreak: Unveil Internal Jailbreak Mechanisms in Large Language Models

NeuroBreak:揭示大语言模型的内部越狱机制

Chuhan Zhang, Ye Zhang, Bowen Shi, Yuyou Gan, Tianyu Du, Shouling Ji, Dazhan Deng, Yingcai Wu

机构 * Zhejiang University(浙江大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 NeuroBreak是一个自上而下的大语言模型越狱分析系统,可分析神经元级安全机制、关键神经元,经评估验证了有效性,为开发下一代防御策略提供机制见解。

Comments 11 pages, 10 figures. Accepted to IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00997 2026-08-11 cs.CL 版本更新 87%

Uncertainty-Aware Variational Reward Factorization via Probabilistic Preference Bases for LLM Personalization

基于概率偏好基的不确定性感知变分奖励分解用于大语言模型个性化

Gyuseok Lee, Wonbin Kweon, Zhenrui Yue, SeongKu Kang, Jiawei Han, Dong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Korea University(高丽大学)

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出变分奖励分解框架,通过概率偏好基和变分分布实现用户偏好建模,提升LLM个性化效果。

Comments COLM'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08622 2026-08-11 cs.CV 新提交 86%

VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models

VADER:用于视频大语言模型幻觉缓解的自适应去偏方法

Dong Xing, Jiaxin Chen, Hang Yang, Peixun Liu, Qiushi Yang, Yuqing Wang

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title)

AI总结 本研究针对视频大语言模型的幻觉问题,提出无训练自适应去偏框架VADER,通过视觉焦点重分配与选择性证据擦除模块结合对比解码,在LLaVA-Video-7B等模型的EventHallusion任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07521 2026-08-11 cs.HC 新提交 86%

CyberSelf: Embodied Self-Distancing for Emotional Support in Virtual Reality

CyberSelf:用于虚拟现实中情绪支持的具身自我疏离

Bing Li, Dr Yan Hu, Tinghui Li, Yinuo Zhang, Wen Ma, Yuanfeng Zhou, Professor Yiran Shen

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出VR情绪支持系统CyberSelf,整合相似化身、克隆语音与LLM实时对话,短期及长期研究显示其可提升情绪与应对指标,实现具身自我疏离以支持情绪调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07894 2026-08-11 cs.LG cs.PL 新提交 85%

LLM-Based Embeddings for Program Analysis and Optimization

基于大语言模型嵌入的程序分析与优化

Calvin Higgins, Marco Alvarez

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究首次将LLMCompiler生成的程序嵌入应用于程序分析与优化任务,结合源与IR代码嵌入在算法分类上错误率1.54%、较SOTA提升12%,为代码优化提供新方向。

Journal ref 2025 International Joint Conference on Neural Networks (IJCNN), Rome, Italy, 2025, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08926 2026-08-11 cs.AI cs.LG 新提交 84%

Decoding Phenotypes: A Framework for Fusing Genomic Language Models and Neuroimaging

解码表型:融合基因组语言模型与神经成像的框架

Tianli Tao, Ziyang Wang, Emma Robinson, Rachel Sparks, Le Zhang

机构 * King’s College London(伦敦国王学院) Aston University(阿斯顿大学) University of Birmingham(伯明翰大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出多模态框架GeneFuse,整合GLM遗传表征与神经成像特征,在NC vs. MCI、NC vs. AD任务上分别获0.77、0.83的AUROC,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏