arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-09 至 2026-07-09 共收录 232 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 47 篇

2607.07436 2026-07-09 cs.AI cs.CL cs.CR 新提交 62%

The Blind Curator: How a Biased Judge Silently Disables Skill Retirement in Self-Evolving Agents

盲选策展人:有偏见的评判者如何在自我进化的智能体中悄然阻碍技能淘汰

Xing Zhang, Yanwei Cui, Guanghui Wang, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(亚马逊云科技生成式人工智能创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰科技中心,中国)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究自我进化智能体中,有偏见的评判者对技能淘汰的影响。通过损坏奖励分析等方法发现,“误判通过”偏差会导致技能淘汰机制失效,此为行为安全结果。还提出廉价审计可判断评判者是否越过阈值影响智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01420 2026-07-09 cs.CL cs.AI cs.CV 新提交 62%

MultAttnAttrib: Training-Free Multimodal Attribution in Long Document Question Answering

MultAttnAttrib:长文档问答中的无训练多模态归因

Dang Quang Thien Tran, Quang V. Dang, Vinamra Tyagi, Sai Soorya Rao Veeravalli, Trang Nguyen, Ryan A. Rossi, Franck Dernoncourt, Nedim Lipka, Koustava Goswami, Samyadeep Basu

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出无训练归因方法MultAttnAttrib,利用模型预填充、选定注意力头和校准阈值定位证据,并构建多模态归因基准MultAttrEval,实验表明其优于多种方法,匹配GPT 5.4且延迟降低至1/7。

Comments 25 pages (8 main, 17 references + appendix), 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07189 2026-07-09 cs.AI 新提交 57%

Does AI Understand Imaging? A Systematic Benchmark of Agentic AI for Computational Imaging Tasks

人工智能理解成像吗?计算成像任务中智能体人工智能的系统基准测试

Ethan Chung, Chuanjun Zheng, Jasper Tan, Jingxi Li, Haopeng Zhang, Huaijin Chen

机构 * University of Hawaii at Manoa(夏威夷大学马诺阿分校) Glass Imaging(玻璃成像公司)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究人工智能在计算成像任务中的表现,提出ImagingBench基准测试,涵盖五类20个任务及三种评估设置,对多模态系统测试发现智能体模型比专门方法弱,该基准可测差距与跟踪进展。

Comments 14 pages, 11 figures. Preprint / work in progress. Paper Webpage: https://cirp-lab.github.io/imagingbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06605 2026-07-09 cs.LG stat.ML 新提交 57%

A Quiet Failure in Calibrated Virtual Screening: Marginal Conformal Prediction Under-Covers the Minority Class, and a Class-Conditional Fix Recovers It

校准虚拟筛选中的一个隐性失败:边际共形预测对少数类覆盖不足,而类条件修复方法可恢复覆盖

Muhammadjon Tursunbadalov, Mustafojon Tursunbadalov

机构 * School of Science and Technology, Champions College Prep(科学与技术学院,冠军大学预科)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 研究发现在不平衡数据集上标准共形预测对少数类覆盖不足,通过守恒恒等式解释该现象。提出类条件共形预测可恢复少数类覆盖率,定位失败原因并给出诊断方法,还通过成本模型表明弃权可改变筛选效用,制定恢复可靠性的实用方案。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04758 2026-07-09 cs.AI 新提交 57%

AgenticPD: A Stage-Aware Agentic Framework for Physical Design QoR Optimization

AgenticPD:用于物理设计QoR优化的阶段感知智能体框架

Shuo Ren, Zijin Cheng, Yaohui Han, Libo Shen, Leilei Jin, Wanting Tian, Rongliang Fu, Chao Wang, Bei Yu, Tsung-Yi Ho

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 针对物理设计QoR优化难题,现有方法欠佳。提出AgenticPD框架,围绕物理设计流程阶段边界组织,利用Judge Agent引导搜索,阶段专用智能体借助本地工具做决策,提升优化效果。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31126 2026-07-09 cs.LG q-bio.QM stat.ML 新提交 57%

Can Tabular In-Context Learners Generalize to Biomolecular Property Prediction?

表格上下文学习器能否泛化到生物分子性质预测?

Davy Guan, Lu Zhang, Asiri Wijesinghe, Allen Zhu, He Zhao, Helen Power, F. Hafna Ahmed, Andrew Warden, Cheng Soon Ong, Daniel M. Steinberg

机构 * CSIRO(澳大利亚联邦科学与工业研究组织)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文研究表格基础模型(如TabPFN3和TabICL)在生物分子性质预测中的泛化能力,发现其性能取决于所使用的序列或分子表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17588 2026-07-09 cs.CL cs.HC 版本更新 57%

Modeling Distinct Human Interaction in Web Agents

建模网络代理中不同的人类交互

Faria Huq, Zora Zhiruo Wang, Zhanqiu Guo, Venu Arvind Arangarajan, Tianyue Ou, Frank Xu, Shuyan Zhou, Graham Neubig, Jeffrey P. Bigham

机构 * Carnegie Mellon University(卡内基梅隆大学) Duke University(杜克大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文通过收集400条真实用户网络导航轨迹,识别四种人机交互模式,并训练语言模型预测用户干预时机,将干预预测准确率提升61.4%-63.4%,用户评价的代理有用性提高36.8%。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18735 2026-07-09 cs.CV cs.AI 版本更新 57%

Thinking Ahead: Foresight Intelligence in MLLMs and World Model

提前思考:多模态语言模型和世界模型中的预见智能

Zhantao Gong, Liaoyuan Fan, Qing Guo, Xun Xu, Xulei Yang, Shijie Li

机构 * College of Software, Nankai University, China(南开大学软件学院) The University of Hong Kong, China(香港大学) NKIARI, Shenzhen Futian, China(NKIARI,深圳福田,中国) AAIS & VCIP, Nankai University, China(AAIS与VCIP,南开大学,中国) A*STAR Institute of Advanced Intelligence and Computing, Singapore(新加坡A*STAR先进智能与计算研究所)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究定义预见智能,引入FSU-QA数据集,对视觉语言模型在预见任务中全面研究,发现当前模型不足。该数据集可评估世界模型,增强预见推理,微调小模型能超大型先进模型,为开发下一代模型提供基础,还验证了评估协议。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07689 2026-07-09 cs.MA 新提交 50%

Agent Delivery Engineering Predictive Reliability Framework

智能体交付工程预测可靠性框架

Dexing Liu

专题命中 评测与基准 :LLM(abstract)

AI总结 针对长期语言模型多智能体系统的可靠性风险,提出ADE预测可靠性框架,聚合异构信号为信任边际指标,用三重方法并行预测,经多轮验证和实验,能检测“虚假繁荣”,实现可靠性量化并提供前瞻性警告。

Comments 117pages,83figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06909 2026-07-09 cs.CV 新提交 50%

Seeing What Matters: Lesion-Aware High-Resolution Patch Discovery and Fusion for Chest X-ray Report Generation

看清关键所在:用于胸部X光报告生成的病灶感知高分辨率补丁发现与融合

Yingshu Li, Yunyi Liu, Zhenghao Chen, Tong Chen, Zailong Chen, Lingqiao Liu, Lei Wang, Luping Zhou

机构 * The University of Sydney(悉尼大学) The University of Newcastle(纽卡斯尔大学) University of Wollongong(卧龙岗大学) The University of Adelaide(阿德莱德大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究针对胸部X光报告生成中高分辨率感知难题,提出LePaX框架。该框架将高分辨率感知设为固定令牌预算下的空间分辨率分配问题,通过可学习空间分辨率分配和全局-区域融合两个组件,在不增令牌数时实现高分辨率CXR感知,提升了临床和语言指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06838 2026-07-09 cs.CV 新提交 50%

WildCity: A Real-World City-Scale Testbed for Rendering, Simulation, and Spatial Intelligence

WildCity:用于渲染、模拟和空间智能的真实世界城市规模测试平台

Xiangyu Han, Mengyu Yang, Jiaqi Li, Bowen Chang, Ziyu Chen, Hexu Zhao, Rahul Kumar Agrawal, Anthony Rodriguez, Fiona Hua, Marco Pavone, Chen Feng, Yiming Li

机构 * May Mobility(五月出行公司) New York University(纽约大学) NVIDIA(英伟达公司) Stanford University(斯坦福大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对人工智能在构建城市规模空间表征方面的挑战,引入WildCity真实世界多模态数据集,建立重建基线并转化为模拟器,分析关键挑战,推动城市规模渲染及相关人工智能发展。

Comments ECCV 2026; Project Page: https://han-xiangyu.github.io/Wild-City/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08630 2026-07-09 cs.HC 版本更新 50%

Sycamore: Characterizing Synthetic Personas for Evaluating Genomics Visualization Retrieval

Sycamore:用于评估基因组可视化检索的合成身份表征

Huyen N. Nguyen, Astrid van den Brandt, Nils Gehlenborg

专题命中 评测与基准 :LLM(abstract)

AI总结 Sycamore通过三种条件探针设计评估基因组可视化检索系统,探讨合成身份在真实用户反馈中的表现及影响。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06285 2026-07-09 cs.CV 版本更新 50%

MMEarth-Bench: Global Model Adaptation via Multimodal Test-Time Training

MMEarth-Bench:通过多模态测试时训练进行全局模型适配

Lucia Gordon, Serge Belongie, Christian Igel, Nico Lang

机构 * Harvard University, USA(哈佛大学,美国) University of Copenhagen, Denmark(哥本哈根大学,丹麦)

专题命中 评测与基准 :pretraining(abstract)

AI总结 研究针对地理空间机器学习中现有基准数据集不足,引入含多模态任务的MMEarth-Bench,通过多模态测试时训练方法提升模型性能,改善地理泛化能力。

Comments Published at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 47 篇

2607.07388 2026-07-09 cs.CL cs.LG 新提交 93%

TF-Engram: A Train-Free Engram with SSD-Backed Memory for Large Language Models

TF-Engram:一种用于大语言模型的基于固态硬盘支持内存的免训练印记

Yutang Ma, Kecheng Huang, Xikun Jiang, Zili Shao

机构 * The Chinese University of Hong Kong(香港中文大学) Beijing Institute of Technology, Zhuhai(北京理工大学珠海学院)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);pretraining(abstract)

AI总结 研究针对大语言模型知识扩展成本高问题,提出TF-Engram免训练印记系统,通过离线构建特定短语语义内存、跨层次存储及预测预取等方法,在Qwen3-0.6B上提升下游分数,证明可将其作为低开销组件集成到LLM推理中。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29251 2026-07-09 cs.AI q-fin.CP 版本更新 92%

When Summaries Distort Decisions: Information Fidelity in LLM-Compressed Financial Analysis

当摘要扭曲决策:LLM压缩财务分析中的信息保真度

Hoyoung Lee, Suhwan Park, Seunghan Lee, Jun Seo, Jaehoon Lee, Sungdong Yoo, Minjae Kim, CheolWon Na, Zhangyang Wang, Zach Golkhou, Minkyu Kim, Sotirios Sabanis, Alejandro Lopez-Lira, Dhagash Mehta, Soonyoung Lee, Chanyeol Choi, Wonbin Ahn, Yongjae Lee

机构 * UNIST(全纳科学技术大学) LG AI Research(LG人工智能研究) Sungkyunkwan University(成均馆大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) J.P. Morgan Chase(摩根大通) State Street(州立银行) University of Edinburgh(爱丁堡大学) University of Florida(佛罗里达大学) BlackRock(黑石) LinqAlpha

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究LLM压缩财务信息时因丢失决策相关上下文导致投资判断改变的问题,提出通过生成多个候选压缩并审计分歧的代理上下文压缩方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07321 2026-07-09 cs.AI cs.CL cs.MA 新提交 90%

From Atomic Actions to Standard Operating Procedures: Iterative Tool Optimization for Self-Evolving LLM Agents

从原子动作到标准操作程序:自进化语言模型智能体的迭代工具优化

Haipeng Ding, Yuexiang Xie, Zhewei Wei, Yaliang Li, Bolin Ding

机构 * Renmin University of China(中国人民大学) Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有LLM智能体框架问题,提出将原子动作合成SOP实现自进化,介绍EvoSOP框架,经实验验证该框架能显著提升任务成功率、减少交互轮数,为自进化智能体开发提供可扩展路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07142 2026-07-09 cs.NI 新提交 90%

Small Language Model-based Control for BBR over Low Earth Orbit Satellite Internet

基于小语言模型的低地球轨道卫星互联网上的BBR控制

Rakshitha De Silva, Shiva Raj Pokhrel, Jonathan Kua

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);SLM(abstract,abstract_cn)

AI总结 研究低地球轨道卫星互联网中BBR控制问题,提出基于小语言模型的自适应框架,结合多种技术生成可行步调动作,实验表明该框架能在保持吞吐量优势时大幅减少重传,降低计算成本。

Comments 10 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29483 2026-07-09 cs.DC 版本更新 90%

Fog Computing and Large Language Models: A vision for mutual beneficiaries

雾计算与大型语言模型:互惠互利的愿景

Satish Narayana Srirama

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文探讨雾计算与大型语言模型(LLMs)如何相互受益,通过优化LLMs以适应雾基础设施,并利用LLMs的代码生成能力动态部署雾应用,综述了当前研究现状与未来方向。

Comments Paper accepted for publication at IEEE Computer Magazine. During the final editing, title changed slightly ("The" is removed). PDF now has final DOI

Journal ref IEEE Computer, ISSN: 0018-9162, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00086 2026-07-09 cs.CL 版本更新 89%

RIMRULE: Improving Tool-Using Language Agents via MDL-Guided Rule Learning

RIMRULE:通过MDL引导的规则学习改进使用工具的语言智能体

Xiang Gao, Yuguang Yao, Qi Zhang, Kaiwen Dong, Avinash Baidya, Ruocheng Guo, Hilaf Hasson, Kamalika Das

机构 * Intuit AI Research(Intuit AI研究)

专题命中 效率与部署 :language agent(title);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究针对大型语言模型在特定领域使用工具的难题,提出RIMRULE神经符号方法,通过从失败轨迹提炼规则并用MDL目标巩固,以动态注入规则提升性能,实验证明该方法能提高工具使用准确性,且规则具有跨架构可移植性。

Comments Published as a long paper in the main conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07626 2026-07-09 cs.CL cs.AI 新提交 88%

Future Confidence Distillation in Large Language Models

大语言模型中的未来置信度蒸馏

Sahil Kale

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型置信度估计,通过比较解决问题前后的置信度,发现其在回答过程中演变。基于此引入未来置信度蒸馏,用解决问题后的置信度估计训练解决问题前隐藏表征的预测器,实现可靠且低成本的置信度估计。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07467 2026-07-09 cs.AI 新提交 85%

SpaCellAgent: A Self-Evolving LLM-Based Multi-Agent Framework for Trajectory Analysis

SpaCellAgent:一种基于自进化大语言模型的轨迹分析多智能体框架

Songhan Wang, Haoang Chi, He Li, Zhiheng Zhang, Jiayan Yuan, Cheems Wang, Hao Peng, Xinwang Liu, Wenjing Yang

机构 * University of Shanghai for Science and Technology(上海理工大学) National University of Defense Technology(国防科技大学) Hong Kong Baptist University(香港浸会大学) Shanghai University of Finance and Economics(上海财经大学) Tsinghua University(清华大学) Beihang University(北京航空航天大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对轨迹推断现有方法需大量人工干预的问题,提出基于大语言模型的多智能体框架SpaCellAgent,利用多智能体架构、动态工具编排引擎和自进化模块,经实验验证其能大幅提高分析效率,推动先进时空建模民主化。

Comments 27 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07046 2026-07-09 cs.DC 新提交 85%

Voltron: Enabling Elastic Multi-Device Execution of LLM Inference for Empowered Edge Intelligence

Voltron:实现用于增强型边缘智能的大语言模型推理的弹性多设备执行

Chanwoo Cho, Wooseok Kim, Yonglak Son, Young Seo Lee, Young Geun Kim

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究旨在解决大语言模型推理在集中式执行的局限,提出利用边缘多用户端设备的方法。核心方法是Voltron框架,能弹性利用多设备适应边缘环境。主要贡献是比单设备执行的模型精度高16.5%,满足用户QoS需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06636 2026-07-09 cs.SE cs.AI cs.LG 新提交 84%

Specification Grounding Drives Test Effectiveness for LLM Code

规范基础驱动大语言模型代码测试有效性

Amin Haeri, Mahdi Ghelichi

机构 * TD Bank(TD银行)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型代码测试,固定测试器等因素,仅改变一条提示行来隔离规范基础对测试效果的影响。发现规范基础是测试有效性的主要驱动因素,能提高代码正确性、灵敏度和精度,降低误报率,在不同模型和供应商中都有此效果,在算法问题上无影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28421 2026-07-09 cs.CV cs.AI 版本更新 83%

JuZhou 1.0 Technical Report: The First Edge-Native Text-to-Image Foundation Model Trained Entirely on China-Developed AI Accelerators

JuZhou 1.0 技术报告:首个完全在中国开发的AI加速器上训练的边缘原生文本到图像基础模型

Ce Chen, Congrui Wang, Yonglin Li, Zhenchen Wan, Mingyang Geng, Junhao Xiao, Zhengpeng Xing, Yaqing Hu, Yao Wu, Zhaoyang Qu, Long Lan, Xinwang Liu, Yingqi Peng, Shijia Li, Zufeng Zhang, Chen Ma, Jingjing Zhou, Xingyu Wang, Qilin Lu, Bin Jiang, Qilin Sun, Shanzhi Gu, Yaoguang Jin, Tongliang Liu, Kede Ma, Yifan Peng

专题命中 效率与部署 :foundation model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 提出JuZhou 1.0,一个超轻量级文本到图像基础模型,通过紧凑骨干网络、Rectified Flow训练、DMD2蒸馏和中文语义对齐,实现完全离线设备端运行,性能优于SDXL等模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04985 2026-07-09 cs.LG 版本更新 83%

FPTQuant: Function-Preserving Transforms for LLM Quantization

FPTQuant:用于大语言模型量化的函数保持变换

Boris van Breugel, Yelysei Bondarenko, Paul Whatmough, Markus Nagel

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对大语言模型推理能耗高问题,提出FPTQuant方法,通过引入三种函数保持变换促进Transformer量化,经训练使模型在量化时保持功能,实现静态INT4量化,有最小开销且速度大幅提升,在精度-速度权衡上表现优异。

Comments Forty-third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17842 2026-07-09 cs.LG 版本更新 81%

SNLP: Layer-Parallel Inference via Structured Newton Corrections

SNLP:通过结构化牛顿校正的层并行推理

Ligong Han, Kai Xu, Hao Wang, Akash Srivastava

机构 * Core AI, IBM(IBM核心AI)

专题命中 效率与部署 :SFT(abstract,abstract_cn);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 提出结构化牛顿层并行(SNLP)框架,通过将Transformer层间依赖视为非线性残差方程并用结构化牛顿校正并行求解,实现推理加速,在0.5B模型上获得高达2.58倍加速。

Comments Project webpage: https://github.com/phymhan/nanochat-snlp

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07184 2026-07-09 cs.LG cs.AI 新提交 81%

Predicting LLM Safety Before Release by Simulating Deployment

通过模拟部署预测大语言模型发布前的安全性

Marcus Williams, Hannah Sheahan, Cameron Raymond, Tomek Korbak, Deng Pan, Peilin Yang, Leon Maksin, Ningyi Xie, Phillip Guo, Ian Kivlichan, Micah Carroll

机构 * OpenAI(开放人工智能研究公司)

专题命中 效率与部署 :LLM(title);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过模拟部署预测大语言模型发布前安全性的方法,从去识别化对话出发,固定前缀用候选模型生成回复来评估。该方法能估计行为不当率,优于基线,还能克服工具重新采样挑战,为外部研究提供途径,助力预测模型现实行为及评估部署风险。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27742 2026-07-09 cs.CV 版本更新 80%

TIR-Agent: Training an Explorative and Efficient Agent for Image Restoration

TIR-Agent:训练一个探索性且高效的图像修复代理

Guoli Jia, Yisheng Zhang, Haote Hu, Shanxu Zhao, Kaikai Zhao, Long Sun, Xinwei Long, Kai Tian, Che Jiang, Zhaoxiang Liu, Kai Wang, Shiguo Lian, Kaiyan Zhang, Bowen Zhou

机构 * Tsinghua University(清华大学) China Unicom(中国联通) Hunan University(湖南大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 效率与部署 :SFT(abstract,abstract_cn);language model(abstract);language agent(abstract)

AI总结 本文提出TIR-Agent,通过监督微调和强化学习两阶段训练,解决图像修复中任务调度和工具组合的效率问题,实验表明其在多个基准上表现优异且推理速度提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07026 2026-07-09 cs.LG 新提交 79%

Constrained Decoding for Diffusion Language Models via Efficient Inference over Finite Automata

通过有限自动机上的高效推理实现扩散语言模型的约束解码

Meihua Dang, Stefano Ermon

机构 * Stanford University(斯坦福大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 研究扩散语言模型的约束解码问题,提出基于有限自动机高效推理的算法,能保证约束满足,支持多种解码方式,经实验验证在多种任务上提升准确率且推理开销小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06954 2026-07-09 cs.LG 新提交 79%

Physical activities enable scalable foundation modelling for broad-spectrum health prediction

身体活动助力实现用于广谱健康预测的可扩展基础建模

Zhenghuang Wu, Yuyao Zhu, Songlin Xu

机构 * Beihang University(北京航空航天大学) University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 研究针对多数健康预测传感器模型局限性,提出仅基于步数计数器数据的StepFM基础模型,设计可扩展预训练框架,能跨多任务迁移,实验证明其性能强劲、保持稳健,还揭示了身体活动与健康风险关系,为健康监测奠定了基于步数传感的基础。

Comments 18 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏