LLM-Driven Cross-Paradigm Design for Quantum Optimal Control
基于大语言模型驱动的量子最优控制跨范式设计
专题命中 工作流自动化 :workflow(abstract)
AI总结 研究针对量子最优控制实际应用的瓶颈,提出由大语言模型驱动的QOC-Workbench工作流程,可跨范式设计协议,能自主解析文献、积累控制模式,在多场景验证中表现出色,建立了自主量子控制的跨范式方法。
Comments 19 pages, 8 figures
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
基于大语言模型驱动的量子最优控制跨范式设计
专题命中 工作流自动化 :workflow(abstract)
AI总结 研究针对量子最优控制实际应用的瓶颈,提出由大语言模型驱动的QOC-Workbench工作流程,可跨范式设计协议,能自主解析文献、积累控制模式,在多场景验证中表现出色,建立了自主量子控制的跨范式方法。
Comments 19 pages, 8 figures
通过隐式神经表示从标准快速多层 2D MRI 实现便携式无替代 4D MRI
专题命中 工作流自动化 :workflow(abstract)
AI总结 研究提出 SIMPLE - 4D 工作流程,通过标准快速多层 2D MRI 重建切片实现便携式无替代 4D MRI,结合采集无关前端、无替代变分运动编码器和基于隐式神经表示的时空重建,在多数据集验证,有创新成果及性能提升。
Comments 52 pages, 8 figures, 6 tables
复杂多元材料中用于团簇展开的避免不稳定性主动学习
专题命中 工作流自动化 :workflow(abstract)
AI总结 研究复杂多元材料团簇展开时训练成本问题,提出在主动学习工作流程中集成稳定性分类,用基于马氏距离的结构选择增强该程序,通过训练复杂FCC MPEA团簇展开进行基准测试,确保模型稳健性。
Comments 13 pages, 8 figures, supporting information included
不同环境下氢原子盘的大小:孤立星系、致密星系群、星系团和星系对
专题命中 工作流自动化 :workflow(abstract)
AI总结 研究不同环境下星系氢原子盘大小,以AMIGA为对照样本,通过拟合椭圆计算氢原子直径,避免传统比值偏差,用基线残差量化截断,发现HCG星系氢原子盘明显小于孤立星系,截断随演化序列增加,与室女座星系团样本类似。
Comments 21 pages, 8 figures. Accepted for publication in Astronomy & Astrophysics. Analysis code and data: https://github.com/ianjarog/galaxydisksize ; online material: https://doi.org/10.5281/zenodo.21415323
分子动力学衍生的有色噪声介导微管蛋白中色氨酸激子的安德森局域化和环境辅助传输
专题命中 工作流自动化 :workflow(abstract)
AI总结 研究微管蛋白中色氨酸激子传输,通过全原子分子动力学模拟表征耦合蛋白质-溶剂浴涨落,其有色噪声使慢蛋白质模式致安德森局域化,快水模式助量子传输,与白噪声模型不同,该流程可推广至其他色素-蛋白质系统。
Comments 15 pages, 5 main + 5 supplementary figures. Code: https://github.com/Varato/tubulin-bath-fluctuation v2: introduction tightened; citation and punctuation fixes; results unchanged. v3: added Fig. 1 fit-residual inset; clarified AIC model selection vs two-step parameter extraction; no scientific changes
Vis4GS: 3D高斯泼溅重建的可视分析工具
专题命中 工作流自动化 :workflow(abstract)
AI总结 针对3DGS重建中高斯属性对伪影的影响难以解释的问题,提出Vis4GS多视图可视分析工具,通过链接伪影与高斯属性、视图覆盖、训练进度和谱系,支持结构化诊断重建失败原因。
Comments Accepted to IEEE VIS 2026 Short Papers
一种支持多信号检测和多格式输出的厂商无关LiDAR数据转换系统
机构 * BITS Pilani, Hyderabad Campus(比拉理工学院海德拉巴校区) ; Department of Electrical and Electronics Engineering, BITS Pilani, Hyderabad Campus(比拉理工学院海德拉巴校区电气与电子工程系) ; Department of Computer Science and Information Systems, BITS Pilani, Hyderabad Campus(比拉理工学院海德拉巴校区计算机科学与信息系统系)
专题命中 工作流自动化 :workflow(abstract)
AI总结 提出一种厂商无关的LiDAR数据转换系统,通过加权多信号方法自动识别传感器厂商,并输出五种标准格式,解决了多厂商SDK不兼容问题。
Comments Manuscript submitted at Software: Practice and Experience
曲率自适应一致性流匹配:基于强化学习的自主轨迹优化
机构 * Tsinghua University(清华大学)
专题命中 工作流自动化 :agent(abstract)
AI总结 提出曲率自适应一致性流匹配(CACFM),利用强化学习代理动态构建效率导向课程,优先处理关键区域,在FLUX和SDXL等大规模模型上实现最先进结果,极少数步下保持高视觉保真度。
Comments Accepted by ECCV 2026
从传统自动化到具身无线智能:视觉-语言-动作赋能的物理感知通信网络
专题命中 工作流自动化 :AI agent(abstract)
AI总结 提出具身智能基站(eBS)范式,采用视觉-语言-动作(VLA)流水线,使基站具备环境感知、因果物理推理和物理感知动作生成能力,实现从规则自动化到具身智能的转变。
Comments submitted for possible jounal publication
高能物理中的蒙特卡罗生态系统:入门指南
专题命中 工作流自动化 :workflow(abstract)
AI总结 本文概述高能物理中蒙特卡罗生态系统的结构和方法,解释其在碰撞实验中的作用及未来发展方向。
代理心理测量:在代理编码基准中的任务级性能预测
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Fulcrum ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 软件智能体 :agent(title,abstract);agentic(title,abstract);分类 cs.AI
AI总结 本文提出了一种基于任务级性能预测的代理编码基准评估框架,结合IRT理论与任务特征,区分LLM和支架能力,以更准确预测未见基准和组合的性能。
作为编码智能体基础模型中间训练的函数感知中间填充
机构 * University of Waterloo(滑铁卢大学) ; University of British Columbia(英属哥伦比亚大学) ; NVIDIA(英伟达公司) ; Verdent AI(Verdent人工智能公司) ; Vector Institute(向量研究所)
专题命中 软件智能体 :agent(title,abstract);tool-use(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 研究针对编码智能体将外部工具返回集成到推理中的问题,利用函数感知中间填充进行中间训练,在多个模型上提升了性能,并减轻了后训练对非智能体编码等基准测试的能力侵蚀。
TRIM:通过代理轨迹最小化减少人工智能生成的代码冗余
机构 * Dept. of Computer Science Columbia University(计算机科学系哥伦比亚大学) ; Google Inc(谷歌公司) ; Google DeepMind(谷歌DeepMind)
专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 研究人工智能生成代码冗余问题,提出TRIM算法,通过最小化代理轨迹间接减少代码冗余,实验证明该方法有效且高效,能显著降低代码冗余,同时减少验证成本。
检索就足够了:使用工具的智能体实现无需训练的可解释性
机构 * University of Maryland(马里兰大学)
专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 研究神经网络激活可解释性方法,提出HARP方法,即让语言模型智能体利用激活向量数据库及工具,通过迭代查询、形成并验证假设来实现无需训练的可解释性,该方法在多方面表现出色,还凸显现有训练方法局限并推动新基准测试。
Comments 25 pages, 7 figures
智能拉取请求的测试覆盖分析
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.SE
AI总结 研究人工智能编码代理生成的拉取请求的测试覆盖情况,分析4882个相关请求,发现代理包含测试更改比例低,现有测试覆盖不足,代理编写测试仅在少数请求中提升覆盖,错误处理结构测试严重不足,为此提出相关改进措施。
Comments 12 pages, to appear 42nd International Conference on Software Maintenance and Evolution
在长上下文情况下代理技能如何失效:代码审计中的白盒研究
专题命中 软件智能体 :agent(title,abstract);workflow(abstract);分类 cs.SE
AI总结 研究长上下文下代码审计中代理技能失效问题,通过改变上下文分类故障位置,对比不同条件下Codex等运行情况,发现长上下文影响大,不同任务表现有别,外部检查表效果好,编码代理支架有帮助,给出故障分类和实证案例。
终端中的智能代码审查:行为、成本和人工对齐的轨迹级分析
专题命中 软件智能体 :agentic(title,abstract);planning(abstract);分类 cs.SE
AI总结 研究终端环境中智能代码审查的行为、成本等,基于审查者轨迹分析,发现智能审查者审查精度高但有探索等开销,成功审查与规划等有关,凸显轨迹感知和成本敏感评估对未来此类系统的好处。
Pomona:通过小型自动化变更实现彭博社的持续代码质量改进
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.SE
AI总结 提出Pomona轻量级代理工具,通过扫描和修复技能自动发现并修复代码问题,生成约10行差异的小型PR,经一个月团队部署和10名高级工程师问卷评估,17个PR中15个成功合并,中位关闭时间低于2小时,8/10工程师愿意采用。
Comments 6 pages, 2 figures, 1 table, under review
FormulaCode: 评估在大规模代码库上进行代理优化
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; California Institute of Technology(加州理工学院) ; Cornell University(康奈尔大学)
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 FormulaCode是一个评估大型真实代码库上代理优化能力的基准,包含957个从科学Python仓库挖掘出的性能瓶颈,配以专家撰写的补丁和平均264.6个社区维护的性能工作负载,揭示了前沿LLM代理在多目标优化上的重大挑战。
Comments ICML Camera Ready Version
KernelDiag:基于代理的内核崩溃根本原因诊断
专题命中 软件智能体 :agent(title,abstract);分类 cs.SE
AI总结 针对Linux内核崩溃根本原因诊断难的问题,提出KernelDiag框架,通过日志到代码映射及专门代理进行结构化因果推理,在KGYM基准测试中表现出色,优于现有方法,为自动内核根本原因诊断奠定基础。
Boogu-Image-0.1:提升开源统一多模态理解与生成能力
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI
AI总结 介绍开源统一多模态模型Boogu-Image-0.1,通过改进模型理解、数据质量和训练管道等,结合智能推理扩展,提升生成和编辑性能,在标准基准测试中表现出色,成本低,还分享实践讨论并开源代码等推动相关生态发展。
ORB5X v1.0:一个使用智能AI构建的性能可移植的全局电磁陀螺动力学PIC C++/Kokkos代码
专题命中 软件智能体 :agentic(title);workflow(abstract)
AI总结 本文介绍ORB5X,它是ORB5的C++/Kokkos版本,保留了原Fortran代码的数学模型与算法,通过替换模块和数组提升性能可移植性,经测试与原代码精度相近,且能在多种设备上编译运行。
RuBench:一个具有原生编写的俄语任务规范的仓库级智能编码基准测试
机构 * Independent Researcher(独立研究者)
专题命中 软件智能体 :agentic(title);分类 cs.AI、cs.CL、cs.SE
AI总结 RuBench 1.0是含25个俄语任务的仓库级智能编码基准测试,任务源于开源仓库修复提交,按客户请求风格编写。评估多种产品配置,报告运行结果,发现最佳配置解决78.7%任务,还发现产品替换模型问题,为智能编码评估提供新基准。
Comments 20 pages, 1 figure, 9 tables. v2 adds Round 2: Russian-market coding agents (SourceCraft CLI, Koda CLI), Antigravity with Gemini 3.1 Pro / 3.5 Flash, and Codex CLI with GPT-5.6 on the same frozen task set, plus a tool-call contamination re-audit (network + disk layers). Data, full trajectories and harness: https://github.com/eugeneshilow/rubench
使用编码智能体进行自动研究:古兰经诵读数据上的泛化器和指标最大化器
机构 * Innopolis University(因诺波利斯大学) ; Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所)
专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.SE
AI总结 研究在古兰经诵读数据任务中智能体自动研究模式,Claude Code和OpenAI Codex从同一起点出发,先发明相同算法后有分歧,添加测试集后情况变化,还提炼出评估自主智能体的五条设计规则,智能体解决方案超越手工管道。
SWE-Pruner Pro:编码语言模型已知道该修剪什么
专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE
AI总结 研究针对编码代理长上下文修剪问题,提出SWE-Pruner Pro,利用代理内部表示直接修剪工具输出。在多基准测试中节省令牌,保持任务质量,在MiMo-V2-Flash上提升解决率和准确率。
Comments Project page: https://github.com/Ayanami1314/swe-pruner-pro
CLOSER-Bench:评估硬件代理的预算跨阶段设计封闭性
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 研究硬件代理跨阶段设计封闭性评估难题,提出CLOSER-Bench协议,通过配对任务记录调用,测量多方面指标。经试点和验证揭示差距,构建加速器,促使将硬件封闭视为预算顺序决策问题。
Comments 6 pages, 2 figures, 4 tables
当经过验证的世界模型仍然失败时:大语言模型合成代码世界模型中的游戏充分性与预测准确性
机构 * AGILabs(AGILabs实验室)
专题命中 软件智能体 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型合成的代码世界模型,发现其虽预测准确率高,但在游戏中仍失败,存在验证与正确的差距,揭示危害规律,指出更多数据无法修复,相同机制在信念推理函数上重现,表明规划世界模型充分性应基于搜索分布或游戏衡量。
Comments 41 pages, 4 figures. Code and reproduction log: https://github.com/JaviMaligno/code-world-models
“知道它足够恶意吗?”评估用于细粒度恶意软件行为审计的大语言模型
机构 * University College London(伦敦大学学院) ; The University of Hong Kong(香港大学)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE
AI总结 研究针对大语言模型用于恶意软件审计可靠性不明问题,引入MalEval诊断框架,通过配对代码库与审计报告提供基本事实,经中间表示压缩代码库,映射输出到证据链,分解审计为四阶段任务,评估发现大语言模型在审计中有诸多问题,为后续可靠工作流程研究提供参考。
Comments Paper has beed accepted by ISSTA 2026
DepRepair:基于大语言模型的针对依赖项破坏更改的源代码修复
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 研究软件项目因第三方库更新致依赖项破坏更改的问题,提出DepRepair单调用大语言模型方法,通过证据过滤器、用法定位器和子类别感知指南,基于结构化上游证据修复,在DepBench基准测试中取得高可执行通过率。
Comments 10 pages, 5 figures, 7 tables
一半的专家,全部的代码:用于编码的专家混合语言模型的一次性领域剪枝
专题命中 软件智能体 :agentic(abstract);分类 cs.LG
AI总结 研究针对编码任务的专家混合语言模型,通过五种策略对两个模型进行剪枝,探究能移除多少及哪些专家。发现移除一半专家在代码基准测试无损失,损害多在编码外,但获胜策略因模型而异,还揭示了困惑度等问题及剪枝与量化的关系,强调需 per - model 验证。
Comments 15 pages, 3 figures. Code and pruned checkpoints: github.com/anik-jha/moep