Agentic Design Review System
代理设计评审系统
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出AgenticDRS系统,通过多个代理协作分析设计,结合图匹配和提示扩展方法,实现高效的设计评估与反馈生成。
Comments Project Page: https://sayannag.github.io/AgenticDRS
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
代理设计评审系统
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出AgenticDRS系统,通过多个代理协作分析设计,结合图匹配和提示扩展方法,实现高效的设计评估与反馈生成。
Comments Project Page: https://sayannag.github.io/AgenticDRS
混合人类-智能体社会困境在能源市场中的应用
机构 * Department of Data Science and AI, Faculty of Information Technology(数据科学与人工智能系,信息科技学院)
专题命中 Agent评测 :agent(title);autonomous agent(abstract);分类 cs.AI
AI总结 本文研究了在能源市场中人类与智能体的混合群体中合作行为的产生,通过引入智能体和实验展示协调机制,探讨部分采用对整体结果的影响及战略部署中的挑战。
Comments 20 pages, 7 figures. Submitted to Proceedings of the Royal Society A, Special Issue on "The evolution of sociality in hybrid human AI populations"
AI代理能否达成一致?
专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.LG
AI总结 研究发现,基于LLM的代理在无质押设置中难以可靠达成一致,群体规模增大和拜占庭代理的存在显著降低共识成功率,活锁问题主导了失败原因。
ResearchGym: 在真实世界人工智能研究中评估语言模型代理
专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 ResearchGym通过重新利用学术论文中的任务环境,评估语言模型代理在真实世界AI研究中的能力,发现其在复杂任务中存在可靠性不足的问题,但偶尔能实现前沿性能。
Comments ICLR 2026 Agents in the Wild Workshop
对抗性强化学习用于检测车联网中的虚假数据注入攻击
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文提出基于对抗性强化学习的方法,用于检测车联网中的虚假数据注入攻击,通过纳什均衡策略优化检测效果,提升交通网络的鲁棒性。
将顺序设计动作建模为设计师在无限画布上的外部化
专题命中 Agent评测 :agent(abstract);AI agent(abstract)
AI总结 研究探讨了AI在无限画布设计中的作用,发现AI通过改变认知分配和工作流程,促进了设计师与AI的协同进化。
EducaSim:用于CS1教学实践的交互仿像
专题命中 Agent评测 :agent(abstract,comments);multi-agent(comments)
AI总结 EducaSim通过生成代理为教师培训提供交互仿像,实现低成本大规模教学实践。
Comments 7 pages, 3 figures, 2 tables. Presents a multi-agent generative architecture for educational simulations intended for instructor training
深度强化学习在水下对接应用中的仿真到现实适应
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出利用高保真数字双胞胎环境和PPO算法,开发了用于水下对接的深度强化学习控制器,通过仿真到现实适应提升了对接成功率,并在物理测试中验证了其有效性。
Comments Currently under review by IROS 2026
在通用人工智能中的价值在无知下
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出通过半测度损失将信念分布视为不精确概率分布,并利用Choquet积分计算预期效用,以解决通用人工智能中价值在无知下的问题。
Journal ref In International Conference on Artificial General Intelligence (pp. 338-349). Cham: Springer Nature Switzerland (2025)
你让我这么做:测量LLM代理中指令文本诱导的私有数据泄露
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究发现LLM代理在处理嵌入文档指令时存在安全漏洞,导致高比例的数据泄露,且现有防御措施无法有效检测此类攻击。
Comments 14 pages
奖励黑客代理:用于LLM机器学习工程代理的基准评估完整性
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本研究提出RewardHackingAgents基准,用于评估机器学习工程代理的评估完整性,通过显式测量评估者篡改和训练测试泄漏两种妥协向量,展示评估完整性可作为核心指标进行验证。
OpenClaw PRISM: 一种零fork、纵深防御的运行时安全层,用于工具增强的大语言模型代理
专题命中 Agent评测 :agent(abstract)
AI总结 OpenClaw PRISM通过零fork运行时安全层,结合启发式和LLM扫描流程,提供纵深防御机制,以增强工具增强型大语言模型代理的安全性。
Comments 23 pages, 3 figures, 6 tables. Open-source system paper with benchmark artifact pipeline
基于观察者的 Sorites 矛盾及由此导出的逻辑方法
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了一种基于观察者和时间依赖的三值逻辑方法,用于解决Sorites矛盾问题。
Comments 19 pages
Journal ref Logic Journal of IGPL vol. 33(2025), no. 3
LaMoGen:通过LLM引导的符号推理实现语言到动作生成
机构 * Department of Computer Science, Hong Kong Baptist University, HKSAR(香港 Baptist 大学计算机科学系)
专题命中 Agent评测 :agent(abstract)
AI总结 LaMoGen通过LLM引导的符号推理实现语言到动作的生成,利用LabanLite动作表示提升动作的可解释性和可控性。
Comments Accepted by CVPR 2026. Supplementary material included. Project page: https://jjkislele.github.io/LaMoGen/
动态贝叶斯回归分位数合成用于预测风险展望
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出动态贝叶斯回归分位数合成方法,通过引入时间变化的潜在因子结构,提升多变量时间序列的分位数预测性能。