GitHub AI 热榜 TOP10 2026年第39周

本周 GitHub AI 热榜 TOP10 深度解析(2026 年第 39 周 · 9 月 21–27 日)

 

如果给这周找一个关键词,我会选「可验证」。过去几周大家比的是"Agent 能干多少活",本周榜单上的赢家比的是"Agent 干完的活能不能被相信":一个记忆系统不再只存事实,而是记录每条事实从哪来、冲突时信谁;一个安全审计技能硬性规定发现问题的人不能自己判定问题成立,必须换一个 Agent 从头尝试推翻它;一个管理 Agent 的平台把"外部系统连接"做成了需要人工审批的公司级意图清单。Agent 正在从"能写会跑"走向"能拿出证据"。

 

数据取自 GitHub Trending 周榜(近 7 天滚动窗口新增星标排序),抓取时间 2026-09-27,并与 ghtrends.dev 日榜、quidproquo 日报、稀土掘金日榜交叉验证。星数为抓取时点实时值,阅读时可能已有变化。

 

目录

 

 


 

本周 TOP10 速览

 

#   仓库                                 语言        总星      本周新增
--  -----------------------------------  ----------  --------  --------
1   vectorize-io/hindsight               Python      34,638    +7,282
2   stablyai/orca                        TypeScript  79,168    +6,503
3   cloudflare/security-audit-skill      JavaScript  22,141    +6,474
4   affaan-m/ECC                         JavaScript  268,080   +5,522
5   paperclipai/paperclip                TypeScript  88,231    +5,376
6   dream-num/univer                     TypeScript  19,808    +4,660
7   alibaba/open-code-review             Go          41,740    +4,310
8   Tencent/WeKnora                      Go          30,445    +3,015
9   anthropics/financial-services        Python      37,758    +2,633
10  addyosmani/agent-skills              JavaScript  99,355    +2,510

 

榜单外紧跟着的是 anthropics/claude-code(+1,744)、superdesigndev/treg(+1,773)、HKUDS/CLI-Anything(+1,055)。前十里 AI 相关占了九个,唯一非 AI 的 cloudflare/quiche(QUIC 协议实现)没能挤进来。

 


 

1. vectorize-io/hindsight:会分辨"手册写的"和"聊天说的"的记忆

 

一句话定位:Agent Memory That Learns——一个带来源优先级推理(provenance-aware reasoning)的长期记忆系统,不只是向量库。

 

为什么本周爆火:本周增长冠军 +7,282 星。它戳中了 RAG 和记忆类项目最尴尬的痛点:当手册规定和客户在聊天里随口说的一句话冲突时,Agent 该信谁?Hindsight 把这事儿做成了可配置的,而且给出了量化结果——在"手册与闲聊冲突"这类问题上,基线只有 0/6 和 4/6,声明来源优先级后变成 6/6 和 6/6,整体从 28/36 提升到 36/36。

 

核心亮点:

 

  • 记忆不是向量,是观察图:写入时把内容抽取成 memory_units(事实)并记录 fact 级来源(attachment_ids + 文档 metadata),检索走 observation 图 + GIN 索引 + connected source 探测,而不是单纯向量 top-k。
  • Retain / Recall / Reflect 三段式:写入抽取、检索注入、基于来源的推理。Reflect mission 可声明"优先手册而非对话"。
  • 多模态是一等公民:图片和文件走 vision model 抽取,附件按 sha256 内容寻址存储。真实 image-QA 数据集上"能直接从图读出"与"记忆能回答"的差距从 31.3% 降到 10.0%,prose 文章基准从 75% 提到 100%。
  • 性能优化很硬:270k units / 50k observations / 8.4M links / 138k 度 hub 的压力 bank 上,recall p50 从 4.0s 降到 0.23s,最坏从 13.8s 降到 0.39s,8 个并行从 13.8s 降到 0.40s,且得分集合完全一致。
  • 集成面铺得极开:ZCode(三个进程 hook:SessionStart / UserPromptSubmit=recall / Stop=retain)、Meta Muse(MCP connector)、Hermes(插件)、Pipecat(语音);远程 MCP server 暴露 bank 与 mental model 工具。
  • bank alias 支持零停机 id 迁移,多个 Agent 可共享或隔离各自的记忆银行。

 

技术栈:核心 Python(hindsight-api、hindsight-embed),Rust CLI(hindsight-cli),Next.js 控制台,OpenAPI 生成 Python/TypeScript/Go 客户端;数据库支持 PostgreSQL 与 Oracle;Docker + Helm 部署。

 

快速上手(部分):

 

# Python 包:hindsight-api / hindsight-all / hindsight-embed
# Rust CLI:hindsight-cli(含 hindsight-admin rename-bank)
 
# Agent 集成
hindsight-zcode install          # 安装三个进程 hook,无需 MCP
hermes plugins install hindsight
# Claude Code 插件市场
zcode plugins add-marketplace vectorize-io/hindsight

 

适合谁:需要给编码 Agent / 个人助手 / 语音 Agent 配长期记忆的开发者;需要私有化部署(Docker/Helm/Postgres/Oracle)、需要控制面 UI、需要多 Agent 共享记忆的团队。

 

注意事项:许可证类型未在抓取到的页面内容中出现,商用前必须确认;安装文档分散在各子包,完整 README 上手段落建议到仓库核实;它目前没有提到遗忘曲线 / 记忆衰减机制,长期运行的记忆膨胀问题需自行评估。Oracle 支持意味着企业向,但对个人用户意义有限。

 


 

2. stablyai/orca:把并行 Agent 舰队做成正经开发环境

 

一句话定位:ADE(Agent Development Environment)——用你自己的订阅,并行跑任意编码 Agent,桌面 / 移动 / 远程三端统一面板。

 

为什么二连榜:本周再收 +6,503 星(上周 +5,404),累计 79,168,增速不降反升。它切的需求非常具体:一个 issue 配一个 Agent,多个 Agent 同时干活,而且用的是你自己已有的订阅额度。这个组合在"并行 Agent"这个新兴品类里几乎没有对手。

 

核心亮点:

 

  • 自带订阅:接入你已有的 Codex / Claude 等凭证,Orca 只做调度外壳,不托管模型、不额外收费。
  • 三端架构:Electron 桌面端(Win/macOS)+ React Native/Expo 移动端 + 远程 headless runtime,上周刚上线移动端 OTA phase C(web shell bridge 实现页端 RpcClient)。
  • 并行编排:worker 调度、最新优先分页、截断警告,多任务并行不串味。
  • 工程细节扎实:PTY 流反压看门狗(60s)、CJK 输入法对齐、SSH 重连边界、Windows 原生依赖与 userData 写入兼容性、文件浏览器全工作区搜索。
  • Skills 系统:computer-use 限定 GUI、orca-cli 指令、Playwright 路由限制。

 

技术栈:TypeScript;Electron + React Native/Expo + Node/Postgres;pnpm、Vitest、oxlint。

 

适合谁:同时推进多个 issue 的独立开发者;批量改代码 / 修 lint 的工程团队;想在手机上盯 Agent 进度的重度用户。

 

注意事项:许可证类型未在仓库显要位置标明,商用前务必确认;多 Agent 并行会成倍放大额度消耗,需自行监控。

 


 

3. cloudflare/security-audit-skill:发现问题的人不许自己判定问题成立

 

一句话定位:Cloudflare 开源的一个 coding-agent 技能,把你的 Agent 变成安全审计员——六阶段流程,产出机器可读、经独立验证的发现。

 

为什么本周爆火:本周 +6,474 星。它是 Cloudflare 那篇《Build your own vulnerability harness》博客的开源落地版——那套后来长成跨机群多阶段系统的漏洞发现载具,就是从这一个 repo 的 skill 长出来的。核心设计一句话就能打动人:检查某个发现的 Agent,永远不是找到它的那个 Agent。找到问题的 Agent 不能自己认定问题成立,必须交给一个全新的 Agent 从头尝试推翻它。等于把"同行评审"制度化写进了 Agent 工作流。

 

六阶段流程:

 

  1. Reconnaissance:绘制架构、信任边界、输入面、既有证据与确定性覆盖,落到 architecture.md 和 coverage-ledger.json
  2. Coverage-led hunting:从 ledger 单元分派隔离的 hunter agent,记录它们的检查,并用 coverage critic 找缺口
  3. Candidate validation:每个唯一候选交给一个全新 verifier,任务是证伪它
  4. Structured output:把 confirmed / needs_validation / rejected 写进 findings.json,并按 report-schema.json 校验
  5. Independent record verification:全新 Agent 验证最终来源声明;发生实质性替换的,再换一个独立 verifier
  6. Target-neutral reporting:从已验证记录和覆盖台账生成 REPORT.md、FINDINGS-DETAIL.md、NEEDS-VALIDATION.md

 

五条设计原则(值得单独记下来):

 

  • 只确认已成立的边界失效;来源不扎实的线索保持为 needs_validation 并记录确切未决事实
  • 对抗式验证:检查者 ≠ 发现者
  • 严重度必须有实际影响,可能性 × 影响,而不是偏离检查清单的程度
  • 纵深防御缺口不算漏洞:如果 A 层已经挡住了攻击,B 层缺失只是加固建议
  • 多轮运行提升覆盖率——官方测试中,单轮只找到多轮累计所能发现漏洞的约一半

 

攻击面分类很全:除核心类外,还覆盖内存安全与二进制、AI 与 LLM(提示注入、Agent/工具、输出处理)、Web 协议与认证、客户端/浏览器、供应链与发布、云与部署、RPC 与消息协议、资源耗尽与可用性、数据隔离与生命周期、桌面移动与本地 IPC。

 

技术栈:JavaScript(含零依赖的 validate-findings.cjs 与 validate-coverage-ledger.cjs 校验器);MIT 许可证。

 

快速上手:

 

npx skills add https://github.com/cloudflare/security-audit-skill \
  --skill security-audit --global
 
# 然后在代码库里问你的 Agent:
# security audit this codebase
# find security vulnerabilities in ./src

 

前置条件(重要):需要一个支持工具调用和并行子 Agent 的编码 Agent;需要 Node.js 跑校验器;必须有一个 OS 强制的沙箱来跑目标控制的构建、测试、进程、浏览器、模拟器、fuzzer 和 fixture——要禁用外网、使用净化后的白名单环境、强制资源限制、只允许写入指定的 scratch 路径。没有这些控制,工作流会把线索保持为 needs_validation 而不是执行目标代码。

 

适合谁:平台工程 / DevSecOps 团队;想在 CI 里加一道 Agent 安全审计的团队;做 AI 驱动安全工具研究的人。

 

注意事项:这是完整审计流程,Token 消耗相当可观;没有合格沙箱时效果会大幅打折;默认输出目录为 ~/security-audit-skill/<repo-name>/run-<N>,只有你显式指定版本控制忽略的目录时才会往目标仓库里写。

 


 

4. affaan-m/ECC:27 万星,Agent Harness 的事实标准还在加固

 

一句话定位:Agent Harness 性能优化系统——Skills、Instincts、Memory、Security、Research-first 五件套,适配 Claude Code、Codex、OpenCode、Cursor 等全平台。

 

为什么还在涨:本周 +5,522 星,累计 268,080。这是它连续第四周在榜,也是全 GitHub 累计星数最高的 Agent 工具生态项目。当 Skills 框架进入"比拼覆盖广度与精细度"的阶段,ECC 靠结构化 Skill 模板的规模成为事实标准之一,并且仍在持续吸收新框架的模式(此前新增过 Rails 框架模式 Skill)。

 

核心亮点:

 

  • Instincts(直觉)层:不只是技能清单,而是把"遇到这种情况该怎么反应"的行为倾向也编码进去。
  • Memory 层:跨会话记忆,此前刚修掉"读了一半"与"压根没记录"被混淆的边界问题。
  • Research-first:强制先调研再动手,抑制 Agent 上来就写代码的冲动。
  • Security 护栏:内置安全约束,防止破坏性操作。
  • 全平台覆盖:一套配置多处生效,不绑定单一厂商。

 

技术栈:JavaScript;MIT 许可证。

 

适合谁:深度使用编码 Agent、希望一次性沉淀团队方法论的工程师;不想每个项目重复造 Skill 轮子的团队。

 

注意事项:体积庞大,初次加载上下文开销不小,建议按需启用子模块而非全量加载;累计星数为动态值,引用前建议核对。

 


 

5. paperclipai/paperclip:把 AI Agent 当数字员工来管

 

一句话定位:开源的 AI Agent 控制平面——在公司里创建、运行、编排、监督和治理 Agent,把它们当数字员工。

 

为什么本周爆火:本周 +5,376 星,累计 88,231。9 月是它的高密度交付月,几乎每周都有实质更新:应用内公告系统(9/14)、ClipLab v0.2.0 Agent 视觉身份与入职向导(9/19)、公开评估历史中心(9/16)、DeepWiki 贡献者手册 6 章 30 页含 244 个源码锚点(9/21)、Daytona 镜像构建修复(9/23)、CI 瘦身与签名标准镜像(9/24)、recovery 修复(9/27)。

 

核心亮点:

 

  • Agent 有身份:ClipLab 引擎给每个 Agent 分配持久化视觉形象(17 种配色),入职向导完成 sleepy → wink → idle 的"唤醒"序列。
  • 任务的未来调度:issue monitor 可安排未来的检查、重试、唤醒,UI 带实时倒计时。
  • 外部连接要审批:Agent 需要外部应用时提交 connection intent,持久化为公司级意图,需操作员批准,支持 OAuth 与 Hermes Gateway 派发。这是"治理"落到实处的关键设计。
  • 结果回收有保障:recovery 逻辑保留 native coordinator 所有权,直到 workspace copy-back / 评估 / 仲裁完成,避免已接受的结果被误清理。
  • 两套评估体系:Runner evals 与 Product E2E evals,结果进入公开静态 hub。
  • Runner 适配广泛:native runner + Daytona / Codex / Claude(ACPX)适配器。

 

技术栈:TypeScript + pnpm monorepo(ui / server / cli / shared / hermes-paperclip-adapter);React + Vite 前端,Node.js 后端 + PostgreSQL;Vitest + Playwright/Storybook 测试;支持自托管 Docker 部署。

 

适合谁:已经让多个 Agent 参与实际业务、需要统一编排与治理的团队;想自托管、要数据不出内网的组织。

 

注意事项:许可证与完整安装命令未在抓取到的页面内容中出现,商用与部署前请以仓库 README / LICENSE 为准;它是完整平台级项目,上手成本远高于一个 Skill。

 


 

6. dream-num/univer:让 Agent 真正接手 Office 文档

 

一句话定位:The Office Harness for AI Agents——表格、文档、幻灯片、画布、关系型数据表、PDF 共用一套运行时,浏览器和 Node.js 同构。

 

为什么本周上榜:本周 +4,660 星,累计 19,808。它做的事很朴素但很关键:让 Agent 能用结构化 API 检查和修改 Office 内容,而不是生成一堆文件让人自己开。9 月 24 日刚发布 v1.0.2,同期更新了 SDK 示例与 Workspace 案例。

 

核心亮点:

 

  • 同构设计:浏览器里跑 UI,Node.js 里跑 headless 处理,同一套架构同一套 Facade API。
  • 插件优先:每个能力都是可组合的插件,能增删替换、懒加载;也有 presets/ 提供开箱组合。
  • Canvas 渲染引擎 + 独立公式引擎:复杂工作簿也能保持响应。
  • 面向 Agent 的三件事:结构化 API 程序化编辑;通过内容检查、渲染截图、布局诊断做输出验证;Agent 在隔离的 worktree 草稿里工作,人审阅后再决定合并什么。
  • 生态已铺开:univer-sdk-skills(给 Agent 用的集成指令)、univer-mcp(自然语言驱动 Univer Sheets)、Univer CLI(本地命令行工作区),以及 DeepSeek Harness / WorkBuddy / OpenClaw 的 Office 插件。
  • Univer Workspace 参考实现:开源可自托管,Agent 能生成基于表格的 mini-app(决策看板、交互报告),网页上的指标、图表、控件直接绑定单元格。

 

技术栈:TypeScript;支持 React / Vue / Web Components 集成;有明暗主题适配。开源版与 Pro 版并存(实时协作、导入导出、打印、图表、数据透视等属 Pro 扩展)。

 

快速上手(Preset 模式):

 

pnpm add @univerjs/presets @univerjs/preset-sheets-core

 

import { UniverSheetsCorePreset } from '@univerjs/preset-sheets-core'
import { createUniver, LocaleType, mergeLocales } from '@univerjs/presets'
import '@univerjs/preset-sheets-core/lib/index.css'
 
const { univerAPI } = createUniver({
  locale: LocaleType.EN_US,
  presets: [UniverSheetsCorePreset({ container: 'app' })],
})
 
univerAPI.createWorkbook({})

 

适合谁:要把表格/文档编辑嵌入 SaaS 产品或内部工具的团队;需要服务端处理工作簿的场景;想让 Agent 交付可审阅 Office 产物的 AI 应用开发者。

 

注意事项:Sheets 最成熟,Docs / Slides 仍在演进;实时协作、导入导出、图表、打印等能力在 Pro 版,许可与包可用性按特性而异,商用前需确认。

 


 

7. alibaba/open-code-review:二连榜,增速依然凶悍

 

一句话定位:混合架构代码审查工具——确定性流水线 + LLM Agent 双轨并行,行级精确评论,内置 NPE、线程安全、XSS、SQL 注入等多语言规则集,兼容 OpenAI 与 Anthropic。

 

为什么还在涨:上周断层第一(+15,028),本周再收 +4,310 星,累计 41,740。热度回落但体量已经站稳,说明它不是一次性话题项目。核心方法论值得再强调一次:能用规则确定的问题绝不花钱问模型,只有需要语义理解的部分才交给 LLM Agent,且 token 预算检查提前到每一轮调用前。

 

核心要点(补充上周未展开的部分):

 

  • Token 预算硬约束:超预算的组走 grace round 提交已发现项后报 failed(budget),不会静默烧钱。
  • 行级评论落地 IDE:VSCode 扩展可用,JetBrains 插件(Kotlin)已上架 Marketplace。
  • 审查会话可归档:ocr session export 导出自包含 HTML,适合作为 CI 产物。
  • 安装友好:Go 二进制按平台拆成 npm 包走 optionalDependencies,不依赖 GitHub Release 下载。
  • 多模型兼容:OpenAI / Anthropic 协议通用,仓库内有 Claude Code、Codex、Kimi 的插件注册清单。

 

技术栈:核心 Go,CLI 启动器 Node.js,VSCode 扩展 TypeScript,JetBrains 插件 Kotlin。

 

适合谁:中大型研发团队做 CR 流水线;需要在 CI 里留痕归档的合规场景。

 

注意事项:许可证类型建议发布前到仓库二次确认;JetBrains 插件仍属早期版本;"阿里规模验证"目前是官方口径,暂无公开性能基准。

 


 

8. Tencent/WeKnora:二连榜,企业知识平台站稳了

 

一句话定位:腾讯开源的 LLM 知识平台——把原始文档变成可查询的 RAG、自主推理 Agent、自维护 Wiki。

 

为什么还在涨:上周 +4,867,本周 +3,015,累计 30,445。作为中文企业场景里最完整的开源知识平台之一,它靠的是"一条龙 + MIT 全开源 + 可私有化"这个组合拳,而不是单一功能亮点。

 

三大能力(快速回顾):

 

  • 可查询 RAG:多源自动同步(飞书 Wiki/云盘、GitLab、腾讯 IMA、Notion、语雀、钉钉、RSS),10+ 格式解析(Office 经 anydoc 引擎在 Go 进程内转 Markdown),向量 + 关键词 + 混合检索,chunk 级编辑与修订。
  • 自主推理 Agent:ReAct 模式调度检索工具、MCP 工具、租户技能目录;Docker / E2B / Cube 沙箱执行环境;跨会话长期记忆。
  • 自维护 Wiki:蒸馏成结构化互联 Markdown 知识库 + 交互式知识图谱,支持修订历史(快照 + 行级 diff + 一键回滚)。

 

其他要点:内置原生 MCP Server(mcp-go Streamable HTTP,per-workspace endpoint);20+ LLM 提供商;RBAC 四级角色矩阵、审计日志、作用域 API Key;IM 接入企业微信 / 飞书 / Slack / Telegram / QQBot;Docker Compose 与 Helm 双部署路径;当前版本 v0.8.0。

 

技术栈:Go 后端 + Node/Nginx 前端;文档解析用 Rust 静态库 anydoc 经 cgo 链接;数据库仅支持 PostgreSQL 或 SQLite(明确不支持 MySQL);MIT 许可证。

 

适合谁:要建内部文档问答与合规审计的企业 IT;要求数据主权可控的知识管理团队。

 

注意事项:不支持 MySQL;v0.8.0 已移除 local host-process 沙箱,必须用 Docker / E2B / Cube。

 


 

9. anthropics/financial-services:Anthropic 把金融岗做成了十个 Agent

 

一句话定位:Anthropic 官方的金融服务业参考 Agent、技能与数据连接器——覆盖投行、股票研究、私募股权、财富管理、基金行政与财务运营、KYC 运营。

 

为什么本周上榜:本周 +2,633 星,累计 37,758。这是继 knowledge-work-plugins 之后,Anthropic 在垂直行业里的第二记重拳,而且这次是按岗位做成端到端 Agent,不再只是技能集合。同一套源文件两种用法:装成 Claude Cowork 插件,或通过 Claude Managed Agents API(/v1/agents)部署在你自己的工作流引擎后面。

 

十个命名 Agent:

 

  • Pitch Agent:comps、precedents、LBO → 品牌化 pitch deck
  • Meeting Prep Agent:客户会议前的简报包
  • Market Researcher:行业/主题 → 概览、竞争格局、同业对比、想法清单
  • Earnings Reviewer:财报电话会 + 文件 → 模型更新 → 笔记草稿
  • Model Builder:DCF、LBO、三表模型、comps,在 Excel 里实时构建
  • Valuation Reviewer:GP 资料包 → 估值模板 → LP 报告
  • GL Reconciler:发现差异、追踪根因、流转签字
  • Month-End Closer:权责发生制、roll-forwards、差异说明
  • Statement Auditor:分配前审计 LP 报表
  • KYC Screener:解析入职文档、跑规则引擎、标记缺失

 

垂直插件:financial-analysis(所有数据连接器集中在此)、investment-banking、equity-research、private-equity、fund-admin、operations,以及 LSEG、S&P Global 两个 partner 插件。数据连接器包括 Daloopa、Morningstar、S&P Global、FactSet、Moody's、MT Newswires、Aiera、LSEG、PitchBook、Chronograph、Egnyte、Box。

 

技术栈:全部基于文件——Markdown + JSON + YAML,无构建步骤;维护脚本用 Python 3(check.py manifest lint、sync-agent-skills.py、orchestrate.py);另有 claude-for-msft-365-install 为 Excel/PowerPoint/Word/Outlook 提供加载项;Apache-2.0 许可证。

 

快速上手:

 

# Cowork:Settings → Plugins → Add plugin,粘贴仓库 URL
 
# Claude Code:
claude plugin marketplace add anthropics/financial-services
claude plugin install financial-analysis@claude-for-financial-services
claude plugin install pitch-agent@claude-for-financial-services
 
# Managed Agents 部署
export ANTHROPIC_API_KEY=sk-ant-...
scripts/deploy-managed-agent.sh gl-reconciler

 

适合谁:投行、股票研究、私募股权从业者;基金行政与财务运营团队;KYC 与入职合规团队;想在自有环境 fork 并按公司流程改造的企业 IT。

 

注意事项(重要):官方明确声明"本仓库内容不构成投资、法律、税务或会计建议",所有产出只是分析师工作草稿,必须由合格专业人员审核——不做投资推荐、不执行交易、不过账、不批准入职。覆盖范围没有保险、没有独立的风险管理职能,合规侧只有 KYC。此外财富管理相关的 wealth-management 插件(9/11)与 claude-for-financial-advisors 目录(9/21)近期被移除,README 仍有残留描述,选型时需以仓库实际目录为准。

 


 

10. addyosmani/agent-skills:老将回榜,靠的是工程纪律

 

一句话定位:Chrome 团队 Addy Osmani 维护的生产级工程技能集——25 个技能覆盖 Define → Plan → Build → Verify → Review → Ship 全生命周期。

 

为什么本周上榜:本周 +2,510 星,累计 99,355,逼近十万。它上榜不是靠新功能,而是靠一整套"不让 Agent 偷懒"的机制设计——在 Skill 同质化越来越严重的当下,这种工程纪律反而是稀缺品。

 

核心机制:

 

  • 反合理化表格:每个技能都附常见借口("我待会儿再补测试")与文档化反驳,提前堵死偷懒路径。
  • 验证不可协商:每个技能以证据要求结尾(测试通过、构建输出、运行时数据),"看起来对"不算数。
  • 安全护栏:破坏性路径操作需允许列表根目录 + 深度下限 + 所有者检查。
  • 怀疑驱动审查:CLAIM → EXTRACT → DOUBT → RECONCILE → STOP。
  • Google 工程文化基因:Hyrum's Law、Beyonce Rule、测试金字塔、Chesterton's Fence、trunk-based、Shift Left。
  • 平台覆盖极广:Claude Code、Codex、Cursor、Antigravity、Gemini CLI、Copilot、Kiro 原生支持,经 skills CLI 可装到 70+ 个 Agent。

 

技术栈:JavaScript;MIT 许可证。

 

快速上手:

 

npx skills add addyosmani/agent-skills
npx skills add addyosmani/agent-skills --skill test-driven-development

 

适合谁:希望 Agent 遵守工程规范而非自由发挥的团队;想学"技能该怎么写"的开发者(仓库内有与 Superpowers、Matt Pocock skills 的对比文档)。

 

注意事项:25 个技能全量加载会占用可观上下文,建议按项目阶段选择性启用。

 


 

 

信号一:Agent 的评价标准从"能做"转向"可验证"

 

本周最有价值的两条设计都指向同一件事。Hindsight 让记忆带上来源并支持优先级仲裁——当手册和聊天冲突时,它知道该信谁,且能给出 36/36 的量化证据。Cloudflare 的 security-audit-skill 硬性规定发现者与验证者必须分离,找到问题的 Agent 无权判定问题成立。这两条都不是能力增强,而是可信度增强。当 Agent 开始进入生产流程,"你的结论凭什么成立"会变成比"你能干多少活"更重要的问题。

 

信号二:安全审计成为 Agent 的一等公民能力

 

Cloudflare 开源自家漏洞发现载具的种子 skill,加上此前 Claude-Red 等同类项目的热度,说明企业要的不再是"Agent 帮我写代码",而是"Agent 帮我攻击和审计代码库"。值得注意的是它的五条原则里有一条很反直觉但很专业:纵深防御缺口不算漏洞。这类判断力恰恰是普通漏洞扫描器给不出来的。

 

信号三:Agent 管理平台化,"治理"从口号变成具体功能

 

Paperclip(+5,376)和 Orca(+6,503)代表了两条不同路径:Orca 面向开发者,解决"多个 Agent 并行干活"的执行问题;Paperclip 面向组织,解决"Agent 作为数字员工如何被管理"——有身份、有入职流程、有任务监控、外部系统连接需要人工审批。后者把"治理"落到了一个非常具体的功能点上,这比任何原则声明都有说服力。

 

信号四:大厂在垂直行业里"下沉"到岗位级

 

Anthropic 一周之内两个仓库在榜:knowledge-work-plugins(上周 +3,000)覆盖通用岗位,financial-services(本周 +2,633)深入金融业,直接给出 Pitch Agent、GL Reconciler、KYC Screener 这样按职能命名的端到端 Agent。它甚至提供了 Managed Agents API 让企业部署在自己的工作流引擎后面。这是模型厂商从"卖能力"转向"卖岗位"的明确动作。

 

信号五:Agent 开始接管传统生产力软件的"活儿"

 

Univer(+4,660)的定位"Office Harness for AI Agents"很能说明问题:Agent 不只是生成文件内容,还要能程序化编辑、自我验证(内容检查 / 渲染截图 / 布局诊断)、在隔离 worktree 里工作等人审阅后合并。这套"编辑—验证—审阅"的闭环,正是 Agent 从演示走向交付所必需的最后一段路。同类方向还有榜外的 HKUDS/CLI-Anything(让所有软件 Agent 化)。

THE END