---
title: "GitHub AI 项目回溯周报｜2026-02-02 至 2026-02-08"
description: "2 月第一周，OpenAI 给 Codex 做的技能目录在日榜上待了 6 天，AI 渗透测试工具 shannon 最后两天排在日榜第一；另有两个管多 Agent 协作的工具和一个开源的端侧全模态模型。本期依据互联网档案馆存下的日榜补写。"
pubDate: 2026-02-08
tags: ["GitHub AI 日报", "回溯周报", "Agent Skills", "AI 安全", "Agent 编排"]
---

这一期是 2026 年 9 月补写的。本站的 AI 日报从 2026 年 8 月 24 日才开始，之前没有记录，就按周往回补，材料是互联网档案馆存下的 GitHub Trending 日榜，每天一份。这一周每天上榜 11 到 12 个仓库，七天加起来 35 个，这里从中挑了 9 个 AI 项目。

入选的九个里上榜最久的是 OpenAI 的 skills 仓库，里面是给 Codex 用的技能，一共上榜 6 天。这一周单日涨得最多的是 shannon，一个用 AI 给自家网页应用做渗透测试的工具，2 月 7 日、8 日两天各涨了三千多个 Star。另一条线是几个 Agent 怎么一起干活，ChatDev 在零代码的画布上编排，Maestro 直接调度现成的编码 Agent。

挑选的条件有三条。AI 得是项目的核心能力，存档页上的 Star 要过 1,000，到周日为止的 90 天里还有提交或发布。资源清单、教程、书的配套代码和提示词合集都不收；前面几周收过的项目，除非这一周发了主版本号升级的新版，也不再收。排序先看这一周上了几天榜，再看单日涨得最多的那天。单日增星是存档那一刻页面上显示的当天数字，每天存档的钟点不一样，只能大致比较。表里的 Star 是这一周最后一次上榜时页面上显示的总数，许可证、发布和提交记录都截至 2 月 8 日。

## 九个项目

| # | 项目 | 上榜 | 单日最多增星 | Star | 方向 |
|---|---|---|---|---|---|
| 1 | [openai/skills](https://github.com/openai/skills) | 6 天 | +621（02-05） | 6,552（02-08） | Codex 技能目录 |
| 2 | [OpenBMB/ChatDev](https://github.com/OpenBMB/ChatDev) | 3 天 | +476（02-04） | 29,878（02-04） | 零代码多 Agent 编排 |
| 3 | [karpathy/nanochat](https://github.com/karpathy/nanochat) | 3 天 | +447（02-04） | 42,163（02-04） | 低成本训练大模型 |
| 4 | [pedramamini/Maestro](https://github.com/RunMaestro/Maestro) | 3 天 | +336（02-03） | 1,583（02-04） | 多 Agent 桌面调度 |
| 5 | [KeygraphHQ/shannon](https://github.com/KeygraphHQ/shannon) | 2 天 | +3,139（02-08） | 11,225（02-08） | AI 渗透测试 |
| 6 | [linshenkx/prompt-optimizer](https://github.com/linshenkx/prompt-optimizer) | 2 天 | +329（02-06） | 19,581（02-06） | 提示词优化工具 |
| 7 | [topoteretes/cognee](https://github.com/topoteretes/cognee) | 2 天 | +256（02-06） | 11,979（02-06） | Agent 图谱记忆 |
| 8 | [p-e-w/heretic](https://github.com/p-e-w/heretic) | 2 天 | +69（02-08） | 4,838（02-08） | 模型去除拒答 |
| 9 | [OpenBMB/MiniCPM-o](https://github.com/OpenBMB/MiniCPM-V) | 2 天 | +44（02-08） | 23,271（02-08） | 端侧全模态模型 |

## 逐个看

### 1. [openai/skills](https://github.com/openai/skills)

这是 OpenAI 给 Codex 准备的技能目录。README 的说法是，一个技能就是一个文件夹，放着指令、脚本和资源，Agent 碰到相关任务时自己找来用，写一次到处能用，页面上还链到 agentskills.io 的开放标准。`.system` 里的技能随最新版 Codex 自动装上，`.curated` 和 `.experimental` 里的用 `$skill-installer` 按名字或目录地址安装。仓库没有整体的许可证，每个技能目录里各带一份 LICENSE.txt。

到 2 月 8 日，精选区里有 30 个技能，从部署到 Vercel、Netlify、Cloudflare，到对接 Figma、Linear 和 Notion，范围挺杂。2 月 2 日加进来三个安全方面的技能。一个按语言和框架做安全审查，一个从 git 历史里算出敏感代码归谁维护；威胁建模那个先读代码仓库，再写出一份 Markdown 威胁模型。实验区在 2 月 7 日从五个技能删到只剩 wrapped，2 月 8 日又换成了 build-things。README 里举的安装例子还是实验区的 create-plan，这时已经删掉了。

### 2. [OpenBMB/ChatDev](https://github.com/OpenBMB/ChatDev)

ChatDev 最早是一家虚拟软件公司，CEO、CTO、程序员这些角色都由 Agent 扮演，一起把软件从设计做到测试和文档。1 月 7 日发布的 2.0 起名 DevAll，README 管它叫零代码多 Agent 平台，在配置里定义 Agent、工作流和任务，拿来做数据可视化、3D 生成和深度调研，旧版挪到了 chatdev1.0 分支。网页控制台里有可视化画布，可以拖着编排；要批量跑，还有一个 Python SDK。

这一周它没有发新版，最新的还是 1 月 22 日的 v2.1.0。2 月 7 日加了一个按时间控制循环的 loop_timer 节点，第二天界面上的提示框补了帮助内容，Windows 上的构建脚本也修了兼容问题。在 2.0 里，老 ChatDev 变成了 `yaml_instance/` 下的一个工作流文件 ChatDev_v1.yaml，和做坦克大战、在 Blender 里搭圣诞树的模板排在一起。

### 3. [karpathy/nanochat](https://github.com/karpathy/nanochat)

nanochat 的简介是 The best ChatGPT that $100 can buy。README 说它是训练大模型最简单的实验框架，在一台 GPU 节点上跑完分词、预训练、微调、评测、推理和聊天界面，代码短，好改。主打的例子是训练一个 GPT-2 水平的模型。README 算了一笔账，2019 年训 GPT-2 大约花了 43,000 美元，现在用一台 8 卡 H100 节点跑 3 个小时左右，按每卡每小时 3 美元算约 72 美元。所有超参数都跟着一个旋钮走，就是 Transformer 的层数。

README 里有一张到 GPT-2 水平要多久的排行榜，第 0 行是 2019 年 OpenAI 原版的 GPT-2，168 小时。这一周榜上多了两条，都是 Karpathy 自己跑的。2 月 2 日那条换成 fp8 训练，时间降到 2.91 小时；2 月 5 日那条把总批量加到 100 万个 token，降到 2.76 小时。没成的尝试也留在提交记录里，2 月 5 日有一条提交就叫 `try and fail relu^2 -> swiglu`。

### 4. [pedramamini/Maestro](https://github.com/RunMaestro/Maestro)

Maestro 是一个跨平台的桌面应用，用来同时调度一群 AI Agent 和好几个项目，README 说是给离不开键盘的重度用户做的。它支持 Claude Code、OpenAI Codex、OpenCode 和 Factory Droid，自己只做一层直通，这些工具里配好的 MCP、技能和权限照样生效，区别是不再交互式地跑，每个任务发一个提示、收一个回复。Auto Run 按写好的规格文档逐项执行，每个任务开一个干净的新会话，作者说他连续无人值守跑过将近 24 个小时。

这一周它没发新版，最新的还是 1 月 24 日的 v0.14.5，默认分支上倒有两百多次提交。2 月 7 日合进了一批 0.15.0 的收尾改动，新手引导里加了远程控制那一步。README 里还有一套成就系统，按累计 Auto Run 时长从 Apprentice 一路升到 Titan of the Baton，一共 11 级。仓库当时在 pedramamini 名下，现在转到了 RunMaestro。许可证是 AGPL-3.0。

### 5. [KeygraphHQ/shannon](https://github.com/KeygraphHQ/shannon)

shannon 是一个自动做渗透测试的 AI 工具，README 开头说它的活很简单，赶在别人之前，先找出你的网页应用哪里能被攻破。它只做白盒测试，得能读到应用的源代码。先分析代码找可能的漏洞，再用内置浏览器去实际验证，验证不了的不写进报告，README 管这条规矩叫 No Exploit, No Report。核心推理用的是 Anthropic 的 Claude Agent SDK。仓库里是 Lite 版，许可证 AGPL-3.0，另有收费的 Pro 版。

2 月 7 日、8 日两天它都排日榜第一，7 日仓库里有两次提交，其中一次把品牌改成了 Shannon by Keygraph。README 说 Lite 版在不给提示、能看源码的 XBOW 基准上成功率 96.15%。我觉得最该看的是免责声明。它会真的发起攻击，可能改掉或删掉目标应用里的数据，README 要求别在生产环境跑，要先拿到系统所有者的书面授权；报告里也可能有大模型编出来的内容，得有人复核。跑一次完整测试大约 1 到 1.5 小时，用 Claude 4.5 Sonnet 大约花 50 美元。

### 6. [linshenkx/prompt-optimizer](https://github.com/linshenkx/prompt-optimizer)

prompt-optimizer 是一个提示词优化工具，一键改写提示词，可以多轮迭代，系统提示词和用户提示词都能改，改前改后还能并排对比测试。它接 OpenAI、Gemini、DeepSeek、智谱、SiliconFlow 这些模型，也能文生图、图生图，有网页版、桌面版、Chrome 插件和 Docker 四种用法，另外带一个 MCP 服务。README 强调它是纯前端项目，数据只存在浏览器本地，不经过中间服务器。

纯前端也有代价，README 常见问题的第一条就是跨域。不少模型服务不接受浏览器的跨域请求，网页版就连不上，README 推荐换桌面版，或者自己架一个 API 中转。这一周有两次提交和跨域有关，补了服务商的跨域信息，也改了跨域提示框；另外加了 Ollama 适配器，修了 Anthropic 适配器拉取模型列表和 max_tokens 必填的问题，2 月 5 日发了 v2.5.3。许可证文件写明只按 GNU AGPL 第 3 版授权。

### 7. [topoteretes/cognee](https://github.com/topoteretes/cognee)

cognee 给 AI Agent 做记忆。README 说它把原始数据变成持久的 Agent 记忆，向量检索和图数据库一起用，文档能按意思搜到，彼此的关系也连在一起，可以替掉传统的 RAG。它能从 30 多种数据源导入。最小的例子先 add 一段文本，cognify 生成知识图谱，再用 memify 往图上加记忆算法，查的时候用 search。

2 月 4 日它发了 v0.5.2，加了多查询的三元组检索和内容翻译，多用户支持扩展到了 pgvector 和 Neo4j。发布说明里有一条归在幻觉下面的修复，把那个出了名的 John Doe 实体引用删掉了，说是为了数据更准。2 月 8 日又合进了新的图谱可视化。许可证是 Apache-2.0。

### 8. [p-e-w/heretic](https://github.com/p-e-w/heretic)

heretic 自称全自动去除语言模型审查的工具，README 把 safety alignment 直接叫作审查。它不需要重新训练模型，自己搜索参数，目标是让模型少拒答，同时尽量少损失原来的能力。README 放了一张对比表，统计的是模型面对一组有害提示词时拒答多少次，说它在 Gemma 3 12B 上做出的版本拒答次数和两个手工做的版本一样，离原模型更近。

这一周它没有发新版，最新的还是 2025 年 12 月的 v1.1.0。2 月 2 日合进了一位外部贡献者写的新算法选项，其余几次提交是打印内存占用、修小问题和升级 CI。许可证是 AGPL-3.0。

### 9. [OpenBMB/MiniCPM-o](https://github.com/OpenBMB/MiniCPM-V)

MiniCPM-o 是 OpenBMB 的端侧多模态模型系列，从 MiniCPM-V 升级而来，图像、视频、文字和音频都能输入，输出文字和语音。2 月 3 日开源的 MiniCPM-o 4.5 共 9B 参数，在 SigLip2、Whisper-medium、CosyVoice2 和 Qwen3-8B 的基础上端到端搭成。README 说它在视觉和语音上接近 Gemini 2.5 Flash。新本事是全双工，视频和音频持续输入的时候，文字和语音照样往外输出，互不堵塞；模型每秒判断一次要不要开口，能根据看到的场景主动提醒。

2 月 5 日 README 加了一条说明，网页演示可能因为网络出现延迟，他们正在做本地部署的 Docker 镜像；2 月 6 日镜像就出了，能在自己的 Mac 上跑低延迟的全双工对话。GitHub 上的发布记录还停在 2025 年 5 月。README 写明模型权重和代码都用 Apache-2.0。仓库当时叫 OpenBMB/MiniCPM-o，现在改名叫 OpenBMB/MiniCPM-V。

## 几条线索

这一周有几个项目拿编码 Agent 给自己定位。shannon 的核心推理用 Claude Agent SDK，README 讲自己为什么要有，理由是 Claude Code、Cursor 这类工具让团队不停地往外发代码，渗透测试却一年才做一次。Maestro 不自己做 Agent，拿 Claude Code、Codex、OpenCode 和 Factory Droid 来统一调度；OpenAI 的 skills 仓库直接给 Codex 装能力。

安全方面，shannon 和 OpenAI 那三个安全技能都把明确的许可放在前面。shannon 要求先拿到目标系统所有者的书面授权，别在生产环境跑。那三个技能的描述里写着，只有用户明确要安全审查、归属分析或威胁建模时才触发，一般的代码审查不算。

ChatDev 和 Maestro 都在处理几个 Agent 怎么一起干活，做法不一样。ChatDev 2.0 在自己的画布上定义 Agent 和工作流，不写代码就能搭出多 Agent 系统。Maestro 不定义新的 Agent，让现成的编码 Agent 分头跑，群聊里由一个主持的 AI 把问题派给合适的 Agent，再把回答汇总。

## 来源

互联网档案馆存下的 GitHub Trending 日榜，每天一份。

- [2 月 2 日](https://web.archive.org/web/20260202113927/https://github.com/trending)
- [2 月 3 日](https://web.archive.org/web/20260203124014/https://github.com/trending)
- [2 月 4 日](https://web.archive.org/web/20260204114906/https://github.com/trending)
- [2 月 5 日](https://web.archive.org/web/20260205125806/https://github.com/trending)
- [2 月 6 日](https://web.archive.org/web/20260206134005/https://github.com/trending)
- [2 月 7 日](https://web.archive.org/web/20260207113958/https://github.com/trending)
- [2 月 8 日](https://web.archive.org/web/20260208112725/https://github.com/trending)

各项目的许可证、发布、提交和 README 内容，取自 GitHub 上对应仓库截至 2026 年 2 月 8 日的历史记录。
