---
title: "GitHub AI 项目回溯周报｜2026-01-19 至 2026-01-25"
description: "2026 年 1 月第四周，入选的十个项目里有两个做 RAG，微软开源了语音识别模型 VibeVoice-ASR，mastra 的核心包升到 1.0。本期依据互联网档案馆存下的日榜补写。"
pubDate: 2026-01-25
tags: ["GitHub AI 日报", "回溯周报", "RAG", "语音", "AI Agent"]
---

这一期是 2026 年 9 月补写的。本站的 AI 日报从 2026 年 8 月 24 日才开始，之前没有记录，就按周往回补，材料是互联网档案馆存下的 GitHub Trending 日榜，每天一份。这一周每天上榜 7 到 11 个仓库，七天加起来 32 个，这里从中挑了 10 个 AI 项目。

入选的项目里有两个做 RAG，PageIndex 不用向量库，让大模型在文档的目录树上推理着找段落，UltraRAG 把检索、生成这些环节拆成一个个 MCP 服务。语音这边，微软 1 月 21 日在 VibeVoice 里开源了语音识别模型，两天后 mlx-audio 就接上了它。剩下的多是写 Agent、训 Agent 的框架和工具，其中 mastra 的核心包在这一周升到了 1.0。

挑选的条件有三条。AI 得是项目的核心能力，存档页上的 Star 要过 1,000，到周日为止的 90 天里还有提交或发布。资源清单、教程、书的配套代码和提示词合集都不收；前面几周收过的项目，除非这一周发了主版本号升级的新版，也不再收。排序先看这一周上了几天榜，再看单日涨得最多的那天。单日增星是存档那一刻页面上显示的当天数字，每天存档的钟点不一样，只能大致比较。表里的 Star 是这一周最后一次上榜时页面上显示的总数，许可证、发布和提交记录都截至 1 月 25 日。

## 十个项目

| # | 项目 | 上榜 | 单日最多增星 | Star | 方向 |
|---|---|---|---|---|---|
| 1 | [microsoft/agent-lightning](https://github.com/microsoft/agent-lightning) | 4 天 | +333（01-22） | 11,589（01-23） | Agent 训练框架 |
| 2 | [block/goose](https://github.com/aaif-goose/goose) | 3 天 | +454（01-22） | 27,796（01-24） | 本地开源 Agent |
| 3 | [VectifyAI/PageIndex](https://github.com/VectifyAI/PageIndex) | 2 天 | +1,350（01-24） | 8,770（01-25） | 无向量推理式 RAG |
| 4 | [virattt/dexter](https://github.com/virattt/dexter) | 2 天 | +505（01-22） | 8,670（01-23） | 金融研究 Agent |
| 5 | [mastra-ai/mastra](https://github.com/mastra-ai/mastra) | 2 天 | +460（01-22） | 20,297（01-23） | TypeScript Agent 框架 |
| 6 | [OpenBMB/UltraRAG](https://github.com/OpenBMB/UltraRAG) | 2 天 | +437（01-25） | 3,707（01-25） | MCP 架构 RAG 框架 |
| 7 | [microsoft/VibeVoice](https://github.com/microsoft/VibeVoice) | 2 天 | +362（01-25） | 21,822（01-25） | 语音合成与识别 |
| 8 | [Blaizzy/mlx-audio](https://github.com/Blaizzy/mlx-audio) | 2 天 | +263（01-25） | 3,713（01-25） | Mac 本地语音推理 |
| 9 | [deepseek-ai/FlashMLA](https://github.com/deepseek-ai/FlashMLA) | 2 天 | +30（01-23） | 12,242（01-23） | 注意力计算内核 |
| 10 | [browser-use/browser-use](https://github.com/browser-use/browser-use) | 1 天 | +205（01-24） | 76,573（01-24） | 浏览器操作 Agent |

## 逐个看

### 1. [microsoft/agent-lightning](https://github.com/microsoft/agent-lightning)

Agent Lightning 是微软做的 Agent 训练框架，README 的口号是几乎不改代码，就能把现有的 Agent 变成可以优化的对象。它不挑框架，LangChain、OpenAI Agent SDK、AutoGen、CrewAI 写的 Agent 都能接，不用框架、直接调 OpenAI 接口的也行；多 Agent 系统里可以只挑其中一两个来优化。算法有强化学习、自动提示词优化和监督微调。接法是在 Agent 里插一句 `agl.emit_xxx()`，或者让 tracer 自动记下提示词、工具调用和奖励，这些事件存进 LightningStore，算法从中学习，再把改好的提示词模板或模型权重送回去。

这一周仓库只有 1 月 19 日一个维护流水线的提交。最近一次发布是去年 12 月的 v0.3.0，发布说明里有接入 Tinker 作强化学习后端，还有一项预览功能，把 Claude Code 当作被训练的 Agent，在 SWE-Bench 上训练。1 月 20 日和 21 日，它在日榜上排第一。

### 2. [block/goose](https://github.com/aaif-goose/goose)

goose 是一个在本机运行的开源 AI Agent，README 说它能从零搭项目、写代码并执行、调试失败，也能编排工作流、调用外部 API，全程自己完成。它不绑定模型，支持同时配置多个模型来兼顾效果和成本，扩展靠 MCP 服务，有桌面应用和命令行两种用法。仓库当时在 block 名下，现在转到了 aaif-goose。

这一周它发了三个版本，1 月 22 日的 1.21.0 加了多会话、可以独立运行的 MCP 应用、用户自定义模板和 Linux 上的 Flatpak 包，在非本机地址上运行时还要求先认证。第二天的 v1.21.1 只回退了一次依赖升级。主分支上另外合进了会话分叉和 Codex 订阅的接入，这两项没赶上周内的发布。

### 3. [VectifyAI/PageIndex](https://github.com/VectifyAI/PageIndex)

PageIndex 做的是不用向量的 RAG。README 认为向量检索找的是相似，专业文档要的是相关，而相关得靠推理。它先把长文档整理成一棵类似目录的树，每个节点带标题、起止位置和摘要；检索时让大模型沿着这棵树往下找，README 说这是模仿人类专家翻阅复杂文档的办法，灵感来自 AlphaGo。这样既不切块，也不用向量数据库，检索结果能对到具体的页和章节。

README 说基于它做的 Mafin 2.5 在金融问答基准 FinanceBench 上准确率 98.7%。开源代码负责从 PDF 或 Markdown 生成这棵树，默认调用 OpenAI 的 gpt-4o；聊天平台、MCP 和 API 是另外的托管服务。这一周仓库修了提取目录时可能陷入死循环的问题，1 月 25 日 README 加了一行大标题，写的是 Vectorless, Reasoning-based RAG。

### 4. [virattt/dexter](https://github.com/virattt/dexter)

dexter 是一个做金融研究的自主 Agent，README 给的比方是专做金融研究的 Claude Code。它把复杂的金融问题拆成一步步的研究计划，调用工具取利润表、资产负债表、现金流量表这些实时数据，做完自己检查，不行就接着改。为了防止跑飞，它内置了循环检测和步数上限。程序跑在 Bun 上，除了大模型的 API key，还要 Financial Datasets 的 key，网页搜索可选 Exa 或 Tavily。

这一周提交很密。1 月 21 日 README 换了新截图，删掉了示例问题和架构两节；1 月 23 日网页搜索改为首选 Exa、Tavily 退作备用，界面上多了计时、token 数和每秒 token 数。README 写着项目用 MIT 许可，仓库里当时却没有许可证文件。同在 virattt 名下的 ai-hedge-fund，本系列第一期收过。

### 5. [mastra-ai/mastra](https://github.com/mastra-ai/mastra)

mastra 是用 TypeScript 写 AI 应用和 Agent 的框架，存档页上的简介说它出自做 Gatsby 的团队，README 上挂着 Y Combinator W25 的徽章。模型路由用一个接口接 40 多家服务商；Agent 自己推理目标、挑工具、反复迭代，直到模型给出最终答案或者满足设定的停止条件。需要明确控制流程时，可以写图结构的工作流，用 `.then()`、`.branch()`、`.parallel()` 串起来。流程能暂停等人确认，状态存进存储，隔多久都能接着跑。

1 月 20 日，核心包 @mastra/core 结束测试，版本号改成 1.0.0，同一天合进一个标题叫 Stable v1 的文档提交，当天版本号又升到 1.0.4。这一周主分支还加了 Agent 的版本管理，RAG 模块支持按 20 种编程语言给代码分块。仓库根目录的 LICENSE.md 当时写的是 Apache License 2.0，版权方是 Kepler Software。

### 6. [OpenBMB/UltraRAG](https://github.com/OpenBMB/UltraRAG)

UltraRAG 由清华大学 THUNLP、Northeastern University 的 NEUIR、OpenBMB 和 AI9stars 一起做，README 称它是第一个基于 MCP 架构的轻量 RAG 开发框架。检索、生成这些环节各自做成独立的 MCP 服务，由 MCP 客户端编排，顺序、循环、条件分支都写在 YAML 配置里。配套的 UltraRAG UI 是一个可视化的 RAG 开发环境，画布和代码双向同步，搭好的流程一键就能变成对话网页。

README 的更新记录里，1 月 23 日发布了 UltraRAG 3.0，口号是告别黑箱开发，让每一行推理逻辑都看得见；1 月 20 日还开源了 8B 的端侧写作 Agent 模型 AgentCPM-Report。这一周的提交大多在改界面、做代码审查，1 月 23 日也更新了 3.0 的文档。许可证是 Apache-2.0。

### 7. [microsoft/VibeVoice](https://github.com/microsoft/VibeVoice)

VibeVoice 是微软开源的一组语音模型，语音合成和语音识别都有。按 README 的介绍，它用帧率只有 7.5 Hz 的连续语音 tokenizer 来省下处理长音频的算力，再用大模型理解上下文，用扩散头生成声音细节。这一周最大的动作是 1 月 21 日开源的 VibeVoice-ASR，一段 60 分钟的音频一次处理完，输出里同时标出谁在说、什么时候说、说了什么，还能事先给它人名、术语这类热词，README 说支持 50 多种语言。之后几天，仓库又补上了微调代码和 vLLM 推理支持。

仓库里还有能流式输入文本的 VibeVoice-Realtime-0.5B。做长篇多人对话合成的 VibeVoice-TTS 去年 8 月开源，9 月被撤下代码，README 的解释是发现有人把它用在了和初衷不符的地方。风险一节提醒，高质量的合成语音可能被拿去冒充他人、诈骗，模型只建议用于研究。许可证是 MIT。

### 8. [Blaizzy/mlx-audio](https://github.com/Blaizzy/mlx-audio)

mlx-audio 建在苹果的 MLX 框架上，在 Apple Silicon 的 Mac 上做语音合成、语音识别和语音到语音的转换。它收了一长串模型，合成有 Kokoro、Qwen3-TTS、CSM、Dia、Chatterbox 等，识别有 Whisper、Parakeet、Voxtral 和 VibeVoice-ASR，另有按文字提示分离声音的 SAM-Audio 和降噪模型。模型支持 3 位、4 位、6 位、8 位等量化，自带网页界面，也提供兼容 OpenAI 接口的 REST 服务。

这一周它接模型接得很快。1 月 22 日加上阿里的 Qwen3-TTS，1 月 23 日又接上微软两天前开源的 VibeVoice-ASR。随后几天，它修好了 Qwen3-TTS 声音克隆和量化出的毛病，也修了 VibeVoice-ASR 处理长音频时崩溃的问题。Swift 代码在 1 月 22 日挪去了单独的仓库。周日发了 v0.3.0，这一天它在日榜上排第一。

### 9. [deepseek-ai/FlashMLA](https://github.com/deepseek-ai/FlashMLA)

FlashMLA 是 DeepSeek 的注意力计算内核库，DeepSeek-V3 和 DeepSeek-V3.2-Exp 都靠它跑。里面有稀疏和稠密两套内核，稀疏的那套支撑 DeepSeek 稀疏注意力，按 token 挑出需要计算的位置，解码阶段用 FP8 存 KV 缓存。README 说在 H800 SXM5 上，稠密解码内核受内存带宽限制时能到 3000 GB/s，受算力限制时能到 660 TFLOPS，稀疏预填充内核能到 640 TFlops。它要求 SM90 或 SM100 架构的显卡，CUDA 12.8 以上。

README 写着它受 FlashAttention 和 cutlass 启发，还列了 MetaX、Moore Threads、Hygon、Intellifusion、Iluvatar Corex 和 AMD 这些厂商各自适配的版本。这一周只有两个很小的提交，补了一处头文件引用，改了几行接口代码。仓库到这时没有发布过正式版本，许可证是 MIT。

### 10. [browser-use/browser-use](https://github.com/browser-use/browser-use)

browser-use 是让 AI Agent 操作浏览器的 Python 库，给它一个任务，Agent 自己开网页、点按钮、填表单。README 的快速上手分两套，一套给编码 Agent，让 Cursor、Claude Code 去读它的文档自己写代码；一套给人，装好包、配上 API key、装好 Chromium 就能跑。自家的 ChatBrowserUse 模型专门为浏览器任务优化过，README 说平均比别的模型快 3 到 5 倍。库本身开源免费，验证码、代理和大规模并发，README 建议交给它的云服务。

1 月 22 日的 0.11.4 主打命令行，open、state、click、type 这些子命令之间浏览器一直开着，还配了一个 Claude Code 技能，发布说明写明是给 Claude Code 和 Codex 用的，本地和远程浏览器都能接。之后两天又加了对自家新模型的支持，以及用 CDP 连上已经打开的浏览器。它是这一周十个里 Star 最多的。

## 几条线索

VibeVoice-ASR 从开源到被别的项目接走，只用了两天。微软 1 月 21 日放出这个模型，mlx-audio 1 月 23 日就把它加进了支持列表，周日发布的新版本里也带着它。两边 README 都写着它一次能处理 60 分钟的长音频，同时给出说话人和时间戳。

RAG 这边的两个项目，都在强调检索过程要看得见。PageIndex 说向量检索是不透明的近似搜索，它每一步检索都靠推理，能追溯到具体页码和章节。UltraRAG 3.0 喊出告别黑箱开发，配套界面把流程画在画布上，改画布和改代码两边同步。

Claude Code 在这一周的名单里出现了好几次。dexter 的 README 直接说自己是专做金融研究的 Claude Code。browser-use 这一周发的命令行和技能，发布说明写明是给 Claude Code 和 Codex 用的。mastra 则是自己在用，仓库根目录放着 CLAUDE.md，这一周还加了几个给 Claude Code 用的 React 和 Tailwind 技能。

## 来源

互联网档案馆存下的 GitHub Trending 日榜，每天一份。

- [1 月 19 日](https://web.archive.org/web/20260119123147/https://github.com/trending)
- [1 月 20 日](https://web.archive.org/web/20260120112530/https://github.com/trending)
- [1 月 21 日](https://web.archive.org/web/20260121102257/https://github.com/trending)
- [1 月 22 日](https://web.archive.org/web/20260122113349/https://github.com/trending)
- [1 月 23 日](https://web.archive.org/web/20260123111405/https://github.com/trending)
- [1 月 24 日](https://web.archive.org/web/20260124122552/https://github.com/trending)
- [1 月 25 日](https://web.archive.org/web/20260125124801/https://github.com/trending)

各项目的许可证、发布、提交和 README 内容，取自 GitHub 上对应仓库截至 2026 年 1 月 25 日的历史记录。
