Agentic Design Patterns,一套完整的学习材料,424页PDF加配套Jupyter Notebook。
覆盖提示链、路由、并行化这些基础模式,也有Reflection、Tool Use、Planning、Multi-Agent这些进阶内容,连RAG、Guardrails、Human-in-the-Loop这种实际落地的运维向设计都包含了。
🔗https://github.com/evoiz/Agentic-Design-Patterns
覆盖提示链、路由、并行化这些基础模式,也有Reflection、Tool Use、Planning、Multi-Agent这些进阶内容,连RAG、Guardrails、Human-in-the-Loop这种实际落地的运维向设计都包含了。
🔗https://github.com/evoiz/Agentic-Design-Patterns
PDF里的内容想直接喂给LLM,不用复制粘贴、手动调格式。
MarkPDFdown能把PDF或图片转成Markdown,标题、表格、公式这些结构尽量留住,通过OpenAI或OpenRouter接多个模型跑,支持CLI操作,也能只抽指定页面。
我试了一下,最烦人的是那种扫描版PDF里的表格,它居然能认出来不乱掉。
如果只需要正文里的某几页,直接指定范围就行,不用全跑一遍浪费时间。
🔗https://github.com/MarkPDFdown/markpdfdown
MarkPDFdown能把PDF或图片转成Markdown,标题、表格、公式这些结构尽量留住,通过OpenAI或OpenRouter接多个模型跑,支持CLI操作,也能只抽指定页面。
我试了一下,最烦人的是那种扫描版PDF里的表格,它居然能认出来不乱掉。
如果只需要正文里的某几页,直接指定范围就行,不用全跑一遍浪费时间。
🔗https://github.com/MarkPDFdown/markpdfdown
要说安全工具里的老炮,bettercap 绝对算一个,GitHub 上 万 Star 摆在那儿呢。
别的工具还要东拼西凑,它倒好,WiFi 抓包、蓝牙扫描读写、ARP 欺骗、HTTP 代理拦截,一条龙全包了。
更贴心的是自带 Web 面板,鼠标点点就能可视化操作,不像有些工具全靠敲命令。脚本用 JavaScript 写,想怎么定制测试逻辑都顺手。
官方还给了 Docker 镜像,一条命令跑起来。搞安全的朋友,这玩意儿放工具箱里不亏。
🔗 http://github.com/bettercap/bettercap
别的工具还要东拼西凑,它倒好,WiFi 抓包、蓝牙扫描读写、ARP 欺骗、HTTP 代理拦截,一条龙全包了。
更贴心的是自带 Web 面板,鼠标点点就能可视化操作,不像有些工具全靠敲命令。脚本用 JavaScript 写,想怎么定制测试逻辑都顺手。
官方还给了 Docker 镜像,一条命令跑起来。搞安全的朋友,这玩意儿放工具箱里不亏。
🔗 http://github.com/bettercap/bettercap
昨晚上闲逛 GitHub,刷到一个东西直接给我整精神了。
有人给 Claude Code 套了个马甲,硬生生变成了免费视频剪片工具,叫 Video Use。
你猜怎么着?把原始素材往文件夹一扔,完事。就这一个动作。
剪片段、去填充词、上字幕、调色加滤镜、处理动画、最后渲染出片。六件事,全自动。
没有时间线拖拽,没有手动逐帧修,啥麻烦都没有。
我第一反应是拿它跟 Remotion 比了一下——说真的,后者更像“帮你写代码生成视频”,这个直接“替你剪完交片”,俩路子。
🔗这里 https://github.com/browser-use/video-use
有人给 Claude Code 套了个马甲,硬生生变成了免费视频剪片工具,叫 Video Use。
你猜怎么着?把原始素材往文件夹一扔,完事。就这一个动作。
剪片段、去填充词、上字幕、调色加滤镜、处理动画、最后渲染出片。六件事,全自动。
没有时间线拖拽,没有手动逐帧修,啥麻烦都没有。
我第一反应是拿它跟 Remotion 比了一下——说真的,后者更像“帮你写代码生成视频”,这个直接“替你剪完交片”,俩路子。
🔗这里 https://github.com/browser-use/video-use
自己瞎折腾AI编程助手,不如给它加个硬核工作流。
GitHub上有个叫Superpowers的项目,狂揽26.5万星,专治各种AI编程的“懒病”。
它的玩法很直接:在AI写任何代码前,先强制它和你头脑风暴、定规范、做计划。然后严格遵守TDD红绿循环,没写测试?代码直接删掉重来。整个过程还会用隔离的git worktrees,让多个子代理并行干活,互不干扰。
拿Claude Code举例,裸奔状态下的它,习惯直接甩代码、盲目调试、顺手把测试也丢了。但装上Superpowers后,就像被资深工程师上身,强制走完7步标准流程:头脑风暴→规范→计划→TDD→子代理→审查→发布。在全部测试通过前,一行正式代码都出不来。
这玩意儿不挑食,Claude Code、Codex、Cursor、Gemini CLI、OpenCode、Copilot CLI全都能用。一旦开工,代理可以自主运行好几个小时,绝不跑偏。
🔗https://github.com/obra/superpowers
GitHub上有个叫Superpowers的项目,狂揽26.5万星,专治各种AI编程的“懒病”。
它的玩法很直接:在AI写任何代码前,先强制它和你头脑风暴、定规范、做计划。然后严格遵守TDD红绿循环,没写测试?代码直接删掉重来。整个过程还会用隔离的git worktrees,让多个子代理并行干活,互不干扰。
拿Claude Code举例,裸奔状态下的它,习惯直接甩代码、盲目调试、顺手把测试也丢了。但装上Superpowers后,就像被资深工程师上身,强制走完7步标准流程:头脑风暴→规范→计划→TDD→子代理→审查→发布。在全部测试通过前,一行正式代码都出不来。
这玩意儿不挑食,Claude Code、Codex、Cursor、Gemini CLI、OpenCode、Copilot CLI全都能用。一旦开工,代理可以自主运行好几个小时,绝不跑偏。
🔗https://github.com/obra/superpowers
一个本地AI代理Skales,支持Windows、macOS、Linux、Android、iOS全平台。
设个目标让它后台自己跑,还能多设备组队、浏览器自动化、写代码、跑工作流。
本地优先,自带免费试用额度,也支持BYOK。不用装Docker,下载即用。
🔗https://github.com/skalesapp/skales
设个目标让它后台自己跑,还能多设备组队、浏览器自动化、写代码、跑工作流。
本地优先,自带免费试用额度,也支持BYOK。不用装Docker,下载即用。
🔗https://github.com/skalesapp/skales
网上AI Agent的课程一抓一大把,但大多要么太理论,要么照着文档念,看完还是一脸懵。
微软官方出了一套免费的《AI Agents for Beginners》,从零开始,带你完整过一遍构建过程。
A哥看到目前已扩展到18节课,覆盖基础概念到生产部署的每个环节,Tool Use、Agentic RAG、Planning、Multi-Agent、记忆管理、上下文工程这些都有。
每节课配详细文字教程+视频,Python代码示例用Jupyter Notebook直接能跑。
🔗传/送https://github.com/microsoft/ai-agents-for-beginners
微软官方出了一套免费的《AI Agents for Beginners》,从零开始,带你完整过一遍构建过程。
A哥看到目前已扩展到18节课,覆盖基础概念到生产部署的每个环节,Tool Use、Agentic RAG、Planning、Multi-Agent、记忆管理、上下文工程这些都有。
每节课配详细文字教程+视频,Python代码示例用Jupyter Notebook直接能跑。
🔗传/送https://github.com/microsoft/ai-agents-for-beginners
在现有K8s集群里一键创建带独立API Server、CRD、RBAC的虚拟集群,体验和真集群几乎没差,成本却低一大截。
vCluster就是这么个东西。CNCF认证K8s发行版,支持Shared/Dedicated/Private Nodes/Standalone多种架构,秒级创建,适合多租户、CI/CD、AI/GPU平台。
Adobe、NVIDIA、CoreWeave在用,已部署超4000万个租户集群。
开源Apache-2.0,一行命令上手:
vcluster create my-vcluster --namespace team-x
🔗https://github.com/loft-sh/vcluster
vCluster就是这么个东西。CNCF认证K8s发行版,支持Shared/Dedicated/Private Nodes/Standalone多种架构,秒级创建,适合多租户、CI/CD、AI/GPU平台。
Adobe、NVIDIA、CoreWeave在用,已部署超4000万个租户集群。
开源Apache-2.0,一行命令上手:
vcluster create my-vcluster --namespace team-x
🔗https://github.com/loft-sh/vcluster
浏览器自动化这件事,Index曾经做到过开源领域的天花板级别。
它能像人一样操作网页,自主执行复杂任务,把任何网站变成可调用的API。背后是带视觉能力的推理LLM在驱动,Gemini Pro、Claude Sonnet、OpenAI o4-mini都支持。
几行代码就能接进去,交互式CLI、代码集成、Serverless API三种方式随便选。想要结构化输出?Pydantic Schema直接定义,数据提取稳得很。配合Laminar还能看完整的浏览器会话回放,每一步操作都清清楚楚。
Apache-2.0协议,GitHub上2.3k Star。安装就两行命令的事:
bash
pip install lmnr-index
index run
这个仓库在2025年已经归档为只读状态了,不再维护更新。但作为浏览器Agent领域的参考实现,它依然值得一看。
🔗传送 https://github.com/lmnr-ai/index
它能像人一样操作网页,自主执行复杂任务,把任何网站变成可调用的API。背后是带视觉能力的推理LLM在驱动,Gemini Pro、Claude Sonnet、OpenAI o4-mini都支持。
几行代码就能接进去,交互式CLI、代码集成、Serverless API三种方式随便选。想要结构化输出?Pydantic Schema直接定义,数据提取稳得很。配合Laminar还能看完整的浏览器会话回放,每一步操作都清清楚楚。
Apache-2.0协议,GitHub上2.3k Star。安装就两行命令的事:
bash
pip install lmnr-index
index run
这个仓库在2025年已经归档为只读状态了,不再维护更新。但作为浏览器Agent领域的参考实现,它依然值得一看。
🔗传送 https://github.com/lmnr-ai/index
想在不联网的本地设备上跑一个能看懂视频的多模态模型,又不愿意被云厂商的API定价拿捏?
NVIDIA开源的这个VILA系列,或许是个答案。
专为高效视频和多图像理解设计,在准确率和速度之间卡了个不错的位置。
VILA-、NVILA、LongVILA三个版本各有侧重,模型尺寸从3B到40B全覆盖,最小的那档连Jetson Orin这种边缘设备都能跑。
训练成本比同类模型低,推理用4bit AWQ量化后速度更快。代码、训练脚本、评估工具、模型权重全开源,Apache-2.0代码协议,模型权重走CC BY-NC 4.0。
3.8k Star,NVIDIA出品。多模态研究、视频理解、边缘AI部署。
这里https://github.com/NVlabs/VILA
NVIDIA开源的这个VILA系列,或许是个答案。
专为高效视频和多图像理解设计,在准确率和速度之间卡了个不错的位置。
VILA-、NVILA、LongVILA三个版本各有侧重,模型尺寸从3B到40B全覆盖,最小的那档连Jetson Orin这种边缘设备都能跑。
训练成本比同类模型低,推理用4bit AWQ量化后速度更快。代码、训练脚本、评估工具、模型权重全开源,Apache-2.0代码协议,模型权重走CC BY-NC 4.0。
3.8k Star,NVIDIA出品。多模态研究、视频理解、边缘AI部署。
这里https://github.com/NVlabs/VILA
“给AI一个任务,还你一个结果”这句话喊了好几年,真能做到的没几个。
字节的DeerFlow算一个例外。
它是一个能跑长周期任务的SuperAgent引擎,自己调研、写代码、产出内容都能干。Docker沙箱做隔离环境,代码真跑、文件真改。
子代理拆任务,每个小任务都有独立记忆,不会跑着跑着忘掉前面干了什么。Skills可以自己往上挂,飞书、Slack、Telegram、Discord的消息通道也接着。
2.0版本用LangGraph重写了底层,性能比之前稳不少。我试了一个需要跨三个系统查资料的调研任务,丢进去就不用管了,半小时后回来收结果就行。
🔗https://github.com/bytedance/deer-flow
字节的DeerFlow算一个例外。
它是一个能跑长周期任务的SuperAgent引擎,自己调研、写代码、产出内容都能干。Docker沙箱做隔离环境,代码真跑、文件真改。
子代理拆任务,每个小任务都有独立记忆,不会跑着跑着忘掉前面干了什么。Skills可以自己往上挂,飞书、Slack、Telegram、Discord的消息通道也接着。
2.0版本用LangGraph重写了底层,性能比之前稳不少。我试了一个需要跨三个系统查资料的调研任务,丢进去就不用管了,半小时后回来收结果就行。
🔗https://github.com/bytedance/deer-flow
日志监控、电商站内搜、安全分析,这三个场景我全用一个引擎扛住了。
Elasticsearch,Elastic开源的那个分布式搜索,底层是Apache Lucene。
PB级数据靠水平扩展就能撑,全文搜、向量搜、日志分析、指标监控全支持,索引和查询基本实时响应,聚合分析也够硬。
现在RAG和生成式AI也经常拿它当向量库。Kibana和Logstash搭一块就是Elastic Stack,一套下来覆盖我上面说的所有场景。
🔗https://github.com/elastic/elasticsearch
Elasticsearch,Elastic开源的那个分布式搜索,底层是Apache Lucene。
PB级数据靠水平扩展就能撑,全文搜、向量搜、日志分析、指标监控全支持,索引和查询基本实时响应,聚合分析也够硬。
现在RAG和生成式AI也经常拿它当向量库。Kibana和Logstash搭一块就是Elastic Stack,一套下来覆盖我上面说的所有场景。
🔗https://github.com/elastic/elasticsearch