大模型AI编程前沿
2.1K subscribers
482 photos
285 videos
444 links
AI工具、币圈实事、资金流温度及风险提醒
Download Telegram
找AI聊产品想法,聊了三轮就开始跑偏,需求越来越模糊,代码越写越乱,最后只能关掉窗口重来。
这个模板库vibe-coding-prompt-template就是用来锁住这种失控感的。
先做市场调研,再写PRD,接着定技术方案,最后生成AGENTS.md给AI代理执行。
Claude、Gemini、ChatGPT、Cursor这些工具都能接,MVP的推出流程已经模板化,照着填就行。
想靠AI代理挖YouTube数据,不用自己折腾yt-dlp和浏览器自动化。
youtube-skills,GitHub上约500星,专门给AI代理用的YouTube工具箱。装完之后,代理可以直接拿视频字幕、搜内容、扒频道列表、拉播放清单,全走API,不用管那些被屏蔽的IP和二进制依赖。
它对Claude Code、Cursor、Codex系代理都友好,注册送100次免费调用,不用绑卡。
https://github.com/ZeroPointRepo/youtube-skills
假设你有一份两百页的研究报告,想一眼看清核心概念之间的关联,不用自己翻索引。
knowledge_graph做这个的,GitHub上约千星。
丢进去一篇文章或PDF,它用本地LLM(Mistral 7B跑在Ollama上)把概念和关系拎出来,生成一张可交互的图谱。不需要OpenAI的key,零成本试水。
出来的图可以直接喂给Graph RAG做检索增强问答,比传统向量检索多了一层结构化的关联信息。
Agentic Design Patterns,一套完整的学习材料,424页PDF加配套Jupyter Notebook。
覆盖提示链、路由、并行化这些基础模式,也有Reflection、Tool Use、Planning、Multi-Agent这些进阶内容,连RAG、Guardrails、Human-in-the-Loop这种实际落地的运维向设计都包含了。
🔗https://github.com/evoiz/Agentic-Design-Patterns
想把查资料的事全丢给AI,不用自己开浏览器翻半天。
google-ai-mode-skill,专门给Claude Code用的技能,把Google的AI Mode搜索结果直接喂给对话。
它会一次性从几十个来源里把信息汇总好,带着引用返回,省掉AI自己一页页翻网页的功夫。不用API密钥,装好就能用。
PDF里的内容想直接喂给LLM,不用复制粘贴、手动调格式。
MarkPDFdown能把PDF或图片转成Markdown,标题、表格、公式这些结构尽量留住,通过OpenAI或OpenRouter接多个模型跑,支持CLI操作,也能只抽指定页面。
我试了一下,最烦人的是那种扫描版PDF里的表格,它居然能认出来不乱掉。
如果只需要正文里的某几页,直接指定范围就行,不用全跑一遍浪费时间。
🔗https://github.com/MarkPDFdown/markpdfdown
要说安全工具里的老炮,bettercap 绝对算一个,GitHub 上 万 Star 摆在那儿呢。
别的工具还要东拼西凑,它倒好,WiFi 抓包、蓝牙扫描读写、ARP 欺骗、HTTP 代理拦截,一条龙全包了。
更贴心的是自带 Web 面板,鼠标点点就能可视化操作,不像有些工具全靠敲命令。脚本用 JavaScript 写,想怎么定制测试逻辑都顺手。
官方还给了 Docker 镜像,一条命令跑起来。搞安全的朋友,这玩意儿放工具箱里不亏。
🔗 http://github.com/bettercap/bettercap
Karpathy 搞的那个 autoresearch 脚本,我是真服,一晚上不睡觉,自己跑上百轮实验调参,换我早崩了。
现在好了,有人把这套路直接搬到 Claude Code 和 Codex 上了,项目名也叫 autoresearch。
玩法特简单:丢一个目标和量化指标进去,Agent 自个儿在那儿改代码、跑验证,效果变好了就留,翻车了自动撤回去。
最戳我的是给了 14 个子命令,调优、找 Bug、安全审计、发版都能管,还塞了 9 个安全钩子防手滑。
昨晚上闲逛 GitHub,刷到一个东西直接给我整精神了。
有人给 Claude Code 套了个马甲,硬生生变成了免费视频剪片工具,叫 Video Use。
你猜怎么着?把原始素材往文件夹一扔,完事。就这一个动作。
剪片段、去填充词、上字幕、调色加滤镜、处理动画、最后渲染出片。六件事,全自动。
没有时间线拖拽,没有手动逐帧修,啥麻烦都没有。
我第一反应是拿它跟 Remotion 比了一下——说真的,后者更像“帮你写代码生成视频”,这个直接“替你剪完交片”,俩路子。
🔗这里 https://github.com/browser-use/video-use
自己瞎折腾AI编程助手,不如给它加个硬核工作流。
GitHub上有个叫Superpowers的项目,狂揽26.5万星,专治各种AI编程的“懒病”。
它的玩法很直接:在AI写任何代码前,先强制它和你头脑风暴、定规范、做计划。然后严格遵守TDD红绿循环,没写测试?代码直接删掉重来。整个过程还会用隔离的git worktrees,让多个子代理并行干活,互不干扰。
拿Claude Code举例,裸奔状态下的它,习惯直接甩代码、盲目调试、顺手把测试也丢了。但装上Superpowers后,就像被资深工程师上身,强制走完7步标准流程:头脑风暴→规范→计划→TDD→子代理→审查→发布。在全部测试通过前,一行正式代码都出不来。
这玩意儿不挑食,Claude Code、Codex、Cursor、Gemini CLI、OpenCode、Copilot CLI全都能用。一旦开工,代理可以自主运行好几个小时,绝不跑偏。
🔗https://github.com/obra/superpowers
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_6657896970
一个本地AI代理Skales,支持Windows、macOS、Linux、Android、iOS全平台。
设个目标让它后台自己跑,还能多设备组队、浏览器自动化、写代码、跑工作流。
本地优先,自带免费试用额度,也支持BYOK。不用装Docker,下载即用。
🔗https://github.com/skalesapp/skales
网上AI Agent的课程一抓一大把,但大多要么太理论,要么照着文档念,看完还是一脸懵。
微软官方出了一套免费的《AI Agents for Beginners》,从零开始,带你完整过一遍构建过程。
A哥看到目前已扩展到18节课,覆盖基础概念到生产部署的每个环节,Tool Use、Agentic RAG、Planning、Multi-Agent、记忆管理、上下文工程这些都有。
每节课配详细文字教程+视频,Python代码示例用Jupyter Notebook直接能跑。
🔗传/送https://github.com/microsoft/ai-agents-for-beginners
漏洞扫描器这行当,老牌工具多的是,但Nuclei硬是靠社区模板杀出了一条路,成了安全圈的标配。
玩法简单:YAML写模板,定义检测逻辑,然后往目标上一扔,HTTP、DNS、TCP、SSL、WebSocket、Code这些协议都能扫。社区贡献了上万个现成模板,从CVE到配置错误到暴露面,基本覆盖了常见场景。
真正让Nuclei跟其他扫描器拉开差距的,是它的验证方式,不是发了请求看状态码就报洞,而是模拟真实攻击步骤去验证,所以误报率压得很低。
并行扫描速度够快,CI/CD里接进去做回归检测也顺手。
在现有K8s集群里一键创建带独立API Server、CRD、RBAC的虚拟集群,体验和真集群几乎没差,成本却低一大截。
vCluster就是这么个东西。CNCF认证K8s发行版,支持Shared/Dedicated/Private Nodes/Standalone多种架构,秒级创建,适合多租户、CI/CD、AI/GPU平台。
Adobe、NVIDIA、CoreWeave在用,已部署超4000万个租户集群。
开源Apache-2.0,一行命令上手:
vcluster create my-vcluster --namespace team-x
🔗https://github.com/loft-sh/vcluster
浏览器自动化这件事,Index曾经做到过开源领域的天花板级别。
它能像人一样操作网页,自主执行复杂任务,把任何网站变成可调用的API。背后是带视觉能力的推理LLM在驱动,Gemini Pro、Claude Sonnet、OpenAI o4-mini都支持。
几行代码就能接进去,交互式CLI、代码集成、Serverless API三种方式随便选。想要结构化输出?Pydantic Schema直接定义,数据提取稳得很。配合Laminar还能看完整的浏览器会话回放,每一步操作都清清楚楚。
Apache-2.0协议,GitHub上2.3k Star。安装就两行命令的事:
bash
pip install lmnr-index
index run
这个仓库在2025年已经归档为只读状态了,不再维护更新。但作为浏览器Agent领域的参考实现,它依然值得一看。
🔗传送 https://github.com/lmnr-ai/index
想在不联网的本地设备上跑一个能看懂视频的多模态模型,又不愿意被云厂商的API定价拿捏?
NVIDIA开源的这个VILA系列,或许是个答案。
专为高效视频和多图像理解设计,在准确率和速度之间卡了个不错的位置。
VILA-、NVILA、LongVILA三个版本各有侧重,模型尺寸从3B到40B全覆盖,最小的那档连Jetson Orin这种边缘设备都能跑。
训练成本比同类模型低,推理用4bit AWQ量化后速度更快。代码、训练脚本、评估工具、模型权重全开源,Apache-2.0代码协议,模型权重走CC BY-NC 4.0。
3.8k Star,NVIDIA出品。多模态研究、视频理解、边缘AI部署。
这里https://github.com/NVlabs/VILA
美国数据中心市场正在经历剧烈震荡:资本巨头集中抛售资产的同时,民间的“反数据中心运动”也在红蓝两州同步扩散。
这两股力量叠加,会给市场和AI行业带来多大冲击?