大模型AI编程前沿
2.11K subscribers
483 photos
300 videos
445 links
AI工具、币圈实事、资金流温度及风险提醒
Download Telegram
做地理数据分析的都知道,想找个既好用又不用把敏感数据上传到别人服务器的工具,简直比找外星人还难。
这个GeoLibre,算是解决了这个难问题,它是一个完全开源的轻量级GIS平台,可视化、探索、分析全给你包圆了。
最戳A哥是它全平台制霸的特性:浏览器里能跑、桌面端能装、手机上能用,连Jupyter笔记本里都能直接调用。
所有数据都在本地处理,不会偷偷上传到云端,隐私这块拿捏得死死的。它还支持3D城市建模和月球火星这种行星地图,内置了700多个处理工具,而且不用安装任何额外依赖。不错👍
OpenAI 这波直接把 GPT- Luna 降价 80%、Terra 降价 20%,还顺便给 Sol 加了 倍速的 Fast 模式……
感觉像是在用实际行动告诉大家:
“别光盯着竞品卷参数了,我们先把价格卷穿地心再说。”😂
我到现在还记得第一次刷到AI生成的那种画面和字幕完全匹配的短视频时有多震撼,后来才发现背后都是这类工具在批量生产。
这不,GitHub上刚破10万星的那MoneyPrinterTurbo,就是干这个的,给它一个主题甚至几个关键词,它就能自己把脚本、画面、配音、BGM全给你串成一条高清成片。
它不光有Web界面可以点点点,还开放了API接口,想批量生成或者直接同步发到TikTok、YouTube这些平台都没问题。想想看,以前做个视频光找素材就得半天,现在全自动流水线作业,内容生产效率直接拉满。
感兴趣研究研究:https://github.com/harry0703/MoneyPrinterTurbo/
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_6657896970
我关注短剧赛道有一阵了,最大的痛点从来不是缺创意,是产能跟不上,小说改剧本、分镜设计、角色定稿、视频生成、拼接剪辑,一套流程走下来,一个月能出一部都算快的。
Toonflow做成了流水线。
丢一本小说进去,AI编剧帮你拆结构、智能分镜拆画面、角色一致性生成定人设、视频自动生成拼接出成片,三层Agent协作(决策/执行/监督),基本不用你手动介入。
https://github.com/HBAI-Ltd/Toonflow-app
传统RAG解析网页的时候,表格、图表、排版、信息图这些信息基本都会丢掉,解析器只认文字,不认结构。
PixelRAG换了个做法:把网页/PDF/文档直接渲染成截图,然后用截图做向量检索。你看到的是什么样,它搜的就是什么样,表格和图表里的信息不会消失。
Berkeley团队出品,已经预建了828万维基百科页面的索引,可以直接用。文字查询和图片查询都支持,还配了一个Claude Code插件,让Claude能“看到”网页长什么样。
🔗https://github.com/StarTrail-org/PixelRAG
以前用Google Workspace的API,每次都要翻文档写curl,参数一多就头大。
gws把这个过程简化到了一行命令的程度,Drive、Gmail、Calendar、Sheets、Docs、Chat、Admin全都能操作。
它基于Google Discovery Service动态生成命令,API更新自动跟上,不需要手动维护。
--help、--dry-run、自动分页这些对人有用的功能都有;结构化JSON输出加上100多个内置Agent Skills,对AI Agent也直接友好。
安装方式很简单,npm全局安装或者brew都行,支持OAuth、Service Account、现成Token多种认证方式,笔记本和CI都能用。
https://github.com/googleworkspace/cli
做股票交易最烦的一件事就是资源太散,研究用A网站、选股用B工具、看图开C平台、查数据再翻D文档,来回切到手软。
这个Awesome Stock Trading把从入门到进阶的全链路资源一次整理好了:
研究(Seeking Alpha、Morningstar)、选股(Finviz、Zacks)、图表(TradingView、StockCharts)、新闻(Bloomberg、WSJ)、组合跟踪(Ghostfolio)、回测(QuantConnect)、数据API(Alpha Vantage),还有十几本经典书单。
https://github.com/shi-rudo/awesome-stock-trading
过去搭文档站,要么套个黑盒主题,想改点东西得翻半天文档;要么从头写,光布局和组件就得折腾一整天。
Nimbus把这做成了一键生成,跑一行命令,完整的Astro文档站直接落盘到项目里,布局、组件、样式、内容全部以真实源码的形式给你,从第一天起就归你掌控,而不是锁在一个黑盒主题里。
对AI Agent友好这一点做得特别到位:默认输出/llms.txt、页面.md双生文件、JSON-LD、OG图,人类和AI都能顺畅读取。
全文搜索、明暗主题、无障导航、面包屑、移动端侧边栏这些该有的都有,不用自己补。
多版本文档、按需加组件都支持。静态输出,优先适配Cloudflare,也可以部署到任意平台。
传送https://github.com/cloudflare/nimbus
想让LLM学会在推理过程中主动调用搜索引擎,这件事现在有了一个完整的开源RL训练框架。
Search-R1把DeepSeek-R1的思路延伸到了检索场景,基于veRL搭建,支持PPO、GRPO、REINFORCE等多种RL算法,Llama3、Qwen2.5都能跑。搜索引擎这块很灵活,本地稀疏检索(BM25)、稠密检索(e5)和在线搜索(Google、Bing)都接得上。
即使是base模型,也能通过RL训练学会多轮检索和推理交错进行。支持多机训练30B以上的模型,论文、模型权重、训练数据全公开。
想搭一个本地语音对话Agent,传统做法是把VAD、STT、LLM、TTS四个模块拼起来,每个环节选型、调接口、写胶水代码,折腾完一圈发现能跑通已经很不容易了。
Hugging Face开源的Speech-to-Speech直接给了一套生产级管线,四个环节全部模块化,每个都能单独替换。LLM走OpenAI兼容协议,云端API、Hugging Face Inference、本地vLLM或llama.cpp都能接。
默认配置用Parakeet做STT、Qwen3-TTS做语音输出,一行pip install加一条命令就能启动一个OpenAI Realtime兼容的WebSocket服务。
这套管线已经在数千台Reachy Mini机器人上作为对话后端跑了很久,稳定性不用太担心。
https://github.com/huggingface/speech-to-speech
12周,24节课,从零开始学AI,微软官方开源的这套课程,结构比很多付费课都扎实。
不用TensorFlow或PyTorch的预修知识,实验、测验、实践课全配齐。内容从符号AI(知识表示、专家系统)起步,一路推到神经网络、深度学习、计算机视觉、文本神经架构,最后延伸到遗传算法和多智能体系统。
不碰商业案例和Azure认知服务,也不讲经典机器学习(那部分另有课程),专注打底子。
支持50多种语言,简体中文在仓库里直接可读。适合系统入门,也适合当教学大纲直接拿来用。
传送门🔗https://github.com/microsoft/AI-For-Beginners
Skills、MCP、连接服务这些东西,每换一个工具就得重新配一遍。换三次工具,配置重复三次,时间全耗在重复劳动上。
OpenWork把这个问题堵住了,一次配置,多工具、多设备、团队共用。一个OpenWork MCP接Codex、Claude Code、Cursor,不用在每个工具里单独折腾。跨平台桌面端(macOS、Windows、Linux),不装桌面端也行,已有Agent直接挂MCP。
团队场景下,OpenWork Den做组织级管理:模型权限、技能市场、策略与访问控制。
个人用可以沉淀工作流,团队用可以统一分发。
GitHub:https://github.com/different-ai/openwork
用 Claude Code、Cursor、Copilot 这些工具写代码,最肉疼的就是 API 额度!
用着用着突然提示限额,要么掏钱续命,要么只能干等着。
9router 的解法非常直接:在你这些 AI 编程工具后面,统一接上 40 多个 AI 提供商、100 多个模型。你正常用 Claude Code,背后实际跑的可能是免费的 Gemini 或者便宜的 DeepSeek,完全无感。
它还内置了三层自动故障转移:订阅额度用完自动切到便宜的,便宜的也不行了就切到免费的,整个流程你甚至感觉不到中断。
另外一个很实用的功能是 RTK Token Saver,它会自动压缩 git diff、grep、ls 这类工具的输出,每个请求省下 20-40% 的 token。还有个 Caveman 模式,注入精简指令,输出 token 能砍掉 65%。
安装完后会启动一个本地 Dashboard,一条命令搞定:
bash
npm install -g 9router
9router
打开 http://localhost:20128配置一下就行。支持 Docker、VPS、Cloudflare Workers 多种部署方式。
这个项目快 21000 Star,说是 AI 编程圈的白嫖神器真不夸张。
🔗https://github.com/decolua/9router
传统RAG在处理不断变化的信息时有个明显的短板,它把数据当成静态的,但现实世界的事实会变。之前做Agent相关的项目时,这个问题一直让我挺头疼的。
Graphiti(Zep开源的项目)针对这个场景做了个设计:把对话、业务数据、文档自动构建成带时间维度的知识图谱,每条事实都记录它从什么时候开始有效、什么时候被更新替代。这样既能查当前状态,也能回溯某个时间点的情况。
它支持增量更新,不用每次全量重建,检索时混合了语义、关键词和图遍历几种方式。
我个人比较在意的是数据来源可追溯这一点,每个结论都能往回找到原始内容,排查问题时能省不少力气。
目前支持Neo4j、FalkorDB、Amazon Neptune这些图数据库后端,Python 以上就能跑。如果你正在做Agent相关的项目,又觉得传统RAG在动态数据上不太顺手,这个值得了解一下。
🔗传送https://github.com/getzep/graphiti
之前为了下载管理视频,试过好几个方案,要么不支持某些站点,要么管理界面太简陋。
MyTube算是我目前看到覆盖比较全的一个自托管方案。
它基于yt-dlp,支持YouTube、B站、Twitch这些常见平台,订阅频道后能自动下载新内容,不用手动一个个去拉。本地媒体库支持分类整理,界面UI做得还算干净。
比较意外的两个点是:内置了Cloudflare Tunnel,不用自己折腾端口转发和反向代理;整个项目是100%通过提示词生成的,零手写代码,目前已经有1.1k星标。Docker一键部署对不熟悉Node.js环境的人来说也比较友好。。
🔗https://github.com/franklioxygen/MyTube