大模型AI编程前沿
2.12K subscribers
484 photos
315 videos
446 links
AI工具、币圈实事、资金流温度及风险提醒
Download Telegram
Mesh-LLM能把多台机器的GPU和内存池化,统一暴露成OpenAI兼容API(localhost:9337)。
支持模型路由、超大模型分层拆分(Skippy)、Mixture-of-Agents(把同一个请求发给所有模型再汇总仲裁)。
用法简单:mesh-llm serve --auto加入公共网络,或加--publish自建私有网络。
对Agent和聊天应用来说,相当于有了一个去中心化的推理后端。
🔗 地址:https://github.com/Mesh-LLM/mesh-llm
Lightpanda是用Zig从头构建的无头浏览器,不是Chromium或WebKit的fork。内存占用约123MB(,Chrome约2GB,差距约16倍;执行时间5秒 vs Chrome的46秒,快约9倍。
支持CDP协议(兼容Puppeteer/Playwright),原生Agent模式(支持Anthropic、OpenAI、Gemini、Ollama等多种后端,可纯REPL模式运行),原生MCP服务,直接导出Markdown。
提供Docker镜像、Homebrew、AUR等多种安装方式。
目前仍在Beta阶段,核心JS执行、DOM操作、Fetch/XHR、表单交互等已支持,但Web API覆盖还在持续完善中。
🔗 地址:https://github.com/lightpanda-io/browser
一组让Hermes Agent无缝接入Buzz社区的便携技能包:
hermes-in-buzz:把远程Hermes网关变成原生Buzz消息Agent,覆盖中继连接、身份配置、权限控制等端到端部署
buzz-media-attachments:本地媒体作为原生附件发送,支持MP4自动修复和GIF降级
buzz-self-hosting:自托管Buzz Relay的完整部署与排障指南,覆盖常见踩坑点(如localhost vs 127.0.0.1、Windows/Git Bash兼容性等)
手动配置一套通信链路确实头疼,把这些skill丢给Agent照着干省事多了。
🔗 地址:https://github.com/tonbistudio/buzz-skills
周末闲着刷到一个影视站,没注册没付费就直接看了,资源更新挺快,手机打开也不卡,弹窗也比同类站点少得多。
顺手试了两部片子,1080P 流畅,部分还有 4K 源。
这里:https://olevod.com
AI工程领域不缺理论教程,缺的是能直接跑起来的实战代码。
这个(Hands-On AI Engineering)项目合集把多Agent系统、RAG、OCR、音频处理、多模态、微调等方向的生产级代码都整理好了。
研究助手、金融分析、旅行规划、代码助手、收据识别、处方数字化、公式提取……每个都配完整README和依赖配置,支持OpenAI、Anthropic、开源模型等多种方案。
🔗 项目地址:https://github.com/Sumanth077/Hands-On-AI-Engineering
AnakinScraper OSS,专为AI打造的开源网页抓取API。
一键把任意网站转成干净的Markdown或结构化JSON,直接喂给RAG、AI Agent使用。
亮点:
反检测浏览器(Camoufox Firefox)、
智能代理自动选择(Thompson Sampling)、
处理链自动降级(HTTP→浏览器→外部API)、
一条命令启动:make up。完全自托管,无云依赖。
支持同步/异步/批量,内置Web仪表盘。比Firecrawl、Crawlee更轻量、更智能,专为AI场景优化!
🔗 https://github.com/Anakin-Inc/anakin
Pipecat是一个Python框架,专门用来构建实时语音和多模态AI对话应用。
语音优先架构,把STT、TTS、LLM、传输层这些模块都做成可插拔的,按需组装就行。
能用它做语音助手、AI伴侣、客户支持代理、多智能体协作系统这些。内置WebRTC和WebSocket传输,超低延迟,支持流式音频视频,对话体验比较自然。
服务商支持很全:STT有Deepgram、AssemblyAI、Whisper;LLM有OpenAI、Anthropic、Gemini;TTS有ElevenLabs、Cartesia;还有OpenAI Realtime、Gemini Multimodal Live这类端到端语音方案。
🔗 地址:https://github.com/pipecat-ai/pipecat
有个学生把AirPods跟苹果设备绑死的限制给掀了。
他搞了个叫LibrePods(万星)的开源工具,专门解锁那些原本只有苹果生态才能用的功能,
切降噪模式、入耳检测、看剩余电量、点头摇头切歌、对话感知,现在Android和Linux也能直接用
🔗 https://github.com/librepods-org/librepods
港大开源了个终身个性化辅导系统DeepTutor,GitHub3.6万星了。不是那种你问一句它答一句的机器人,而是把你自己的教材、论文、笔记全喂进去,照着你的资料来:
深度解题把推理过程一步步拆开;
自动出题批改生成对症练习;
复杂主题自动调研整理成结构化报告;
抽象概念转成图表、动画、互动内容;
记住你的进度和薄弱点,动态调整学习路径。
支持多种RAG引擎、本地模型、Skills和长期记忆,Docker自托管,Apache 2.0开源。
🔗 项目https://github.com/HKUDS/DeepTutor
英语学习资源导航站,把各类网站、课程和工具按场景分类整理好。
🔗 https://en.knowledgefxg.com
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_6657896970
试想一下,你丢给手机一句复杂指令,AI自己规划步骤、动手执行、最后确认结果对不对。
OpenDroid干的就是这事,开源AI代理,专门在安卓设备上跑任务。
🔗 https://github.com/yashab-cyber/opendroid
还在每台设备手动开代理?
OpenSurge for Mac能把Mac变成全屋透明代理网关,手机、电视、游戏机全从Mac拿DHCP/DNS,设备端零配置。
三种模式可选:
旁路由模式让指定设备手动指向Mac(推荐新手);
局域网DHCP接管让同网络设备自动接入;
独立下游LAN适合有独立AP或VLAN的场景。
每台设备都能单独配置走代理还是直连,手机走规则分流、游戏机连美服、电视走流媒体节点,互不干扰。
支持导入已有的mihomo配置或订阅,带Web GUI看实时连接和流量,底部由dnsmasq + mihomo驱动。
🔗 https://github.com/YTwsy/OpenSurge-for-Mac
AI短剧创作者的利器来了。零门槛上手做短剧漫剧。
Jellyfish导入剧本,自动拆解成镜头序列,角色、场景、道具一致性全程锁死,画风不会中途跑偏。
图频一键生成,长时间任务支持追踪、取消、恢复,最后直接导出竖屏短剧成品,从文字到画面全程打通。
整条产线串起来了,想玩的自己去折腾。
🔗 https://github.com/Forget-C/Jellyfish
连算卦这种传了上千年的老行当,AI也进来插了一脚。
有人搞了个Claude Code的插件叫bazi-skill,上手基本不用动脑子,打个算八字”仨字就启动。
AI问完出生年月和时辰,自动把四柱排好、五行断清、格局看透,末了还递给你一份事业感情健康的详细分析。
不是乱编,是正儿八经把命理体系灌进去了。
装起来也很顺手,clone到skills文件夹完事。
🔗 https://github.com/jinchenma94/bazi-skill
听英语材料总觉得长播客太费劲?
BBC Learning English 的 Classic Stories 栏目挺适合过渡。
它把《1984》《小妇人》《双城记》《罗密欧与朱丽叶》这类文学经典压缩成短篇音频故事,顺带拆解高频词和不同用法。
每集不长,读速也克制,既能过故事瘾,又能顺手补补听力、词汇和语感,对初中级水平的人特别友好。
🔗 https://bbc.co.uk/programmes/p02pc9s1/episodes/player?page=1
语音克隆这东西又往前拱了一大截。
LuxTTS这个轻量级TTS模型上手试完,
快:单卡干到150倍实时,CPU都比真人说话还利索
清:原生48khz高保真输出,好多模型还卡在24khz磨蹭
省:1GB显存就管够,你那块老卡也能跟着焕发第二春
克隆出来的效果还敢正面跟比它大10倍的模型掰手腕,
关键是本地就能跑
🔗 https://github.com/ysharma3501/LuxTTS
以前做个短视频得写脚本、找素材、配音、加字幕,折腾一下午。现在扔个关键词进去,全程自动跑完。
MoneyPrinterTurbo这个开源项目,输入主题就直接给你生成一条完整的高清视频。
脚本自动写,素材智能匹配,字幕和配音自动合成,背景音乐也顺手加上。
Web界面、API调用、命令行都能用,Docker一键部署省了不少事。
GitHub上已经堆了11万多Star,热度确实猛。
🔗https://github.com/harry0703/MoneyPrinterTurbo
This media is not supported in your browser
VIEW IN TELEGRAM
DeepSeek Harness 最近爆火,但很多人卡在第一步:环境配置、命令行、依赖安装。
这个开源项目直接把 DeepSeek Harness 做成了桌面 App。
不用折腾 Node、终端,直接进入本地 AI Agent 工作台。
支持 Sessions、项目管理、文件处理、Web Research、插件系统、Office 自动化等能力,全部整合在一个界面里。
This media is not supported in your browser
VIEW IN TELEGRAM
这个开源 Skill 有点意思,直接把 AI 生成的视频,变成能被网页操控的交互动画。
页面滚动,产品自动拆解,鼠标移动,角色跟着转头,拖动进度,动画还能前进、后退、停在任意位置。
Oil Motion 会让 Agent 自动完成关键画面设计、连续动作生成、逐帧清洗、资源压缩,以及 WebP 图集 / MP4 + WebGL 的前端接入。
你只需要给素材、想表达什么,以及动画跟随什么操作。
很适合产品官网、角色互动、功能演示。
This media is not supported in your browser
VIEW IN TELEGRAM
发现一个能直接省掉每天2小时重复劳动的东西。
文档提取、信息结构化这块,之前靠正则、靠手写NER、靠天价API、靠人工熬夜抄数据,现在基本可以宣布进入倒计时了。
Google 刚开源了 LangExtract。
一句话讲清楚它能干嘛:把任何乱七八糟的长文本(合同、报告、论文、会议纪要,哪怕上百页),直接变成干净、结构化、还能回溯原文的数据。而且不是那种“大概提取一下就行”的半成品。
它会把每一条结果精确映射回原文的具体位置,生成一个可交互的HTML页面,点进去就能核对。做合规、做审计、做知识库的人,看到这个功能基本会直接尖叫。
支持 Gemini、Ollama、本地模型,想省钱就本地跑,想效果好就上云。
安装极其简单:pip install langextract,几分钟就能跑起来。以前那些脆弱的正则表达式、自己维护的NER管道、一年几十万的提取服务,现在看着都有点滑稽了。
免费、开源、真能干活。