大模型AI编程前沿
2.12K subscribers
485 photos
330 videos
447 links
AI工具、币圈实事、资金流温度及风险提醒
Download Telegram
Pipecat是一个Python框架,专门用来构建实时语音和多模态AI对话应用。
语音优先架构,把STT、TTS、LLM、传输层这些模块都做成可插拔的,按需组装就行。
能用它做语音助手、AI伴侣、客户支持代理、多智能体协作系统这些。内置WebRTC和WebSocket传输,超低延迟,支持流式音频视频,对话体验比较自然。
服务商支持很全:STT有Deepgram、AssemblyAI、Whisper;LLM有OpenAI、Anthropic、Gemini;TTS有ElevenLabs、Cartesia;还有OpenAI Realtime、Gemini Multimodal Live这类端到端语音方案。
🔗 地址:https://github.com/pipecat-ai/pipecat
有个学生把AirPods跟苹果设备绑死的限制给掀了。
他搞了个叫LibrePods(万星)的开源工具,专门解锁那些原本只有苹果生态才能用的功能,
切降噪模式、入耳检测、看剩余电量、点头摇头切歌、对话感知,现在Android和Linux也能直接用
🔗 https://github.com/librepods-org/librepods
港大开源了个终身个性化辅导系统DeepTutor,GitHub3.6万星了。不是那种你问一句它答一句的机器人,而是把你自己的教材、论文、笔记全喂进去,照着你的资料来:
深度解题把推理过程一步步拆开;
自动出题批改生成对症练习;
复杂主题自动调研整理成结构化报告;
抽象概念转成图表、动画、互动内容;
记住你的进度和薄弱点,动态调整学习路径。
支持多种RAG引擎、本地模型、Skills和长期记忆,Docker自托管,Apache 2.0开源。
🔗 项目https://github.com/HKUDS/DeepTutor
英语学习资源导航站,把各类网站、课程和工具按场景分类整理好。
🔗 https://en.knowledgefxg.com
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_6657896970
试想一下,你丢给手机一句复杂指令,AI自己规划步骤、动手执行、最后确认结果对不对。
OpenDroid干的就是这事,开源AI代理,专门在安卓设备上跑任务。
🔗 https://github.com/yashab-cyber/opendroid
还在每台设备手动开代理?
OpenSurge for Mac能把Mac变成全屋透明代理网关,手机、电视、游戏机全从Mac拿DHCP/DNS,设备端零配置。
三种模式可选:
旁路由模式让指定设备手动指向Mac(推荐新手);
局域网DHCP接管让同网络设备自动接入;
独立下游LAN适合有独立AP或VLAN的场景。
每台设备都能单独配置走代理还是直连,手机走规则分流、游戏机连美服、电视走流媒体节点,互不干扰。
支持导入已有的mihomo配置或订阅,带Web GUI看实时连接和流量,底部由dnsmasq + mihomo驱动。
🔗 https://github.com/YTwsy/OpenSurge-for-Mac
AI短剧创作者的利器来了。零门槛上手做短剧漫剧。
Jellyfish导入剧本,自动拆解成镜头序列,角色、场景、道具一致性全程锁死,画风不会中途跑偏。
图频一键生成,长时间任务支持追踪、取消、恢复,最后直接导出竖屏短剧成品,从文字到画面全程打通。
整条产线串起来了,想玩的自己去折腾。
🔗 https://github.com/Forget-C/Jellyfish
连算卦这种传了上千年的老行当,AI也进来插了一脚。
有人搞了个Claude Code的插件叫bazi-skill,上手基本不用动脑子,打个算八字”仨字就启动。
AI问完出生年月和时辰,自动把四柱排好、五行断清、格局看透,末了还递给你一份事业感情健康的详细分析。
不是乱编,是正儿八经把命理体系灌进去了。
装起来也很顺手,clone到skills文件夹完事。
🔗 https://github.com/jinchenma94/bazi-skill
听英语材料总觉得长播客太费劲?
BBC Learning English 的 Classic Stories 栏目挺适合过渡。
它把《1984》《小妇人》《双城记》《罗密欧与朱丽叶》这类文学经典压缩成短篇音频故事,顺带拆解高频词和不同用法。
每集不长,读速也克制,既能过故事瘾,又能顺手补补听力、词汇和语感,对初中级水平的人特别友好。
🔗 https://bbc.co.uk/programmes/p02pc9s1/episodes/player?page=1
语音克隆这东西又往前拱了一大截。
LuxTTS这个轻量级TTS模型上手试完,
快:单卡干到150倍实时,CPU都比真人说话还利索
清:原生48khz高保真输出,好多模型还卡在24khz磨蹭
省:1GB显存就管够,你那块老卡也能跟着焕发第二春
克隆出来的效果还敢正面跟比它大10倍的模型掰手腕,
关键是本地就能跑
🔗 https://github.com/ysharma3501/LuxTTS
以前做个短视频得写脚本、找素材、配音、加字幕,折腾一下午。现在扔个关键词进去,全程自动跑完。
MoneyPrinterTurbo这个开源项目,输入主题就直接给你生成一条完整的高清视频。
脚本自动写,素材智能匹配,字幕和配音自动合成,背景音乐也顺手加上。
Web界面、API调用、命令行都能用,Docker一键部署省了不少事。
GitHub上已经堆了11万多Star,热度确实猛。
🔗https://github.com/harry0703/MoneyPrinterTurbo
This media is not supported in your browser
VIEW IN TELEGRAM
DeepSeek Harness 最近爆火,但很多人卡在第一步:环境配置、命令行、依赖安装。
这个开源项目直接把 DeepSeek Harness 做成了桌面 App。
不用折腾 Node、终端,直接进入本地 AI Agent 工作台。
支持 Sessions、项目管理、文件处理、Web Research、插件系统、Office 自动化等能力,全部整合在一个界面里。
This media is not supported in your browser
VIEW IN TELEGRAM
这个开源 Skill 有点意思,直接把 AI 生成的视频,变成能被网页操控的交互动画。
页面滚动,产品自动拆解,鼠标移动,角色跟着转头,拖动进度,动画还能前进、后退、停在任意位置。
Oil Motion 会让 Agent 自动完成关键画面设计、连续动作生成、逐帧清洗、资源压缩,以及 WebP 图集 / MP4 + WebGL 的前端接入。
你只需要给素材、想表达什么,以及动画跟随什么操作。
很适合产品官网、角色互动、功能演示。
This media is not supported in your browser
VIEW IN TELEGRAM
发现一个能直接省掉每天2小时重复劳动的东西。
文档提取、信息结构化这块,之前靠正则、靠手写NER、靠天价API、靠人工熬夜抄数据,现在基本可以宣布进入倒计时了。
Google 刚开源了 LangExtract。
一句话讲清楚它能干嘛:把任何乱七八糟的长文本(合同、报告、论文、会议纪要,哪怕上百页),直接变成干净、结构化、还能回溯原文的数据。而且不是那种“大概提取一下就行”的半成品。
它会把每一条结果精确映射回原文的具体位置,生成一个可交互的HTML页面,点进去就能核对。做合规、做审计、做知识库的人,看到这个功能基本会直接尖叫。
支持 Gemini、Ollama、本地模型,想省钱就本地跑,想效果好就上云。
安装极其简单:pip install langextract,几分钟就能跑起来。以前那些脆弱的正则表达式、自己维护的NER管道、一年几十万的提取服务,现在看着都有点滑稽了。
免费、开源、真能干活。
This media is not supported in your browser
VIEW IN TELEGRAM
InkOS直接把AI从聊天写小说升级成真正的创作Agent。
统一Pi Agent内核,长篇短篇剧本互动影游翻译全搞定,角色伏笔状态全管住,再也不怕写崩。
不再只生成文字,而是全流程托管:世界观、角色、记忆、审稿、修订、封面、互动剧情、多语言,全塞进一个工作台。
Skill还能继续扩展。
This media is not supported in your browser
VIEW IN TELEGRAM
用 Codex 搓了一个会呼吸的 3D「天空之城」。
从一张插画开始,一点点把城堡、浮岛、房间、人物和光影做成可交互的 3D 场景。
现在里面已经有人走动、聊天、看书、晒太阳,云和旗帜也会慢慢飘。
Media is too big
VIEW IN TELEGRAM
MotionSites,把顶级网页美学做成了 Prompt。
里面收录了 500+ 高质量网页设计 Prompt,涵盖 Landing Page、SaaS、3D、作品集、动效等。
看到喜欢的效果,直接复制 Prompt 丢给 Claude、Cursor、Codex,就能开始做。
还支持 MCP,把整套设计灵感直接接进 AI 编程工具。
做 Vibe Coding,代码已经不是问题,现在连审美都有人帮你打包好了。
Media is too big
VIEW IN TELEGRAM
花了差不多一天时间,用 Codex + Three.js 把一张中国古代闹市图,做成了能直接逛的 3D 场景。
现在已经有河道、拱桥、古建筑、摊位、船只、NPC,主角也能自动寻路、避让行人、从桥头正常过桥,基本把走完整个闹市跑通了。
目前还得继续磨:人物动作有点僵,偶尔会穿栏杆,NPC 和摊位细节也不够,担子、货物、店铺陈设都还很粗。
Media is too big
VIEW IN TELEGRAM
Bruno Simon 用 Three.js 做的个人站,简直是 3D 神级作品!
直接开一辆小车在 3D 世界里乱撞、探索、解锁成就、找隐藏彩蛋……
完全把作品集做成了一款超有趣的小游戏。
Three.js + WebGPU 拉满,手感、细节、性能都绝了。
而且作品已开源,非常值得 3D 玩家 star 学习!
This media is not supported in your browser
VIEW IN TELEGRAM
发现个超香的开源GIS神器!
GeoLibre:轻量云原生GIS平台,
浏览器、桌面、手机、Jupyter全通吃。数据全程本地跑,隐私拉满。
更猛的是:
1000+地理处理工具用WebAssembly浏览器里跑,
地形、水文、LiDAR、遥感全包,零安装、零服务器、数据不外传。
可视化探索分析一把梭,MapLibre+DuckDB加持,顺手还能玩月球火星地图。
免费开源,真香警告~