大模型AI编程前沿
2.12K subscribers
485 photos
330 videos
447 links
AI工具、币圈实事、资金流温度及风险提醒
Download Telegram
Grok Imagine 生成帅哥自拍照!
Prompt👇
一位年轻成年男性在室内卧室中进行近距离手机自拍,胸部以上近景构图,人物脸部占据画面主体,正面略微俯视镜头,肩膀自然放松,身体轻微侧向镜头,眼睛直视镜头,表情安静自然,嘴唇微微放松。
男生拥有深黑色短发,发丝略带天然纹理,轻微凌乱而有层次感,刘海自然垂落在额前,顶部有少量碎发和自然翘起的发束,清晰表现每一根头发的真实质感。右侧眉尾处有一道极淡的旧疤痕痕迹。
脸型棱角分明,下颌线清晰自然,五官立体,深棕色眼睛,长而直的天然睫毛,轻微内双眼皮,浓淡适中的自然眉毛,鼻梁高挺,鼻尖圆润,嘴唇线条分明,呈现自然浅粉色。面部没有明显妆容,保持原生皮肤状态。
皮肤保持真实人体皮肤质感,能够看到细微毛孔、皮肤纹理、鼻尖高光、脸颊细小色差、剃须后淡淡的青茬痕迹和自然肤色变化,皮肤细腻但保留真实细节,呈现高分辨率真人摄影质感。
耳朵无耳饰,耳廓线条清晰自然。
身穿一件纯棉质感深灰色圆领短袖T恤,领口自然贴合颈部,面料有轻微日常穿着后的柔软褶皱。
场景为现代简约卧室,背景使用暖灰色墙面,左侧可以看到深色门框与阴影区域,右后方摆放一盏开启的暖黄色床头台灯,背景自然虚化但仍然能够识别室内空间。
室内自然光与暖色台灯混合照明。人物正面受到柔和自然光照射,脸部光线均匀柔软,右侧背景带暖黄色灯光,左侧略暗,形成非常轻微而真实的明暗层次。眼睛带自然窗光反射,高光柔和。
真实手机前置摄像头自拍风格,近距离拍摄,轻微广角透视,真实镜头距离,人物没有刻意摆拍感,像男生在卧室里随手拍摄的一张日常自拍。
photorealistic, ultra realistic skin texture, visible pores, individual hair strands, natural facial details, realistic smartphone selfie, soft indoor lighting, warm ambient light, shallow depth of field, high dynamic range, natural color grading, subtle sensor texture, highly detailed, 4K portrait photography
我英语能真正突破瓶颈,靠的不是什么神奇课程,而是一份2017年就开源的学习指南English-level-up-tips。
作者本人就是高考英语省状元,把怎么学这件事拆解得极其透彻,从认知底层逻辑、单词记忆系统、听力输入方法,到阅读、口语、写作,甚至最近还加上了用AI学英语的完整路径(把Gemini、ChatGPT这些工具塞进"目标-材料-反馈-输出的训练流程里)。
自己就是照着它的认知篇重新调整了学习心态,不再追求速成,而是老老实实建立每天的输入输出习惯,三个月后回头看,进步比我之前瞎折腾一整年都大。
没有捷径,全是扎扎实实的方法论和可执行的计划,需要你自己花时间去落地。英语进阶这件事也讲得足够透,让你知道每一步该往哪走、为什么这么走。
🔗https://github.com/byoungd/English-level-up-tips
这个把《新概念英语》全四册做成在线点读页面的项目NCE。
它是一个纯前端实现的静态页面,把原版的美音音频和中英对照文本整合在了一起。比较直接:打开浏览器就能用,每句话都可以点击单独播放,手机和电脑显示都适配。需要反复听某个句子的跟读练习来说,比翻实体书配光盘或者手动拖进度条要方便不少。
四册从零基础到高阶都有,词汇量从600到4000词,基本覆盖了从入门到备考雅思/托福的需求。
我体验下来的几个细节:
一是页面加载速度还可以,音频文件托管在外部,第一次播放可能需要缓冲;
二是中文字幕部分标注了是由AI生成的,偶尔会有小误差,但作为辅助理解够用了;
三是它提供了一个"外挂资源"机制,如果你有自己的音频和字幕文件,可以按它的目录结构打包,接入同一个播放器使用,这个设计有一定扩展性。
作为免费开源项目,它不提供任何商业化的学习服务,主要价值在于把经典教材的音频和文本做了便捷的整合。
🔗 地址:https://github.com/iChochy/NCE
关注本地化AI视频生成工具,DeepBeepMeep团队开源的Wan2GP算是一个值得留意的项目,目前GitHub上已超过8000 Stars 。
核心特点是把多种生成模型整合到一个本地运行的界面中,并针对低显存环境做了优化。
从技术架构来看,它支持的模型范围比较广:视频生成方面覆盖了Wan /、MiniMax H3、LTX-2、Hunyuan Video等,图像生成支持Qwen Image、Flux 等,音频和TTS也有Qwen3 TTS、Omnivoice等选项。
最突出的特点是本地运行,所有计算都在用户自己的GPU上完成,数据不会上传到云端,也没有订阅或水印限制。硬件要求方面,官方声称部分模型最低只需6GB VRAM即可运行,同时支持AMD显卡和较老的NVIDIA 10系、20系显卡。
安装方式提供了自动化脚本、Docker镜像和Pinokio一键安装等多种途径,对非技术用户相对友好。
主要价值在于一站式整合,不需要在多个模型之间反复切换和配置环境,通过一个Web界面就能完成视频、图像、音频的生成和后期处理(如超分辨率、修音、LoRA定制等)。
作为本地工具,生成速度和质量高度依赖本地硬件配置;同时,部分高级功能(如Sliding Windows长视频生成、特定模型的量化版本)需要一定的学习成本,并非开箱即用。
🔗 项目地址:https://github.com/deepbeepmeep/Wan2GP
商业AI视频平台每个月要收几十美金,生成的内容还受各种审核限制,想用的模型分散在不同平台上,来回切换非常麻烦。
Open Generative AI这个开源项目提供了一个不同的选择,自托管、无内容过滤、一次性部署永久使用。
它把400多个模型(Flux、Kling、Sora、Veo、Midjourney等)集成到同一套界面里,覆盖图像、视频、音频、口型同步、电影工作室、工作流和设计Agent等14个创作场景。
桌面端和Web版都有,还支持本地推理(sd.cpp + Wan2GP),部分模型可完全不依赖API key运行,数据留在本地。
代码采用MIT许可,可以自由修改和二次开发。
🔗https://github.com/Anil-matcha/Open-Generative-AI
之前用Claude Code跑任务,会话一多电脑就开始卡顿,风扇呼呼转,后来发现它单个会话就吃掉将近400MB内存。
换到jcode之后才感觉到差距,同样开10个会话,占用才100多MB,启动快到几乎感觉不到等待(首帧14ms)。
内置语义记忆系统,能自动检索之前的对话内容,不需要手动调用记忆工具。侧边栏可以实时预览文件或diff,Mermaid图表渲染也很快(作者专门写了个Rust渲染库,比常规方案快约1800倍)。
支持的Provider很全,Claude、OpenAI、Gemini、Copilot、Ollama这些都行,还支持多Agent协作的Swarm模式和Agent自主改自己源码的自我开发模式。
🔗https://github.com/1jehuang/jcode
《牛来》导演觉醒系统了
任务是上线一个电影
Mesh-LLM能把多台机器的GPU和内存池化,统一暴露成OpenAI兼容API(localhost:9337)。
支持模型路由、超大模型分层拆分(Skippy)、Mixture-of-Agents(把同一个请求发给所有模型再汇总仲裁)。
用法简单:mesh-llm serve --auto加入公共网络,或加--publish自建私有网络。
对Agent和聊天应用来说,相当于有了一个去中心化的推理后端。
🔗 地址:https://github.com/Mesh-LLM/mesh-llm
Lightpanda是用Zig从头构建的无头浏览器,不是Chromium或WebKit的fork。内存占用约123MB(,Chrome约2GB,差距约16倍;执行时间5秒 vs Chrome的46秒,快约9倍。
支持CDP协议(兼容Puppeteer/Playwright),原生Agent模式(支持Anthropic、OpenAI、Gemini、Ollama等多种后端,可纯REPL模式运行),原生MCP服务,直接导出Markdown。
提供Docker镜像、Homebrew、AUR等多种安装方式。
目前仍在Beta阶段,核心JS执行、DOM操作、Fetch/XHR、表单交互等已支持,但Web API覆盖还在持续完善中。
🔗 地址:https://github.com/lightpanda-io/browser
一组让Hermes Agent无缝接入Buzz社区的便携技能包:
hermes-in-buzz:把远程Hermes网关变成原生Buzz消息Agent,覆盖中继连接、身份配置、权限控制等端到端部署
buzz-media-attachments:本地媒体作为原生附件发送,支持MP4自动修复和GIF降级
buzz-self-hosting:自托管Buzz Relay的完整部署与排障指南,覆盖常见踩坑点(如localhost vs 127.0.0.1、Windows/Git Bash兼容性等)
手动配置一套通信链路确实头疼,把这些skill丢给Agent照着干省事多了。
🔗 地址:https://github.com/tonbistudio/buzz-skills
周末闲着刷到一个影视站,没注册没付费就直接看了,资源更新挺快,手机打开也不卡,弹窗也比同类站点少得多。
顺手试了两部片子,1080P 流畅,部分还有 4K 源。
这里:https://olevod.com
AI工程领域不缺理论教程,缺的是能直接跑起来的实战代码。
这个(Hands-On AI Engineering)项目合集把多Agent系统、RAG、OCR、音频处理、多模态、微调等方向的生产级代码都整理好了。
研究助手、金融分析、旅行规划、代码助手、收据识别、处方数字化、公式提取……每个都配完整README和依赖配置,支持OpenAI、Anthropic、开源模型等多种方案。
🔗 项目地址:https://github.com/Sumanth077/Hands-On-AI-Engineering
AnakinScraper OSS,专为AI打造的开源网页抓取API。
一键把任意网站转成干净的Markdown或结构化JSON,直接喂给RAG、AI Agent使用。
亮点:
反检测浏览器(Camoufox Firefox)、
智能代理自动选择(Thompson Sampling)、
处理链自动降级(HTTP→浏览器→外部API)、
一条命令启动:make up。完全自托管,无云依赖。
支持同步/异步/批量,内置Web仪表盘。比Firecrawl、Crawlee更轻量、更智能,专为AI场景优化!
🔗 https://github.com/Anakin-Inc/anakin
Pipecat是一个Python框架,专门用来构建实时语音和多模态AI对话应用。
语音优先架构,把STT、TTS、LLM、传输层这些模块都做成可插拔的,按需组装就行。
能用它做语音助手、AI伴侣、客户支持代理、多智能体协作系统这些。内置WebRTC和WebSocket传输,超低延迟,支持流式音频视频,对话体验比较自然。
服务商支持很全:STT有Deepgram、AssemblyAI、Whisper;LLM有OpenAI、Anthropic、Gemini;TTS有ElevenLabs、Cartesia;还有OpenAI Realtime、Gemini Multimodal Live这类端到端语音方案。
🔗 地址:https://github.com/pipecat-ai/pipecat
有个学生把AirPods跟苹果设备绑死的限制给掀了。
他搞了个叫LibrePods(万星)的开源工具,专门解锁那些原本只有苹果生态才能用的功能,
切降噪模式、入耳检测、看剩余电量、点头摇头切歌、对话感知,现在Android和Linux也能直接用
🔗 https://github.com/librepods-org/librepods
港大开源了个终身个性化辅导系统DeepTutor,GitHub3.6万星了。不是那种你问一句它答一句的机器人,而是把你自己的教材、论文、笔记全喂进去,照着你的资料来:
深度解题把推理过程一步步拆开;
自动出题批改生成对症练习;
复杂主题自动调研整理成结构化报告;
抽象概念转成图表、动画、互动内容;
记住你的进度和薄弱点,动态调整学习路径。
支持多种RAG引擎、本地模型、Skills和长期记忆,Docker自托管,Apache 2.0开源。
🔗 项目https://github.com/HKUDS/DeepTutor
英语学习资源导航站,把各类网站、课程和工具按场景分类整理好。
🔗 https://en.knowledgefxg.com
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_6657896970
试想一下,你丢给手机一句复杂指令,AI自己规划步骤、动手执行、最后确认结果对不对。
OpenDroid干的就是这事,开源AI代理,专门在安卓设备上跑任务。
🔗 https://github.com/yashab-cyber/opendroid
还在每台设备手动开代理?
OpenSurge for Mac能把Mac变成全屋透明代理网关,手机、电视、游戏机全从Mac拿DHCP/DNS,设备端零配置。
三种模式可选:
旁路由模式让指定设备手动指向Mac(推荐新手);
局域网DHCP接管让同网络设备自动接入;
独立下游LAN适合有独立AP或VLAN的场景。
每台设备都能单独配置走代理还是直连,手机走规则分流、游戏机连美服、电视走流媒体节点,互不干扰。
支持导入已有的mihomo配置或订阅,带Web GUI看实时连接和流量,底部由dnsmasq + mihomo驱动。
🔗 https://github.com/YTwsy/OpenSurge-for-Mac