This media is not supported in your browser
VIEW IN TELEGRAM
Terminator:将桌面应用解析为HTML网站,像使用Playwright一样操作桌面。
基于OS级无障碍API,比视觉工具快10倍;支持Windows和macOS,Windows性能最佳;能与后台应用交互,不受窗口焦点限制
基于OS级无障碍API,比视觉工具快10倍;支持Windows和macOS,Windows性能最佳;能与后台应用交互,不受窗口焦点限制
IndexTTS-vLLM:让语音合成更快速、更高效。核心价值在于通过vLLM加速IndexTTS的推理过程,显著提升语音合成的速度和并发能力。
单个请求RTF从0.3降至0.1;GPT模型decode速度提升至280 token/s;支持多角色音频混合,为语音合成带来更多创意可能
单个请求RTF从0.3降至0.1;GPT模型decode速度提升至280 token/s;支持多角色音频混合,为语音合成带来更多创意可能
为下一代图像理解和生成模型提供原子化能力数据集支持的开源工具。
提供多种原子能力数据集,如“改变、添加、移除”“缩放”“风格迁移”等;支持自定义数据集构建脚本;与ModelScope和DashScope深度集成,无缝对接模型训练和推理
ImagePulse | #工具
提供多种原子能力数据集,如“改变、添加、移除”“缩放”“风格迁移”等;支持自定义数据集构建脚本;与ModelScope和DashScope深度集成,无缝对接模型训练和推理
ImagePulse | #工具
《Build a Large Language Model (From Scratch)》的中文版电子书,助力更多中文读者掌握大模型技术。| #电子书
从零开始构建模型,涵盖从基础架构到高级调优的全过程;提供配套实践代码,助力读者实操学习;翻译团队采用AI翻译助手+人工精细校对,确保翻译质量
从零开始构建模型,涵盖从基础架构到高级调优的全过程;提供配套实践代码,助力读者实操学习;翻译团队采用AI翻译助手+人工精细校对,确保翻译质量
Flow Matching and Diffusion Models:一门由MIT开设的前沿课程,专注于生成式AI的数学原理与实践。它能帮助学习者从零开始构建图像扩散模型,掌握随机微分方程的工具。
课程涵盖从理论到实践的完整内容;提供3个配套的实践实验室,手把手教你构建模型;涵盖多种数据模态,如图像、视频、蛋白质结构等
课程涵盖从理论到实践的完整内容;提供3个配套的实践实验室,手把手教你构建模型;涵盖多种数据模态,如图像、视频、蛋白质结构等