这个数据库工具不仅开源免费,还直接集成了AI能力。
你可以用大白话写查询,它自带一个类似Claude的代理,能自动读取你的表结构并帮你执行SQL。
名字叫 Tabularis ,别人收费的功能它直接白给。支持PostgreSQL、MySQL、SQLite,还有DuckDB、ClickHouse、Redis、Firestore等15种以上数据源。
它内置了一个MCP服务器,Claude、Cursor、Devin这些AI工具可以直接读取你的数据库结构,并在同一个应用里跑查询,不用切来切去。
🔗https://github.com/TabularisDB/tabularis
你可以用大白话写查询,它自带一个类似Claude的代理,能自动读取你的表结构并帮你执行SQL。
名字叫 Tabularis ,别人收费的功能它直接白给。支持PostgreSQL、MySQL、SQLite,还有DuckDB、ClickHouse、Redis、Firestore等15种以上数据源。
它内置了一个MCP服务器,Claude、Cursor、Devin这些AI工具可以直接读取你的数据库结构,并在同一个应用里跑查询,不用切来切去。
🔗https://github.com/TabularisDB/tabularis
GitHub 上星标最高的爬虫工具,没有之一。
Crawl4AI 能把任意网页转成干净的 Markdown 格式,专门为 LLM 设计,跑得比付费服务还快。
不需要 API Key,不用注册账号,也没有按页收费的套路。
作者说自己之前被一个月 16 美元的付费爬虫搞烦了,一气之下花几天时间自己撸了一个,结果直接火了。
目前 74.6k Star,Apache 2.0 协议。
https://github.com/unclecode/crawl4ai
Crawl4AI 能把任意网页转成干净的 Markdown 格式,专门为 LLM 设计,跑得比付费服务还快。
不需要 API Key,不用注册账号,也没有按页收费的套路。
作者说自己之前被一个月 16 美元的付费爬虫搞烦了,一气之下花几天时间自己撸了一个,结果直接火了。
目前 74.6k Star,Apache 2.0 协议。
https://github.com/unclecode/crawl4ai
有个 GitHub 仓库专门扒各大 AI 产品背后的系统指令,ChatGPT、Claude、Gemini、Copilot、Perplexity、Grok 全都有。
不是提示词合集,不是越狱教程,是这些产品真正在跑的那套底层规则。目前已经 60k Star,几乎每周都在更新。
用了这么久的 AI,我才意识到模型怎么回答,很大程度上取决于对话框后面那套巨大的指令文件。
整理的东西包括:
GPT- 和 Codex 的系统提示
Claude Fable 5、Opus 、Sonnet 5
Gemini Flash 和 AI Studio
Perplexity Computer 模式
GitHub Copilot、Cursor、Grok、Qwen 等更多
规则覆盖了工具怎么用、记忆怎么存、搜索怎么决策、安全边界在哪、代理怎么调度、语气风格怎么定。
大多数人把 AI 当黑盒,聪明人已经在读说明书了。
优势就是这么拉开的。A哥认为一个 GitHub 仓库能教你的东西,比瞎试几周提示词还多。
🔗https://github.com/asgeirtj/system_prompts_leaks
不是提示词合集,不是越狱教程,是这些产品真正在跑的那套底层规则。目前已经 60k Star,几乎每周都在更新。
用了这么久的 AI,我才意识到模型怎么回答,很大程度上取决于对话框后面那套巨大的指令文件。
整理的东西包括:
GPT- 和 Codex 的系统提示
Claude Fable 5、Opus 、Sonnet 5
Gemini Flash 和 AI Studio
Perplexity Computer 模式
GitHub Copilot、Cursor、Grok、Qwen 等更多
规则覆盖了工具怎么用、记忆怎么存、搜索怎么决策、安全边界在哪、代理怎么调度、语气风格怎么定。
大多数人把 AI 当黑盒,聪明人已经在读说明书了。
优势就是这么拉开的。A哥认为一个 GitHub 仓库能教你的东西,比瞎试几周提示词还多。
🔗https://github.com/asgeirtj/system_prompts_leaks
那个“模型越大,内存要求越高”的老规矩,是不是该被扔进垃圾桶了?
Colibri的出现,直接让这个说法站不住脚,它愣是在一台只有25GB内存、连显卡都没有的普通电脑上,把GLM-这个拥有7440亿参数的庞然大物给跑起来了。
它不是那种把整个模型一股脑全塞进内存的粗暴玩法,而是玩了一手漂亮的“按需加载”:
1.核心部件常驻内存
2.其他部分则放在硬盘里,随用随取
3.结果就是,顶级大模型就这么“屈尊”降到了咱们的日常设备上。
当然,这种操作并非没有代价,生成速度的快慢现在得看硬盘的脸色。
但话说回来,能在本地硬件上把这种量级的模型给“盘活”,这件事本身的象征意义就已经足够大了。
不再需要去云端排队,也不用眼馋那些天价的GPU集群,Colibri用开源的力量,硬生生把本地AI的极限又往上顶了一截。
🔗:https://github.com/JustVugg/colibri
Colibri的出现,直接让这个说法站不住脚,它愣是在一台只有25GB内存、连显卡都没有的普通电脑上,把GLM-这个拥有7440亿参数的庞然大物给跑起来了。
它不是那种把整个模型一股脑全塞进内存的粗暴玩法,而是玩了一手漂亮的“按需加载”:
1.核心部件常驻内存
2.其他部分则放在硬盘里,随用随取
3.结果就是,顶级大模型就这么“屈尊”降到了咱们的日常设备上。
当然,这种操作并非没有代价,生成速度的快慢现在得看硬盘的脸色。
但话说回来,能在本地硬件上把这种量级的模型给“盘活”,这件事本身的象征意义就已经足够大了。
不再需要去云端排队,也不用眼馋那些天价的GPU集群,Colibri用开源的力量,硬生生把本地AI的极限又往上顶了一截。
🔗:https://github.com/JustVugg/colibri
有人直接把价值数百万美元的计算成果,打包成了一个15TB的压缩包,放在网上任人下载。
项目叫The Well,里面塞满了16个物理模拟数据集,从恒星爆炸到湍流,从磁场流体到生物系统,基本把计算物理的硬骨头都啃了一遍。
以前你想搞到这种级别的数据?
要么去求国家实验室批机时,要么排队等上几周的HPC集群,要么养一个研究团队烧经费。
现在呢?一条命令就能拉下来,直接喂给AI模型当训练素材。
用神经网络的一次前向传播,替代掉那些又慢又贵的偏微分方程数值解。
背后撑场子的也不是什么野鸡团队,Flatiron Institute牵头,剑桥、普林斯顿、伯克利、NYU、东大、洛斯阿拉莫斯的人都在名单上。
传送门https://github.com/PolymathicAI/the_well/
项目叫The Well,里面塞满了16个物理模拟数据集,从恒星爆炸到湍流,从磁场流体到生物系统,基本把计算物理的硬骨头都啃了一遍。
以前你想搞到这种级别的数据?
要么去求国家实验室批机时,要么排队等上几周的HPC集群,要么养一个研究团队烧经费。
现在呢?一条命令就能拉下来,直接喂给AI模型当训练素材。
用神经网络的一次前向传播,替代掉那些又慢又贵的偏微分方程数值解。
背后撑场子的也不是什么野鸡团队,Flatiron Institute牵头,剑桥、普林斯顿、伯克利、NYU、东大、洛斯阿拉莫斯的人都在名单上。
传送门https://github.com/PolymathicAI/the_well/
AI代理翻车,根因往往不在模型本身。
更多时候,是那些藏在暗处的故障(幻觉、工具误调用、无声无息地跑偏),在酿成大祸之前,根本没人注意到。
一个叫iFixAi的开源项目,思路挺有意思:它不盯着最终输出好不好,而是直接去挖代理的"行为底细"。
跑45项专项检查,覆盖捏造事实、被恶意操纵、刻意欺骗、行为不可预测、决策过程不透明等维度,最后给你一个A到F的评级。
整个过程跑完不到5分钟,而且它不挑行业也不挑模型,自己的代理也好,第三方接口也罢,都能接进去测。
https://github.com/ifixai-ai/iFixAi
更多时候,是那些藏在暗处的故障(幻觉、工具误调用、无声无息地跑偏),在酿成大祸之前,根本没人注意到。
一个叫iFixAi的开源项目,思路挺有意思:它不盯着最终输出好不好,而是直接去挖代理的"行为底细"。
跑45项专项检查,覆盖捏造事实、被恶意操纵、刻意欺骗、行为不可预测、决策过程不透明等维度,最后给你一个A到F的评级。
整个过程跑完不到5分钟,而且它不挑行业也不挑模型,自己的代理也好,第三方接口也罢,都能接进去测。
https://github.com/ifixai-ai/iFixAi
Boris Cherny作为Claude Code的负责人,提过一个很有意思的观点。他早就放弃手动写prompt了,而是写自动化循环程序来驱动AI工作。OpenClaw项目的创建者也有差不多的实践心得。
这种把提示词工程上升到系统架构层面的做法,圈子里给了个名字叫Loop Engineering。
有个开源项目把这套思路做成了可以直接落地的方案,提供了完整的模式库、项目初始模板和配套CLI。
它的核心机制拆解开来是这些:用automations做定时任务触发,worktrees提供隔离环境,skills沉淀项目上下文,plugins通过MCP协议对接外部工具。sub-agents把工作流分成生成和校验两个阶段,STATE文件负责跨会话状态记忆。
项目里直接给出了7个经过验证的生产级模式。
每个模式都提供了Claude Code、Codex等四种不同工具的实现,还附带了loop-audit、loop-init、loop-cost三个管理工具。
🔗:https://github.com/cobusgreyling/loop-engineering
这种把提示词工程上升到系统架构层面的做法,圈子里给了个名字叫Loop Engineering。
有个开源项目把这套思路做成了可以直接落地的方案,提供了完整的模式库、项目初始模板和配套CLI。
它的核心机制拆解开来是这些:用automations做定时任务触发,worktrees提供隔离环境,skills沉淀项目上下文,plugins通过MCP协议对接外部工具。sub-agents把工作流分成生成和校验两个阶段,STATE文件负责跨会话状态记忆。
项目里直接给出了7个经过验证的生产级模式。
每个模式都提供了Claude Code、Codex等四种不同工具的实现,还附带了loop-audit、loop-init、loop-cost三个管理工具。
🔗:https://github.com/cobusgreyling/loop-engineering
终端里的AI编程助手,Kimi Code CLI算是一个值得关注的选择。它出自Moonshot AI之手,开源,启动后能直接处理代码读写、shell命令执行、文件搜索和网页抓取,过程中还会自己判断下一步做什么。
官方把这套工具做成了单文件安装,跑起来很快,TUI界面响应也在毫秒级。开箱就用Kimi模型,同时也兼容其他API提供商。
支持把视频拖进对话让AI理解画面内容,有插件生态可以扩展,还能用子Agent做并行任务。
如果日常在终端里折腾代码,这玩意应该能派上用场。
开源地址:https://github.com/MoonshotAI/kimi-code
官方把这套工具做成了单文件安装,跑起来很快,TUI界面响应也在毫秒级。开箱就用Kimi模型,同时也兼容其他API提供商。
支持把视频拖进对话让AI理解画面内容,有插件生态可以扩展,还能用子Agent做并行任务。
如果日常在终端里折腾代码,这玩意应该能派上用场。
开源地址:https://github.com/MoonshotAI/kimi-code
设计圈里,Figma的替代方案其实一直有人在找,Penpot算是其中一个跑得比较快的。GitHub星数已经冲到万,代码开源,免费,想自托管也没问题。
它跟别的设计工具不太一样的地方在于,输出的东西直接就是SVG、CSS、HTML。设计师那边画完,开发这边打开就能直接用,不用猜尺寸、不用重新切图、不用来回对齐。
功能层面有几个值得拎出来说的:实时协作是基操,Design Tokens和组件系统做设计规范挺好用,CSS Flex和Grid让响应式从设计阶段就能跑起来。
MCP服务器加AI工作流算是个新东西,AI可以读写设计文件,相当于多了一个能动手的助手。WebGL加速和背景模糊这些渲染能力也在往生产级靠。
产品、设计、开发三个角色都能往里装,数据在自己手上,不用担心被某个平台绑定死。
🔗:https://github.com/penpot/penpot
它跟别的设计工具不太一样的地方在于,输出的东西直接就是SVG、CSS、HTML。设计师那边画完,开发这边打开就能直接用,不用猜尺寸、不用重新切图、不用来回对齐。
功能层面有几个值得拎出来说的:实时协作是基操,Design Tokens和组件系统做设计规范挺好用,CSS Flex和Grid让响应式从设计阶段就能跑起来。
MCP服务器加AI工作流算是个新东西,AI可以读写设计文件,相当于多了一个能动手的助手。WebGL加速和背景模糊这些渲染能力也在往生产级靠。
产品、设计、开发三个角色都能往里装,数据在自己手上,不用担心被某个平台绑定死。
🔗:https://github.com/penpot/penpot
A哥发现个超级硬核的开源项目,必须得分享一波。
OmniRoute,一个MIT协议的免费AI网关。就一个端点,背后连了290多家提供商(其中90多家免费),500多个模型随便调——Kimi、Claude、GPT、Gemini、DeepSeek、MiniMax全都有。
Claude Code、Cursor、Codex、Cline、Copilot这些工具,它全都适配好了,拿来就能用。
智能配额感知,某个提供商额度用完了自动fallback到下一个,你根本不用管
RTK+Caveman压缩技术,能省15%到95%的Token,长期用下来省不少钱
支持MCP和A2A协议,还有桌面端和PWA
口号挺狂的——「Never stop coding」,但看下来确实有两把刷子。
https://github.com/diegosouzapw/OmniRoute
OmniRoute,一个MIT协议的免费AI网关。就一个端点,背后连了290多家提供商(其中90多家免费),500多个模型随便调——Kimi、Claude、GPT、Gemini、DeepSeek、MiniMax全都有。
Claude Code、Cursor、Codex、Cline、Copilot这些工具,它全都适配好了,拿来就能用。
智能配额感知,某个提供商额度用完了自动fallback到下一个,你根本不用管
RTK+Caveman压缩技术,能省15%到95%的Token,长期用下来省不少钱
支持MCP和A2A协议,还有桌面端和PWA
口号挺狂的——「Never stop coding」,但看下来确实有两把刷子。
https://github.com/diegosouzapw/OmniRoute
用文字直接搓CAD模型,以前想都不敢想,现在真被这个开源项目给干出来了。
text-to-cad(CAD Skills),一套专为AI Agent打造的技能库,面向CAD设计、机器人和硬件开发场景。你把需求用大白话一说,或者扔张参考图过去,Claude Code、Codex这些Agent就能直接上手干活:
生成和编辑3D CAD模型,主力输出STEP格式,STL、3MF、GLB也都能导
写URDF、SRDF、SDF这些机器人描述文件,搞仿真和MoveIt规划用的
生成DXF工程图和G-code切片,3D打印前处理一步到位
还能搜现成的STEP标准件、预览模型,甚至对接Bambu Labs直接开打
想法到模型的距离,被大幅缩短了。
安装就一行命令:
npx skills install earthtojake/text-to-cad
🔗https://github.com/earthtojake/text-to-cad
text-to-cad(CAD Skills),一套专为AI Agent打造的技能库,面向CAD设计、机器人和硬件开发场景。你把需求用大白话一说,或者扔张参考图过去,Claude Code、Codex这些Agent就能直接上手干活:
生成和编辑3D CAD模型,主力输出STEP格式,STL、3MF、GLB也都能导
写URDF、SRDF、SDF这些机器人描述文件,搞仿真和MoveIt规划用的
生成DXF工程图和G-code切片,3D打印前处理一步到位
还能搜现成的STEP标准件、预览模型,甚至对接Bambu Labs直接开打
想法到模型的距离,被大幅缩短了。
安装就一行命令:
npx skills install earthtojake/text-to-cad
🔗https://github.com/earthtojake/text-to-cad
给pi coding agent配了个本地Web UI,用起来真顺手。
Pi Web,专门给pi agent量身打造的浏览器界面,功能挺全乎:
在浏览器里翻历史会话、实时聊天,不用切回终端
模型参数调整和技能管理,点一点就行
项目文件直接预览,代码、图片、PDF都能看
支持Git worktree切换,会话还能fork出去独立折腾
一条命令跑起来:
bash
npx /pi-web@latest
🔗 https://github.com/agegr/pi-web
Pi Web,专门给pi agent量身打造的浏览器界面,功能挺全乎:
在浏览器里翻历史会话、实时聊天,不用切回终端
模型参数调整和技能管理,点一点就行
项目文件直接预览,代码、图片、PDF都能看
支持Git worktree切换,会话还能fork出去独立折腾
一条命令跑起来:
bash
npx /pi-web@latest
🔗 https://github.com/agegr/pi-web
阿里最近开源了一个AI代码审查工具,真可以。
Open Code Review :阿里出品的代码审查CLI,架构上走的是确定性流水线加LLM Agent的混合路线。
评论能精准落到具体行,内置了NPE、线程安全、XSS、SQL注入这些常见坑的检测规则。
OpenAI和Anthropic兼容的模型都能接。
可以审Git Diff,也可以全量扫整个文件。
https://github.com/alibaba/open-code-review
Open Code Review :阿里出品的代码审查CLI,架构上走的是确定性流水线加LLM Agent的混合路线。
评论能精准落到具体行,内置了NPE、线程安全、XSS、SQL注入这些常见坑的检测规则。
OpenAI和Anthropic兼容的模型都能接。
可以审Git Diff,也可以全量扫整个文件。
https://github.com/alibaba/open-code-review
之前真没想过,家里那台普通路由器除了上网还能干这个。
一个用WiFi信号做空间感知和生命体征监测的开源项目RuView ,全程不用摄像头。
靠WiFi CSI技术实现人体存在检测,穿墙也能感知。
接触式或非接触式测呼吸和心率。
活动识别、跌倒检测、睡眠质量分析。
硬件成本很低,ESP32节点大概9美元,跑边缘AI,支持接入Home Assistant和Apple Home。
🔗https://github.com/ruvnet/RuView
一个用WiFi信号做空间感知和生命体征监测的开源项目RuView ,全程不用摄像头。
靠WiFi CSI技术实现人体存在检测,穿墙也能感知。
接触式或非接触式测呼吸和心率。
活动识别、跌倒检测、睡眠质量分析。
硬件成本很低,ESP32节点大概9美元,跑边缘AI,支持接入Home Assistant和Apple Home。
🔗https://github.com/ruvnet/RuView
一张照片扔进去,Three.js代码直接给你吐出来,img2threejs v1.3刚刚发布了。
它不走网格路线,也不用手动建模,全靠程序化生成。对着一张某宝刀之类的参考图,它就能给你整出一套可用的Three.js模型代码。
v1.3这波升级主要啃了几块硬骨头:
几何重建更准了,材质生成更细了,整体输出质量上了一个台阶。
演示里用的是CS2里那把M9 Bayonet | Doppler Phase 3的图,效果自己看。
🔗: https://github.com/hoainho/img2threejs
它不走网格路线,也不用手动建模,全靠程序化生成。对着一张某宝刀之类的参考图,它就能给你整出一套可用的Three.js模型代码。
v1.3这波升级主要啃了几块硬骨头:
几何重建更准了,材质生成更细了,整体输出质量上了一个台阶。
演示里用的是CS2里那把M9 Bayonet | Doppler Phase 3的图,效果自己看。
🔗: https://github.com/hoainho/img2threejs
Google最近开源了一款叫Magika的工具,用AI来识别文件类型,效果相当不错。
整个模型也就几MB大小,跑在单CPU上毫秒级就能出结果,覆盖了200多种格式,平均准确率能到99%左右。
Google自己已经在Gmail、Drive和Safe Browsing里大规模用上了,每周处理数千亿个文件,还集成到了VirusTotal里。
命令行、Python、JavaScript都能调,比传统的file命令好用太多了。
GitHub:https://github.com/google/magika
整个模型也就几MB大小,跑在单CPU上毫秒级就能出结果,覆盖了200多种格式,平均准确率能到99%左右。
Google自己已经在Gmail、Drive和Safe Browsing里大规模用上了,每周处理数千亿个文件,还集成到了VirusTotal里。
命令行、Python、JavaScript都能调,比传统的file命令好用太多了。
GitHub:https://github.com/google/magika
OfficeAI开源的OfficeCLI,给AI Agent用的一套Office自动化命令行工具。
单文件二进制、开源免费,不用装Microsoft Office就能跑。Word、Excel、PowerPoint三件套全支持。
对Agent来说,这项目等于把Office文件操作收敛成了一组稳定可调的命令接口。
以前让Agent做PPT,得拼凑Python库、XML处理、模板、截图工具,流程散还容易出错。
OfficeCLI把这些全收进一个CLI里——创建文件、读取结构、修改元素、渲染预览检查,一条命令搞定一套动作,很适合现在Agent的工作流。
https://github.com/iOfficeAI/OfficeCLI
单文件二进制、开源免费,不用装Microsoft Office就能跑。Word、Excel、PowerPoint三件套全支持。
对Agent来说,这项目等于把Office文件操作收敛成了一组稳定可调的命令接口。
以前让Agent做PPT,得拼凑Python库、XML处理、模板、截图工具,流程散还容易出错。
OfficeCLI把这些全收进一个CLI里——创建文件、读取结构、修改元素、渲染预览检查,一条命令搞定一套动作,很适合现在Agent的工作流。
https://github.com/iOfficeAI/OfficeCLI
还在熬夜对着Excel一行行复制粘贴做PPT?GitHub上这个JavaScript库或许能让你早点下班。
项目叫PptxGenJS,MIT协议,老外开源的,星星攒了不少。Node、React、浏览器里都能跑,不用装Office也不用买授权,纯代码生成原生.pptx文件,Keynote和Google Slides也能正常打开。
4行代码就能搓出一页PPT,API设计得挺顺手
网页上的HTML表格,一行代码直接转成幻灯片
图表、图片、形状、企业母版这些要素都支持
纯本地跑,不经过任何后端服务,数据不用出机器
https://github.com/gitbrent/PptxGenJS
项目叫PptxGenJS,MIT协议,老外开源的,星星攒了不少。Node、React、浏览器里都能跑,不用装Office也不用买授权,纯代码生成原生.pptx文件,Keynote和Google Slides也能正常打开。
4行代码就能搓出一页PPT,API设计得挺顺手
网页上的HTML表格,一行代码直接转成幻灯片
图表、图片、形状、企业母版这些要素都支持
纯本地跑,不经过任何后端服务,数据不用出机器
https://github.com/gitbrent/PptxGenJS
同一个AI,别人两周上线一个项目,你还在跟"记不住规范"斗智斗勇?
问题不在AI,是你缺个能管住它的框架。
GitHub刚破11k星的Trellis,专治这个:
.trellis/spec/ 沉淀规范,每次会话自动喂上下文,不用从头教。
PRD→实现→审查,全链路留痕,AI再也不会写着写着就飘了。
Spec跟着仓库版本走,团队经验自动沉淀,新人上手直接抄作业。
一套结构通吃14个AI编程平台,换工具不用重搭工作流。
http://github.com/mindfold-ai/Trellis/blob/main/README_CN.md
问题不在AI,是你缺个能管住它的框架。
GitHub刚破11k星的Trellis,专治这个:
.trellis/spec/ 沉淀规范,每次会话自动喂上下文,不用从头教。
PRD→实现→审查,全链路留痕,AI再也不会写着写着就飘了。
Spec跟着仓库版本走,团队经验自动沉淀,新人上手直接抄作业。
一套结构通吃14个AI编程平台,换工具不用重搭工作流。
http://github.com/mindfold-ai/Trellis/blob/main/README_CN.md
公网裸奔的Web服务,随时可能被扫到漏洞。
SafeLine(雷池)是一个自部署WAF,把企业级的入口防护做成了普通开发者也能几分钟装好、在控制台里配明白的工具。
你的真实业务藏在它后面,外部请求先过它:判断有没有SQL注入、XSS、命令注入、SSRF、路径穿越、RCE这些常见攻击,再决定放行、拦截、限速还是丢人机验证。
暴力破解、HTTP Flood、恶意爬虫、漏洞扫描也都能拦。独立开发者、自建服务玩家、中小团队官网、安全和运维——这类人最需要它。
入口有层防护,和裸奔上公网,体验差别很大。
🔗 https://github.com/chaitin/SafeLine
SafeLine(雷池)是一个自部署WAF,把企业级的入口防护做成了普通开发者也能几分钟装好、在控制台里配明白的工具。
你的真实业务藏在它后面,外部请求先过它:判断有没有SQL注入、XSS、命令注入、SSRF、路径穿越、RCE这些常见攻击,再决定放行、拦截、限速还是丢人机验证。
暴力破解、HTTP Flood、恶意爬虫、漏洞扫描也都能拦。独立开发者、自建服务玩家、中小团队官网、安全和运维——这类人最需要它。
入口有层防护,和裸奔上公网,体验差别很大。
🔗 https://github.com/chaitin/SafeLine
AI操控电脑这件事,终于有了统一的开源方案Cua。
不用为每个操作系统单独写适配,macOS、Linux、Windows一套代码全兼容。
底层驱动鼠标键盘、访问终端、截取屏幕,全都有。
可以在本地跑,也可以部署到云沙箱,行为完全一致。
它内置了OSWorld和ScreenSpot基准测试,还能导出操作轨迹用于训练模型。
Apple Silicon上几乎感知不到损耗。
开源,MIT协议,拿来就能用。
🔗:https://github.com/trycua/cua
不用为每个操作系统单独写适配,macOS、Linux、Windows一套代码全兼容。
底层驱动鼠标键盘、访问终端、截取屏幕,全都有。
可以在本地跑,也可以部署到云沙箱,行为完全一致。
它内置了OSWorld和ScreenSpot基准测试,还能导出操作轨迹用于训练模型。
Apple Silicon上几乎感知不到损耗。
开源,MIT协议,拿来就能用。
🔗:https://github.com/trycua/cua