❤️‍🩹爱错❤️‍🩹 一个分享家 🛰
2.1K subscribers
3.37K photos
23 videos
3 files
2.06K links
🏅 精选互联网资源和资讯 🏵


♦️ 赠人玫瑰,手有余香。
♦️ The rose's in her hand,the flavor in mine.
♦️ 我为人人,人人为我。
♦️ All for one,one for all.

🎈以 AI 为主,敬请点赞。



📥 投稿处: https://t.me/aicuo?direct
Download Telegram
Realmbird正在写Deepseek 新架构mHC的系列文章,目前完成了一篇。| blog

流形约束超连接(Manifold-Constrained Hyper-Connections,mHC)是 Deepseek 新增的一种架构,并已在 Deepseek v4 中实现。

mHC 是对 HC(超连接)的一种修复,它解决了 HC 导致的梯度消失或爆炸问题,同时仍保持性能提升。因为在 HC 上添加权重和偏置会使来自较早层的信号更难更新,从而使残差流的“残差性”降低。

HC 是一种诅咒般的方法,通过在残差流上添加权重和偏置来模拟更宽的残差流。

mHC 是对 HC 的改进,其中使用 Sinkhorn-Knopp 方法使残差流上的权重和偏置变为双随机矩阵。双随机矩阵的行和列之和都为 1,就像同时沿行和列应用 softmax。MHC-lite 与 mHC 论文类似,但使用了 Birkhoff-von Neumann 方法来实现双随机矩阵。
一份面向工程设计的人形机器人指南,很多人形机器人的硬件/物理学知识 | blog | #指南

“一个类人机器人每小时大约走 5,000 步。每一步都会将相当于身体重量 2–3 倍的冲击力传递到腿部执行器——偶尔承受这样的力还可以,但当这种冲击连续数千次而不间断时,就会造成破坏。这种无情的工作循环正是大多数类人机器人执行器失效的原因,也是幸存者最终都采用相同工程解决方案的原因。

关键在于,因为这种冲击发生的速度快于任何传感器循环的反应时间(亚毫秒级),执行器必须在机械上能够‘让步’(可反向驱动性),以吸收能量。如果执行器在机械上是自锁的——如大多数工业用滚珠丝杠——齿轮箱就必须吸收 100% 的冲击能量,从而导致瞬间剪切失效。”
GPT-5.5 中转 API 白嫖免费额度 🎁

专注于提供 大模型中转/代理服务 的站点,通过下面链接注册,白嫖免费额度:
https://freemodel.dev/invite/FRE-2f5a0a37
通过 GitHub 注册:
https://www.orcarouter.ai/ref/ref_9b4dbb69efa9d930e387
PaletteInspiration| 爱错

PaletteInspiration 平台汇集了超过 3,000 位艺术家创作的数万幅画作及其相应的色彩构成。该项目通过提取和关联作品中的 HTML 颜色代码,为设计师和艺术家提供了一个宝贵的视觉资源库。用户可以便捷地通过搜索画作名称来获取其完整的色彩调色板,亦可反向操作,输入特定颜色值,进而探寻与之相关的艺术作品及其创作者。

此平台不仅是一个专业的色彩参考工具,也为艺术爱好者呈现了一个广阔的数字艺术展览空间,涵盖了不同时代的各类艺术珍品。
OCR识别需要多个工具,布局分析工具拆分文档结构,文本识别模型提取内容,还要额外的手动后处理,来回切换效率低下。

GLM-OCR 把OCR全流程功能全部整合到一起,提供了精准×快速×全面的文档理解解决方案。

不仅有SOTA级多模态OCR模型和布局分析,还支持复杂表格/公式/代码识别,云端API和本地部署,甚至一键CLI/Python调用。

主要功能:

- SOTA性能,在OmniDocBench V1.5得分94.62,文档理解基准排名第一;
- 实景优化,完美处理复杂表格、代码文档、印章等挑战场景;
- 高效推理,仅0.9B参数,支持vLLM/SGLang/Ollama部署,低延迟高并发;
- 超易使用,pip install glmocr 一行命令解析图片/PDF,支持CLI/Python/Flask API;
- 完整SDK,云API(零GPU)或自托管,支持大图/PDF多页文档;
- 模块化架构,可自定义布局检测、OCR调用和结果格式化(JSON/Markdown)。

支持云端API、vLLM/SGLang本地部署、多平台使用,通过pip安装即可快速上手,适合AI开发者和企业文档处理。
多模态AI开发常常需要多个专用模型,理解模型处理视觉分析,生成模型负责图像输出,还要额外集成推理和工具调用,切换繁琐效率低下。

SenseNova-U1 用NEO-unify架构从第一性原理统一多模态理解、推理和生成,提供端到端原生多模态解决方案。| 在线尝试

不仅实现像素到词的统一建模,支持高质量文本到图像生成、图像编辑、交错图文生成,还能进行视觉问答、视觉语言行动(VLA)和世界建模,开源SOTA性能。

主要功能:

- 原生统一多模态架构,无需VE和VAE,支持端到端像素-词处理;
- 高质量文本到图像生成,支持复杂信息图表、海报、漫画等高密度渲染;
- 图像编辑和交错图文生成,可生成连贯的文本+图像教程和故事;
- 视觉理解和推理,支持长上下文VQA和代理式视觉任务;
- 支持GGUF量化、低显存推理,单GPU友好,兼容Web/本地部署;
- 提供SenseNova-Studio在线 playground 和SenseNova-Skills代理集成。

支持 Transformers、LightLLM 多框架部署,8B/A3B模型规模,Apache 2.0许可,适合AI开发者、研究者和应用集成。
重构 Claude 使用逻辑:从自动补全升级为 AI 协作伙伴 | 推文

通过将 Andrej Karpathy 的 4 条基础规则扩展为针对现代 Agent 工作流的 12 条指令,可以将 Claude 的编程错误率大幅降低。核心在于将 AI 从“自动补全工具”升级为遵循“行为契约”的协作伙伴。

很多人把 CLAUDE.md 当成随手丢弃的偏好清单,要么塞满 4000 个 token 导致模型完全无视,要么干脆空着。这就像给一个极度聪明的实习生发了一本厚得没法读的员工手册,最后他只能靠直觉乱撞。

Karpathy 最初提出的 4 条规则解决了“写代码”时的基本逻辑问题:别瞎猜、保持简单、外科手术式修改、目标导向。这确实把错误率压了下来,但现在的 AI 已经不是只会写单行代码的补全工具了,它们是会在多个文件间跳转、执行多步任务的 Agent。

现在的痛点变了。有网友提到,Agent 会在长任务中迷失方向,或者在两个不同的代码风格之间试图“取平均值”,结果写出了一堆逻辑混乱的缝合怪。

为了补齐这些漏洞,需要引入更硬核的约束。比如,别让模型去做确定性的逻辑判断,那是代码该干的事,不是概率模型该干的事;必须设置严格的 Token 预算,否则它会陷入无休止的循环,直到烧光你的额度;还有最重要的,要求它“大声失败”。如果迁移漏掉了记录,或者测试只是在测常量,它必须直接告诉你“我没把握”,而不是伪装成成功。

有趣的是,规则并不是越多越好。当规则超过 200 行,模型就会开始机械地模仿“存在规则”这个事实,而不再理解规则本身。

这本质上是在为 AI 编写一套“操作系统协议”。规则不是建议,而是契约。
开发项目管理常常需要监督编码代理,监控任务进度、审查PR、验证CI状态,还要手动处理复杂工作,来回协调效率低下。

OpenAI Symphony 将项目工作转化为隔离的自主实现运行,让团队管理工作而非监督编码代理。

不仅能监控Linear看板自动生成代理处理任务,还提供CI状态、PR审查反馈、复杂度分析和演示视频等工作证明,验收后安全合并PR。

主要功能:

- 监控任务板(如Linear),自动生成隔离代理实现任务;
- 提供完整工作证明:CI状态、PR审查、复杂度分析、walkthrough视频;
- 安全PR合并机制,工程师无需实时监督;
- 支持harness engineering代码库,适用于成熟项目;
- 实验性Elixir参考实现,可快速部署运行;
- SPEC规范公开,便于自定义开发其他语言版本。

支持Elixir/Python等语言实现,适合工程团队和AI开发项目使用,低调工程预览版,专为可信环境测试。
为什么 AI 复杂任务,正在放弃 Markdown 转向 HTML | 推文

随着 AI 代理能力的增强,传统的 Markdown 格式已难以承载复杂的逻辑与视觉需求。转向 HTML 作为 AI 的输出媒介,能实现更高信息密度、交互式体验与更直观的视觉呈现,从而让人类在协作中保持深度参与。

当 AI 代理(Agent)开始处理极其复杂的任务时,Markdown 这种“轻量级”的语法反而成了一种枷锁。

如果你习惯于看 AI 生成的 Markdown 计划书,大概会发现一个尴尬的现状:一旦文档超过百行,阅读体验就开始崩塌。为了弥补表达能力的不足,AI 甚至会用 Unicode 字符去模拟颜色,或者用 ASCII 字符画一些简陋的流程图。这就像是在用电报机试图传输高清视频,虽然能传达意思,但效率低得令人沮丧。

HTML 正在成为一种更高效的“通信协议”。

它不仅仅是关于“好看”。HTML 的核心优势在于信息密度。通过嵌入 SVG 矢量图、利用 CSS 进行布局、甚至加入 JavaScript 实现交互,AI 可以交付一个真正的“产品”而非仅仅是一段“描述”。比如,与其看一段描述数据趋势的文字,不如让 AI 直接生成一个带滑块的交互式仪表盘。

有网友提到,HTML 带来的交互感能让协作变得更有趣。你可以要求 AI 生成一个临时的、针对特定任务的“微型编辑器”:比如一个可以拖拽排序的任务卡片流,或者一个带实时预览的 Prompt 调试器。这种“即用即弃”的工具感,让文档从静态的记录变成了动态的实验室。

当然,这种转变并非没有代价。

HTML 的 Token 消耗通常是 Markdown 的数倍,且在版本控制(Git Diff)中显得非常臃肿。如果只是为了简单的笔记,Markdown 依然是王者。但当我们需要进行复杂的架构设计、代码评审或原型开发时,HTML 提供的语义化结构和视觉清晰度,能显著降低人类的认知负荷。

与其说我们在重新发现 HTML,不如说我们在利用 Web 技术栈,为 AI 时代构建一种全新的、可交互的“数字界面”。

当文档本身变成了一个可以运行的小程序,我们与 AI 的关系,也从单纯的“指令与反馈”,进化成了真正的“共创”。