推理引擎WASTE开源:把Kimi K3完整跑进64GB MacBook
边缘数据库公司 SQLite AI 开源推理引擎 WASTE。它让保留全部层和专家的 Kimi K3,能在一台 64GB MacBook Pro 上运行。转换后的模型约占 1TB,速度为每秒 0.49 至 0.54 个 Token。
WASTE 把约 27GB 的模型主干留在内存。8 万多个专家放在内置 SSD。每生成一个 Token,只从硬盘读取当前调用的专家。
这个版本没有蒸馏、裁剪或删除专家。WASTE 将原本采用 MXFP4 的专家权重重新量化到 3-bit,并把模型主干压成 4-bit 和 8-bit。
GitHub 仓库
边缘数据库公司 SQLite AI 开源推理引擎 WASTE。它让保留全部层和专家的 Kimi K3,能在一台 64GB MacBook Pro 上运行。转换后的模型约占 1TB,速度为每秒 0.49 至 0.54 个 Token。
WASTE 把约 27GB 的模型主干留在内存。8 万多个专家放在内置 SSD。每生成一个 Token,只从硬盘读取当前调用的专家。
这个版本没有蒸馏、裁剪或删除专家。WASTE 将原本采用 MXFP4 的专家权重重新量化到 3-bit,并把模型主干压成 4-bit 和 8-bit。
GitHub 仓库
GitHub
GitHub - sqliteai/waste: Run the full 2.78-trillion-parameter Kimi K3 model beyond available RAM by streaming activated weights…
Run the full 2.78-trillion-parameter Kimi K3 model beyond available RAM by streaming activated weights directly from NVMe. A dependency-free, embeddable C inference engine. - sqliteai/waste
❤7
模型自称Claude不等于蒸馏,1000条回答就能让Qwen认错自己
研究者 Ziqian Zhong 让 Claude、GPT-4o 等模型回答 1000 个普通问题,再删掉其中所有模型名和公司名。他随后用这些问答材料微调 Qwen、DeepSeek 等开源模型。
训练后,部分模型开始认错自己的身份。Qwen3.5-397B-A17B 原本只有 0.6% 的回答自称 Claude。用 Claude 的回答训练一轮后,这一比例升至 40.3%。
Ziqian Zhong 的解释是,这些模型在预训练时看过大量 Claude 的对话和介绍,已经把某些表达习惯与「Claude」联系起来。微调让 Qwen 学会了这种说话方式,被问到身份时,也更容易回答自己是 Claude。
为验证这一点,他用 GPT-4.1-mini 把 Claude 的回答改成粗糙的简单句,回答内容基本不变,但语气和排版不再像 Claude。再用这批材料微调后,3 个模型中有 2 个几乎不再自称 Claude,说明语言风格是身份转移的主要原因。
类似现象此前已经有论文研究过。2025 年的《Subliminal Learning》发现,模型会从训练数据中继承另一个模型的偏好和行为。
因此,模型自称 Claude,并不能直接证明它接受过 Claude 蒸馏。它也可能只是学会了 Claude 的表达方式,再把这种风格和「自己是谁」联系到了一起。
Ziqian Zhong
研究者 Ziqian Zhong 让 Claude、GPT-4o 等模型回答 1000 个普通问题,再删掉其中所有模型名和公司名。他随后用这些问答材料微调 Qwen、DeepSeek 等开源模型。
训练后,部分模型开始认错自己的身份。Qwen3.5-397B-A17B 原本只有 0.6% 的回答自称 Claude。用 Claude 的回答训练一轮后,这一比例升至 40.3%。
Ziqian Zhong 的解释是,这些模型在预训练时看过大量 Claude 的对话和介绍,已经把某些表达习惯与「Claude」联系起来。微调让 Qwen 学会了这种说话方式,被问到身份时,也更容易回答自己是 Claude。
为验证这一点,他用 GPT-4.1-mini 把 Claude 的回答改成粗糙的简单句,回答内容基本不变,但语气和排版不再像 Claude。再用这批材料微调后,3 个模型中有 2 个几乎不再自称 Claude,说明语言风格是身份转移的主要原因。
类似现象此前已经有论文研究过。2025 年的《Subliminal Learning》发现,模型会从训练数据中继承另一个模型的偏好和行为。
因此,模型自称 Claude,并不能直接证明它接受过 Claude 蒸馏。它也可能只是学会了 Claude 的表达方式,再把这种风格和「自己是谁」联系到了一起。
Ziqian Zhong
👍4❤1😁1
千问新语音识别模型发布:医疗术语召回率达95.36%
阿里发布 Qwen-Audio-3.0-ASR-Flash 语音识别模型。它能结合上下文理解讲话内容,重点提升医学、工业等专业术语的识别能力。
用户可以添加自定义热词,帮助模型听准药品名、设备名和行业缩写。模型还能修正口语表达,自动整理出带标点和结构的文字稿。
官方内部测试中,医疗术语召回率达到 95.36%,工业术语达到 93.24%。该系列提供实时流式、录音文件和非实时识别三种接口。
Qwen
阿里发布 Qwen-Audio-3.0-ASR-Flash 语音识别模型。它能结合上下文理解讲话内容,重点提升医学、工业等专业术语的识别能力。
用户可以添加自定义热词,帮助模型听准药品名、设备名和行业缩写。模型还能修正口语表达,自动整理出带标点和结构的文字稿。
官方内部测试中,医疗术语召回率达到 95.36%,工业术语达到 93.24%。该系列提供实时流式、录音文件和非实时识别三种接口。
Qwen
动察Beating AI News
半年暴赚439%的AI基金遭反噬,Citadel接手大部分股票仓位 24 岁前 OpenAI 研究员 Leopold Aschenbrenner 管理的 Situational Awareness,在 AI 股票大跌后,将大部分公开股票卖给 Citadel。基金交易前约有 160 亿美元公开股票,重仓 SK 海力士、CoreWeave、Nebius 等 AI 产业链公司。 基金此前借钱放大仓位。市场反转后,它需要追加资金或出售资产,最终选择减仓。CNBC 称基金清空了公开股票,路透社和《华尔街日报》则称出售大部分仓位。…
刚刚上百亿美元被清仓的24岁AI股神Leopold本周末结婚,未婚妻是Anthropic CEO幕僚长
CNBC 援引两名知情人士称,24 岁前 OpenAI 研究员 Leopold Aschenbrenner 将于本周末结婚。未婚妻 Avital Balwit 现任 Anthropic CEO Dario Amodei 的幕僚长。
两人曾在 SBF 创办的 FTX Future Fund 共事。FTX 崩塌后,Leopold 加入 OpenAI,Avital 后来进入 Anthropic。
婚礼前夕,Leopold 的基金刚把大部分股票仓位卖给 Citadel。网友因此调侃,Leopold 忙着结婚,已经离婚的 Citadel 创始人 Ken Griffin 忙着赚钱。
CNBC
CNBC 援引两名知情人士称,24 岁前 OpenAI 研究员 Leopold Aschenbrenner 将于本周末结婚。未婚妻 Avital Balwit 现任 Anthropic CEO Dario Amodei 的幕僚长。
两人曾在 SBF 创办的 FTX Future Fund 共事。FTX 崩塌后,Leopold 加入 OpenAI,Avital 后来进入 Anthropic。
婚礼前夕,Leopold 的基金刚把大部分股票仓位卖给 Citadel。网友因此调侃,Leopold 忙着结婚,已经离婚的 Citadel 创始人 Ken Griffin 忙着赚钱。
CNBC
🤡4
Arena上线AutoEval:AI先模拟真人打分,新模型1小时就能出分
大模型竞技评测平台 Arena 推出 AutoEval,用奖励模型(学习真人偏好的评分模型)模拟用户投票,为新模型快速生成排行榜分数。新模型发布后,不用等待数天积累真人票数,最快不到 1 小时就能获得预估排名。该分数会标注为 AutoEval,后续再由真人投票结果校正。
这套系统基于数百万组真实用户偏好数据训练。评测时,AutoEval 会比较不同模型的回答质量,并按照 Arena 原有排行榜规则计算分数。目前它支持文本、视觉、生图和代码模型评测。
Arena 回测显示,AutoEval 与后续真人排名的相关性超过 0.98。两款模型真实分差超过 10 分时,它判断胜负的准确率超过 90%;分差超过 15 分时达到 100%。
Arena
大模型竞技评测平台 Arena 推出 AutoEval,用奖励模型(学习真人偏好的评分模型)模拟用户投票,为新模型快速生成排行榜分数。新模型发布后,不用等待数天积累真人票数,最快不到 1 小时就能获得预估排名。该分数会标注为 AutoEval,后续再由真人投票结果校正。
这套系统基于数百万组真实用户偏好数据训练。评测时,AutoEval 会比较不同模型的回答质量,并按照 Arena 原有排行榜规则计算分数。目前它支持文本、视觉、生图和代码模型评测。
Arena 回测显示,AutoEval 与后续真人排名的相关性超过 0.98。两款模型真实分差超过 10 分时,它判断胜负的准确率超过 90%;分差超过 15 分时达到 100%。
Arena
X (formerly Twitter)
Arena.ai (@arena) on X
Today we’re launching AutoEval: a new evaluation methodology that ranks models using reward models based on millions of real Arena user preferences.
Highlights:
- High-quality evaluation signals calibrated on real preference data
- Strong alignment with…
Highlights:
- High-quality evaluation signals calibrated on real preference data
- Strong alignment with…
❤2👍1
动察Beating AI News
传GPT-6已内测近两个半月,能力疑似逼近AGI OpenAI CEO Sam Altman 下周将向美国政府和议员介绍下一代模型。官方没有公布型号,但社区已把近期线索拼成一张「GPT-6」能力图谱。 OpenAI 已确认,推翻 Erdős 单位距离猜想、在 NanoGPT 竞赛中突破沙箱,以及拆分认证令牌绕过扫描器,来自同一款长期任务模型。它能持续追踪目标。遇到限制后,它不会立即放弃,还会主动寻找系统漏洞。 这款模型最迟在 5 月上旬已经投入测试。它当时向 NanoGPT 仓库提交了 PR #287。5…
OpenAI向美国官员展示新模型Astra:多个Agent可长期协作解决难题
《The Information》援引三名知情人士称,OpenAI 正在测试一条暂称 Astra 的新模型线。它与 Sol、Terra、Luna 并列,主打让多个 Agent 长时间协作,处理复杂项目和高难度数学问题。
OpenAI CEO Sam Altman 本周已在华盛顿向政策制定者和监管机构演示 Astra。具体发布时间尚未确定。
Astra 是暂定名称,最终归入哪一代 GPT 也没有敲定。OpenAI 正在考虑 GPT-6,也可能继续放在 GPT-5 系列,例如 GPT-5.7。
Astra 计划成为首批在公开发布前,按美国政府新框架开放给联邦机构评估的模型。这套机制主要检查模型的高级网络能力,名义上自愿,也不要求政府批准后才能发布。
The Information
《The Information》援引三名知情人士称,OpenAI 正在测试一条暂称 Astra 的新模型线。它与 Sol、Terra、Luna 并列,主打让多个 Agent 长时间协作,处理复杂项目和高难度数学问题。
OpenAI CEO Sam Altman 本周已在华盛顿向政策制定者和监管机构演示 Astra。具体发布时间尚未确定。
Astra 是暂定名称,最终归入哪一代 GPT 也没有敲定。OpenAI 正在考虑 GPT-6,也可能继续放在 GPT-5 系列,例如 GPT-5.7。
Astra 计划成为首批在公开发布前,按美国政府新框架开放给联邦机构评估的模型。这套机制主要检查模型的高级网络能力,名义上自愿,也不要求政府批准后才能发布。
The Information
The Information
Exclusive: OpenAI Previews ‘Astra’ AI Model in DC
OpenAI is preparing to release a new model family, tentatively using the name “Astra,” with improved abilities to complete long-running tasks, according to three people briefed on the plans.
OpenAI CEO Sam Altman demonstrated Astra to policymakers and…
OpenAI CEO Sam Altman demonstrated Astra to policymakers and…
❤1
动察Beating AI News
DeepSeek-V4-Flash正式版发布,V4-Pro还得等 DeepSeek 发布 V4-Flash 正式版 API,重点提升编程、工具调用和长任务执行能力。官方称,多项 Agent 基准成绩大幅超过此前的 V4-Pro-Preview。 新版本原生支持 Responses API,并针对 Codex 做了适配。模型结构和参数规模没有变化,主要重新进行了后训练。 本次只升级 API 接口,DeepSeek App 和网页端没有更新。V4-Pro 正式版仍未发布,官方称将尽快上线。 DeepSeek
DeepSeek没把新版能力锁在API,V4-Flash正式版权重开源
DeepSeek 已在 Hugging Face 放出 V4-Flash-0731 正式版权重,并继续采用 MIT 许可证。开发者可以自行部署、微调和商用,不必只能通过 DeepSeek 官方 API 使用。
这次开放的是刚完成后训练升级的正式版。它在多项 Agent 测试中超过 V4-Pro-Preview,相关能力现在也能由第三方独立部署和复测。
Hugging Face
DeepSeek 已在 Hugging Face 放出 V4-Flash-0731 正式版权重,并继续采用 MIT 许可证。开发者可以自行部署、微调和商用,不必只能通过 DeepSeek 官方 API 使用。
这次开放的是刚完成后训练升级的正式版。它在多项 Agent 测试中超过 V4-Pro-Preview,相关能力现在也能由第三方独立部署和复测。
Hugging Face
huggingface.co
deepseek-ai/DeepSeek-V4-Flash-0731 · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
👍10❤1
动察Beating AI News
前OpenAI CTO新模型Inkling-Small开源:参数不到Inkling三成,性能只差1分 OpenAI 前 CTO Mira Murati 创办的 Thinking Machines Lab 发布 Inkling-Small,并开放完整权重。这是一款多模态推理模型,支持文字、图片和音频输入。和 Inkling 一样,模型采用 Apache 2.0 许可证。 Inkling-Small 共有 2760 亿参数,每次激活 120 亿。Inkling 则有 9750 亿总参数,激活 410 亿。Artificial…
Thinking Machines提出分级开源:先API、再微调、最后放权重
OpenAI 前 CTO Mira Murati 创办的 Thinking Machines Lab 提出一套开源模型的安全路线。模型先通过受限 API 提供给防御机构,再逐步开放受监控使用和托管微调。只有模型风险可控,外部防御体系也准备好,团队才考虑公开权重。公开权重并非默认终点,任何阶段都可以暂停。
团队以 Inkling 和 Inkling-Small 为例。两款模型接受了内部评测、4 家独立机构测试,以及专门去除拒答限制的微调。结果显示,它们在生化、网络攻击和失控风险上,没有明显超过现有开源模型。团队因此判断,公开权重不会增加实质性风险。
Thinking Machines 还在研究从训练数据中剔除危险知识,尽量保留模型的通用能力,同时削弱生化和网络攻击能力。
Thinking Machines
OpenAI 前 CTO Mira Murati 创办的 Thinking Machines Lab 提出一套开源模型的安全路线。模型先通过受限 API 提供给防御机构,再逐步开放受监控使用和托管微调。只有模型风险可控,外部防御体系也准备好,团队才考虑公开权重。公开权重并非默认终点,任何阶段都可以暂停。
团队以 Inkling 和 Inkling-Small 为例。两款模型接受了内部评测、4 家独立机构测试,以及专门去除拒答限制的微调。结果显示,它们在生化、网络攻击和失控风险上,没有明显超过现有开源模型。团队因此判断,公开权重不会增加实质性风险。
Thinking Machines 还在研究从训练数据中剔除危险知识,尽量保留模型的通用能力,同时削弱生化和网络攻击能力。
Thinking Machines
Thinking Machines Lab
A Safe Path to Open Weights
Strategic openness can strengthen AI safety and support broader access as defenses and safety science mature.
❤2😁1
动察Beating AI News
DeepSeek-V4-Flash正式版发布,V4-Pro还得等 DeepSeek 发布 V4-Flash 正式版 API,重点提升编程、工具调用和长任务执行能力。官方称,多项 Agent 基准成绩大幅超过此前的 V4-Pro-Preview。 新版本原生支持 Responses API,并针对 Codex 做了适配。模型结构和参数规模没有变化,主要重新进行了后训练。 本次只升级 API 接口,DeepSeek App 和网页端没有更新。V4-Pro 正式版仍未发布,官方称将尽快上线。 DeepSeek
CC Switch升级:DeepSeek-V4-Flash接Codex终于不用后台中转
开源模型切换工具 CC Switch 发布 v3.19.1,支持 DeepSeek-V4-Flash 的原生 Responses API。用户填入 DeepSeek API Key,就能在 Codex 中直接调用这款模型。
旧版也能接入 DeepSeek,但必须开启 CC Switch 的本地路由,把 Codex 请求转换成另一种接口格式。新版直接连接 DeepSeek 官方接口,使用时不再依赖后台代理。
目前只有 V4-Flash 支持这种直连方式。V4-Pro 仍需走旧路由,DeepSeek 预计在 8 月上旬为它加入 Responses API。
CC Switch
开源模型切换工具 CC Switch 发布 v3.19.1,支持 DeepSeek-V4-Flash 的原生 Responses API。用户填入 DeepSeek API Key,就能在 Codex 中直接调用这款模型。
旧版也能接入 DeepSeek,但必须开启 CC Switch 的本地路由,把 Codex 请求转换成另一种接口格式。新版直接连接 DeepSeek 官方接口,使用时不再依赖后台代理。
目前只有 V4-Flash 支持这种直连方式。V4-Pro 仍需走旧路由,DeepSeek 预计在 8 月上旬为它加入 Responses API。
CC Switch
GitHub
Releases · farion1231/cc-switch
A cross-platform desktop All-in-One assistant for Claude Code, Codex, OpenCode, OpenClaw, Grok Build & Hermes Agent. Only official website: ccswitch.io - farion1231/cc-switch
🔥1
YC开源内部多Agent平台QM,让公司拥有自己的AI员工团队
Y Combinator 开源内部使用的多 Agent 平台 QM。它类似 Hermes、OpenClaw,允许企业创建、管理和协作多个 AI Agent。
QM 支持 Slack 和网页界面,采用 MIT 开源协议。YC 已将它用于财务、法律、活动和工程等内部工作,也用于开发 QM 本身。
GitHub 仓库
Y Combinator 开源内部使用的多 Agent 平台 QM。它类似 Hermes、OpenClaw,允许企业创建、管理和协作多个 AI Agent。
QM 支持 Slack 和网页界面,采用 MIT 开源协议。YC 已将它用于财务、法律、活动和工程等内部工作,也用于开发 QM 本身。
GitHub 仓库
Altman回应Kimi K3:部分速度档位OpenAI更划算
OpenAI CEO Sam Altman 在《Invest Like the Best》播客中回应月之暗面的开源旗舰模型 Kimi K3。主持人称它是本周最值得关注的 AI 发布,并追问它是否会成为类似 DeepSeek 的里程碑事件。
Altman 没有正面回答 Kimi K3 是否具有里程碑意义,也没有给出能力对比结果。他强调,OpenAI 要在不同速度和价格档位上提供最划算的模型,并称在特定延迟要求下,OpenAI 目前比 Kimi 更划算。不过,他没有说明具体型号、价格或测试条件。
Altman 承认,廉价模型和开放权重模型会长期存在。部分用户需要自己部署和修改权重,开源模型因此会一直有市场。OpenAI 也会用自家大模型蒸馏出更小、更便宜的模型。
对于 OpenAI 模型被竞争者蒸馏的担忧,Altman 称这不在他最担心的十件事里。他认为 OpenAI 未来会拥有巨大的推理需求,即使利润率不高,收入规模也足以继续承担昂贵的模型训练。
Invest Like the Best
OpenAI CEO Sam Altman 在《Invest Like the Best》播客中回应月之暗面的开源旗舰模型 Kimi K3。主持人称它是本周最值得关注的 AI 发布,并追问它是否会成为类似 DeepSeek 的里程碑事件。
Altman 没有正面回答 Kimi K3 是否具有里程碑意义,也没有给出能力对比结果。他强调,OpenAI 要在不同速度和价格档位上提供最划算的模型,并称在特定延迟要求下,OpenAI 目前比 Kimi 更划算。不过,他没有说明具体型号、价格或测试条件。
Altman 承认,廉价模型和开放权重模型会长期存在。部分用户需要自己部署和修改权重,开源模型因此会一直有市场。OpenAI 也会用自家大模型蒸馏出更小、更便宜的模型。
对于 OpenAI 模型被竞争者蒸馏的担忧,Altman 称这不在他最担心的十件事里。他认为 OpenAI 未来会拥有巨大的推理需求,即使利润率不高,收入规模也足以继续承担昂贵的模型训练。
Invest Like the Best
YouTube
Sam Altman on AGI, Compute, and Human Agency
Sam Altman joins us for a wide-ranging conversation about OpenAI’s next chapter, the race for compute, and what happens as artificial intelligence becomes more powerful, abundant, and embedded across the economy. He explains why OpenAI recently narrowed its…
❤1
动察Beating AI News
Hugging Face遭AI Agent入侵,幕后黑手竟是OpenAI测试模型 Hugging Face 此前披露,一套来源不明的自主 AI Agent 入侵了生产系统。OpenAI 现在确认,这套 Agent 由多个内部测试模型驱动,包括 GPT-5.6 Sol 和一款能力更强的预发布模型。 OpenAI 当时正让模型参加 ExploitGym 网络安全评测。为了测试能力上限,团队降低了模型对网络攻击任务的拒绝,并关闭了平时用于拦截高风险行为的生产级分类器。 模型原本只需完成基准题,却发现软件代理中的零日漏洞,逃出…
OpenAI模型攻入Hugging Face,Altman称AI开发可能要减速
OpenAI CEO Sam Altman 表示,Hugging Face 入侵事件让他第一次切身感到前沿模型的安全风险。OpenAI 事发后暂停训练。他认为,如果模型继续以现在的速度变强,行业可能需要放慢开发,给社会留出补上防线的时间。
这起事故发生在 OpenAI 内部网络安全评测中。GPT-5.6 Sol 和一款更强的预发布模型,为测试被降低了网络攻击拒答限制。它们先利用零日漏洞突破 OpenAI 沙箱,取得互联网访问;随后又利用被盗凭据和漏洞进入 Hugging Face 生产数据库,直接取得测试答案。
Altman 说,短期可以暂停训练、修补漏洞和加固沙箱。但两个月后的模型还会更强,短期措施解决不了能力持续增长的问题。长期难题是如何控制开发速度,又不让规则变成头部公司排除竞争的工具,也不让前沿实验室被视为串通。
Invest Like The Best
OpenAI CEO Sam Altman 表示,Hugging Face 入侵事件让他第一次切身感到前沿模型的安全风险。OpenAI 事发后暂停训练。他认为,如果模型继续以现在的速度变强,行业可能需要放慢开发,给社会留出补上防线的时间。
这起事故发生在 OpenAI 内部网络安全评测中。GPT-5.6 Sol 和一款更强的预发布模型,为测试被降低了网络攻击拒答限制。它们先利用零日漏洞突破 OpenAI 沙箱,取得互联网访问;随后又利用被盗凭据和漏洞进入 Hugging Face 生产数据库,直接取得测试答案。
Altman 说,短期可以暂停训练、修补漏洞和加固沙箱。但两个月后的模型还会更强,短期措施解决不了能力持续增长的问题。长期难题是如何控制开发速度,又不让规则变成头部公司排除竞争的工具,也不让前沿实验室被视为串通。
Invest Like The Best
YouTube
Sam Altman on AGI, Compute, and Human Agency
Sam Altman joins us for a wide-ranging conversation about OpenAI’s next chapter, the race for compute, and what happens as artificial intelligence becomes more powerful, abundant, and embedded across the economy. He explains why OpenAI recently narrowed its…
👍2
动察Beating AI News
Patel 同时是投资人,已入股约 20 家 AI 初创公司,包括 Mira Murati 创办的 Thinking Machines Lab,以及去年与英伟达达成超过 9 亿美元授权合作的芯片公司 Enfabrica。SemiAnalysis 研报写到这些公司时,不会像传统媒体那样主动披露 Patel 的投资关系,对它们的竞争对手也照常覆盖。
SemiAnalysis要募4亿美元基金:边写AI芯片研报边投资
芯片与 AI 基础设施研究机构 SemiAnalysis 正筹集一只 4 亿美元风投基金。美国 SEC 文件显示,基金名为 SemiAnalysis Capital Fund I,由创始人 Dylan Patel 管理。
Patel 已持股约 20 家初创公司,包括 Thinking Machines Lab 和芯片公司 Enfabrica。他此前还募集 5000 万美元,专门投资 AI 基础设施公司 Fluidstack。
SemiAnalysis 过去靠研究芯片和 AI 基础设施建立影响力,现在开始大规模募集资金,直接投资自己长期关注的行业。它可能一边评价相关公司,一边持有这些公司的股份,今后如何披露投资关系会更加重要。
The Information
芯片与 AI 基础设施研究机构 SemiAnalysis 正筹集一只 4 亿美元风投基金。美国 SEC 文件显示,基金名为 SemiAnalysis Capital Fund I,由创始人 Dylan Patel 管理。
Patel 已持股约 20 家初创公司,包括 Thinking Machines Lab 和芯片公司 Enfabrica。他此前还募集 5000 万美元,专门投资 AI 基础设施公司 Fluidstack。
SemiAnalysis 过去靠研究芯片和 AI 基础设施建立影响力,现在开始大规模募集资金,直接投资自己长期关注的行业。它可能一边评价相关公司,一边持有这些公司的股份,今后如何披露投资关系会更加重要。
The Information
The Information
Exclusive: SemiAnalysis’ Dylan Patel Targets $400 Million Venture Capital Fund
A new venture capital fund called SemiAnalysis Capital Fund I, managed by Dylan Patel, the founder of chip and infrastructure research firm SemiAnalysis, is targeting raising $400 million, according to a securities filing.
The Information reported in…
The Information reported in…
👍1🤯1
动察Beating AI News
OpenAI以8520亿美元估值完成1220亿美元融资,首次向散户开放入股通道 OpenAI 宣布完成硅谷史上最大规模融资,总额 1220 亿美元,投后估值 8520 亿美元。该轮融资在今年 2 月公布的 1100 亿美元战略投资人承诺基础上,额外募集了 120 亿美元,其中 30 亿美元首次来自个人投资者。 此前公布的 1100 亿美元承诺中,亚马逊出资 500 亿美元(150 亿美元即时到账,350 亿美元在 OpenAI 上市或实现 AGI 后跟投),英伟达和软银各出资 300 亿美元。Andreessen…
亚马逊提前兑现500亿美元承诺,OpenAI最后213亿美元到账
亚马逊已完成对 OpenAI 的 500 亿美元投资。这不是新一轮融资,而是 2 月公布的 1100 亿美元融资完成交割。
亚马逊第一季度先投入 150 亿美元,第二季度追加 137 亿美元。6 月 30 日后,公司又买入 213 亿美元 OpenAI 优先股,至此全部投完。亚马逊由此持有 OpenAI 约 5% 股份。
原协议允许亚马逊自行决定提前投资。OpenAI 上市或达到特定技术里程碑后,剩余投资才会变成强制义务,最晚期限为 2028 年底。相关条件尚未触发,亚马逊仍选择提前付清。
FT
亚马逊已完成对 OpenAI 的 500 亿美元投资。这不是新一轮融资,而是 2 月公布的 1100 亿美元融资完成交割。
亚马逊第一季度先投入 150 亿美元,第二季度追加 137 亿美元。6 月 30 日后,公司又买入 213 亿美元 OpenAI 优先股,至此全部投完。亚马逊由此持有 OpenAI 约 5% 股份。
原协议允许亚马逊自行决定提前投资。OpenAI 上市或达到特定技术里程碑后,剩余投资才会变成强制义务,最晚期限为 2028 年底。相关条件尚未触发,亚马逊仍选择提前付清。
FT
❤3😁1
Google AI Studio手机App胎死腹中:80万人预约,功能转入Gemini
谷歌放弃原定推出的 Google AI Studio iOS 和 Android App。它原本要把 AI Studio 的应用生成和代码修改功能搬到手机,让用户随时用提示词做软件。已有约 80 万人预约,但谷歌决定不再发布独立 App。
应用生成功能将直接嵌入 Gemini。未来用户可以在普通对话中描述需求,让 Gemini 生成对应应用。该功能计划覆盖手机和桌面端,具体上线时间尚未公布。
Google AI Studio 网页版会继续开发,仍面向希望从提示词一路做到完整产品的用户。
Google AI Studio
谷歌放弃原定推出的 Google AI Studio iOS 和 Android App。它原本要把 AI Studio 的应用生成和代码修改功能搬到手机,让用户随时用提示词做软件。已有约 80 万人预约,但谷歌决定不再发布独立 App。
应用生成功能将直接嵌入 Gemini。未来用户可以在普通对话中描述需求,让 Gemini 生成对应应用。该功能计划覆盖手机和桌面端,具体上线时间尚未公布。
Google AI Studio 网页版会继续开发,仍面向希望从提示词一路做到完整产品的用户。
Google AI Studio
动察Beating AI News
Kimi K3接入Claude Code,平均任务成本是Kimi Code的9倍 AI Agent 基础设施公司 Composio 将同一款 Kimi K3 接入 Kimi Code、Hermes 和 Claude Code,完成 28 项相同任务。三套运行框架的成功数只差 2 项,Token 用量和成本却相差很大。 Kimi Code 完成 22 项,Hermes 完成 21 项,Claude Code 完成 20 项。单项任务 Token 中位数分别为 6.1 万、6.7 万和 34 万。Composio…
Claude Code跑Kimi K3最贵最慢,成本是Hermes Agent近4倍
AI Agent 基础设施公司 Composio 扩大测试,把同一款 Kimi K3 接入 6 套 Agent 框架,完成 26 项相同任务。这里比较的是运行框架,底层模型均为 Kimi K3。
Kimi Code 完成 21 项排名第一。Hermes 完成 20 项,Pi Agent 和 Claude Code 均为 19 项,OpenCode 为 18 项,Codex 以 17 项垫底。
按 Kimi K3 官方价格估算,Hermes 和 Pi Agent 平均每项任务成本最低,分别为 0.39 美元和 0.40 美元。Claude Code 达到 1.47 美元,约为 Hermes 的 3.8 倍。
Pi Agent 速度最快,单项任务中位耗时为 161.7 秒。Claude Code 最慢,达到 347.6 秒。同一模型换套框架,成功数最多只差 4 项,平均成本却相差近 4 倍,耗时相差超过 2 倍。
Composio
AI Agent 基础设施公司 Composio 扩大测试,把同一款 Kimi K3 接入 6 套 Agent 框架,完成 26 项相同任务。这里比较的是运行框架,底层模型均为 Kimi K3。
Kimi Code 完成 21 项排名第一。Hermes 完成 20 项,Pi Agent 和 Claude Code 均为 19 项,OpenCode 为 18 项,Codex 以 17 项垫底。
按 Kimi K3 官方价格估算,Hermes 和 Pi Agent 平均每项任务成本最低,分别为 0.39 美元和 0.40 美元。Claude Code 达到 1.47 美元,约为 Hermes 的 3.8 倍。
Pi Agent 速度最快,单项任务中位耗时为 161.7 秒。Claude Code 最慢,达到 347.6 秒。同一模型换套框架,成功数最多只差 4 项,平均成本却相差近 4 倍,耗时相差超过 2 倍。
Composio
动察Beating AI News
OpenAI向美国官员展示新模型Astra:多个Agent可长期协作解决难题 《The Information》援引三名知情人士称,OpenAI 正在测试一条暂称 Astra 的新模型线。它与 Sol、Terra、Luna 并列,主打让多个 Agent 长时间协作,处理复杂项目和高难度数学问题。 OpenAI CEO Sam Altman 本周已在华盛顿向政策制定者和监管机构演示 Astra。具体发布时间尚未确定。 Astra 是暂定名称,最终归入哪一代 GPT 也没有敲定。OpenAI 正在考虑 GPT…
OpenAI新模型Astra首秀:一口气推进10道十年未解数学难题
OpenAI 首次正式公布下一款主力模型 Astra。内部版本在 10 个长期未解的数学和理论计算机科学问题上取得新结果。这些问题的核心结论至少 10 年没有进展,多数停滞时间更长。
其中一些问题被直接解决或推翻。Astra 首次构造出非 sofic 群,回答了群论中的一个核心开放问题;它还推翻 Connes 刚性猜想,并解决 3 个 Erdős 问题。其余成果包括球体堆积、编码理论、量子复杂性和后量子密码相关问题的新上下界与困难性证明。
OpenAI 称,模型找到这 10 项结果所用的 Token,按 Sol API 价格折算约为 2000 美元。
这些数学论证由 Astra 生成。人类随后协助整理成论文,模型再把每项证明转成 Lean 证书,让计算机逐步核验推导是否成立。OpenAI 已公开论文、证明证书和模型的推理过程。
OpenAI
OpenAI 首次正式公布下一款主力模型 Astra。内部版本在 10 个长期未解的数学和理论计算机科学问题上取得新结果。这些问题的核心结论至少 10 年没有进展,多数停滞时间更长。
其中一些问题被直接解决或推翻。Astra 首次构造出非 sofic 群,回答了群论中的一个核心开放问题;它还推翻 Connes 刚性猜想,并解决 3 个 Erdős 问题。其余成果包括球体堆积、编码理论、量子复杂性和后量子密码相关问题的新上下界与困难性证明。
OpenAI 称,模型找到这 10 项结果所用的 Token,按 Sol API 价格折算约为 2000 美元。
这些数学论证由 Astra 生成。人类随后协助整理成论文,模型再把每项证明转成 Lean 证书,让计算机逐步核验推导是否成立。OpenAI 已公开论文、证明证书和模型的推理过程。
OpenAI
👍7❤1
动察Beating AI News
DeepSeek V4正式版疑似延期至8月,或直接撞上下一代模型集中发布 DeepSeek V4 正式版(V4 GA)可能推迟到 8 月中旬发布。 网友爆料称,DeepSeek 即将为自研 Harness 工具启动封闭测试,并从问卷参与者中挑选少量用户。封闭测试结束后约 1 至 2 周会开放 V4 GA,发布时间可能在 8 月 10 日至 20 日之间。 如果消息属实,DeepSeek V4 正式版上线时可能会面对更强竞争。届时 GPT-6、Claude Fable 5.1、GLM-5.5 等下一代模型可能已经进入市场。…
DeepSeek Harness开始内测,申请者需要提交开源作品
DeepSeek Harness 开始面向开源项目开发者招募内测用户。申请者需要做过 Agent Harness 相关项目,并提交 GitHub ID 和代表作。
Harness 是包在大模型外的一套 Agent 执行框架,负责管理上下文、调用工具和完成任务。DeepSeek 今年上半年已组建专门团队,并招聘产品经理、研发工程师和研究员。
几天前,社区曾流传一份小范围内测通知,但真实性无法确认。现在负责人公开招募,直接确认 DeepSeek Harness 已进入内测。
Tianyi Cui
DeepSeek Harness 开始面向开源项目开发者招募内测用户。申请者需要做过 Agent Harness 相关项目,并提交 GitHub ID 和代表作。
Harness 是包在大模型外的一套 Agent 执行框架,负责管理上下文、调用工具和完成任务。DeepSeek 今年上半年已组建专门团队,并招聘产品经理、研发工程师和研究员。
几天前,社区曾流传一份小范围内测通知,但真实性无法确认。现在负责人公开招募,直接确认 DeepSeek Harness 已进入内测。
Tianyi Cui
🐳5❤1