动察Beating AI News
3.19K subscribers
902 photos
2 videos
1 file
3.44K links
AI新闻信息流
Download Telegram
动察Beating AI News
谷歌发布Gemini 3.6 Flash,Gemini 4也已启动预训练 谷歌发布 Gemini 3.6 Flash,主打编程、知识工作和多模态 Agent。新模型完成多步骤任务时,需要的推理步骤和工具调用更少。 Artificial Analysis 评测显示,它比 Gemini 3.5 Flash 少用 17% 的输出 Token。API 输入价格保持每百万 Token 1.5 美元,输出价格从 9 美元降至 7.5 美元。Token 用量和单价同时下降,Agent 执行长任务会更省钱。 性能也有提升。DeepSWE…
谷歌Gemini 3.5 Pro传8月10日发布,爆料称难敌OpenAI和Anthropic

爆料博主 Dan 称,谷歌可能在 8 月 10 日发布 Gemini 3.5 Pro。Dan 最初预告 8 月 12 日,数小时后又把日期改为 8 月 10 日。

谷歌 5 月曾称 Pro 版将在 6 月推出,但最终跳票。7 月 21 日,谷歌只表示模型正在与合作伙伴测试,准备好后会尽快开放。延迟与编程能力未达到内部目标有关。

Dan 还判断,新模型整体会很强,但未必能明显超过 Anthropic 和 OpenAI 的顶级模型。

Dan
👍4
Cursor重排GPU流水线,MoE模型训练提速41%

Cursor 开源 Mixture-of-Kittens(MoK),用于加速 MoE 大模型训练。它把原本分开的 GPU 数据传输和计算,合进一个 kernel(直接在 GPU 上运行的底层程序)。

MoE 会把模型拆成大量「专家」,每次只调用其中一部分。专家分散在不同 GPU 上,数据需要频繁搬运,有时会占掉一半以上的训练时间。

MoK 让 GPU 一边传数据,一边做计算,减少等待。在 512 块 GB300 GPU 的实际训练中,整体吞吐提高 41%。单独测试 MoE 层时,最高比公开方案快 2.37 倍。

MoK 已用于 Cursor 数万块 GPU 的 Composer 训练,并以 Apache 2.0 开源。目前只支持英伟达 Blackwell GPU,主要面向拥有 GB200、GB300 NVL72 集群的机构。

Cursor
1
研究人员造出会自己找漏洞、复制扩散的AI病毒,7天扩散到20台机器

多伦多大学、Vector Institute、剑桥大学和 ServiceNow 的研究人员,造出一种由开放权重大模型驱动的计算机蠕虫。它会扫描网络、识别目标机器的漏洞、生成攻击方案,并在攻陷设备后复制自己,继续攻击下一台机器。

团队在由 33 台虚拟机组成的隔离网络中进行了 15 轮实验,每轮持续 7 天。蠕虫平均获得 23.1 台机器的管理员权限,并在 20.4 台机器上启动新副本,最长连续传播 7 代。

与依赖预设攻击脚本的传统蠕虫相比,这套系统能根据每台机器的情况调整攻击方式。它还会读取模型训练结束后公开的漏洞资料,再把文字说明转成实际攻击步骤。

不过,这仍是实验室概念验证。测试网络里的每台机器都预埋了漏洞,没有杀毒软件或主动防御。主实验还依赖共享 GPU 池,模型和完整代码也没有公开。

论文
1
大模型也分满血版和缩水版:换家云厂商,能力可能差一倍

模型评测机构 Artificial Analysis 推出 API 准确率榜单,测试同一个开源模型,换到不同服务商后还能保留多少能力。首批测试 GLM-5.2、gpt-oss-120b 和 DeepSeek V4 Pro,共覆盖 44 个 API 端点。

服务商包括 AWS、微软 Azure、Google Vertex、Cloudflare,也有 Fireworks、DeepInfra、CoreWeave、SiliconFlow 等 AI 推理平台。Artificial Analysis 自行部署官方模型,把成绩记为 100%,再用相同题目测试各家 API。

结果显示,GLM-5.2 最差端点只有 52%,几乎砍半。gpt-oss-120b 得分在 70% 至 101% 之间。DeepSeek V4 Pro 最稳定,9 家服务商都在 97% 至 107%,官方 API 得分最高。

差距主要来自量化、输出长度、推理配置和工具调用处理。同一个模型名字,实际能力可能完全不同,选 API 不能只看价格和速度。

Artificial Analysis
👍3
梁文锋的幻方量化7月全线暴跌,9只产品都跌超20%

梁文锋旗下幻方量化 7 月遭遇大幅回撤。私募排排网公开展示的 9 只产品,单月净值全部下跌超过 20%。跌幅最大的是幻方中证500量化进取1号,单月下跌 22.15%。截至 7 月 31 日,仅 1 只产品保住 0.04% 的年内正收益,其余 8 只全部转亏。

这次并非幻方单独翻车。7 月 13 日至 17 日,中证500单周下跌约 11.7%,中证1000和中证2000均跌超 12%。同期,幻方 10 只量化多头产品一周全部跌超 15%。鸣石、平方和、九坤和明汯等头部机构也同步回撤。

业内将原因指向科技成长股和高动量策略过度拥挤。市场风格突然反转后,相似策略集中调仓,过去赚钱的因子迅速变成亏损来源。今年上半年,1236 只指数增强产品平均超额收益只有 3.11%,去年同期为 14.17%。

每日经济新闻
🤡5
豆包能边看边听边说了,还会主动提醒你

字节跳动 Seed 发布 SeedRealtime,并在豆包 App 上线。它能同时处理声音和画面,边看、边听、边回答。相比上一代只能听和说的 Seeduplex,这次新增了实时视觉能力。

用户可以让它盯着镜头找东西、检查操作或阅读文字。目标出现、画面变化或用户做错步骤时,它会主动提醒,不必等人提问。

在多人和嘈杂环境中,它还能判断谁在说话,并结合人脸、声音和手势理解上下文。字节称,其抢话、反应慢和噪声误触发等问题,比传统拼接方案减少约一半。

字节跳动
3
动察Beating AI News
中国AI应用最大单轮融资纪录诞生:演语科技获近3亿美元融资,ARR达3亿比肩Suno 国内AI创意内容集团演语科技(Evoken,旗下含LiblibAI、LibTV、星流)近日披露完成近3亿美元B+轮融资。该交易实际于今年上半年早些时候交割,投后估值超20亿美元,创国内AI应用赛道最高单轮纪录。领投方包括Granite Asia、腾讯与顺为资本,高榕、蚂蚁、红杉等老股东加码。 截至2026年5月,演语科技年度经常性收入(ARR)已达3亿美元,较交割时暴增近3倍。该收入规模在AI应用层已与全球头部应用S…
Lovart母公司演语科技拟赴港IPO,新融资估值冲向30亿美元

AI 设计 Agent Lovart 的母公司演语科技正与顾问初步讨论赴港 IPO。公司同时接近完成新一轮融资,估值或达 30 亿美元。

Lovart 面向设计师和创作者,可根据一句需求生成、修改并批量输出视觉素材。它不自研基础模型,主要调用 GPT、Gemini 等第三方模型。演语科技在国内还运营 LiblibAI、星流和 LibTV。

演语科技 6 月刚完成近 3 亿美元 B+ 轮融资,投后估值超过 20 亿美元。截至 5 月,公司 ARR(年化经常性收入)超过 3 亿美元。若新融资落地,其估值将在不到两个月内升至 30 亿美元。

彭博社
动察Beating AI News
只激活51亿参数,蚂蚁新模型11项测试超过万亿旗舰 蚂蚁百灵(Inclusion AI)发布 Ling-3.0-flash。模型共有 1240 亿参数,但激活参数只有 51 亿。 按官方公布的对比,它在 12 项基准中有 11 项超过 Ring-2.6-1T,激活参数仅为这款万亿旗舰的约十二分之一。 架构上,它将 Kimi Delta Attention 与 MLA 注意力层按 5:1 组合,以加强长文本记忆。模型原生支持 256K 上下文,最高可扩展至 100 万。 Ling-3.0-flash…
蚂蚁Ling-3.0-flash正式开源,FP8版仅128GB

蚂蚁百灵(inclusionAI)正式开放 Ling-3.0-flash 权重,同时提供 BF16 原版和 FP8 量化版。两版均采用 MIT 许可证,已上线 Hugging Face 和 ModelScope,可用 SGLang 或 vLLM 自行部署。

BF16 版权重约 255GB,FP8 版约 128GB,体积接近减半。FP8 用更低精度保存参数,可以降低存储和显存门槛。官方列出的 4 项测试中,FP8 与 BF16 的最大分差为 1.57 分。

Ling-3.0-flash 总参数 1240 亿,每次生成只激活 51 亿。模型支持 25.6 万 Token 上下文,主要面向编程、搜索、深度研究和工具调用等 Agent 任务。官方评测显示,它在多数基准上达到或超过万亿参数的前代模型 Ring-2.6-1T。

蚂蚁百灵
Cherry Studio 2.0发布:百万行代码重写,加入Agent模式

Cherry Studio 发布 2.0。这款多模型 AI 桌面客户端重写了底层架构、界面和数据系统,团队称累计修改超过百万行代码。Windows、macOS 和 Linux 均可使用,1.x 用户可以直接升级。

新版重点加入 Agent 模式。用户可以接入 Claude Code、Codex 等工具,让 AI 查资料、写文档、做演示、分析数据和修改代码。运行环境已经内置,不用再单独安装大量依赖。

2.0 还支持多窗口、分屏和本地知识库,并优化了长对话、大文件夹导入和历史记录加载。

Cherry Studio 正从多模型聊天客户端,变成一个集研究、办公和编程于一体的桌面 AI 工具。

Cherry Studio 2.0
💩9👍1
AI收入撑不起烧钱速度,谷歌搬出「自我进化」新故事

谷歌今年计划投入约 2000 亿美元建设 AI 数据中心和购买设备。在伯克利的一场 AI 峰会上,DeepMind 首席战略官 Jasjeet Sekhon 坦言,目前的 AI 收入还撑不起这样的资本开支,行业可能出现「钱花出去了,收入却没跟上」的空窗期。

Sekhon 为谷歌如此重金投入找到的长期理由是 RSI,也就是让 AI 参与研发下一代 AI,再用更强的模型继续改进算法、软件和训练方法。他称,RSI 已成为这轮巨额投资的关键逻辑,并把当前的投入称为「人类文明史上最大的科学赌注」。

但真正的 RSI 还没有出现。目前只能看到一些早期迹象,例如用模型优化算法,或辅助设计其他模型的部分组件。Sekhon 预计,RSI 可能在未来几年实现。

谷歌正在用一个尚未落地的技术目标,解释今天约 2000 亿美元的投入。

The Information
🤡3👍1
95后小伙用AI编「小作文」,炒纯碱赚8.5万被罚48.5万

四川证监局对个人投资者孙哲元作出处罚。他用 AI 批量生成 17 篇纯碱生产虚假文章,并发布在百度百家号「帝侃」上。传播期间,他交易纯碱期货,扣除手续费后获利 85028.85 元。监管没收全部收益,并罚款 40 万元,合计罚没约 48.5 万元。

这 17 篇文章围绕两条假消息。4 篇声称某纯碱企业锅炉故障,生产线至少停半年;另外 13 篇声称阿拉善地震导致工厂受损。两批文章发布后一天,合计阅读 8794 次。已有投资者向上市公司求证,也有人向监管平台举报。

孙哲元申辩称,文章没有造成实质影响,期货盈利也与假消息无关。他还称自己长期患有精神疾病。四川证监局全部驳回,认定其主观故意明显,也未能证明事发时无法辨认或控制自己的行为。监管同时明确,传播虚假信息期间的期货交易收益,可以直接认定为违法所得。

行政处罚决定书
😁1
Liquid AI发布2.6B参数端侧模型,3项评测超过Qwen3.5-9B

Liquid AI 发布 LFM2.5-2.6B,并开放模型权重。这款端侧 Agent 模型只有 26 亿参数,量化后内存占用约 2.5GB,在手机端也能达到每秒约 30 Token 的生成速度。

官方评测中,它在工具调用、多轮指令遵循和结构化输出三项测试上超过 Qwen3.5-9B。后者有 97 亿参数,接近它的 4 倍。不过,Qwen3.5-9B 在代码和部分复杂 Agent 任务中仍然领先。

Liquid AI
🔥1
Pokee发布1000万Token模型,上下文接近主流模型10倍

AI Agent 创业公司 Pokee AI 发布 Pokee-Isaac 28B。模型参数总量只有 280 亿,上下文窗口却达到 1000 万 Token。目前主流模型的上限约为 100 万 Token,Isaac 接近它们的 10 倍。

Pokee 自测中,Isaac 在 RULER 长文本测试里,从 25.6 万到 400 万 Token 一直保持在 95 分上下。拉满 1000 万 Token 后,得分仍有 93.3。其余五款对照模型从 200 万 Token 起都没有返回可用结果。

Pokee 把超长上下文归因于自研的「非纯 Decoder-only 架构」,即没有完全沿用常见大模型的纯解码器结构。不过,技术报告没有公开具体架构、注意力机制和显存方案,外界暂时无法判断它究竟怎么做到的。

Pokee AI 成立于 2024 年,由前 Meta 应用强化学习负责人朱哲清创办。公司曾获得 Point72 Ventures 领投的 1200 万美元种子轮,高通创投和 Samsung NEXT 等参投。

Pokee AI
🔥1
千问查漏洞3轮召回率追平Opus 5,成本只有一半

安全公司 Aikido 用代码审计 Agent 测试了 7 款模型,包括 Qwen3.8-Max、Claude Opus 5、Kimi K3 Max、DeepSeek V4 Flash,以及 GPT-5.6 Sol、Luna 和 Terra。测试包含 32 个近期公开漏洞,每款模型运行 3 次。

Qwen3.8-Max 三轮合计找到 26 个漏洞,召回率达到 81.3%,与 Opus 5 并列第一。它的 F1 综合分(兼顾漏报和误报)为 83.2%,略低于 Opus 5、Kimi K3 Max 和 GPT-5.6 Sol。

千问的问题是单次发挥不稳定。26 个漏洞中,只有 10 个连续三轮都能找到,Opus 5 和 Sol 都有 19 个。不过,千问总成本约 821 美元,只有 Opus 5 和 Sol 的一半,但仍是 DeepSeek V4 Flash 的 5 倍。

pilvar
🔥2
动察Beating AI News
Goodfire发布Silico:首个拆开AI黑箱、直接改行为的商用工具 AI 实验室 Goodfire 发布 Silico,一个将机械可解释性(mechanistic interpretability,通过映射模型内部神经元及其连接通路来理解模型行为的技术)包装成商用产品的平台。Goodfire 称 Silico 是首个覆盖数据集构建到模型训练全流程的同类工具。训练 AI 一直像炼金术,靠反复试错碰运气,Silico 想要把它变成精确工程。 Silico 支持查看单个神经元或神经元组,追踪上下游通路…
Goodfire让Agent替研究员跑AI实验,月费1000美元

AI 可解释性公司 Goodfire 开放研究工具 Silico。研究人员写下目标后,它会制定计划、同时运行多组实验、跟踪进度并整理结果。

Silico 能训练和优化模型、复现论文,也能排查数据和模型设计中的问题。研究人员仍需审核方案、调整方向,并判断最终结果。

Goodfire 用 Silico 分析了总参数达 2.8 万亿的 Kimi K3。它找到模型内部控制写作风格的特征,再调节这些特征,让 Kimi K3 改用「海盗口吻」回答。

Silico 目前通过 macOS 客户端使用。个人版每月 1000 美元,使用 Goodfire 的 GPU 需另付费,也能接入自己的服务器。

Goodfire
👏1
Mistral发布3B多模态审核模型,改一句Prompt就能换规则

欧洲 AI 独角兽 Mistral 推出内容审核模型 Shieldstral。模型只有 30 亿参数,可以检查文字、图片和图文内容,也能判断 AI 是否应该拒绝回答。

不少传统审核模型会预先设定色情、暴力、仇恨等类别。审核标准变化后,通常需要补充数据,再训练或微调模型。

Shieldstral 可以直接读取自然语言规则。开发者改一下审核要求,就能换一套标准,不必重新训练模型。

模型支持中文等 12 种语言,采用 Apache 2.0 许可。官方称,单张 16GB 显存的英伟达显卡即可运行,文本审核成绩与参数量大约 7 倍的 GPT-OSS-Safeguard-20B 持平。

Mistral
🥰1
动察Beating AI News
前OpenAI首席科学家Ilya秘密研究被扒:要让AI像人一样边干边学 SSI 至今没有发布模型,一名海外博主却从公开线索中拼出了它可能的研究方向:让 AI 在部署后继续学习,而不是训练结束就停止进步。 线索主要来自 Ilya Sutskever 本人。他多次称,现有模型最大的缺陷是泛化能力远弱于人类。他理想中的 AI 像一个「超级智能的 15 岁少年」,能进入任何行业,再通过少量经验快速学会工作。 《华尔街日报》还称,SSI 正在研究「人脑运作中被忽视的部分」。英伟达看过其保密研究后决定投资,并帮助…
前OpenAI首席科学家Ilya终于要出牌,SSI首个模型或在8月亮相

前 OpenAI 首席科学家 Ilya Sutskever 创办的 AI 实验室 Safe Superintelligence(SSI),可能在 8 月发布模型。

Atreides Management 管理合伙人兼 CIO Gavin Baker 在播客《Invest Like The Best》中透露:「SSI 说他们会在 8 月推出模型。」

SSI 成立两年来一直秘密研发,没有发布模型或披露技术细节。7 月底,它刚与英伟达达成长期合作,算力计划扩大约 10 倍。英伟达还向 SSI 投资了 50 亿美元。Ilya 当时表示,团队已经有「值得扩大规模」的研究成果。

Invest Like The Best
👍1
动察Beating AI News
Sand.ai获超亿美元融资:坚持自回归视频路线,计划7月发布开源MoE大模型 视频生成大模型公司 Sand.ai(成立于 2024 年 1 月)宣布完成两轮合计超亿美元的融资。投资方包括 Look Capital、Lollapalooza Capital(王慧文家办)、九坤创投、经纬创投、和玉资本(MSA Capital)、创新工场、源码资本、IDG、百度风投等多家一线机构。本轮融资由星涵资本担任财务顾问。 Sand.ai 创始人曹越在接受采访时表示,团队一直坚持被视作非共识的自回归(Autoreg…
Sand.ai开源全球首个千亿级视频MoE模型MAGI-2 Preview

Sand.ai 发布并开源 MAGI-2 Preview,这是全球首个千亿级开源 MoE 视频生成模型。模型总参数约 114B,但每次只激活约 6B。

模型支持文生视频和图生视频,可以同时生成画面、对白、音乐和环境声。目前单次固定生成 10 秒内容,再将画面提升到 1080p。

不过,参数更大不代表效果更强。MiniMax H3 的生成主干是 33B 稠密模型,在 Artificial Analysis 有声图生视频榜单中排名第三,高于 MAGI-2 的第六。MAGI-2 的主要亮点,是把视频模型扩到千亿参数,同时把单次激活压到约 6B。

模型采用 Apache 2.0 许可,完整权重约 307GB,本地运行需要 8 张英伟达 Hopper GPU。

Sand.ai
👏1
Mechanize刚估值5亿美元,谷歌拟花超15亿美元挖团队

谷歌正与 AI 创业公司 Mechanize 谈判,交易规模超过 15 亿美元。谷歌计划招募部分员工,同时获得其技术的非独家授权。相关人员将参与模型评测和研发。

Mechanize 不直接提供编程助手式产品。它为 AI 编程 Agent 搭建训练和评测环境,让模型开发功能、部署应用或排查代码问题,再根据完成情况打分。这些数据可以继续用于强化学习,提升模型的编程能力。

Mechanize 于 2025 年成立。今年 4 月,它刚以 5 亿美元投后估值融资 910 万美元。谷歌拟议交易的金额,已经达到这笔估值的 3 倍以上。

谷歌此前也用过同一套方式。去年,它花费约 24 亿美元获得 Windsurf 技术授权,并招募其 CEO 和部分研发人员。公司留在原地,核心人才和技术先进入谷歌。

Business Insider
👏1
DeepMind CEO哈萨比斯转任Alphabet首席科学家,Jeff Dean离职创业

谷歌宣布调整 AI 管理层。Google DeepMind CEO Demis Hassabis 将卸任 CEO,转任 Google DeepMind 董事长,并出任谷歌母公司 Alphabet 首席科学家,负责集团 AI 长期研究方向,同时继续领导 AI 制药公司 Isomorphic Labs。

Google DeepMind CTO Koray Kavukcuoglu 将接管团队日常运营。目前谷歌尚未任命新的 CEO。

与此同时,原 Alphabet 首席科学家 Jeff Dean 将与 Oriol Vinyals、Quoc Le 等人离职创业,成立 AI 科研公司 Discovery Loop,Alphabet 计划投资这家公司并提供谷歌云资源。

Axios
🤡1