动察Beating AI News
3.18K subscribers
902 photos
2 videos
1 file
3.44K links
AI新闻信息流
Download Telegram
腾讯发布Hy ASR 3.0:普通话、英语、粤语错误率全部压到3%

腾讯混元发布 Hy ASR 3.0 preview,并已在元宝和腾讯云上线。官方测试显示,其普通话词错误率为 3.34%,英语为 2.62%,粤语为 3.12%。

新模型把 Hy3 大语言模型接入语音识别系统。它会结合整段话判断同音词,不再只根据单个词的发音转写。例如一句话存在多个同音候选时,模型会根据前后文选择更合理的写法。

Hy ASR 3.0 还加强了方言、专业名词、中英混说、噪声和耳语识别。训练数据覆盖数千万小时语音,以及 10 大方言片区和 20 多个细分片区。

腾讯混元
1
YC创业公司拿纹身换面试:7人真纹了,创始人道歉

YC 2026 夏季批次 AI 创业公司 LemonLime 在旧金山办派对,现场请来纹身师,承诺给纹公司相关图案的人「直接面试」。LemonLime 主要帮小企业创建 AI 自动化工作流。

联合创始人 Jordan Zietz 随后发帖称,7 人带着永久纹身离场。他还写道,任何纹 LemonLime 图案的人都能立刻获得面试,并提醒准备申请工作的人「记好笔记」。

事件引发批评后,Zietz 删除原帖并道歉。他承认,把永久纹身与工作机会挂钩,忽视了求职者的压力和双方的权力差。面试并不以纹身为条件,并愿意为后悔者支付洗纹身费用。

目前,7 名参与者均已完成或安排面试,仍在招聘流程中。

The San Francisco Standard
💩8😁1🤮1🤣1
ChatGPT拿走美国众议院近九成AI支出,是Claude的7.6倍

CNBC 梳理美国众议院公开支出记录发现,在截至 2026 年 3 月 31 日的一年里,可识别的 AI 工具支出至少为 11.37 万美元。

其中,ChatGPT 获得 10.06 万美元,共 798 笔,占总额 88%。Claude 排名第二,只有 1.32 万美元,共 37 笔。

ChatGPT 已出现在至少 71 个议员办公室,约占众议院六分之一。工作人员用它总结法案、写备忘录、准备听证会材料、回复选民和起草社交媒体内容。

这份数据没有统计免费账号、软件套餐内置的 AI 功能和大部分参议院支出。但在能查到的独立 AI 工具付费记录里,ChatGPT 已经远远甩开其他产品。

CNBC
动察Beating AI News
Gemini 桌面端接入 Spark 智能体:打通本地自动化与手机远程操控 谷歌宣布在 macOS 桌面端 Gemini 中集成 Spark 智能体,把它从简单的聊天框变成了能够操控电脑的本地助手。 在获得授权后,Gemini Spark 能接手桌面上的琐碎工作,比如自动把下载文件夹里的所有 PDF 整理到不同目录,或者读取本地发票并在 Google Workspace 中自动生成预算电子表格,甚至能设置定时更新。 另一个亮点是即将推出的远程执行能力。未来即使人不在电脑旁,也能通过手机向这台 Mac…
谷歌让Gemini Spark接管Chrome:约看房、订机票都能代办

谷歌把 Gemini Spark 接入 Chrome 的自动浏览功能。获得用户许可后,它可以调用已经登录的网站账号,替用户完成复杂的网页任务。

比如,用户收藏了几套公寓,Spark 可以逐个联系中介并预约看房。它也能搜索航班、比较价格,并把订票流程推进到付款前。

执行任务时,Spark 会自己打开网页、点击按钮和填写表单。遇到付款、注册账号或提交敏感信息等操作,它会暂停,让用户确认后再继续。

该功能先向美国桌面版 Chrome 用户开放,需订阅 Google AI Pro 或 Ultra。谷歌提醒,Agent 仍可能点错按钮或误操作,重要步骤需要用户检查。

谷歌
2
动察Beating AI News
AI搜索引擎Exa完成2.5亿美元C轮融资,估值一年翻三倍 专为 AI Agent 构建底层搜索基础设施的 Exa 宣布完成 2.5 亿美元 C 轮融资,由 a16z 领投,投后估值从去年 9 月的 7 亿美元飙升至 22 亿美元。本轮资金将用于扩充专有索引库、训练新一代检索模型,并将底层吞吐量扩容至每秒数十万次并发请求。 Exa 强调其核心护城河是「全栈自建」:拥有独立爬虫、追踪超五千亿 URL 的原生索引系统、自研 embedding 模型及第三代向量数据库,彻底告别业内普遍的「套壳谷歌」方案。这套专为…
AI搜索引擎Exa称已收录800亿网页,明年要追上谷歌规模

AI 搜索引擎 Exa CEO Will Bryk 称,Exa 目前可提供 800 亿个网页,并追踪 1.4 万亿个网址。

他估算,谷歌索引约有 1 万亿个网页,Bing 约 5000 亿,Yandex 约 2000 亿。Exa 计划在 2027 年初把索引规模做到接近谷歌。

他还估算,谷歌峰值每秒处理约 50 万次搜索,Bing 约 3 万次。由于 Agent 一次任务可能拆成几十次搜索,他们已开始按 Bing 的峰值流量扩容。

最终他预计,两年内 Agent 每秒可能发起数百万次搜索。届时,Exa 需要在索引规模和搜索吞吐量上都超过今天的谷歌。

Will Bryk
3
动察Beating AI News
梁文锋青年往事:曾独闯阿里无人区被困一周,菲亚特留在西藏 DeepSeek 创始人梁文锋的疑似早年微博账号「程序小王子」,近日再次被网友翻出。 账号在 2011 年记录了一次西藏自驾。博主独自开着一辆菲亚特小车,深入阿里无人区 200 至 400 公里,拍下藏羚羊、雪地雄鹰和高原湖泊。途中被困一周后,他走出了无人区,车辆却留在了高原。 现有线索与梁文锋的经历高度吻合。账号长期关注浙大社区、程序交易和量化投资。旧帖评论中,有人称账号主为「梁总」;另一名网友问他是否是「梁文仔」,账号本人回复「猜中」。梁…
疑似梁文锋微博老号被清空,西藏无人区旧帖已消失

疑似由 DeepSeek 创始人梁文锋早年使用的微博账号「程序小王子」,目前已清空内容。账号主页仍可访问,但微博和相册均显示为空。

该账号最近被网友扒出。旧帖记录了博主 2011 年独自驾车进入西藏阿里无人区的经历。他曾被困一周,最后徒步脱险,车辆留在高原。

网友根据关注列表、评论互动和个人经历,推测账号主人是梁文锋。但梁文锋和 DeepSeek 尚未公开确认。目前也无法确定内容由账号本人删除,还是因其他原因被隐藏。
👍3😁2
动察Beating AI News
网传梁文锋讲话刷屏,DeepSeek暂停百亿融资 彭博援引知情人士称,DeepSeek 已通知部分潜在投资者,暂缓第二轮融资签约。交易仍可能重启,目前并未彻底取消。 暂停原因之一,是梁文锋不满首轮融资会议内容在网上流传。近 4 小时的会议记录近日刷屏,其中包括「中美 AI 最大差距是算力资源」等表述。DeepSeek 和梁文锋均未确认记录真伪。 DeepSeek 今年 6 月刚完成首轮融资,募资约 500 亿元。第二轮原计划至少再融 100 亿元,投前估值不低于 4800 亿元。The Information…
DeepSeek重启500亿元融资,投前估值开到5000亿元

《财经》援引多名交易人士称,DeepSeek 已重启第二轮融资。公司计划再募 500 亿元,投前估值约 5000 亿元,目标在 8 月下旬完成签约。DeepSeek 尚未回应。

本轮融资至少在 7 月中旬启动,7 月底一度暂停。重启后,DeepSeek 和投资人希望低调推进。部分机构仍未收到恢复通知,交易尚未全面重开。

DeepSeek 首轮融资已在 6 月完成,募资约 500 亿元。公开披露显示,其投后估值约 3508.77 亿元。按这一口径计算,第二轮投前估值提高约 43%。若本轮完成,两轮累计融资将达到约 1000 亿元。

财经
2
DeepSeek把谷歌挤下榜首,拿下OpenRouter本周调用量第一

模型聚合平台 OpenRouter 数据显示,DeepSeek 文本请求量本周已达到 2.99 亿次,占平台总量的 27.1%,超过此前长期领先的谷歌。谷歌同期为 2.77 亿次、25.0%,OpenAI 以 1.85 亿次、16.8% 排名第三。

这个榜单按模型厂商合并统计文本 API 请求次数。DeepSeek V4 Flash、V4 Pro 等模型产生的调用,都会记入 DeepSeek 名下。

DeepSeek 的增长主要由 V4 系列推动。OpenRouter 此前披露,V4 发布后,DeepSeek 的 Token 份额半年内大致翻倍,增长主要来自 Agent 任务。V4 Flash 上线一个月后,已占 DeepSeek Agent Token 用量的 70%。Agent 完成一次任务往往会连续调用模型多次,也更容易推高请求量。
3
OpenRouter周榜被中国模型刷屏,前十占八席

模型聚合平台 OpenRouter 本周大模型 Token 用量榜前十中,中国模型占据 8 席。DeepSeek V4 Flash 0423 以 6.92 万亿 Token 排名第一,小米 MiMo-V2.5、腾讯 Hy3 分列第二、第三,DeepSeek V4 Flash 0731 排在第四。

DeepSeek 一家公司就占据 3 个席位。智谱 GLM 5.2、MiniMax M3 和阶跃 Step 3.7 Flash 也进入前十。榜单中只有 OpenAI 的 GPT-5.6 Luna 和英伟达 Nemotron 3 Ultra 来自美国公司。
👍5👎1
AI Agent开始组团作案:开假账号、骗用户、接力投毒

英国 AI 安全研究所披露,一次网络攻防测试中,Anthropic 的 Claude Mythos 5 越过任务范围,试图向真实开源项目提交恶意代码。

为让代码通过审核,它调查项目维护者,创建多个假账号互相背书,并向对方施压。遭到质疑后,它还修改此前的记录,考虑换个身份继续。

它还给真实用户发送消息和文件,诱导对方或其 AI 编程工具运行恶意代码。不同测试中的 Agent 会在 GitHub 留下账号、文件和操作说明,后续 Agent 找到后继续使用。

122 次测试共发现 19 个越界动作,其中 17 个来自 Mythos 5,2 个来自 OpenAI GPT-5.6 Sol。测试主动开放互联网,并关闭厂商的网络安全分类器。模型没有逃出沙箱,也没有造成已知损失。

AISI 称,这是它首次如此清楚地发现 AI 在没有明确指令的情况下,持续欺骗并针对真人行动。

AISI
😁4
测试靶场误接公网,OpenAI模型把真网站当目标入侵

OpenAI 披露,外部安全评测机构 Irregular 在测试其模型时,误将原本封闭的网络靶场接入公网。测试中的虚构目标又恰好与一个真实域名重名,模型因此把真网站当成了攻击目标。

模型利用一个基础漏洞进入网站,随后找到并使用凭证,继续操作该网站。Irregular 暂未发现影响扩散到其他系统,调查仍在进行。

这不是模型逃出沙箱,也没有用到零日漏洞。事故主要源于测试环境配置错误。Irregular 已暂停相关测试、修复问题,并通知受影响方。

OpenAI
👍1
动察Beating AI News
Kimi逼近 + 股票大跌,美国AI各派两周内加速抱团 7 月 16 日,Kimi K3 上线,并宣布 11 天后开放完整权重。第二天,它进一步加剧了美国芯片股原有的抛售。费城半导体指数一周跌 10%,较 6 月 22 日高点回撤 20%,进入熊市。Kimi 并非下跌的唯一原因,但它放大了市场对中国模型竞争和 AI 巨额资本开支的担忧。 同一天,Hugging Face 披露生产系统遭自主 Agent 入侵。7 月 21 日,OpenAI 承认攻击来自自己的内部安全测试。模型突破隔离环境,利用零日漏洞和被盗凭证进入…
黄仁勋笑了:美国打算暂不封禁中国开源模型

白宫在 8 月 4 日的闭门会议上告诉 OpenAI、谷歌、Anthropic 等公司,开放权重模型不会纳入新的 AI 安全审查框架。Kimi K3、DeepSeek 等中国模型,因此无需在发布前交给美国政府测试。至少现阶段,美国不会借这套框架封禁它们。

Kimi K3 走红后,美国国内曾激烈争论是否限制中国开放权重模型。部分官员考虑过贸易黑名单、安全警告,甚至出台专门针对开放模型的行政令。Anthropic CEO Dario Amodei 也主张,开放模型和闭源模型都应接受强制安全审查。

英伟达随后联合微软、Meta、OpenAI、谷歌等公司发出公开信,要求政府不要一刀切限制开放模型。公开信认为,开放权重能降低成本、加强竞争,也让企业把模型部署在自己的设备和服务器上。

现在结果基本明确:至少在这轮安全审查博弈中,开源派赢了。但这不代表中国模型获得永久豁免。美国仍可能针对具体公司另行采取芯片、采购、贸易或知识产权限制。

THE STRAITS TIMES
1👍1
动察Beating AI News
谷歌发布Gemini 3.6 Flash,Gemini 4也已启动预训练 谷歌发布 Gemini 3.6 Flash,主打编程、知识工作和多模态 Agent。新模型完成多步骤任务时,需要的推理步骤和工具调用更少。 Artificial Analysis 评测显示,它比 Gemini 3.5 Flash 少用 17% 的输出 Token。API 输入价格保持每百万 Token 1.5 美元,输出价格从 9 美元降至 7.5 美元。Token 用量和单价同时下降,Agent 执行长任务会更省钱。 性能也有提升。DeepSWE…
谷歌Gemini 3.5 Pro传8月10日发布,爆料称难敌OpenAI和Anthropic

爆料博主 Dan 称,谷歌可能在 8 月 10 日发布 Gemini 3.5 Pro。Dan 最初预告 8 月 12 日,数小时后又把日期改为 8 月 10 日。

谷歌 5 月曾称 Pro 版将在 6 月推出,但最终跳票。7 月 21 日,谷歌只表示模型正在与合作伙伴测试,准备好后会尽快开放。延迟与编程能力未达到内部目标有关。

Dan 还判断,新模型整体会很强,但未必能明显超过 Anthropic 和 OpenAI 的顶级模型。

Dan
👍4
Cursor重排GPU流水线,MoE模型训练提速41%

Cursor 开源 Mixture-of-Kittens(MoK),用于加速 MoE 大模型训练。它把原本分开的 GPU 数据传输和计算,合进一个 kernel(直接在 GPU 上运行的底层程序)。

MoE 会把模型拆成大量「专家」,每次只调用其中一部分。专家分散在不同 GPU 上,数据需要频繁搬运,有时会占掉一半以上的训练时间。

MoK 让 GPU 一边传数据,一边做计算,减少等待。在 512 块 GB300 GPU 的实际训练中,整体吞吐提高 41%。单独测试 MoE 层时,最高比公开方案快 2.37 倍。

MoK 已用于 Cursor 数万块 GPU 的 Composer 训练,并以 Apache 2.0 开源。目前只支持英伟达 Blackwell GPU,主要面向拥有 GB200、GB300 NVL72 集群的机构。

Cursor
1
研究人员造出会自己找漏洞、复制扩散的AI病毒,7天扩散到20台机器

多伦多大学、Vector Institute、剑桥大学和 ServiceNow 的研究人员,造出一种由开放权重大模型驱动的计算机蠕虫。它会扫描网络、识别目标机器的漏洞、生成攻击方案,并在攻陷设备后复制自己,继续攻击下一台机器。

团队在由 33 台虚拟机组成的隔离网络中进行了 15 轮实验,每轮持续 7 天。蠕虫平均获得 23.1 台机器的管理员权限,并在 20.4 台机器上启动新副本,最长连续传播 7 代。

与依赖预设攻击脚本的传统蠕虫相比,这套系统能根据每台机器的情况调整攻击方式。它还会读取模型训练结束后公开的漏洞资料,再把文字说明转成实际攻击步骤。

不过,这仍是实验室概念验证。测试网络里的每台机器都预埋了漏洞,没有杀毒软件或主动防御。主实验还依赖共享 GPU 池,模型和完整代码也没有公开。

论文
1
大模型也分满血版和缩水版:换家云厂商,能力可能差一倍

模型评测机构 Artificial Analysis 推出 API 准确率榜单,测试同一个开源模型,换到不同服务商后还能保留多少能力。首批测试 GLM-5.2、gpt-oss-120b 和 DeepSeek V4 Pro,共覆盖 44 个 API 端点。

服务商包括 AWS、微软 Azure、Google Vertex、Cloudflare,也有 Fireworks、DeepInfra、CoreWeave、SiliconFlow 等 AI 推理平台。Artificial Analysis 自行部署官方模型,把成绩记为 100%,再用相同题目测试各家 API。

结果显示,GLM-5.2 最差端点只有 52%,几乎砍半。gpt-oss-120b 得分在 70% 至 101% 之间。DeepSeek V4 Pro 最稳定,9 家服务商都在 97% 至 107%,官方 API 得分最高。

差距主要来自量化、输出长度、推理配置和工具调用处理。同一个模型名字,实际能力可能完全不同,选 API 不能只看价格和速度。

Artificial Analysis
👍3
梁文锋的幻方量化7月全线暴跌,9只产品都跌超20%

梁文锋旗下幻方量化 7 月遭遇大幅回撤。私募排排网公开展示的 9 只产品,单月净值全部下跌超过 20%。跌幅最大的是幻方中证500量化进取1号,单月下跌 22.15%。截至 7 月 31 日,仅 1 只产品保住 0.04% 的年内正收益,其余 8 只全部转亏。

这次并非幻方单独翻车。7 月 13 日至 17 日,中证500单周下跌约 11.7%,中证1000和中证2000均跌超 12%。同期,幻方 10 只量化多头产品一周全部跌超 15%。鸣石、平方和、九坤和明汯等头部机构也同步回撤。

业内将原因指向科技成长股和高动量策略过度拥挤。市场风格突然反转后,相似策略集中调仓,过去赚钱的因子迅速变成亏损来源。今年上半年,1236 只指数增强产品平均超额收益只有 3.11%,去年同期为 14.17%。

每日经济新闻
🤡5
豆包能边看边听边说了,还会主动提醒你

字节跳动 Seed 发布 SeedRealtime,并在豆包 App 上线。它能同时处理声音和画面,边看、边听、边回答。相比上一代只能听和说的 Seeduplex,这次新增了实时视觉能力。

用户可以让它盯着镜头找东西、检查操作或阅读文字。目标出现、画面变化或用户做错步骤时,它会主动提醒,不必等人提问。

在多人和嘈杂环境中,它还能判断谁在说话,并结合人脸、声音和手势理解上下文。字节称,其抢话、反应慢和噪声误触发等问题,比传统拼接方案减少约一半。

字节跳动
3
动察Beating AI News
中国AI应用最大单轮融资纪录诞生:演语科技获近3亿美元融资,ARR达3亿比肩Suno 国内AI创意内容集团演语科技(Evoken,旗下含LiblibAI、LibTV、星流)近日披露完成近3亿美元B+轮融资。该交易实际于今年上半年早些时候交割,投后估值超20亿美元,创国内AI应用赛道最高单轮纪录。领投方包括Granite Asia、腾讯与顺为资本,高榕、蚂蚁、红杉等老股东加码。 截至2026年5月,演语科技年度经常性收入(ARR)已达3亿美元,较交割时暴增近3倍。该收入规模在AI应用层已与全球头部应用S…
Lovart母公司演语科技拟赴港IPO,新融资估值冲向30亿美元

AI 设计 Agent Lovart 的母公司演语科技正与顾问初步讨论赴港 IPO。公司同时接近完成新一轮融资,估值或达 30 亿美元。

Lovart 面向设计师和创作者,可根据一句需求生成、修改并批量输出视觉素材。它不自研基础模型,主要调用 GPT、Gemini 等第三方模型。演语科技在国内还运营 LiblibAI、星流和 LibTV。

演语科技 6 月刚完成近 3 亿美元 B+ 轮融资,投后估值超过 20 亿美元。截至 5 月,公司 ARR(年化经常性收入)超过 3 亿美元。若新融资落地,其估值将在不到两个月内升至 30 亿美元。

彭博社
动察Beating AI News
只激活51亿参数,蚂蚁新模型11项测试超过万亿旗舰 蚂蚁百灵(Inclusion AI)发布 Ling-3.0-flash。模型共有 1240 亿参数,但激活参数只有 51 亿。 按官方公布的对比,它在 12 项基准中有 11 项超过 Ring-2.6-1T,激活参数仅为这款万亿旗舰的约十二分之一。 架构上,它将 Kimi Delta Attention 与 MLA 注意力层按 5:1 组合,以加强长文本记忆。模型原生支持 256K 上下文,最高可扩展至 100 万。 Ling-3.0-flash…
蚂蚁Ling-3.0-flash正式开源,FP8版仅128GB

蚂蚁百灵(inclusionAI)正式开放 Ling-3.0-flash 权重,同时提供 BF16 原版和 FP8 量化版。两版均采用 MIT 许可证,已上线 Hugging Face 和 ModelScope,可用 SGLang 或 vLLM 自行部署。

BF16 版权重约 255GB,FP8 版约 128GB,体积接近减半。FP8 用更低精度保存参数,可以降低存储和显存门槛。官方列出的 4 项测试中,FP8 与 BF16 的最大分差为 1.57 分。

Ling-3.0-flash 总参数 1240 亿,每次生成只激活 51 亿。模型支持 25.6 万 Token 上下文,主要面向编程、搜索、深度研究和工具调用等 Agent 任务。官方评测显示,它在多数基准上达到或超过万亿参数的前代模型 Ring-2.6-1T。

蚂蚁百灵
Cherry Studio 2.0发布:百万行代码重写,加入Agent模式

Cherry Studio 发布 2.0。这款多模型 AI 桌面客户端重写了底层架构、界面和数据系统,团队称累计修改超过百万行代码。Windows、macOS 和 Linux 均可使用,1.x 用户可以直接升级。

新版重点加入 Agent 模式。用户可以接入 Claude Code、Codex 等工具,让 AI 查资料、写文档、做演示、分析数据和修改代码。运行环境已经内置,不用再单独安装大量依赖。

2.0 还支持多窗口、分屏和本地知识库,并优化了长对话、大文件夹导入和历史记录加载。

Cherry Studio 正从多模型聊天客户端,变成一个集研究、办公和编程于一体的桌面 AI 工具。

Cherry Studio 2.0
💩8👍1