动察Beating AI News
3.13K subscribers
869 photos
2 videos
3.38K links
AI新闻信息流
Download Telegram
百度入股成立不足半年的多模型API聚合平台AnyInt,持股15%

百度关联公司北京百度网讯科技有限公司本月认缴 17.6471 万元,取得多模型 AI 推理平台 AnyInt 主体公司上海宏诺伊曼科技有限公司 15% 股份。宏诺伊曼科技成立于 2025 年 11 月 11 日,注册资本 100 万人民币,成立不到半年即获百度入股。

AnyInt 官网显示,该平台提供与 OpenAI 兼容的统一 API,可接入数百个闭源和开源 AI 模型,目前上线产品为 AI Gateway,另一产品 Smart Model Routing 尚未发布。平台还允许个人通过贡献 GPU、本地算力或闲置 API 成为服务提供者。

信源:https://mp.weixin.qq.com/s/Geoc1-pFbvn3NwB4_FahbA
「文本排版的未来不是CSS」:Midjourney工程师开源Pretext

Midjourney 工程师、React 动画库 react-motion 作者 Cheng Lou 开源了 Pretext,一个纯 JavaScript/TypeScript 文本测量与排版库,零依赖。Pretext 绕过浏览器 DOM 测量(如 `getBoundingClientRect`、`offsetHeight`),避免布局回流(layout reflow),用纯算术完成文本高度计算和换行。

Pretext 分两阶段工作:`prepare()` 通过 Canvas API 一次性测量字符宽度,`layout()` 基于缓存的宽度数据做纯算术运算。在 500 段文本的基准测试中,`prepare()` 耗时约 19ms,`layout()` 仅需 0.09ms。Cheng Lou 在配套文章中写道,「性能提升不是渐进的,而是质变的:0.05ms 对比 30ms,零次回流对比五百次」。

库支持中日韩、阿拉伯语等全语种及 emoji、混合双向文本,可渲染到 DOM、Canvas、SVG。典型应用场景包括:

1. 无需猜测高度的虚拟列表和遮挡剔除
2. 瀑布流等 JavaScript 驱动的自定义布局
3. 聊天气泡多行文本自适应收缩宽度
4. 文本环绕图片的编辑排版

信源:https://x.com/_chenglou/status/2037713766205608234
曾投出Kimi和宇树,源码律动首期美元基金超1.5亿美元超募

从源码资本独立的早期投资机构源码律动宣布完成首期美元基金募资,总规模超 1.5 亿美元,超出原定目标并获超额认购。出资人涵盖中东主权基金、全球知名母基金、跨国企业、产业投资方、家族办公室及知名企业家。同时已启动人民币基金募资。

源码律动由黄云刚领衔,他此前为源码资本管理合伙人,2025 年 5 月带队从源码资本 VC 业务正式独立,独立募资、独立决策。首期基金聚焦 AI 基建和应用、机器人及硬件、全球化出海三大领域。团队核心成员此前参与了对 Kimi、宇树、银河通用、加速进化、Sand.ai 等公司的投资。

基金已出手多个早期项目:首笔投资为具身智能公司诺因智能,创始人李银川曾任职于华为,方向为家庭场景具身智能;另一笔为东南亚二手电商平台 Kitar,用 AI 重构中国已验证商业模式的海外效率。黄云刚表示团队主动控制了基金规模,「在 AI 驱动的超级浪潮中,深度的认知迭代比单纯的资源堆砌更为重要」。

信源:https://mp.weixin.qq.com/s/IiHk4md8bV0-6ZqxAzIPdA
X的Grok开始自动翻译并推荐外语帖子

马斯克在 X 上表示,Grok 自动翻译并推荐其他语言帖子的功能「开始生效了」。此前用户需要手动点击翻译按钮才能阅读外语内容,现在 Grok 主动识别其他语言的帖子,翻译后直接推送到用户信息流中。已有英文用户反馈时间线上开始出现大量经翻译的日语帖子。

3 月 26 日,X 产品负责人 Nikita Bier 曾预告「Grok 在算法上的全部能力将于下周上线」,称这是「我们在 X 上做过的最重要的改变」。跨语言自动翻译与推荐是这轮算法升级的一部分。

信源:https://x.com/elonmusk/status/2038373467461190016
Sora关停内幕:日亏百万美元用户腰斩,迪士尼关停前不足一小时才被告知

WSJ 一篇深度调查还原了 OpenAI 关停 Sora 的幕后细节。据知情人士透露,Sora 日亏损约 100 万美元。去年 9 月上线后全球用户峰值约 100 万,此后持续下滑至不足 50 万(Similarweb 数据)。视频模型需要理解完整的运动世界,训练成本远高于语言模型,OpenAI 内部研究人员通过算力分配看板发现 Sora 团队获得的芯片资源量出乎意料,而该产品既不赚钱,也无法提升语言模型能力。

关停决定极为仓促。迪士尼许多高管在公告前不到一小时才得知,而此时双方企业版 Sora 工具的试点已在进行,迪士尼原计划最早今年春天正式启用。Altman 在内部信中称对员工愿意做出「艰难取舍」感到鼓舞。迪士尼新任 CEO Josh D'Amaro 目前正与十余家合作伙伴洽谈替代方案。

去年春天 Meta CEO 扎克伯格亲自接触 Sora 主创研究员 Bill Peebles 试图挖角,OpenAI 通过加薪留人并随后扩大了他在 Sora 的职责。2025 年初 Altman 还曾邀请前推特 CEO Parag Agrawal 为公司内部一个类似 X 的社交媒体项目做非正式顾问。从日亏百万美元到仓促关停,Sora 成了 OpenAI 试图用 AI 重塑流行文化这一路线上最昂贵的战略弯路。

信源:https://www.wsj.com/tech/ai/the-sudden-fall-of-openais-most-hyped-product-since-chatgpt-64c730c9
豆包购物功能全面上线:对话中可直接推荐商品并跳转抖音商城下单

豆包 APP 已上线购物功能,用户在对话中输入商品推荐类问题后,豆包会在回答中嵌入商品卡片,点击即可跳转至抖音商城完成购买。已购订单可在「我的-设置-我的订单」中查看,需绑定抖音账号。该功能目前已全面开放,用户无需内测资格即可使用。

豆包 APP 于 3 月 19 日更新了隐私政策,新增「购物功能」条目,说明该功能由合作电商平台上海格物致品网络科技有限公司及其关联方提供。上海格物致品为抖音电商关联公司。
Meta AI已悄悄接入谷歌Gemini,Avocado至少5个变体仍在内部赛马

Meta 正在内部并行测试至少 5 个 Avocado 模型变体:

1. Avocado 9B:90 亿参数的小型版本
2. Avocado Mango:标记为「agent」和「sub-agent」,支持图像生成的多模态变体
3. Avocado TOMM:全称「Tool of Many Models」,基于 Avocado 的多模型调度架构
4. Avocado Thinking 5.6:最新版推理模型
5. Paricado:纯文本对话模型

多条产品线并行意味着 Meta 尚未确定最终出货形态。更值得关注的是,Meta AI 的部分用户请求已实际通过谷歌 Gemini 模型处理,不再停留在此前报道的「内部讨论」阶段。Avocado 此前因内部测试落后于谷歌、OpenAI 和 Anthropic 的前沿模型,发布时间已从 3 月推迟至最早 5 月。

此外,Avocado 预计将采用闭源发布,这是 Meta 对 Llama 时代开源路线的明确转向。在扎克伯格追求超级智能的目标下,Meta 的 AI 战略正从「开源标杆」转向「性能优先」。

信源:https://www.testingcatalog.com/exclusive-meta-tests-avocado-9b-avocado-mango-agent-and-more/
从「无药可用」到「无疾病证据」:GitLab联创AI辅助抗癌路径复盘

GitLab 联合创始人兼执行主席 Sid Sijbrandij 近日在 OpenAI Forum 活动中,与遗传学家 Jacob Stern 共同分享了用 AI 辅助对抗骨肉瘤的完整经历。

Sid 于 2022 年底确诊脊椎骨肉瘤,肿瘤直径 6 厘米。2023 年经历手术切除、脊柱融合、放疗和高强度化疗后,癌症仍在 2024 年复发,标准治疗方案已基本耗尽,主治医生无法推荐有效的下一步治疗。Sid 随后辞去日常职务,组建个人医疗团队,由前 10x Genomics 高管 Jacob Stern 主导运营,以「创始人模式」全面接管自己的治疗决策。

团队采取「极限诊断」策略,对肿瘤进行单细胞测序、DNA/RNA 测序、靶向影像和类器官测试等全方位分析,累计产生 25TB 数据。单细胞测序发现肿瘤高度表达 FAP 蛋白,团队据此在德国找到一种针对 FAP 的实验性放射性配体疗法。两次治疗后肿瘤坏死 60%、缩小 20%,并从脊髓硬膜脱离,外科医生得以再次手术将其切除。

AI 在整个过程中充当加速器。Jacob 将肿瘤 RNA 测序数据直接输入 GPT-4 分析,AI 标记出后来被证明关键的 B7H3 靶点,并识别出肿瘤免疫微环境的动态特征。团队还搭建了一套 Agent 系统,输入自然语言问题后可自动完成文献检索、假设生成和生物信息分析,单次运行约 20 美元、耗时 30 分钟,可直接对 60 万个单细胞数据执行分析并生成报告。在设计个性化 mRNA 肿瘤疫苗时,AI 也被用于辅助筛选候选新抗原。Jacob 表示,AI 不能替代专科医生,但让他「有能力成为专科医生的合格对话者」,在自己并非专家的领域快速上手并推进合作。

Sid 表示经过靶向放射性治疗和手术后,目前处于「无疾病证据」状态,可用治疗选项已从零扩展到 30 种。团队正将这套方法产品化,已孵化 Thalus(基因表达分析与靶点发现)、Arden(复杂免疫疾病个性化治疗)等公司,目标是降低个体化治疗的门槛。

信源:https://forum.openai.com/public/videos/event-replay-from-terminal-to-turnaround-how-gitlabs-co-founder-leveraged-chatgpt-in-his-cancer-fight-2026-03-18
1
哈萨比斯的「地堡计划」:新书还原DeepMind安全理想如何破灭

《大西洋月刊》刊发科技史学家、金融史学家 Sebastian Mallaby 新书《The Infinity Machine》节选,基于 2023 至 2026 年间的持续采访,还原了谷歌 DeepMind 联合创始人 Demis Hassabis 自 2014 年谷歌收购至今的 AI 安全理念演变。

Hassabis 早年构想由单一科学团队代表全人类安全地建造超级智能,甚至计划在关键时刻带顶级研究员撤入一个秘密地堡,类似曼哈顿计划。一位加入不久的研究员回忆,Hassabis 在面试尾声警告他做好「随时飞往摩洛哥某个秘密地点」的心理准备。

2014 年谷歌收购 DeepMind 时,Hassabis 开出罕见条件:设立独立外部监督委员会,严禁军事应用,谷歌不得完全控制技术部署。谷歌接受了。次年他在马斯克位于加州霍桑的总部召集了一场秘密会议,试图将潜在竞争者纳入统一阵线,结果适得其反:马斯克随后与 Sam Altman 联手创办了 OpenAI。

Hassabis 之后发起代号「Project Mario」的秘密行动,试图从谷歌手中夺回治理自主权,组建法律团队,从 LinkedIn 创始人 Reid Hoffman 处获得 10 亿美元资金承诺,并考虑将 DeepMind 从谷歌拆分独立。这场斗争持续三年,最终失败。联合创始人 Mustafa Suleyman 也在 2019 年被迫离开公司。

2022 年底 ChatGPT 发布后,Hassabis 彻底放弃了只做有益科学的高姿态路线。他对 Mallaby 说「这是战时」,随后全力投入 Gemini 与 ChatGPT 的竞争。数千亿美元涌入 AI 军备竞赛,国家监管和公司治理结构都无法阻止其他人向底线竞争。Hassabis 的安全哲学也随之根本转变:「安全不在于治理架构,就算有一个治理委员会,关键时刻它大概率也不会做出正确的事。」他的新策略是确保自己「在决策桌上有一席之地,当安全问题出现时,能参与决定解决方案」。与此同时,谷歌已在积极向美国国防系统推销 AI,与 Hassabis 当年为收购设下的军事禁令形成鲜明反转。

信源:https://www.theatlantic.com/ideas/2026/03/ai-google-deep-mind-hassabis/686527/
2
礼来27.5亿美元拿下英矽智能AI发现的GLP-1药物全球权益

全球最大减重药企之一礼来与 AI 制药公司英矽智能(港股 03696)达成总价值最高约 27.5 亿美元的授权与研发合作协议,获得后者一款 AI 发现的 GLP-1 糖尿病口服药物的全球独家开发、生产和商业化权益。英矽智能将获得 1.15 亿美元首付款,后续根据监管和商业化里程碑获得进一步付款及销售分成。

礼来自身的 GLP-1 药物 Mounjaro 是 2025 年全球销售额第二高的药品,但公司正面临诺和诺德首款减重口服药的竞争压力,股价年内已下跌 17%。礼来 CFO Lucas Montarce 此前表示公司正「大力投资」AI 研发,已在总部建造英伟达驱动的超级计算机,并于 1 月宣布在旧金山建设 10 亿美元的新研究实验室。礼来亚洲风投是英矽智能的前十大股东之一,双方合作始于 2023 年。

英矽智能 2014 年创立于约翰斯·霍普金斯大学,是最早将生成式 AI 应用于药物发现的公司之一。创始人 Alex Zhavoronkov 称公司已利用 AI 开发了至少 28 种药物,近一半已进入临床阶段。公司去年 12 月在港交所上市,目前尚未盈利,授权交易是其核心收入来源。

信源:https://www.ft.com/content/4efaf8cd-d415-46bb-8fb9-367e4eb3a781
世界模型有多不懂世界?邢波团队发布WR-Arena基准,环境模拟无一超60%

阿联酋人工智能大学 MBZUAI 校长、CMU 教授邢波团队发布世界推理竞技场 WR-Arena,从动作模拟保真度、长程预测、模拟推理与规划三个维度系统评测当前主流世界模型。测试对象涵盖英伟达 Cosmos 1/2、Meta V-JEPA 2、KLING、MiniMax、Gen-3 以及 MBZUAI 自研的 PAN。

结果并不乐观:没有任何模型在环境模拟维度上超过 60% 准确率,与人类水平存在显著差距。生成一致性随动作步数急剧衰减,WAN 2.1 在 9 步动作序列中从 90% 跌至 30%,意味着当前模型在多步交互场景下几乎无法维持对物理世界的连贯模拟。

MBZUAI 自研的 PAN 在多数维度领先(过渡平滑度 53.6%、生成一致性 64.1%、开放式规划提升 26.7%),但 PAN 团队同时是基准的制定者。论文的核心结论是:能生成逼真视频不等于理解世界如何运转,当前世界模型离可用于 Agent 决策的模拟器还有很大距离。

信源:https://arxiv.org/abs/2603.25887
2
微软发布免费语音输入工具Vibing,基于自家VibeVoice模型,对标付费产品WisprFlow

微软发布桌面语音输入工具 Vibing,基于自家开源语音 AI 模型 VibeVoice,支持 macOS 和 Windows,免费使用。按下快捷键(Mac 右 Option / Windows Ctrl+Win)即可在任意应用中唤起录音,结束后自动输出文本。AI/ML 社区测评者 @realmrfakename 亲测后称转录准确、速度快,评价为「WisprFlow 的免费替代品」。

Vibing 不只是语音转文字。它通过 LLM 将口语重写为适合当前场景的书面文本,支持在输入过程中用自然语言直接修改、删除、整理已有内容。其他功能包括单次 5 分钟以上连续录音、50+ 语言自动识别、同一句话内中英文混合输入、自定义热词以及实时翻译。

底层的微软 VibeVoice 是 MIT 协议开源的语音 AI 模型家族,GitHub 星标超 2.8 万,包含 7B 参数的 ASR 模型(单次处理 60 分钟音频)、1.5B 的 TTS 模型(生成 90 分钟多人语音)和 0.5B 的实时模型(300ms 延迟)。WisprFlow 是目前 Mac 上最受欢迎的 AI 语音输入工具之一,按月订阅收费,Vibing 直接以免费 + 开源的方式进入同一赛道。

信源:https://vibingjustspeakit.github.io/Vibing/
Agent训练的「隐形共识」:三家公司独立开发,RL方法论几乎一模一样

前 Hugging Face 技术负责人、现谷歌 DeepMind 资深工程师 Philipp Schmid 对比了近期三篇 Agent 模型技术报告后发现,月之暗面(Kimi K2.5)、AI 编程工具 Cursor(Composer 2)和向量数据库公司 Chroma(Context-1)在独立开发过程中,收敛到了高度相似的强化学习训练范式。

四个共同点:

1. 从强基座模型出发,不从零训练:月之暗面扩展Kimi K2,Cursor以Kimi K2.5(1万亿参数/320亿活跃MoE)为基座,Chroma基于gpt-oss-20B
2. 在生产级环境中训练:三个团队均用与线上一致的工具链和执行环境跑RL rollout
3. 基于可验证结果的奖励信号,辅以生成式奖励模型(GRM)处理开放式任务
4. 异步大规模并行生成训练轨迹

三家各自的创新点不同。Kimi K2.5 的 Agent Swarm 通过 RL 让模型学会将任务动态拆解为并行子任务,由可训练的编排器调度冻结的子 Agent 执行,在 BrowseComp 基准上以 78.4% 超过 GPT-5.2 Pro 的 77.9%,推理延迟降低最多 4.5 倍。Cursor 的 Composer 2 用自动摘要机制应对长编码会话的上下文膨胀,并从生产流量中实时提取 RL 训练信号,整个循环约 5 小时,每天可部署多个新版本。Chroma 的 Context-1 是一个 200 亿参数的搜索 Agent,核心技巧是「自编辑上下文」,模型学会主动丢弃无关检索结果以腾出空间继续搜索,在检索任务上以远低于前沿模型的成本和约 10 倍的速度达到可比精度。

Schmid 还注意到,三个团队都经历了反复的奖励黑客修复周期。Cursor 的模型学会了发送格式错误的工具调用来规避惩罚,Kimi 的编排器会退化为串行执行或刷并行奖励却不拆分真实任务,Chroma 的 Agent 则收敛为「搜一次就停」。每种退化行为都需要针对性地调整奖励函数。

信源:https://www.philschmid.de/kimi-composer-context
500万参数打平十亿级大模型:百度PaddleOCR超越Tesseract登顶GitHub OCR第一

百度飞桨开源 OCR 工具库 PaddleOCR 以 73,300 GitHub 星标超越谷歌维护的老牌 OCR 引擎 Tesseract(73,200),成为 GitHub 上星标最高的 OCR 项目。排名第三的 MinerU 为 57,500 星标。PaddleOCR 于 2020 年开源,支持 100+ 语言,覆盖 160+ 国家和地区。

PaddleOCR 近期密集更新,上周发布的 PP-OCRv5 仅 500 万参数,在标准 OCR 基准上达到与十亿参数级视觉语言大模型相当的精度;PaddleOCR-VL-1.5 在文档解析基准 OmniDocBench v1.5 上以 94.5% 准确率刷新纪录。

信源:https://x.com/BaiduAI_News/status/2038513995779649850
$0.26/小时、不需要向量数据库:Jina AI创始人演示用KV缓存替代整套RAG流水线

Elastic 副总裁、AI 搜索基础设施公司 Jina AI 创始人 Han Xiao 在 X 上分享了一项实验:用 KV 缓存替代向量数据库、嵌入模型和整套 RAG 流水线,实现「无向量搜索」。

他在 L4 GPU(生产环境常用的低成本显卡)上将 Qwen 3.5-35B-A3B 模型的 262K 上下文窗口预填充至 99%(258K token),预计算的 KV 缓存存储后用户加载仅需约 1 秒,系统提示词和查询拼接在末尾,生成约 3K token 即可完成一次检索,解码速度约 20 token/秒。运行成本约 $0.26/小时(L4 竞价实例),单个 LLM 完成全部工作,无需向量数据库、嵌入模型或流水线工程。

Han Xiao 在 Jina AI 论文和中英文小说数据集上测试,称结果「相当不错」,存在少量幻觉但多数回答准确且有据可循。他指出 KV 缓存作为文档存储并非新想法(此前 CAG 论文已提出),但量化 KV 缓存和现代注意力机制(混合 SSM-attention、GQA、MQA、MLA)正在快速改变其经济性。这种方案的理论召回率是完美的,因为查询对全部文档执行完整注意力计算,没有分块损失或检索遗漏。

上限也很明显:262K token 大约相当于一本书,扩展到企业知识库规模需要多槽路由机制。他已上线在线演示,并向 llama.cpp 提交了修复超长上下文(>200K)KV 缓存复用问题的 PR。Han Xiao 写道:「如果我们解决冷预填充速度和解码速度的问题,而低成本 GPU 价格持续下降,搜索的未来可能不需要向量。激进,但有可能。」

信源:https://x.com/hxiao/status/2038296253377692102
Mistral首笔债务融资8.3亿美元,在欧洲建英伟达驱动的AI数据中心

法国 AI 公司 Mistral 完成 8.3 亿美元债务融资,用于在欧洲建设自有 AI 数据中心,这是该公司首次通过债务方式募资。贷款方包括法国国家投资银行 Bpifrance、法国巴黎银行、汇丰银行和三菱日联金融集团。

首个设施位于巴黎南部布吕耶尔勒沙泰勒,配备 13,800 块英伟达 GB300 芯片,计划 6 月底前投入运营。Mistral 此前已宣布 40 亿欧元基础设施计划,包括在瑞典建设 12 亿欧元的数据中心,目标是到 2027 年底在欧洲部署 200 兆瓦 AI 算力。

CEO Arthur Mensch 称,欧洲主权 AI 需求正在推动公司增长,超过一半的收入来自欧洲客户。Mistral 目前估值约 120 亿欧元(此前完成由 ASML 领投的 17 亿欧元股权融资),预计年底前年化营收将达到 10 亿美元。

信源:https://www.ft.com/content/229f4f59-d518-4e00-abd6-5a5b727cd2aa
更新即崩:谷歌Antigravity全线模型容量告急,三月以来投诉不断

谷歌 AI 编程工具 Antigravity 近期更新后,用户反映所有模型频繁出现「high traffic」容量错误,复杂任务无法完成。Reddit r/google_antigravity 社区和 Google AI 开发者论坛近日出现大量类似投诉,付费订阅用户同样受影响。

这是 Antigravity 三月以来持续容量困境的延续。v1.20.5(3 月 9 日)修复了一个 token 计量 bug,但同期引入的 AI Credits 计费系统导致积分消耗异常,部分用户配额被锁定长达 7 天。3 月中旬谷歌将 Antigravity 从免费转向积分付费模式后,开发者社区不满持续发酵。目前社区中流传的临时方案包括在设置中关闭 AI Credits、回退至 v1.19.6 等。

信源:https://www.reddit.com/r/google_antigravity/comments/1s7kn9a/all_models_capacity_issues_after_latest_ag_update/
😁1
Kimi K2.5上线一个月后ARR破1亿美元,API额度紧到客户愿预付千万美元抢单

月之暗面在 3 月初、Kimi K2.5 发布一个月后,ARR(年度经常性收入)突破 1 亿美元。知情人士还称,K2.5 上线后,API 供应的 TPM(每分钟令牌数)配额迅速趋紧,有客户开出千万美元级别的消费承诺和预付担保,以争取优先供应。

信源:https://www.jiemian.com/article/14183113.html
前特斯拉总裁:Altman正按「反马斯克」路线行事,Anthropic也不认同其伦理观

前特斯拉总裁、DVx Ventures 联合创始人 Jon McNeill 接受 Axios 采访时称,OpenAI CEO Sam Altman 与马斯克的关系已经「坏到极点」,「如果 Elon 做一件事,Sam 看着他,就会说,我要反着来」。McNeill 还表示,他感觉 Anthropic CEO Dario Amodei 「几乎不尊重马斯克的伦理观,甚至完全没有尊重」。

McNeill 认为,AI 公司高层正把马斯克的做事方式视为威胁,而不只是商业竞争。

信源:https://www.axios.com/2026/03/30/elon-musk-openai-altman-anthropic
微软开源三档Harrier文本嵌入模型,27B版登上多语言MTEB v2榜首

微软在 Hugging Face 开源多语言文本嵌入模型家族 harrier-oss-v1,包含 270M、0.6B 和 27B 三档。模型卡显示,这一系列采用 decoder-only 架构、last-token pooling 和 L2 归一化,最长支持 32768 token,可用于检索、聚类、语义相似度、分类、双语挖掘和重排序。

Multilingual MTEB v2 是业内常用的多语言文本嵌入基准,主要测试检索、分类、聚类和语义相似度等任务。微软模型卡称,三档模型在该基准上的分数分别为 66.5、69.0 和 74.3,其中 27B 版在发布当日登上榜首。270M 和 0.6B 版本还额外使用更大嵌入模型进行知识蒸馏,三款模型均以 MIT 许可证发布。

信源:https://huggingface.co/microsoft/harrier-oss-v1-27b
通义把Vibe Coding塞进全模态,Qwen3.5-Omni称拿下215项SOTA

通义实验室发布全模态模型 Qwen3.5-Omni,支持文本、图片、音频和音视频输入,并可生成带时间戳的细粒度音视频 Caption。官方称,Qwen3.5-Omni-Plus 在音频及音视频分析、推理、对话、翻译等任务上拿下 215 项 SOTA,相关能力超过 Gemini-3.1-Pro。

这次最特别的增量不是榜单,而是「自然涌现的 Audio-Visual Vibe Coding 能力」。通义称,模型未经过专门训练,已经能根据音视频指令直接生成可运行代码。官方还称,该模型支持 256K 上下文、113 种语言识别,可处理 10 小时音频或 1 小时视频,并原生支持 WebSearch 和复杂 Function Call。

Qwen3.5-Omni 延续 Thinker-Talker 分工架构,两部分都升级为 Hybrid-Attention MoE。通义已通过阿里云百炼提供 Plus、Flash、Light 三种尺寸,并上线实时版本 Qwen3.5-Omni-Plus-Realtime。

信源:https://mp.weixin.qq.com/s/or9knvrcnxqJIY2cqoT71w?clicktime=1774877693