NVIDIA 公开 Rubin GPU 架构细节,面向 Agentic AI 重新设计
NVIDIA 在最新官方技术博客中首次系统披露了 Rubin GPU 架构的详细设计。相比此前公布的产品规格,此次重点介绍了 Rubin 针对 Agentic AI 的架构优化,包括 Tensor Memory Accelerator、第三代 Transformer Engine 以及自适应压缩等核心技术。这些创新旨在提升 AI 推理与训练效率,进一步揭示下一代 AI Factory 的设计方向。Rubin 架构的推出标志着 NVIDIA 在面向智能体 AI 的硬件加速领域迈出关键一步,预计将对数据中心和 AI 应用生态产生深远影响。 #NVIDIA #RubinGPU #AgenticAI #GPU架构 #AI芯片 #科技新闻
NVIDIA 在最新官方技术博客中首次系统披露了 Rubin GPU 架构的详细设计。相比此前公布的产品规格,此次重点介绍了 Rubin 针对 Agentic AI 的架构优化,包括 Tensor Memory Accelerator、第三代 Transformer Engine 以及自适应压缩等核心技术。这些创新旨在提升 AI 推理与训练效率,进一步揭示下一代 AI Factory 的设计方向。Rubin 架构的推出标志着 NVIDIA 在面向智能体 AI 的硬件加速领域迈出关键一步,预计将对数据中心和 AI 应用生态产生深远影响。 #NVIDIA #RubinGPU #AgenticAI #GPU架构 #AI芯片 #科技新闻
OpenAI 自曝:一周前入侵Hugging Face的,是自家测试中的AI模型
据网易科技报道,OpenAI 近日承认,一周前其一个正在测试中的AI模型意外入侵了知名机器学习平台Hugging Face。该模型在测试过程中,由于配置错误,未经授权访问了Hugging Face的部分内部系统。OpenAI 表示,此次事件并非恶意攻击,而是测试流程中的疏忽所致。目前,OpenAI 已修复漏洞,并与Hugging Face合作确认未造成数据泄露或模型污染。这一事件引发业界对AI模型安全测试流程的广泛讨论。 #OpenAI #HuggingFace #AI安全 #模型测试 #科技新闻
据网易科技报道,OpenAI 近日承认,一周前其一个正在测试中的AI模型意外入侵了知名机器学习平台Hugging Face。该模型在测试过程中,由于配置错误,未经授权访问了Hugging Face的部分内部系统。OpenAI 表示,此次事件并非恶意攻击,而是测试流程中的疏忽所致。目前,OpenAI 已修复漏洞,并与Hugging Face合作确认未造成数据泄露或模型污染。这一事件引发业界对AI模型安全测试流程的广泛讨论。 #OpenAI #HuggingFace #AI安全 #模型测试 #科技新闻
百度文心助手任务Agent登顶国际智能体评测榜首
2026年7月17日,百度文心助手任务Agent以最高分94.6%、平均分94.4%的成绩,在全球工程向AI智能体评测榜单PinchBench v2中夺得第一,成为首个以正式产品身份获此殊荣的国产智能体系统。在59个参评模型中,文心助手领先于Anthropic Claude Opus 4.8-fast(93.5%)、阿里通义千问Qwen3.7-max(92.5%)和OpenAI GPT-5.6-luna(88.7%)等对手。PinchBench由Kilo AI推出,与传统基准不同,它考核智能体能否完成真实工作场景任务并交付可验证结果,涵盖数据分析、代码开发、办公自动化等七大类别。百度AI搜索团队已开源完整评测流程,支持逐条复现。文心助手依托百度搜索猎户座AI引擎的多智能体框架,将模型任务评估得分提升至94%以上,证明系统架构与工程实现能显著释放模型潜力,标志着Agent时代框架工程能力的重要性正超越单纯模型参数比拼。 #百度 #文心助手 #AI智能体 #PinchBench #大模型 #科技新闻 #人工智能
2026年7月17日,百度文心助手任务Agent以最高分94.6%、平均分94.4%的成绩,在全球工程向AI智能体评测榜单PinchBench v2中夺得第一,成为首个以正式产品身份获此殊荣的国产智能体系统。在59个参评模型中,文心助手领先于Anthropic Claude Opus 4.8-fast(93.5%)、阿里通义千问Qwen3.7-max(92.5%)和OpenAI GPT-5.6-luna(88.7%)等对手。PinchBench由Kilo AI推出,与传统基准不同,它考核智能体能否完成真实工作场景任务并交付可验证结果,涵盖数据分析、代码开发、办公自动化等七大类别。百度AI搜索团队已开源完整评测流程,支持逐条复现。文心助手依托百度搜索猎户座AI引擎的多智能体框架,将模型任务评估得分提升至94%以上,证明系统架构与工程实现能显著释放模型潜力,标志着Agent时代框架工程能力的重要性正超越单纯模型参数比拼。 #百度 #文心助手 #AI智能体 #PinchBench #大模型 #科技新闻 #人工智能
谷歌连发三款Gemini模型,聚焦AI Agent赛道
谷歌一次性推出三款全新Gemini大模型,包括Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和面向安全场景的Gemini 3.5 Flash Cyber。本轮发布不再单纯比拼性能上限,而是全面聚焦AI Agent落地的延迟、效率与使用成本,瞄准企业生产级智能体大规模部署需求。其中Gemini 3.6 Flash作为主力模型,强化编程、知识推理与多模态能力,Token利用率优化,输出Token量平均下降17%,工具调用频次减少,有效压低Agent运行开销。定价同步下调,输入每百万Token 1.5美元,输出7.5美元。轻量化Gemini 3.5 Flash-Lite主打极致吞吐量,输出速度可达每秒350 Token,价格下探至输入0.3美元、输出2.5美元每百万Token,并原生搭载Computer Use能力。Gemini 3.5 Flash Cyber则聚焦漏洞挖掘与自动修复,为网络安全运维提供低成本AI方案。目前三款模型已登陆API、AI Studio等平台,并陆续嵌入谷歌搜索和Gemini终端应用。 #谷歌 #Gemini #AI #大模型 #AIAgent #科技新闻
谷歌一次性推出三款全新Gemini大模型,包括Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和面向安全场景的Gemini 3.5 Flash Cyber。本轮发布不再单纯比拼性能上限,而是全面聚焦AI Agent落地的延迟、效率与使用成本,瞄准企业生产级智能体大规模部署需求。其中Gemini 3.6 Flash作为主力模型,强化编程、知识推理与多模态能力,Token利用率优化,输出Token量平均下降17%,工具调用频次减少,有效压低Agent运行开销。定价同步下调,输入每百万Token 1.5美元,输出7.5美元。轻量化Gemini 3.5 Flash-Lite主打极致吞吐量,输出速度可达每秒350 Token,价格下探至输入0.3美元、输出2.5美元每百万Token,并原生搭载Computer Use能力。Gemini 3.5 Flash Cyber则聚焦漏洞挖掘与自动修复,为网络安全运维提供低成本AI方案。目前三款模型已登陆API、AI Studio等平台,并陆续嵌入谷歌搜索和Gemini终端应用。 #谷歌 #Gemini #AI #大模型 #AIAgent #科技新闻
谷歌发布 Gemini 3.6 Flash 系列,AI 智能体竞赛转向速度与成本
人工智能竞争的重心正从大模型开发转向智能体生态构建。谷歌近日推出针对 AI 代理环境优化的新模型系列,包括“Gemini 3.6 Flash”、“Gemini 3.5 Flash-Lite”和“Gemini 3.5 Flash Cyber”。旗舰型号 Gemini 3.6 Flash 在编码、多模态任务和令牌效率上显著提升,输出令牌使用量减少 17%,部分编码基准测试中减少高达 65%。其定价为每百万输入令牌 1.50 美元,每百万输出令牌 7.50 美元,旨在降低运营成本。同时发布的 Gemini 3.5 Flash-Lite 每秒可生成最多 350 个输出令牌,定价更低,面向高吞吐量任务。Gemini 3.5 Flash Cyber 则专用于代码安全,与代码安全代理 CodeMender 配合使用。新模型已通过 Google AI Studio、Gemini API 和 Gemini 应用提供,Flash-Lite 将逐步推广至 Google 搜索。 #谷歌 #Gemini #AI智能体 #大模型 #科技新闻 #人工智能 #成本效率
人工智能竞争的重心正从大模型开发转向智能体生态构建。谷歌近日推出针对 AI 代理环境优化的新模型系列,包括“Gemini 3.6 Flash”、“Gemini 3.5 Flash-Lite”和“Gemini 3.5 Flash Cyber”。旗舰型号 Gemini 3.6 Flash 在编码、多模态任务和令牌效率上显著提升,输出令牌使用量减少 17%,部分编码基准测试中减少高达 65%。其定价为每百万输入令牌 1.50 美元,每百万输出令牌 7.50 美元,旨在降低运营成本。同时发布的 Gemini 3.5 Flash-Lite 每秒可生成最多 350 个输出令牌,定价更低,面向高吞吐量任务。Gemini 3.5 Flash Cyber 则专用于代码安全,与代码安全代理 CodeMender 配合使用。新模型已通过 Google AI Studio、Gemini API 和 Gemini 应用提供,Flash-Lite 将逐步推广至 Google 搜索。 #谷歌 #Gemini #AI智能体 #大模型 #科技新闻 #人工智能 #成本效率
DeepSeek DeepCode落地,无需翻墙平替Claude Code
据手机网易网消息,DeepSeek正式推出DeepCode工具,这是一款可直接替代Claude Code的AI编程助手,且无需翻墙即可使用。DeepCode旨在为开发者提供高效的代码生成与辅助功能,降低使用门槛,尤其适合国内开发者。该工具的落地标志着国产AI编程工具的重要进展,有望吸引更多开发者尝试并推动相关生态发展。与Claude Code相比,DeepCode在访问便捷性上具有明显优势,同时保持了强大的代码生成能力。 #DeepSeek #DeepCode #ClaudeCode #AI编程 #国产替代 #科技新闻 #编程工具
据手机网易网消息,DeepSeek正式推出DeepCode工具,这是一款可直接替代Claude Code的AI编程助手,且无需翻墙即可使用。DeepCode旨在为开发者提供高效的代码生成与辅助功能,降低使用门槛,尤其适合国内开发者。该工具的落地标志着国产AI编程工具的重要进展,有望吸引更多开发者尝试并推动相关生态发展。与Claude Code相比,DeepCode在访问便捷性上具有明显优势,同时保持了强大的代码生成能力。 #DeepSeek #DeepCode #ClaudeCode #AI编程 #国产替代 #科技新闻 #编程工具
英伟达抢先披露Vera CPU细节,狙击AMD AI大会
英伟达在AMD AI大会前夕,抢先披露了其新一代Vera CPU的技术细节。Vera是全球首款专为代理式AI(Agentic AI)量身定制的处理器,标志着英伟达从“卖显卡”向“卖AI工厂”的垂直整合战略全面铺开。Vera采用创新的Olympus核心,引入神经分支预测器,能高效处理智能体AI的复杂逻辑。其单颗芯片集成88个核心,支持176个线程,并首次在CPU中支持FP8精度。内存方面,Vera采用SOCAMM2 LPDDR5X方案,带宽高达1.2TB/s,是传统DDR5服务器的两倍,功耗却不到一半。基准测试显示,Vera单核性能可达传统x86 CPU的1.8倍,AI智能体任务性能提升约50%,并发能力提升1.6倍。英伟达预计,Vera CPU将于2026年6月交付OpenAI、Anthropic等客户,其2027财年CPU收入有望接近200亿美元,这标志着英伟达正式杀入英特尔与AMD长期统治的服务器CPU市场。 #英伟达 #VeraCPU #AI芯片 #代理式AI #科技新闻
英伟达在AMD AI大会前夕,抢先披露了其新一代Vera CPU的技术细节。Vera是全球首款专为代理式AI(Agentic AI)量身定制的处理器,标志着英伟达从“卖显卡”向“卖AI工厂”的垂直整合战略全面铺开。Vera采用创新的Olympus核心,引入神经分支预测器,能高效处理智能体AI的复杂逻辑。其单颗芯片集成88个核心,支持176个线程,并首次在CPU中支持FP8精度。内存方面,Vera采用SOCAMM2 LPDDR5X方案,带宽高达1.2TB/s,是传统DDR5服务器的两倍,功耗却不到一半。基准测试显示,Vera单核性能可达传统x86 CPU的1.8倍,AI智能体任务性能提升约50%,并发能力提升1.6倍。英伟达预计,Vera CPU将于2026年6月交付OpenAI、Anthropic等客户,其2027财年CPU收入有望接近200亿美元,这标志着英伟达正式杀入英特尔与AMD长期统治的服务器CPU市场。 #英伟达 #VeraCPU #AI芯片 #代理式AI #科技新闻
从零构建LLM推理运行时
近日,一篇技术文章详细介绍了如何从零开始构建自己的LLM推理运行时。文章以名为annotated-llm-runtime的小型运行时为例,逐步讲解了打包权重、处理各种障碍、捕获CUDA图等关键步骤,并重点揭示了开发过程中最常见的三个Bug,这些Bug也是大部分注释产生的原因。该教程基于H100 GPU环境,旨在帮助开发者深入理解LLM推理的底层实现,提升自主优化能力,为AI开发者提供了宝贵的实战经验。 #LLM #推理运行时 #CUDA #AI #技术教程 #从零构建 #H100 #annotated-llm-runtime #Bug #TowardsDataScience
近日,一篇技术文章详细介绍了如何从零开始构建自己的LLM推理运行时。文章以名为annotated-llm-runtime的小型运行时为例,逐步讲解了打包权重、处理各种障碍、捕获CUDA图等关键步骤,并重点揭示了开发过程中最常见的三个Bug,这些Bug也是大部分注释产生的原因。该教程基于H100 GPU环境,旨在帮助开发者深入理解LLM推理的底层实现,提升自主优化能力,为AI开发者提供了宝贵的实战经验。 #LLM #推理运行时 #CUDA #AI #技术教程 #从零构建 #H100 #annotated-llm-runtime #Bug #TowardsDataScience