DeepSeek V4 Pro正式版上线,智能体能力大幅提升
8月12日深夜,DeepSeek在官方群宣布上线V4 Pro正式版,新版本重点增强了智能体(Agent)能力。官方发布的评测数据显示,V4 Pro的智能体性能接近海外前沿模型Claude的Fable 5,与Opus-4.8不相上下,在AutomationBench和CyberGym两项指标上甚至超越Fable 5。定价方面,V4 Pro作为旗舰版,价格约为轻量级V4 Flash的三倍,输入输出均按tokens计费。此前DeepSeek曾预告API将大幅涨价,但此次并未调价。此外,DeepSeek为Harness业务线设立独立发布阵地,外界解读为对标Claude Code的Harness产品即将正式发布。 #DeepSeek #V4Pro #AI #大模型 #智能体 #Agent #科技新闻 #人工智能 #模型评测
8月12日深夜,DeepSeek在官方群宣布上线V4 Pro正式版,新版本重点增强了智能体(Agent)能力。官方发布的评测数据显示,V4 Pro的智能体性能接近海外前沿模型Claude的Fable 5,与Opus-4.8不相上下,在AutomationBench和CyberGym两项指标上甚至超越Fable 5。定价方面,V4 Pro作为旗舰版,价格约为轻量级V4 Flash的三倍,输入输出均按tokens计费。此前DeepSeek曾预告API将大幅涨价,但此次并未调价。此外,DeepSeek为Harness业务线设立独立发布阵地,外界解读为对标Claude Code的Harness产品即将正式发布。 #DeepSeek #V4Pro #AI #大模型 #智能体 #Agent #科技新闻 #人工智能 #模型评测
7月美国企业AI消费:OpenAI GPT-5.6 Sol收入领先Anthropic Fable 5
金融科技公司Ramp发布的AI指数显示,今年7月,美国企业在OpenAI的GPT-5.6 Sol模型上的支出约为Anthropic Fable 5的75%,表明OpenAI在顶级模型收入上领先。尽管Anthropic在企业采用率上仍以43.5%高于OpenAI的39.7%,但企业对高端模型需求较弱,可能预示企业正控制AI支出。Ramp追踪超7万家美国企业账单,发现AI支出最高的前1%企业人均支出达7400美元,整体企业人均支出约12美元。AI Agent成为增长引擎,推动支出快速扩张。Anthropic在IPO前夕押注用户愿为先进技术支付更高价,但其Fable 5曾因政府命令下架,7月恢复后多次调价。中国开源AI模型热度上升,但未威胁头部厂商。 #AI #OpenAI #Anthropic #企业支出 #Ramp #GPT5 #Fable5 #科技新闻 #AI消费
金融科技公司Ramp发布的AI指数显示,今年7月,美国企业在OpenAI的GPT-5.6 Sol模型上的支出约为Anthropic Fable 5的75%,表明OpenAI在顶级模型收入上领先。尽管Anthropic在企业采用率上仍以43.5%高于OpenAI的39.7%,但企业对高端模型需求较弱,可能预示企业正控制AI支出。Ramp追踪超7万家美国企业账单,发现AI支出最高的前1%企业人均支出达7400美元,整体企业人均支出约12美元。AI Agent成为增长引擎,推动支出快速扩张。Anthropic在IPO前夕押注用户愿为先进技术支付更高价,但其Fable 5曾因政府命令下架,7月恢复后多次调价。中国开源AI模型热度上升,但未威胁头部厂商。 #AI #OpenAI #Anthropic #企业支出 #Ramp #GPT5 #Fable5 #科技新闻 #AI消费
发布 AI 裁判平台:设定目标,AI 小组辩论,裁判裁决完成
近日,一款名为 的 AI 工具在 Hacker News 上亮相。该平台允许用户设定一个目标(如数学证明、文献问题或商业决策),然后由多个 AI 模型组成的小组进行辩论,最后由一个“裁判”模型根据预设的标准(如专家级、出版级或正式证明级)和可验证的证据来裁决目标是否达成。裁判不依赖模型的说服力,而是严格审查每个声明背后的文献来源和计算验证。平台集成了 arXiv、OpenAlex 等学术数据库,并支持 Python 代码执行以验证结果。此外,系统具备“卡住”处理机制,当某个模型遇到瓶颈时,会将具体问题转交给最合适的模型处理,避免无效消耗。所有已建立的结果保存在共享账本中,支持暂停和恢复。 旨在提供一种基于证据而非观点的 AI 协作与验证新范式。 #AI #裁判 #辩论 #证据 #验证 #数学证明 #文献 #HackerNews #新产品 #协作
近日,一款名为 的 AI 工具在 Hacker News 上亮相。该平台允许用户设定一个目标(如数学证明、文献问题或商业决策),然后由多个 AI 模型组成的小组进行辩论,最后由一个“裁判”模型根据预设的标准(如专家级、出版级或正式证明级)和可验证的证据来裁决目标是否达成。裁判不依赖模型的说服力,而是严格审查每个声明背后的文献来源和计算验证。平台集成了 arXiv、OpenAlex 等学术数据库,并支持 Python 代码执行以验证结果。此外,系统具备“卡住”处理机制,当某个模型遇到瓶颈时,会将具体问题转交给最合适的模型处理,避免无效消耗。所有已建立的结果保存在共享账本中,支持暂停和恢复。 旨在提供一种基于证据而非观点的 AI 协作与验证新范式。 #AI #裁判 #辩论 #证据 #验证 #数学证明 #文献 #HackerNews #新产品 #协作
AI文本水印技术揭秘
AI生成的文本也能打上水印?尽管纯文本没有像素或元数据可隐藏信息,但Google和Claude等模型已经实现了这一功能。其原理并非改变字符本身,而是利用模型生成过程中每个词的“选择”来嵌入标记。当模型在多个候选词之间做选择时,系统会通过一个秘密密钥将候选词随机分为“绿色”和“红色”两组,并轻微偏向绿色词,使得水印文本整体上更倾向于使用绿色词。这种偏向非常温和,红色词仍可能被选中,因此文本读起来完全自然。只有持有密钥的人才能检测出这种统计偏差。Google自2024年起在Gemini应用和网页版中使用了该技术,而Claude也计划从2026年起在新模型上实施。这种方法不依赖任何字符级修改,因而能抵抗复制粘贴,且对用户完全透明,为AI生成内容的溯源和防伪提供了新思路。 #AI #文本水印 #大模型 #安全技术 #科技前沿 #AI安全 #水印算法 #Google #Claude #OpenAI
AI生成的文本也能打上水印?尽管纯文本没有像素或元数据可隐藏信息,但Google和Claude等模型已经实现了这一功能。其原理并非改变字符本身,而是利用模型生成过程中每个词的“选择”来嵌入标记。当模型在多个候选词之间做选择时,系统会通过一个秘密密钥将候选词随机分为“绿色”和“红色”两组,并轻微偏向绿色词,使得水印文本整体上更倾向于使用绿色词。这种偏向非常温和,红色词仍可能被选中,因此文本读起来完全自然。只有持有密钥的人才能检测出这种统计偏差。Google自2024年起在Gemini应用和网页版中使用了该技术,而Claude也计划从2026年起在新模型上实施。这种方法不依赖任何字符级修改,因而能抵抗复制粘贴,且对用户完全透明,为AI生成内容的溯源和防伪提供了新思路。 #AI #文本水印 #大模型 #安全技术 #科技前沿 #AI安全 #水印算法 #Google #Claude #OpenAI
ParleHub 发布企业AI协作与成本控制平台,精准追踪项目支出
ParleHub 正式上线,这是一个专为企业设计的AI协作与成本控制平台。其核心功能是为每个项目创建独立的共享线程、预算和费用代码,使AI使用成本直接归属于具体项目,并可直接导出到企业现有的计费系统,解决了以往AI费用无法追溯、分散在管理费中的痛点。平台支持设置预算上限,避免失控支出,同时保留弹性审批路径。在安全方面,ParleHub 提供企业级SSO(支持Microsoft Entra ID和Google Workspace)、文件始终保留在客户租户内、防篡改审计日志及精细的权限管理。它支持Anthropic、OpenAI、Google Gemini等多个模型,项目可切换模型而保持上下文连贯。此外,共享的对话历史使团队知识得到保留,新成员无需重新构建上下文,大幅提升协作效率。 #企业AI #成本控制 #项目管理 #AI协作 #SaaS #企业软件 #安全审计 #模型管理
ParleHub 正式上线,这是一个专为企业设计的AI协作与成本控制平台。其核心功能是为每个项目创建独立的共享线程、预算和费用代码,使AI使用成本直接归属于具体项目,并可直接导出到企业现有的计费系统,解决了以往AI费用无法追溯、分散在管理费中的痛点。平台支持设置预算上限,避免失控支出,同时保留弹性审批路径。在安全方面,ParleHub 提供企业级SSO(支持Microsoft Entra ID和Google Workspace)、文件始终保留在客户租户内、防篡改审计日志及精细的权限管理。它支持Anthropic、OpenAI、Google Gemini等多个模型,项目可切换模型而保持上下文连贯。此外,共享的对话历史使团队知识得到保留,新成员无需重新构建上下文,大幅提升协作效率。 #企业AI #成本控制 #项目管理 #AI协作 #SaaS #企业软件 #安全审计 #模型管理
DeepSeek V4 Pro 正式上线,Agent 能力大幅提升
8月13日凌晨,DeepSeek V4 Pro 正式推出并更新至 API,版本号为 DeepSeek-V4-Pro-0813。新版本重点增强了 Agent 能力,在多项基准测试中表现亮眼。在 AI 编程智能体基准测试 DeepSWE 中,得分从预览版的 7.3 飙升至 62.7,超越 Claude Opus 4.8;在 AI 安全智能体基准测试 Cybergym 和智能体基准测试 AutomationBench 中,甚至超越了目前公认最强的 Claude Fable 5。此前 DeepSeek 已宣布计划近期整体上调 API 服务定价,涨幅预计较大,提醒用户合理安排使用。 #DeepSeek #V4Pro #AI #智能体 #大模型 #科技新闻
8月13日凌晨,DeepSeek V4 Pro 正式推出并更新至 API,版本号为 DeepSeek-V4-Pro-0813。新版本重点增强了 Agent 能力,在多项基准测试中表现亮眼。在 AI 编程智能体基准测试 DeepSWE 中,得分从预览版的 7.3 飙升至 62.7,超越 Claude Opus 4.8;在 AI 安全智能体基准测试 Cybergym 和智能体基准测试 AutomationBench 中,甚至超越了目前公认最强的 Claude Fable 5。此前 DeepSeek 已宣布计划近期整体上调 API 服务定价,涨幅预计较大,提醒用户合理安排使用。 #DeepSeek #V4Pro #AI #智能体 #大模型 #科技新闻