OpenAI 大幅降价,AI 分析成本降至十分之一
OpenAI 近日将 GPT 5.6 Luna 的价格下调了 80%,使得 AI 辅助分析的成本大幅降低。在针对 SQL 生成的基准测试中,Luna 在最大努力模式下保持了 99.8% 的准确率,价格却比此前的冠军模型低 5 倍;而在语义建模测试中,成本更是降至上周的十分之一。文章指出,随着小型模型已具备前代旗舰模型的智能水平,开发者可通过将其与快速分析数据库引擎结合,以不到半美分每次的成本获得低延迟的 AI 分析答案。这一价格/性能曲线的突变,预示着 AI 在数据分析领域的应用将迎来爆发式增长,用户应重新思考如何利用这些更快、更便宜的模型,例如在低智能任务中使用 Luna 并启用最大努力模式,或者同时提出多个问题以加速迭代。 #AI #OpenAI #数据分析 #成本降低 #GPT5
OpenAI 近日将 GPT 5.6 Luna 的价格下调了 80%,使得 AI 辅助分析的成本大幅降低。在针对 SQL 生成的基准测试中,Luna 在最大努力模式下保持了 99.8% 的准确率,价格却比此前的冠军模型低 5 倍;而在语义建模测试中,成本更是降至上周的十分之一。文章指出,随着小型模型已具备前代旗舰模型的智能水平,开发者可通过将其与快速分析数据库引擎结合,以不到半美分每次的成本获得低延迟的 AI 分析答案。这一价格/性能曲线的突变,预示着 AI 在数据分析领域的应用将迎来爆发式增长,用户应重新思考如何利用这些更快、更便宜的模型,例如在低智能任务中使用 Luna 并启用最大努力模式,或者同时提出多个问题以加速迭代。 #AI #OpenAI #数据分析 #成本降低 #GPT5
DeepSeek-V4-Flash正式版上线,Agent能力大幅跃升
7月31日,DeepSeek-V4-Flash正式版上线。该版本采用MoE架构,总参数2840亿,激活参数130亿,支持1M上下文,仅通过重新后训练就实现了Agent能力的显著增强,基准测试得分远超预览版。在9项Agent基准测试中,其终端操作能力得分从61.8飙升至82.7,代码仓库理解与修改任务得分分别达54.2和54.4,网络安全和工具调用能力也表现突出。综合智能体评测方面,在2026年新推出的现实任务评测基准中得分超过25分。整体性能超越国产模型GLM-5.2,逼近美国Opus 4.8。第三方评测平台显示,其智能指数比4月版本提升10分,仅比OpenAI GPT-5.6 Luna低1分,但API成本优势明显。该模型在前端代码评测中排名顶尖,被视为性价比极高的轻量模型,有望利好AI应用产业链发展。 #DeepSeek #AI模型 #大模型 #人工智能 #Agent #科技新闻 #机器学习 #国产模型
7月31日,DeepSeek-V4-Flash正式版上线。该版本采用MoE架构,总参数2840亿,激活参数130亿,支持1M上下文,仅通过重新后训练就实现了Agent能力的显著增强,基准测试得分远超预览版。在9项Agent基准测试中,其终端操作能力得分从61.8飙升至82.7,代码仓库理解与修改任务得分分别达54.2和54.4,网络安全和工具调用能力也表现突出。综合智能体评测方面,在2026年新推出的现实任务评测基准中得分超过25分。整体性能超越国产模型GLM-5.2,逼近美国Opus 4.8。第三方评测平台显示,其智能指数比4月版本提升10分,仅比OpenAI GPT-5.6 Luna低1分,但API成本优势明显。该模型在前端代码评测中排名顶尖,被视为性价比极高的轻量模型,有望利好AI应用产业链发展。 #DeepSeek #AI模型 #大模型 #人工智能 #Agent #科技新闻 #机器学习 #国产模型
我的人工智能基准测试:"生成一张具有哈布斯堡王朝下颚的青蛙SVG"
用户要求AI生成一张具有哈布斯堡王朝特征下颚的青蛙SVG图像,以测试AI模型的视觉生成能力和细节理解能力。AI生成的SVG代码精准呈现了青蛙的基本形态,包括绿色皮肤、眼睛、鼻孔与疣等特征,并特别强调了夸张前突的下颌构造,将下唇标记为“后缩、藏于颚后”,上齿突于下唇之上,呈现出明显的解剖学夸张注释。该模型在注释中还使用了“massive protruding mandible(巨大突出下颌)”等描述性术语,超越简单标签,体现出对用户复杂需求的精确解析与视觉执行能力。 #AI #SVG生成 #青蛙 #哈布斯堡下颚 #基准测试 #视觉理解
用户要求AI生成一张具有哈布斯堡王朝特征下颚的青蛙SVG图像,以测试AI模型的视觉生成能力和细节理解能力。AI生成的SVG代码精准呈现了青蛙的基本形态,包括绿色皮肤、眼睛、鼻孔与疣等特征,并特别强调了夸张前突的下颌构造,将下唇标记为“后缩、藏于颚后”,上齿突于下唇之上,呈现出明显的解剖学夸张注释。该模型在注释中还使用了“massive protruding mandible(巨大突出下颌)”等描述性术语,超越简单标签,体现出对用户复杂需求的精确解析与视觉执行能力。 #AI #SVG生成 #青蛙 #哈布斯堡下颚 #基准测试 #视觉理解
AI 进步放缓?一篇文章引发的个人使用反思与生态担忧
作者阿诺德·克林近日发表文章,反思个人对AI使用体验的停滞感。他指出,尽管媒体报道AI在数学、编码等领域取得进步,但他发现自己两年前能做的事现在依然能做,并未感受到实质性提升。他回忆了90年代互联网和智能手机时代,无数人成为站长和开发者,推动了生态的蓬勃发展。相比之下,当前的AI生态中,他看不到类似的中间层——即围绕AI核心开发应用并吸引用户的群体。作者认为,OpenAI的“GPTs”和Claude的“技能”尝试未能激发活力,可能是缺乏开发者商业模式,或是担心大公司会吞噬成功应用。他担忧AI的发展轨迹可能远逊于1990年代的互联网。 #AI #人工智能 #技术生态 #OpenAI #Claude #开发社区 #科技反思 #应用创新
作者阿诺德·克林近日发表文章,反思个人对AI使用体验的停滞感。他指出,尽管媒体报道AI在数学、编码等领域取得进步,但他发现自己两年前能做的事现在依然能做,并未感受到实质性提升。他回忆了90年代互联网和智能手机时代,无数人成为站长和开发者,推动了生态的蓬勃发展。相比之下,当前的AI生态中,他看不到类似的中间层——即围绕AI核心开发应用并吸引用户的群体。作者认为,OpenAI的“GPTs”和Claude的“技能”尝试未能激发活力,可能是缺乏开发者商业模式,或是担心大公司会吞噬成功应用。他担忧AI的发展轨迹可能远逊于1990年代的互联网。 #AI #人工智能 #技术生态 #OpenAI #Claude #开发社区 #科技反思 #应用创新
欧盟《人工智能法案》核心条款生效,大模型监管时代来临
欧盟《人工智能法案》作为全球首部全面监管人工智能的法律,于2024年通过,其中规范大型语言模型等核心条款将于今年8月正式实施。该法案最初仅针对AI应用,但在ChatGPT于2022年横空出世后,欧盟立法者决定将底层的大模型技术也纳入监管范围。新规要求所有通用AI模型公开构建方式、训练所用版权内容,并为下游用户提供充分信息。对于最强大的“前沿”模型,开发者还需识别并减轻对社会整体的风险。欧盟委员会已采纳由约舒亚·本吉奥等专家起草的自愿行为准则,多数西方主流AI实验室已签署。欧盟设立AI办公室负责执法,但面临资源有限、人才紧缺的挑战,同时还需平衡美国的关注甚至施压。该法案从根本上旨在保护欧洲公民的安全与基本权利,适用于在欧盟商业化的任何外来AI技术。 #欧盟 #人工智能 #AI法案 #大模型 #监管 #科技法规 #前沿模型
欧盟《人工智能法案》作为全球首部全面监管人工智能的法律,于2024年通过,其中规范大型语言模型等核心条款将于今年8月正式实施。该法案最初仅针对AI应用,但在ChatGPT于2022年横空出世后,欧盟立法者决定将底层的大模型技术也纳入监管范围。新规要求所有通用AI模型公开构建方式、训练所用版权内容,并为下游用户提供充分信息。对于最强大的“前沿”模型,开发者还需识别并减轻对社会整体的风险。欧盟委员会已采纳由约舒亚·本吉奥等专家起草的自愿行为准则,多数西方主流AI实验室已签署。欧盟设立AI办公室负责执法,但面临资源有限、人才紧缺的挑战,同时还需平衡美国的关注甚至施压。该法案从根本上旨在保护欧洲公民的安全与基本权利,适用于在欧盟商业化的任何外来AI技术。 #欧盟 #人工智能 #AI法案 #大模型 #监管 #科技法规 #前沿模型