AI辅助解决数学优化领域30年难题,GPT-5.6 Sol 模型2.5小时完成证明
一位应用数学博士在个人博客中透露,OpenAI最新发布的GPT-5.6 Sol模型在2.5小时内成功证明了一个自1996年以来悬而未决的数学优化理论难题。该研究者曾多次尝试使用GPT-5.4和5.5版本解决此问题,均未成功。此次,他提供了10页长的论文提示,模型在无人工干预下一次性完成证明。为确保证明无误,研究者还将结果转化为数学证明语言Lean进行形式化验证,验证通过。该突破被认为标志着AI在数学研究领域进入全新阶段,但研究者也强调,AI生成结果仍需谨慎对待,形式化验证工具Lean的价值因此凸显。相关论文、提示及对话记录已公开在GitHub上。 #OpenAI #GPT5 #数学优化 #AI研究 #Lean验证 #形式化验证 #数学证明 #计算机科学 #技术突破
一位应用数学博士在个人博客中透露,OpenAI最新发布的GPT-5.6 Sol模型在2.5小时内成功证明了一个自1996年以来悬而未决的数学优化理论难题。该研究者曾多次尝试使用GPT-5.4和5.5版本解决此问题,均未成功。此次,他提供了10页长的论文提示,模型在无人工干预下一次性完成证明。为确保证明无误,研究者还将结果转化为数学证明语言Lean进行形式化验证,验证通过。该突破被认为标志着AI在数学研究领域进入全新阶段,但研究者也强调,AI生成结果仍需谨慎对待,形式化验证工具Lean的价值因此凸显。相关论文、提示及对话记录已公开在GitHub上。 #OpenAI #GPT5 #数学优化 #AI研究 #Lean验证 #形式化验证 #数学证明 #计算机科学 #技术突破
同一开源模型不同后端响应速度相差八倍,「流式」输出竟是假象
团队在部署开源模型GLM-5.2时发现,相同模型使用不同服务后端,首个token的响应时间可相差8倍。其中一家云服务商提供的兼容OpenAI API的端点虽然声称支持流式传输,实际却是在生成完整响应后一次性输出所有token,导致每次对话出现长达10秒的停顿。通过切换至更近的数据中心,延迟仅改善约18%,说明缓存是根本原因。进一步测试表明,在实际的缓存命中场景下,廉价端点的响应时间从10秒降至2.7秒,性能差距大幅缩小。这警示开发者:仅凭基准测试或供应商规格表无法反映真实性能。应在实际流量模式下评估后端,关注缓存提示词下的有效吞吐量,而非冷启动请求的假象数据。最终团队选择将专用推理主机设为主力,云端点作为备用系统。 #LLM #模型部署 #性能测试 #流式传输 #OpenAI兼容 #云计算
团队在部署开源模型GLM-5.2时发现,相同模型使用不同服务后端,首个token的响应时间可相差8倍。其中一家云服务商提供的兼容OpenAI API的端点虽然声称支持流式传输,实际却是在生成完整响应后一次性输出所有token,导致每次对话出现长达10秒的停顿。通过切换至更近的数据中心,延迟仅改善约18%,说明缓存是根本原因。进一步测试表明,在实际的缓存命中场景下,廉价端点的响应时间从10秒降至2.7秒,性能差距大幅缩小。这警示开发者:仅凭基准测试或供应商规格表无法反映真实性能。应在实际流量模式下评估后端,关注缓存提示词下的有效吞吐量,而非冷启动请求的假象数据。最终团队选择将专用推理主机设为主力,云端点作为备用系统。 #LLM #模型部署 #性能测试 #流式传输 #OpenAI兼容 #云计算
月之暗面发布2.8万亿参数大模型Kimi K3
中国AI实验室月之暗面今日发布Kimi K3模型,宣称这是其“迄今为止能力最强的模型,拥有2.8万亿参数”。该模型已通过网站和API上线,并承诺将于2026年7月27日开放权重。月之暗面称其为首个“开源3T级模型”,在自报基准测试中,K3主要击败了Claude Opus 4.8 Max和GPT-5.5 High,但略逊于Claude Fable 5和GPT-5.6 Sol。该模型在Artificial Analysis报告中还成为Frontend Code Arena的领先模型,超越了Claude Fable 5。K3的定价为每百万输入代币3美元、输出代币15美元,与Anthropic的Claude Sonnet系列持平,成为目前最贵的中国AI实验室模型,远超其前代Kimi K2.6的价格。作者用OpenRouter运行K3生成骑自行车鹈鹕的SVG,消耗95个输入代币和16,658个输出代币,花费25美分。虽然鹈鹕基准测试曾是评估模型能力的趣味指标,但如今已无法有效反映模型在代理工具调用等关键领域的性能。 #月之暗面 #KimiK3 #大模型 #AI #开源 #基准测试 #技术
中国AI实验室月之暗面今日发布Kimi K3模型,宣称这是其“迄今为止能力最强的模型,拥有2.8万亿参数”。该模型已通过网站和API上线,并承诺将于2026年7月27日开放权重。月之暗面称其为首个“开源3T级模型”,在自报基准测试中,K3主要击败了Claude Opus 4.8 Max和GPT-5.5 High,但略逊于Claude Fable 5和GPT-5.6 Sol。该模型在Artificial Analysis报告中还成为Frontend Code Arena的领先模型,超越了Claude Fable 5。K3的定价为每百万输入代币3美元、输出代币15美元,与Anthropic的Claude Sonnet系列持平,成为目前最贵的中国AI实验室模型,远超其前代Kimi K2.6的价格。作者用OpenRouter运行K3生成骑自行车鹈鹕的SVG,消耗95个输入代币和16,658个输出代币,花费25美分。虽然鹈鹕基准测试曾是评估模型能力的趣味指标,但如今已无法有效反映模型在代理工具调用等关键领域的性能。 #月之暗面 #KimiK3 #大模型 #AI #开源 #基准测试 #技术
LM Studio Bionic
LM Studio 团队正式推出全新应用 LM Studio Bionic,这是一款专为开源模型设计的AI智能体,旨在帮助用户完成编码、研究及文档处理等复杂工作。Bionic 支持使用本地模型,也允许用户切换到云端开源模型处理更繁重的任务,同时保障隐私和控制AI使用成本。LM Studio 承诺对所有用户实行“零数据保留”,且绝不会用用户数据进行训练。Bionic 集成了多种先进功能:包括由 Mistral AI 的 Voxtral 驱动的本地音频转录语音键盘,可在任意应用中听写输入;强大的代码处理能力,能检查、解释和修改本地代码库,并生成内联差异方便审查;支持 GLM 5.2 和 Kimi K2.7 Code 等前沿开源模型;以及用于深度知识工作的文档处理功能,可在沙盒环境中安全操作。Bionic 还内置本地模型下载功能,并可通过 LM Studio Secure Cloud 使用最新云端开源模型。用户可免费下载 Bionic 使用。 #LMStudio #AI智能体 #开源模型 #本地AI #编程工具 #大模型
LM Studio 团队正式推出全新应用 LM Studio Bionic,这是一款专为开源模型设计的AI智能体,旨在帮助用户完成编码、研究及文档处理等复杂工作。Bionic 支持使用本地模型,也允许用户切换到云端开源模型处理更繁重的任务,同时保障隐私和控制AI使用成本。LM Studio 承诺对所有用户实行“零数据保留”,且绝不会用用户数据进行训练。Bionic 集成了多种先进功能:包括由 Mistral AI 的 Voxtral 驱动的本地音频转录语音键盘,可在任意应用中听写输入;强大的代码处理能力,能检查、解释和修改本地代码库,并生成内联差异方便审查;支持 GLM 5.2 和 Kimi K2.7 Code 等前沿开源模型;以及用于深度知识工作的文档处理功能,可在沙盒环境中安全操作。Bionic 还内置本地模型下载功能,并可通过 LM Studio Secure Cloud 使用最新云端开源模型。用户可免费下载 Bionic 使用。 #LMStudio #AI智能体 #开源模型 #本地AI #编程工具 #大模型
Kimi K3 评测
据 Artificial Analysis 发布的最新模型评测,Kimi K3 在智力指数上表现突出,综合评分为 57 分,远高于同类模型平均的 30 分,排名位居第四。不过该模型在速度和价格方面表现一般:输出速度仅 62 tokens/秒,低于平均水平的 73 tokens/秒;输入价格为每百万 tokens 3 美元,输出价格为 15 美元,均高于同类均价。评测中该模型生成了 1.3 亿输出 tokens,属于非常冗长的模型。Kimi K3 支持文本和图像输入,输出文本,上下文窗口达 100 万 tokens,并具备推理能力。 #KimiK3 #人工智能 #模型评测 #大语言模型 #AI
据 Artificial Analysis 发布的最新模型评测,Kimi K3 在智力指数上表现突出,综合评分为 57 分,远高于同类模型平均的 30 分,排名位居第四。不过该模型在速度和价格方面表现一般:输出速度仅 62 tokens/秒,低于平均水平的 73 tokens/秒;输入价格为每百万 tokens 3 美元,输出价格为 15 美元,均高于同类均价。评测中该模型生成了 1.3 亿输出 tokens,属于非常冗长的模型。Kimi K3 支持文本和图像输入,输出文本,上下文窗口达 100 万 tokens,并具备推理能力。 #KimiK3 #人工智能 #模型评测 #大语言模型 #AI
Anthropic发现大模型存在未知潜意识空间“J
据外媒报道,Anthropic研究团队近期在内部探索中发现,大型语言模型的神经网络中隐藏着一个此前未知的“潜意识”区域,他们将其命名为“J-space”。该空间位于模型隐层表征的特殊维度,包含大量未被激活或显式训练过的潜在概念,能够在特定输入下被唤醒并影响模型输出行为。研究显示,J-space中的表征可能与训练数据中的隐性模式相关,甚至包含未被充分理解的情感或逻辑倾向。这一发现引发了对AI安全与可解释性的新讨论,专家认为,深入理解J-space或有助于防范模型产生不可控的“潜意识”偏差,同时对未来模型架构设计提出挑战。目前,Anthropic正计划公开更多技术细节,并呼吁行业共同研究这一现象。 #AI #大模型 #潜意识 #Anthropic #人工智能安全 #神经网络 #科研 #可解释性
据外媒报道,Anthropic研究团队近期在内部探索中发现,大型语言模型的神经网络中隐藏着一个此前未知的“潜意识”区域,他们将其命名为“J-space”。该空间位于模型隐层表征的特殊维度,包含大量未被激活或显式训练过的潜在概念,能够在特定输入下被唤醒并影响模型输出行为。研究显示,J-space中的表征可能与训练数据中的隐性模式相关,甚至包含未被充分理解的情感或逻辑倾向。这一发现引发了对AI安全与可解释性的新讨论,专家认为,深入理解J-space或有助于防范模型产生不可控的“潜意识”偏差,同时对未来模型架构设计提出挑战。目前,Anthropic正计划公开更多技术细节,并呼吁行业共同研究这一现象。 #AI #大模型 #潜意识 #Anthropic #人工智能安全 #神经网络 #科研 #可解释性
北欧时报德国慕尼黑现场|从汽车到Physical AI
据北欧时报德国慕尼黑现场报道,小鹏汽车在活动现场正式提出战略转型方向,从传统汽车制造迈向Physical AI(物理人工智能)领域,并以此在欧洲市场吹响全球化新号角。这一概念融合了智能驾驶、机器人技术等前沿领域,标志着小鹏从单纯车企向AI驱动的实体科技公司转型。该战略旨在借助德国作为欧洲汽车工业重镇的影响力,加速海外市场布局,提升中国智能电动汽车品牌的国际竞争力。小鹏汽车通过展示其技术愿景,向全球业界传递了深耕欧洲、引领物理AI时代的决心。 #小鹏汽车 #PhysicalAI #全球化 #慕尼黑 #北欧时报 #智能汽车 #科技 #中国车企出海 #AI转型
据北欧时报德国慕尼黑现场报道,小鹏汽车在活动现场正式提出战略转型方向,从传统汽车制造迈向Physical AI(物理人工智能)领域,并以此在欧洲市场吹响全球化新号角。这一概念融合了智能驾驶、机器人技术等前沿领域,标志着小鹏从单纯车企向AI驱动的实体科技公司转型。该战略旨在借助德国作为欧洲汽车工业重镇的影响力,加速海外市场布局,提升中国智能电动汽车品牌的国际竞争力。小鹏汽车通过展示其技术愿景,向全球业界传递了深耕欧洲、引领物理AI时代的决心。 #小鹏汽车 #PhysicalAI #全球化 #慕尼黑 #北欧时报 #智能汽车 #科技 #中国车企出海 #AI转型