AI 实现从头重写完整程序,MirrorCode 基准测试揭示新能力
近年来,AI 在软件工程基准测试中进步迅速,但多数任务聚焦于修复漏洞或实现单一功能。Anthropic 与 METR 联合推出的 MirrorCode 基准测试,要求 AI 模型在不接触原始源码的情况下,从头到尾重写整个程序,且输出必须与原始程序完全一致。该基准涵盖 Unix 工具、数据序列化、生物信息学、密码学等 25 个目标程序,并提供充足推理预算(单个任务最高花费 2600 美元、运行 19 天)。测试显示,Claude Opus 4.7 成功重写了约 1.6 万行 Go 代码的生物信息学工具包 gotree,耗时 14 小时、花费 251 美元,而人类工程师需 2 至 17 周。尽管存在数据污染风险(模型可能记忆过开源代码),但记忆筛查表明结果并非由记忆主导。目前 MirrorCode 尚未被完全攻克,排行榜持续更新中。 #AI #软件工程 #MirrorCode #基准测试 #大模型 #Claude #编程 #自动化
近年来,AI 在软件工程基准测试中进步迅速,但多数任务聚焦于修复漏洞或实现单一功能。Anthropic 与 METR 联合推出的 MirrorCode 基准测试,要求 AI 模型在不接触原始源码的情况下,从头到尾重写整个程序,且输出必须与原始程序完全一致。该基准涵盖 Unix 工具、数据序列化、生物信息学、密码学等 25 个目标程序,并提供充足推理预算(单个任务最高花费 2600 美元、运行 19 天)。测试显示,Claude Opus 4.7 成功重写了约 1.6 万行 Go 代码的生物信息学工具包 gotree,耗时 14 小时、花费 251 美元,而人类工程师需 2 至 17 周。尽管存在数据污染风险(模型可能记忆过开源代码),但记忆筛查表明结果并非由记忆主导。目前 MirrorCode 尚未被完全攻克,排行榜持续更新中。 #AI #软件工程 #MirrorCode #基准测试 #大模型 #Claude #编程 #自动化
AI输出不受言论保护?法律争议聚焦人类身份证明
美国法律界正就人工智能输出是否受第一修正案保护展开激烈辩论。多篇法学论文主张,大语言模型输出不属于“言论”,因此可不受严格审查而直接监管。在Garcia诉Character Technologies案中,一名14岁少年与AI角色对话后自杀,法官Anne Conway裁定“不准备认定LLM输出为言论”,允许产品责任和过失索赔继续审理。该案虽于2026年1月和解,但类似诉讼仍在增加,指控AI输出导致医疗危机、暴力或向未成年人提供色情内容。若人类表达受保护而机器输出不受,法律需区分人机创作——但现有技术无法可靠识别文本来源。替代方案如身份验证会加重表达负担,可能削弱匿名性、增加监控压力。这一不确定性对用户和读者的影响可能大于模型开发者。 #AI #言论自由 #第一修正案 #法律 #人工智能 #监管 #隐私 #大语言模型
美国法律界正就人工智能输出是否受第一修正案保护展开激烈辩论。多篇法学论文主张,大语言模型输出不属于“言论”,因此可不受严格审查而直接监管。在Garcia诉Character Technologies案中,一名14岁少年与AI角色对话后自杀,法官Anne Conway裁定“不准备认定LLM输出为言论”,允许产品责任和过失索赔继续审理。该案虽于2026年1月和解,但类似诉讼仍在增加,指控AI输出导致医疗危机、暴力或向未成年人提供色情内容。若人类表达受保护而机器输出不受,法律需区分人机创作——但现有技术无法可靠识别文本来源。替代方案如身份验证会加重表达负担,可能削弱匿名性、增加监控压力。这一不确定性对用户和读者的影响可能大于模型开发者。 #AI #言论自由 #第一修正案 #法律 #人工智能 #监管 #隐私 #大语言模型
AI 正在杀死中国智能手机上的传统 APP
中国手机厂商正借助 AI 打破苹果和谷歌主导的手机应用范式。中兴推出搭载字节跳动豆包 AI 代理的 Nubia NaviX Ultra,该手机没有主屏幕和传统应用商店;另一家由前微软高管创立的 StepFun 发布了 StepX Neo,其系统内置 AI 代理,可将手机功能重组为用户所需的任务;荣耀则在 MagicOS 10 中集成了与阿里巴巴合作开发的 YOYO 智能代理。这些手机均使用 Anthropic 的模型上下文协议(MCP)实现系统级代理访问,但不会进入美国市场。与苹果、谷歌依赖 APP 收入分成不同,中国厂商没有 APP 生态利益,因此可以大胆用 AI 代理层替代 APP 层。这一趋势已导致手机应用内购买收入在 2026 年初下降约 40%。 #AI手机 #中国科技 #智能手机 #无APP #人工智能 #科技趋势
中国手机厂商正借助 AI 打破苹果和谷歌主导的手机应用范式。中兴推出搭载字节跳动豆包 AI 代理的 Nubia NaviX Ultra,该手机没有主屏幕和传统应用商店;另一家由前微软高管创立的 StepFun 发布了 StepX Neo,其系统内置 AI 代理,可将手机功能重组为用户所需的任务;荣耀则在 MagicOS 10 中集成了与阿里巴巴合作开发的 YOYO 智能代理。这些手机均使用 Anthropic 的模型上下文协议(MCP)实现系统级代理访问,但不会进入美国市场。与苹果、谷歌依赖 APP 收入分成不同,中国厂商没有 APP 生态利益,因此可以大胆用 AI 代理层替代 APP 层。这一趋势已导致手机应用内购买收入在 2026 年初下降约 40%。 #AI手机 #中国科技 #智能手机 #无APP #人工智能 #科技趋势
AI Agent 能力被严重低估:从 Claude Code 看当前 AI 实际水平
Google DeepMind 研究员 David P. Reichert 发文指出,许多人仍基于一年前的聊天机器人体验来评判 AI,严重低估了当前 AI agent 的能力。他以 Anthropic 的 Claude Code 为例,展示该代理自主完成了一系列机器学习实验,包括生成神经细胞自动机和迷宫等交互式演示。作者认为,对于数字工作,AI agent 至少已达到初级研究员或研究生水平,具备极快的知识检索和任务执行能力,但仍会犯奇怪错误;主要局限在于缺乏长期持续学习能力,难以执行超过一周的人类时间项目。他呼吁公众更新对 AI 现状的认知,正视其即将带来的深远影响。 #AI #人工智能 #Claude #AI代理 #机器学习 #技术前沿 #认知偏差
Google DeepMind 研究员 David P. Reichert 发文指出,许多人仍基于一年前的聊天机器人体验来评判 AI,严重低估了当前 AI agent 的能力。他以 Anthropic 的 Claude Code 为例,展示该代理自主完成了一系列机器学习实验,包括生成神经细胞自动机和迷宫等交互式演示。作者认为,对于数字工作,AI agent 至少已达到初级研究员或研究生水平,具备极快的知识检索和任务执行能力,但仍会犯奇怪错误;主要局限在于缺乏长期持续学习能力,难以执行超过一周的人类时间项目。他呼吁公众更新对 AI 现状的认知,正视其即将带来的深远影响。 #AI #人工智能 #Claude #AI代理 #机器学习 #技术前沿 #认知偏差
AI 攻克数学难题
2026年5月20日,OpenAI 宣布其内部AI模型成功为数学家保罗·埃尔德什于1946年提出的“单位距离问题”构造出反例,这是首个由AI完成的历史性数学证明。尽管结果并非最终定论,人类数学家数周内便大幅改进,但该模型创新性地引入了此前无人成功应用的数学分支思想,并在数天内催生了其他重要问题的解法。同年8月1日,OpenAI 又宣布其未发布模型Astra取得10项数学进展,包括解决另外三个埃尔德什问题。普林斯顿大学数学家诺加·阿隆评价称,这些突破标志着AI数学能力的“相变”,正深刻改变数学研究方式。埃尔德什生前提出数千个猜想,常以小额奖金悬赏求解,如今这些难题成为科技巨头展示AI实力的竞技场。 #AI #数学 #埃尔德什 #OpenAI #人工智能 #数学证明 #科技突破
2026年5月20日,OpenAI 宣布其内部AI模型成功为数学家保罗·埃尔德什于1946年提出的“单位距离问题”构造出反例,这是首个由AI完成的历史性数学证明。尽管结果并非最终定论,人类数学家数周内便大幅改进,但该模型创新性地引入了此前无人成功应用的数学分支思想,并在数天内催生了其他重要问题的解法。同年8月1日,OpenAI 又宣布其未发布模型Astra取得10项数学进展,包括解决另外三个埃尔德什问题。普林斯顿大学数学家诺加·阿隆评价称,这些突破标志着AI数学能力的“相变”,正深刻改变数学研究方式。埃尔德什生前提出数千个猜想,常以小额奖金悬赏求解,如今这些难题成为科技巨头展示AI实力的竞技场。 #AI #数学 #埃尔德什 #OpenAI #人工智能 #数学证明 #科技突破