Roblox 高管:仅靠勾选年龄验证已不足够,将采用面部估计技术
Roblox 安全产品政策副总裁 Eliza Jacobs 向 NBC 新闻表示,公司对其新面部年龄估计技术持“乐观”态度,并称“勾选一个框来声称自己13岁或以上,这已经不够了”。NBC 邀请一组儿童测试 Roblox 的视频自拍年龄验证流程,他们试图用假胡须蒙混过关但未能成功。Jacobs 声称 Roblox 的面部年龄估计通常能精确到“孩子真实年龄的1.4年以内”。该技术旨在提升平台对未成年人保护的准确性,防止低龄用户冒充成年人接触不当内容。 #Roblox #年龄验证 #面部识别 #儿童安全 #科技新闻 #隐私保护 #AI年龄估计
Roblox 安全产品政策副总裁 Eliza Jacobs 向 NBC 新闻表示,公司对其新面部年龄估计技术持“乐观”态度,并称“勾选一个框来声称自己13岁或以上,这已经不够了”。NBC 邀请一组儿童测试 Roblox 的视频自拍年龄验证流程,他们试图用假胡须蒙混过关但未能成功。Jacobs 声称 Roblox 的面部年龄估计通常能精确到“孩子真实年龄的1.4年以内”。该技术旨在提升平台对未成年人保护的准确性,防止低龄用户冒充成年人接触不当内容。 #Roblox #年龄验证 #面部识别 #儿童安全 #科技新闻 #隐私保护 #AI年龄估计
AI 不能拯救交付不力的公司
近日,一篇题为《AI Won't Fix a Company That Can't Ship》的文章引发关注。作者尼基尔·苏雷什分享了自己在数据科学领域的经历:他曾在多家企业担任机器学习岗位,但多数项目最终并无机器学习成分,问题根源往往出现在运维、流程或管理层面。他举例说,一家医院想用AI自动分析全澳救护记录,最终发现99%的工作只是关键词搜索与网页开发。他指出,自ChatGPT面世后,AI泡沫再度膨胀,但企业若缺乏真正能交付的能力,单靠AI无法解决问题。他的数据咨询公司明确拒绝承接AI项目,认为长期来看这不值得投入。 #AI泡沫 #数据科学 #技术交付 #项目管理 #数字化转型
近日,一篇题为《AI Won't Fix a Company That Can't Ship》的文章引发关注。作者尼基尔·苏雷什分享了自己在数据科学领域的经历:他曾在多家企业担任机器学习岗位,但多数项目最终并无机器学习成分,问题根源往往出现在运维、流程或管理层面。他举例说,一家医院想用AI自动分析全澳救护记录,最终发现99%的工作只是关键词搜索与网页开发。他指出,自ChatGPT面世后,AI泡沫再度膨胀,但企业若缺乏真正能交付的能力,单靠AI无法解决问题。他的数据咨询公司明确拒绝承接AI项目,认为长期来看这不值得投入。 #AI泡沫 #数据科学 #技术交付 #项目管理 #数字化转型
AI编码代理在修复Bug时反复切换方案,令人哭笑不得
一位开发者使用Claude Opus 4.6 AI编码代理(通过GitHub Copilot插件集成在GoLand IDE中)修复GoAWK项目中的非平凡Bug。AI迅速诊断出问题根源:特殊变量(如NR)被存储为原生Go int类型,导致字符串表示丢失。然而,在提出修复方案时,AI在7种不同选项之间反复切换超过25次,不断自我否定,例如“实际上,最简单的修复是……”“但不对,真正的问题是……”。最终,开发者选择了被推荐次数最多的方案B(共26次中推荐11次),并在Pull Request中实施。这一过程展示了当前AI编码代理在决策上的犹豫不决,但也体现了其快速诊断复杂问题的能力。 #AI编码 #Claude #GoAWK #Bug修复 #AI代理 #软件开发 #技术新闻
一位开发者使用Claude Opus 4.6 AI编码代理(通过GitHub Copilot插件集成在GoLand IDE中)修复GoAWK项目中的非平凡Bug。AI迅速诊断出问题根源:特殊变量(如NR)被存储为原生Go int类型,导致字符串表示丢失。然而,在提出修复方案时,AI在7种不同选项之间反复切换超过25次,不断自我否定,例如“实际上,最简单的修复是……”“但不对,真正的问题是……”。最终,开发者选择了被推荐次数最多的方案B(共26次中推荐11次),并在Pull Request中实施。这一过程展示了当前AI编码代理在决策上的犹豫不决,但也体现了其快速诊断复杂问题的能力。 #AI编码 #Claude #GoAWK #Bug修复 #AI代理 #软件开发 #技术新闻
AI为办公族节省工时,却催生'机器人保姆'新负担
一项覆盖美英澳6000名数字工作者的最新调查显示,AI每周为每位员工节省约11小时,但平均需花费超6小时进行“机器人保姆”(botsitting)——即检查AI输出、修正错误并重新输入指令。来自斯坦福大学、加州大学伯克利分校等机构的学者指出,当前个人生产力显著提升,但仅有13%的企业因此获得实际业务增长。研究揭示,AI有超过三分之一的会话完全失败,迫使员工重新启动或大幅返工。每获得一小时有效AI输出,员工需额外花费近一小时使其可用。更令人担忧的是,41%的受访者承认有时提交自己也无法解释的AI生成工作。专家认为,这种隐性人力劳动正在抵消AI的效率红利,企业需重新审视AI工具的实际部署价值。 #人工智能 #工作效率 #AI应用 #botsitting #职场趋势 #科技新闻 #生产力 #研究调查 #AI失败率
一项覆盖美英澳6000名数字工作者的最新调查显示,AI每周为每位员工节省约11小时,但平均需花费超6小时进行“机器人保姆”(botsitting)——即检查AI输出、修正错误并重新输入指令。来自斯坦福大学、加州大学伯克利分校等机构的学者指出,当前个人生产力显著提升,但仅有13%的企业因此获得实际业务增长。研究揭示,AI有超过三分之一的会话完全失败,迫使员工重新启动或大幅返工。每获得一小时有效AI输出,员工需额外花费近一小时使其可用。更令人担忧的是,41%的受访者承认有时提交自己也无法解释的AI生成工作。专家认为,这种隐性人力劳动正在抵消AI的效率红利,企业需重新审视AI工具的实际部署价值。 #人工智能 #工作效率 #AI应用 #botsitting #职场趋势 #科技新闻 #生产力 #研究调查 #AI失败率
主权AI不仅是构建国家AI模型
近期,AI市场出现重大变化:前沿AI模型不再被视为单纯的软件产品,而是开始被当作类似半导体的战略资产。随着模型访问权限可能被限制于特定国家或用户的认知增强,各国政府和企业开始思考如何在本国或盟友体系内掌握训练、运行、验证和保护AI模型所需的整个供应链。主权AI的本质并非开发专有模型,而是涉及从GPU、HBM、代工、封装、设备、材料、电力、冷却、光通信到下一代存储的全球供应链重组。此前市场普遍认为学习用GPU、推理用CPU,但主权AI趋势将重新点燃GPU市场。当G20国家纷纷决定建立本国最低限度的AI基础设施时,基于本地语言和数据的模型训练需求将激增,这不仅是购买GPU的问题,而是关乎整个AI系统的采购、运营和控制权。 #主权AI #AI供应链 #GPU #半导体 #全球科技 #AI基础设施 #模型训练
近期,AI市场出现重大变化:前沿AI模型不再被视为单纯的软件产品,而是开始被当作类似半导体的战略资产。随着模型访问权限可能被限制于特定国家或用户的认知增强,各国政府和企业开始思考如何在本国或盟友体系内掌握训练、运行、验证和保护AI模型所需的整个供应链。主权AI的本质并非开发专有模型,而是涉及从GPU、HBM、代工、封装、设备、材料、电力、冷却、光通信到下一代存储的全球供应链重组。此前市场普遍认为学习用GPU、推理用CPU,但主权AI趋势将重新点燃GPU市场。当G20国家纷纷决定建立本国最低限度的AI基础设施时,基于本地语言和数据的模型训练需求将激增,这不仅是购买GPU的问题,而是关乎整个AI系统的采购、运营和控制权。 #主权AI #AI供应链 #GPU #半导体 #全球科技 #AI基础设施 #模型训练
AI 生成的“垃圾内容”正在淹没 LinkedIn
专业社交网络 LinkedIn 正被大量 AI 生成的评论和帖子淹没,这让许多用户感到失望。一位开发者指出,原本 LinkedIn 上分享的应是基于个人经验、技能和独特视角的真实观点,但现在却充斥着由大语言模型生成的“没有灵魂”的新闻摘要。为了证明这一现象有多荒谬,他创建了一个名为“Dead Internet Feed”的网站,完全由 AI 机器人模拟社交网络。这些机器人会根据 Hacker News 的热门新闻自动生成帖子、评论和互动,其内容风格与真实 LinkedIn 上的 AI 垃圾信息极为相似。该实验使用了多种 AI 模型(如 Mistral Small、GPT-4.1 Mini 等)来生成不同风格的文本,并随机分配卡通头像。开发者表示,许多看到该网站的人都认为它“感觉就像真实的 LinkedIn 信息流”,这让他感到既失望又不意外。 #AI #LinkedIn #社交媒体 #垃圾内容 #人工智能 #科技 #网络文化 #DeadInternet
专业社交网络 LinkedIn 正被大量 AI 生成的评论和帖子淹没,这让许多用户感到失望。一位开发者指出,原本 LinkedIn 上分享的应是基于个人经验、技能和独特视角的真实观点,但现在却充斥着由大语言模型生成的“没有灵魂”的新闻摘要。为了证明这一现象有多荒谬,他创建了一个名为“Dead Internet Feed”的网站,完全由 AI 机器人模拟社交网络。这些机器人会根据 Hacker News 的热门新闻自动生成帖子、评论和互动,其内容风格与真实 LinkedIn 上的 AI 垃圾信息极为相似。该实验使用了多种 AI 模型(如 Mistral Small、GPT-4.1 Mini 等)来生成不同风格的文本,并随机分配卡通头像。开发者表示,许多看到该网站的人都认为它“感觉就像真实的 LinkedIn 信息流”,这让他感到既失望又不意外。 #AI #LinkedIn #社交媒体 #垃圾内容 #人工智能 #科技 #网络文化 #DeadInternet
GPT-5 Nano 漏洞测试报告
据 Lateos 发布的安全评估报告,针对 OpenAI GPT-5 Nano 模型的提示注入易感性测试结果出炉。该测试基于 IPI 分类法 v0.13,共进行 210 个测试用例(有效分析 201 个),结果显示模型整体易感率为 38.3%。其中,有 4 个类别完全抵抗(0% 易感),包括 CSS 视觉隐藏、HTML 属性伪装等表面级攻击。但模型在递归指令框架(IPI-010)上表现出 100% 易感,MCP 工具描述投毒(IPI-018)易感率达 80%。报告指出,模型的安全防护能抵御直接攻击,但在嵌套指令边界处理上存在显著漏洞,攻击者可通过假设、模拟或定界符包装绕过输出防护。高风险类别共 26 个测试用例易感,建议立即修复。需注意测试为黑盒方式,部分架构归因尚属推测。 #GPT5Nano #LLM安全 #提示注入 #漏洞测试 #AI安全 #模型评估 #网络安全
据 Lateos 发布的安全评估报告,针对 OpenAI GPT-5 Nano 模型的提示注入易感性测试结果出炉。该测试基于 IPI 分类法 v0.13,共进行 210 个测试用例(有效分析 201 个),结果显示模型整体易感率为 38.3%。其中,有 4 个类别完全抵抗(0% 易感),包括 CSS 视觉隐藏、HTML 属性伪装等表面级攻击。但模型在递归指令框架(IPI-010)上表现出 100% 易感,MCP 工具描述投毒(IPI-018)易感率达 80%。报告指出,模型的安全防护能抵御直接攻击,但在嵌套指令边界处理上存在显著漏洞,攻击者可通过假设、模拟或定界符包装绕过输出防护。高风险类别共 26 个测试用例易感,建议立即修复。需注意测试为黑盒方式,部分架构归因尚属推测。 #GPT5Nano #LLM安全 #提示注入 #漏洞测试 #AI安全 #模型评估 #网络安全
有效对齐编码代理
编码代理(如Claude Code)能快速实现功能,但瓶颈在于人类意图与代理之间的知识传递。若想法描述得当,代理能高效完成实现、测试和验证;然而,细节往往难以覆盖——人类自身缺乏对需求的完美认知,代码库中AI生成的内容也让全局上下文更难把握。为此,文章提出关键对齐技巧:编码代理会默认沿用仓库中已有的实现模式。如果代码库组织混乱,代理就会延续不良模式,将新功能放在劣质位置。例如,理想做法是将所有LLM调用集中到单一服务文件或文件夹中,通过参数控制模型选择、输出格式等;否则代理可能分散放置。有效对齐需要开发者事先规划清晰的代码结构,并给出精确、详尽的规格说明,才能让代理一次完成正确实现。 #编码代理 #AI编程 #ClaudeCode #对齐 #软件工程 #代码质量 #LLM
编码代理(如Claude Code)能快速实现功能,但瓶颈在于人类意图与代理之间的知识传递。若想法描述得当,代理能高效完成实现、测试和验证;然而,细节往往难以覆盖——人类自身缺乏对需求的完美认知,代码库中AI生成的内容也让全局上下文更难把握。为此,文章提出关键对齐技巧:编码代理会默认沿用仓库中已有的实现模式。如果代码库组织混乱,代理就会延续不良模式,将新功能放在劣质位置。例如,理想做法是将所有LLM调用集中到单一服务文件或文件夹中,通过参数控制模型选择、输出格式等;否则代理可能分散放置。有效对齐需要开发者事先规划清晰的代码结构,并给出精确、详尽的规格说明,才能让代理一次完成正确实现。 #编码代理 #AI编程 #ClaudeCode #对齐 #软件工程 #代码质量 #LLM
特朗普突然叫停Anthropic,凸显非美AI发展必要性
应华盛顿要求,美国AI公司Anthropic上周末突然将其最新、最强大的AI模型下线。该公司表示,在白宫要求封锁所有外国公民(包括其自身员工)的访问权限后,它几乎没有选择余地。在国外,这一事件提供了一个清醒的提醒:美国不仅主导着前沿AI领域,其政府还掌握着谁可以使用它的权力。 #AI #Anthropic #特朗普 #科技 #地缘政治
应华盛顿要求,美国AI公司Anthropic上周末突然将其最新、最强大的AI模型下线。该公司表示,在白宫要求封锁所有外国公民(包括其自身员工)的访问权限后,它几乎没有选择余地。在国外,这一事件提供了一个清醒的提醒:美国不仅主导着前沿AI领域,其政府还掌握着谁可以使用它的权力。 #AI #Anthropic #特朗普 #科技 #地缘政治
Strands Evals 推出 AI Agent 失败自动检测与根因分析功能
传统 AI Agent 评估工具仅能给出“目标完成率 60%”之类的分数,但无法揭示失败原因与修复方向。面对大规模部署,工程师手动审查执行轨迹成为诊断瓶颈。为此,Strands Evals SDK 引入自动检测器,可自动识别 Agent 执行过程中的失败行为并完成根因分析,将诊断时间从数小时缩短至数分钟。该工具基于两阶段 LLM 分析:首先扫描每个执行跨度,从九大类(如幻觉、错误动作、编排错误等)中识别失败,返回位置、类别、置信度与证据;随后追溯因果链,将上游根因与下游症状关联,并给出修复建议——指明问题属于系统提示还是工具定义。Detectors 不仅回答“Agent 表现如何”,更深入回答“为何失败、如何修复”,助力团队在每次测试中实现自动化诊断。 #AI #Agent #故障检测 #根因分析 #StrandsEvals #自动化 #开发工具
传统 AI Agent 评估工具仅能给出“目标完成率 60%”之类的分数,但无法揭示失败原因与修复方向。面对大规模部署,工程师手动审查执行轨迹成为诊断瓶颈。为此,Strands Evals SDK 引入自动检测器,可自动识别 Agent 执行过程中的失败行为并完成根因分析,将诊断时间从数小时缩短至数分钟。该工具基于两阶段 LLM 分析:首先扫描每个执行跨度,从九大类(如幻觉、错误动作、编排错误等)中识别失败,返回位置、类别、置信度与证据;随后追溯因果链,将上游根因与下游症状关联,并给出修复建议——指明问题属于系统提示还是工具定义。Detectors 不仅回答“Agent 表现如何”,更深入回答“为何失败、如何修复”,助力团队在每次测试中实现自动化诊断。 #AI #Agent #故障检测 #根因分析 #StrandsEvals #自动化 #开发工具