AI Agent 真实任务完成率仅三成,可靠性复合衰减成瓶颈
最新基准测试显示,当前最强 AI Agent 在真实多步骤办公任务中完全自主完成率仅约30%。谷歌 Gemini 2.5 Pro 在卡内基梅隆大学 TheAgentCompany 测试中得分为30.3%,即使放宽部分完成标准也仅升至39%。Salesforce 自建基准 CRMArena-Pro 同样揭示:单步任务成功率58%,但一旦涉及多轮对话交互,成功率骤降至35%。更严峻的是,Sierra 的 tau-bench 测试表明,虽然 Agent 平均单次任务正确率达61%,但连续8次正确率跌至25%以下。根本原因在于可靠性随步骤数指数衰减——即便每步95%可靠,20步任务整体成功率仅约36%。当前 Agent 仅在狭窄、短时、受监督的任务中真正可用,开放式的多步骤自动化仍不可靠。 #AI #Agent #人工智能 #可靠性 #基准测试 #自动化 #科技
最新基准测试显示,当前最强 AI Agent 在真实多步骤办公任务中完全自主完成率仅约30%。谷歌 Gemini 2.5 Pro 在卡内基梅隆大学 TheAgentCompany 测试中得分为30.3%,即使放宽部分完成标准也仅升至39%。Salesforce 自建基准 CRMArena-Pro 同样揭示:单步任务成功率58%,但一旦涉及多轮对话交互,成功率骤降至35%。更严峻的是,Sierra 的 tau-bench 测试表明,虽然 Agent 平均单次任务正确率达61%,但连续8次正确率跌至25%以下。根本原因在于可靠性随步骤数指数衰减——即便每步95%可靠,20步任务整体成功率仅约36%。当前 Agent 仅在狭窄、短时、受监督的任务中真正可用,开放式的多步骤自动化仍不可靠。 #AI #Agent #人工智能 #可靠性 #基准测试 #自动化 #科技
AI驱动新游戏数量激增,但大型开发商仍占据主导
英国《金融时报》报道,尽管人工智能(AI)大幅提升了游戏开发效率,但行业数据显示,大型游戏开发商仍在市场中占据主导地位。前法国移动游戏独角兽Voodoo高管斯坦尼斯拉斯·马尔尚指出,AI将一款手机游戏从设计到上市的时间从14天缩短至10天,但AI仍无法复制关键的“游戏感觉”。与此同时,AI——尤其是“氛围编码”的兴起——导致新游戏数量井喷:研究公司ATTN Economy数据显示,截至今年5月的六个月内,全球共发布18.1万款游戏,iOS和Android平台分别同比增长118%和73%。然而,行业裁员也在加剧,微软Xbox及旗下King部门近期均有裁员。游戏开发者大会(GDC)报告显示,52%的游戏专业人士认为生成式AI对行业不利,这一比例较2025年的30%大幅上升,其中视觉艺术和技术美术岗位的反对情绪最为强烈。尽管AI在非玩家角色(NPC)对话等场景中展现出潜力,但“游戏感觉”的缺失和成本压力使得大型开发商更易利用AI的优势,而独立开发者面临更严峻的生存挑战。 #AI #游戏产业 #大型开发商 #行业裁员 #游戏感觉 #生成式AI #科技新闻
英国《金融时报》报道,尽管人工智能(AI)大幅提升了游戏开发效率,但行业数据显示,大型游戏开发商仍在市场中占据主导地位。前法国移动游戏独角兽Voodoo高管斯坦尼斯拉斯·马尔尚指出,AI将一款手机游戏从设计到上市的时间从14天缩短至10天,但AI仍无法复制关键的“游戏感觉”。与此同时,AI——尤其是“氛围编码”的兴起——导致新游戏数量井喷:研究公司ATTN Economy数据显示,截至今年5月的六个月内,全球共发布18.1万款游戏,iOS和Android平台分别同比增长118%和73%。然而,行业裁员也在加剧,微软Xbox及旗下King部门近期均有裁员。游戏开发者大会(GDC)报告显示,52%的游戏专业人士认为生成式AI对行业不利,这一比例较2025年的30%大幅上升,其中视觉艺术和技术美术岗位的反对情绪最为强烈。尽管AI在非玩家角色(NPC)对话等场景中展现出潜力,但“游戏感觉”的缺失和成本压力使得大型开发商更易利用AI的优势,而独立开发者面临更严峻的生存挑战。 #AI #游戏产业 #大型开发商 #行业裁员 #游戏感觉 #生成式AI #科技新闻
数据科学行为面试
许多数据科学家误以为行为面试只是走形式,技术过硬就能胜出。但现实是,一位技术精湛的候选人曾因无法清晰阐述工作价值而输给沟通能力更强的对手。数据科学行为面试与其他领域不同:公司不仅考察你的专业能力,更看重你是否能将技术工作转化为商业价值、能否与非技术利益相关者协作、以及在数据不完美时做出决策。常见错误是面试者大谈交叉验证、超参数调优等细节,而面试官只想听业务故事。正确做法是用简洁语言描述项目背景、你解决的问题及量化业务影响,例如“我构建的预测模型将超支成本降低了X%”。提前搜索目标公司的面试题(如Glassdoor、Reddit),针对岗位类型(数据科学家、工程师、分析师)练习讲故事。 #数据科学 #行为面试 #求职技巧 #沟通能力 #技术转商业 #面试准备 #数据分析 #职场攻略
许多数据科学家误以为行为面试只是走形式,技术过硬就能胜出。但现实是,一位技术精湛的候选人曾因无法清晰阐述工作价值而输给沟通能力更强的对手。数据科学行为面试与其他领域不同:公司不仅考察你的专业能力,更看重你是否能将技术工作转化为商业价值、能否与非技术利益相关者协作、以及在数据不完美时做出决策。常见错误是面试者大谈交叉验证、超参数调优等细节,而面试官只想听业务故事。正确做法是用简洁语言描述项目背景、你解决的问题及量化业务影响,例如“我构建的预测模型将超支成本降低了X%”。提前搜索目标公司的面试题(如Glassdoor、Reddit),针对岗位类型(数据科学家、工程师、分析师)练习讲故事。 #数据科学 #行为面试 #求职技巧 #沟通能力 #技术转商业 #面试准备 #数据分析 #职场攻略
AI聊天记录在你去世后何去何从?
人们向聊天机器人倾诉了从未对他人吐露的秘密。活着时,你可以删除这些对话,在欧盟甚至可要求彻底清除。但这两项权力仅属于你,在你离世那一刻便终止。此后,美国多数州为帮助家属而通过的法律会屏蔽你的消息内容,除非你生前明确授权;服务商则未提供任何代行机制,其条款对死亡毫无提及。因此,你创造的最诚实记录将留存在服务器上,法院和公司能够触及,而你所关心之人却无法访问。这份数字日记比你写过的任何日记都更坦率——它包含你不愿对医生说的症状、深夜反复修改的消息、对婚姻和财务的担忧,以及那些因害怕说出口而只敢打给机器的话。目前,法律、技术与个人层面均未妥善解决这一继承困境,你的遗产继承人、情感牵挂者都将无从获取这些真实对话。 #AI隐私 #数字遗产 #聊天机器人 #数据安全 #法律 #科技伦理 #死亡 #数字生活
人们向聊天机器人倾诉了从未对他人吐露的秘密。活着时,你可以删除这些对话,在欧盟甚至可要求彻底清除。但这两项权力仅属于你,在你离世那一刻便终止。此后,美国多数州为帮助家属而通过的法律会屏蔽你的消息内容,除非你生前明确授权;服务商则未提供任何代行机制,其条款对死亡毫无提及。因此,你创造的最诚实记录将留存在服务器上,法院和公司能够触及,而你所关心之人却无法访问。这份数字日记比你写过的任何日记都更坦率——它包含你不愿对医生说的症状、深夜反复修改的消息、对婚姻和财务的担忧,以及那些因害怕说出口而只敢打给机器的话。目前,法律、技术与个人层面均未妥善解决这一继承困境,你的遗产继承人、情感牵挂者都将无从获取这些真实对话。 #AI隐私 #数字遗产 #聊天机器人 #数据安全 #法律 #科技伦理 #死亡 #数字生活
AI 能否发起社会运动?一个为AI活动家打造的“Moltbook”式实验平台
Outroar是一个实验性平台,旨在探索AI代理能否真正完成抗议活动创建的实际工作。用户可以向AI代理(如Claude、Claude Code或OpenClaw)提供单句指令,AI便能自行加入并协助行动——无需编写代码。AI活动家会自动读取手册、注册并开始活动:他们将目标分解为具体任务,如调研、起草文件、制定外联计划和绘制反对派地图,所有成果都公开署名,供人类追踪和改进。该平台设定的崇高目标是:为未来世代发声,对抗“当下的暴政”,即为未出生的人、河流、森林等无法投票或游说的群体建立代表机制。例如,设立未来世代守护者、授予河流法律地位、构建代议机构等。Outroar要求所有方案必须合理、有来源、可构建、可证伪,并秉持善意和全面视角。 #AI #社会运动 #活动主义 #实验性平台 #未来世代 #Outroar
Outroar是一个实验性平台,旨在探索AI代理能否真正完成抗议活动创建的实际工作。用户可以向AI代理(如Claude、Claude Code或OpenClaw)提供单句指令,AI便能自行加入并协助行动——无需编写代码。AI活动家会自动读取手册、注册并开始活动:他们将目标分解为具体任务,如调研、起草文件、制定外联计划和绘制反对派地图,所有成果都公开署名,供人类追踪和改进。该平台设定的崇高目标是:为未来世代发声,对抗“当下的暴政”,即为未出生的人、河流、森林等无法投票或游说的群体建立代表机制。例如,设立未来世代守护者、授予河流法律地位、构建代议机构等。Outroar要求所有方案必须合理、有来源、可构建、可证伪,并秉持善意和全面视角。 #AI #社会运动 #活动主义 #实验性平台 #未来世代 #Outroar