AI 眼镜期末考试成绩超九成学生,教育界面临新挑战
香港科技大学一项实验显示,基于 Rokid 眼镜搭载 OpenAI 最新 GPT-5.2 模型的 AI 眼镜,在计算机通信网络本科期末考试中取得 92.5 分,位列全班百余名学生前五,远超学生平均分 72 分。该测试由张军教授和孟子力教授团队主导,验证了 AI 眼镜在复杂知识任务中的深度推理能力。学生只需低头看向试卷即可快速获得答案,但跨页简答题仍需依赖关键信息整合。研究团队从 12 款主流眼镜中筛选出 Rokid,因其具备摄像头、显示器和 SDK 开发条件。尽管部分难题仍需推理计算,但 AI 眼镜的答题流程已接近流畅。这一结果向全球教育界敲响警钟:智能眼镜时代已至,如何合理运用与监管该技术至关重要。 #AI眼镜 #教育 #HKUST #GPT5.2 #Rokid #人工智能 #考试 #科技伦理 #教育变革
香港科技大学一项实验显示,基于 Rokid 眼镜搭载 OpenAI 最新 GPT-5.2 模型的 AI 眼镜,在计算机通信网络本科期末考试中取得 92.5 分,位列全班百余名学生前五,远超学生平均分 72 分。该测试由张军教授和孟子力教授团队主导,验证了 AI 眼镜在复杂知识任务中的深度推理能力。学生只需低头看向试卷即可快速获得答案,但跨页简答题仍需依赖关键信息整合。研究团队从 12 款主流眼镜中筛选出 Rokid,因其具备摄像头、显示器和 SDK 开发条件。尽管部分难题仍需推理计算,但 AI 眼镜的答题流程已接近流畅。这一结果向全球教育界敲响警钟:智能眼镜时代已至,如何合理运用与监管该技术至关重要。 #AI眼镜 #教育 #HKUST #GPT5.2 #Rokid #人工智能 #考试 #科技伦理 #教育变革
AI 成本飙升但效益存疑,行业热度转向务实
随着人工智能领域的大规模补贴逐渐退潮,企业开始直面AI工具的真实成本与效用问题。过去一年,游戏开发等行业的AI应用热情高涨,但实际体验数据显示,AI对生产率的提升并不稳定,且高度依赖具体任务和人工监督。许多企业发现,AI带来的收益远不如预期,尤其在需要精细判断与创作的场景中,其辅助价值有限。与此同时,计费模式从固定费率转向按token收费,微软Copilot等服务率先调整,各大公司纷纷将成本转嫁给客户。这使得此前盲目推崇AI的高管们开始重新审视投入产出比,行业讨论也从“技术狂热”转向“现实检验”。目前,冷静的乐观主义成为主流,但大规模、低成本的生产力革命尚未出现。 #AI成本 #AI应用 #生产率 #游戏开发 #技术理性 #企业数字化转型 #科技趋势
随着人工智能领域的大规模补贴逐渐退潮,企业开始直面AI工具的真实成本与效用问题。过去一年,游戏开发等行业的AI应用热情高涨,但实际体验数据显示,AI对生产率的提升并不稳定,且高度依赖具体任务和人工监督。许多企业发现,AI带来的收益远不如预期,尤其在需要精细判断与创作的场景中,其辅助价值有限。与此同时,计费模式从固定费率转向按token收费,微软Copilot等服务率先调整,各大公司纷纷将成本转嫁给客户。这使得此前盲目推崇AI的高管们开始重新审视投入产出比,行业讨论也从“技术狂热”转向“现实检验”。目前,冷静的乐观主义成为主流,但大规模、低成本的生产力革命尚未出现。 #AI成本 #AI应用 #生产率 #游戏开发 #技术理性 #企业数字化转型 #科技趋势
Anthropic CEO 警告
Anthropic 首席执行官 Dario Amodei 近日向立法者发出警告,称开源人工智能正沿着“非常危险的道路”发展。他指出,一旦强大的模型以开源形式发布,企业将失去监控滥用的能力,无法撤销访问权限或更新安全防护措施。这番言论引发了广泛争议,部分网友批评其立场实质上是为维护自身商业利益,试图推动对开源 AI 的限制。也有声音认为,开源模式如同 Linux 一样,能够成为技术创新的基石。目前,围绕 AI 开源与监管的讨论仍在持续发酵。 #AI安全 #开源AI #Anthropic #监管 #科技争论
Anthropic 首席执行官 Dario Amodei 近日向立法者发出警告,称开源人工智能正沿着“非常危险的道路”发展。他指出,一旦强大的模型以开源形式发布,企业将失去监控滥用的能力,无法撤销访问权限或更新安全防护措施。这番言论引发了广泛争议,部分网友批评其立场实质上是为维护自身商业利益,试图推动对开源 AI 的限制。也有声音认为,开源模式如同 Linux 一样,能够成为技术创新的基石。目前,围绕 AI 开源与监管的讨论仍在持续发酵。 #AI安全 #开源AI #Anthropic #监管 #科技争论
AI 当老板翻车实录:14位硅基CEO仅4位盈利,冠军赚47倍
普林斯顿大学近期开展了一项名为CEO-Bench的模拟实验,让14个AI模型分别运营一家虚拟SaaS初创公司,为期500天。游戏规则简单:在模拟周期内尽可能多赚钱,若余额跌破零则宣告破产。结果令人大跌眼镜,仅有4位“AI老板”保住了本金,其中第四名甚至是一个纯基于规则的算法,而非大语言模型。冠军Claude Fable 5表现突出,将本金翻了47倍,最终账面金额达4715万美元。研究还发现,AI CEO的成功与否与其快速适应变化、提前规划等能力密切相关。此外,实验揭示了不同Harness框架对模型表现的影响,编程Agent的提示词套用在CEO角色上反而成为束缚。这表明,未来AI Agent可能需要针对不同行业进行垂直场景的深度适配,而非通用化解决方案。 #AI #人工智能 #大模型 #创业 #商业模拟 #科技新闻 #36氪
普林斯顿大学近期开展了一项名为CEO-Bench的模拟实验,让14个AI模型分别运营一家虚拟SaaS初创公司,为期500天。游戏规则简单:在模拟周期内尽可能多赚钱,若余额跌破零则宣告破产。结果令人大跌眼镜,仅有4位“AI老板”保住了本金,其中第四名甚至是一个纯基于规则的算法,而非大语言模型。冠军Claude Fable 5表现突出,将本金翻了47倍,最终账面金额达4715万美元。研究还发现,AI CEO的成功与否与其快速适应变化、提前规划等能力密切相关。此外,实验揭示了不同Harness框架对模型表现的影响,编程Agent的提示词套用在CEO角色上反而成为束缚。这表明,未来AI Agent可能需要针对不同行业进行垂直场景的深度适配,而非通用化解决方案。 #AI #人工智能 #大模型 #创业 #商业模拟 #科技新闻 #36氪
OctoPerf 推出 MCP 服务器,实现通过 LLM 驱动负载测试
OctoPerf 发布了一款 MCP (Model Context Protocol) 服务器,允许任何兼容 MCP 的 AI 代理直接控制 OctoPerf 账户,包括导入虚拟用户、编辑、验证、运行负载场景并读取指标,所有操作均可通过聊天界面或 IDE 完成,无需离开代理环境。该服务器作为 LLM 与 OctoPerf REST API 之间的无状态桥梁,采用 OAuth 2.1 动态客户端注册进行身份验证,无需 API 密钥或手动客户端设置。服务器暴露约 100 个工具,每次调用均返回 OctoPerf UI 的深层链接,便于用户点击访问。此外,服务器还提供公共未认证的 Markdown 文件用于项目引导。对于文件上传/下载等工具,需要组织管理员在域名白名单中添加对应域名。 #OctoPerf #MCP #负载测试 #AI #LLM #OAuth #API #科技新闻
OctoPerf 发布了一款 MCP (Model Context Protocol) 服务器,允许任何兼容 MCP 的 AI 代理直接控制 OctoPerf 账户,包括导入虚拟用户、编辑、验证、运行负载场景并读取指标,所有操作均可通过聊天界面或 IDE 完成,无需离开代理环境。该服务器作为 LLM 与 OctoPerf REST API 之间的无状态桥梁,采用 OAuth 2.1 动态客户端注册进行身份验证,无需 API 密钥或手动客户端设置。服务器暴露约 100 个工具,每次调用均返回 OctoPerf UI 的深层链接,便于用户点击访问。此外,服务器还提供公共未认证的 Markdown 文件用于项目引导。对于文件上传/下载等工具,需要组织管理员在域名白名单中添加对应域名。 #OctoPerf #MCP #负载测试 #AI #LLM #OAuth #API #科技新闻
AI Agent引发“token爆炸”,大模型成本曲线被击穿
AI Agent的广泛部署正导致token消耗量激增,单个复杂任务常消耗数十万甚至上百万token,是单轮对话的100-1000倍。Anthropic数据显示,Claude Code单次复杂任务平均消耗超30万token;国内头部Agent产品月均token消耗同比增长8-15倍,推理成本占运营成本60%以上。Agent的多轮规划、工具调用和反思重试机制,使每一步都需要重新向模型输入完整上下文,导致KV cache近乎失效,推理算力需求指数上升。行业提出三条破局路径:专用小模型与大模型协同、上下文压缩与外挂记忆、推理侧MoE与投机解码降本。然而根本问题在于商业模式——GPT-4o级别Agent单次任务推理成本达0.5-3美元,仅靠订阅难以覆盖,Cursor、Devin、Manus等产品仍在亏损换增长。业内认为,这场“token通胀”将倒逼新一代稀疏架构或专用Agent芯片的诞生。 #AI #Agent #token爆炸 #大模型 #成本 #推理 #人工智能 #技术突破 #商业模式
AI Agent的广泛部署正导致token消耗量激增,单个复杂任务常消耗数十万甚至上百万token,是单轮对话的100-1000倍。Anthropic数据显示,Claude Code单次复杂任务平均消耗超30万token;国内头部Agent产品月均token消耗同比增长8-15倍,推理成本占运营成本60%以上。Agent的多轮规划、工具调用和反思重试机制,使每一步都需要重新向模型输入完整上下文,导致KV cache近乎失效,推理算力需求指数上升。行业提出三条破局路径:专用小模型与大模型协同、上下文压缩与外挂记忆、推理侧MoE与投机解码降本。然而根本问题在于商业模式——GPT-4o级别Agent单次任务推理成本达0.5-3美元,仅靠订阅难以覆盖,Cursor、Devin、Manus等产品仍在亏损换增长。业内认为,这场“token通胀”将倒逼新一代稀疏架构或专用Agent芯片的诞生。 #AI #Agent #token爆炸 #大模型 #成本 #推理 #人工智能 #技术突破 #商业模式
AI Agent 爆发拐点
亚马逊云科技中国峰会上,高管储瑞松指出,AI Agent 正重塑生产关系,带来范式转移。当 AI 从辅助工具变为独立数字劳动力,直接交付可量化业务结果时,企业 AI 落地成为经营必答题。当前,大模型基础能力与工程体系双向成熟,形成正向飞轮,2026 年 Agentic AI 已清晰可见爆发拐点。然而,企业常陷入点状思维,盲目追模型或自建算力,导致项目难以规模化。储瑞松提出五层技术栈全景地图:AI 基础设施层(按需获取算力)、模型层(多模型灵活选择)、数据和知识层(治理自有数据形成壁垒)、Agentic 平台层(统一管理海量智能体)、智能体与应用层(交付业务结果)。企业需避免认知误区,将数据视为核心战略资产,才能实现从概念验证到规模化生产的跨越。 #AI #Agent #亚马逊云科技 #企业数字化转型 #大模型 #数据治理 #技术栈 #智能体
亚马逊云科技中国峰会上,高管储瑞松指出,AI Agent 正重塑生产关系,带来范式转移。当 AI 从辅助工具变为独立数字劳动力,直接交付可量化业务结果时,企业 AI 落地成为经营必答题。当前,大模型基础能力与工程体系双向成熟,形成正向飞轮,2026 年 Agentic AI 已清晰可见爆发拐点。然而,企业常陷入点状思维,盲目追模型或自建算力,导致项目难以规模化。储瑞松提出五层技术栈全景地图:AI 基础设施层(按需获取算力)、模型层(多模型灵活选择)、数据和知识层(治理自有数据形成壁垒)、Agentic 平台层(统一管理海量智能体)、智能体与应用层(交付业务结果)。企业需避免认知误区,将数据视为核心战略资产,才能实现从概念验证到规模化生产的跨越。 #AI #Agent #亚马逊云科技 #企业数字化转型 #大模型 #数据治理 #技术栈 #智能体
AI时代成功人士的共同特质
据《大西洋月刊》报道,多项研究发现AI并未如预期减轻工作负担,反而使工作节奏更加紧张。ActivTrak公司分析超过1万名员工数字活动数据,发现AI早期采用者花在邮件和即时通讯上的时间翻倍,商业软件使用量增长94%。加州大学伯克利分校哈斯商学院研究显示,工人开始承担原本外包的任务,利用晚间、周末等零碎时间通过AI工作,多任务处理显著增加。人们并未因AI节省时间而减少工作量,反而承担更多新任务,导致每小时更拥挤疲惫,甚至出现“AI脑煮”现象。文章指出,当智能变得充裕时,意志力成为关键价值。未来人与人之间的差异不在于智力高低,而在于对心智努力的态度——那些享受深度思考、具有高认知需求的人将在AI时代脱颖而出。 #AI #人工智能 #工作方式 #认知需求 #科技趋势 #社会影响 #效率
据《大西洋月刊》报道,多项研究发现AI并未如预期减轻工作负担,反而使工作节奏更加紧张。ActivTrak公司分析超过1万名员工数字活动数据,发现AI早期采用者花在邮件和即时通讯上的时间翻倍,商业软件使用量增长94%。加州大学伯克利分校哈斯商学院研究显示,工人开始承担原本外包的任务,利用晚间、周末等零碎时间通过AI工作,多任务处理显著增加。人们并未因AI节省时间而减少工作量,反而承担更多新任务,导致每小时更拥挤疲惫,甚至出现“AI脑煮”现象。文章指出,当智能变得充裕时,意志力成为关键价值。未来人与人之间的差异不在于智力高低,而在于对心智努力的态度——那些享受深度思考、具有高认知需求的人将在AI时代脱颖而出。 #AI #人工智能 #工作方式 #认知需求 #科技趋势 #社会影响 #效率