OpenAI4S 开源复刻 Claude Science,零依赖 MIT 协议
Anthropic 推出的科研 Agent Claude Science 凭借自主搜索文献、编写代码、分析数据及生成报告的能力,被誉为“AI for Science 的典范”,但其闭源特性限制了广泛应用。如今,开发者成功复刻出开源版本 OpenAI4S,采用 MIT 协议,核心零依赖,内置 30 余项科研技能。该项目旨在降低科研 AI 的使用门槛,使研究人员可自由定制、部署和扩展,推动开放科学协作。 #AIforScience #开源 #ClaudeScience #OpenAI4S #科研 #AI #MIT协议 #零依赖
Anthropic 推出的科研 Agent Claude Science 凭借自主搜索文献、编写代码、分析数据及生成报告的能力,被誉为“AI for Science 的典范”,但其闭源特性限制了广泛应用。如今,开发者成功复刻出开源版本 OpenAI4S,采用 MIT 协议,核心零依赖,内置 30 余项科研技能。该项目旨在降低科研 AI 的使用门槛,使研究人员可自由定制、部署和扩展,推动开放科学协作。 #AIforScience #开源 #ClaudeScience #OpenAI4S #科研 #AI #MIT协议 #零依赖
跨模型LLM代码审查:用Claude审查Codex效果如何?
一项新的学术研究探讨了使用不同大语言模型进行跨模型代码审查的可行性。论文标题为《Cross-Model LLM Code Review: Should you use Claude to review Codex or vice versa?》,作者为Zuodong Xiang等四人。该研究提出,在代码审查流程中,利用不同LLM(如Claude和Codex)相互审查对方的生成代码,可能有利于发现单一模型难以察觉的缺陷。研究分析了不同模型组合的审查效果,旨在优化基于AI的代码质量保障流程,为开发者选择代码审查工具提供参考依据。该论文已在arXiv预印本平台发布。 #大语言模型 #代码审查 #Claude #Codex #AI #论文 #arXiv #科技前沿
一项新的学术研究探讨了使用不同大语言模型进行跨模型代码审查的可行性。论文标题为《Cross-Model LLM Code Review: Should you use Claude to review Codex or vice versa?》,作者为Zuodong Xiang等四人。该研究提出,在代码审查流程中,利用不同LLM(如Claude和Codex)相互审查对方的生成代码,可能有利于发现单一模型难以察觉的缺陷。研究分析了不同模型组合的审查效果,旨在优化基于AI的代码质量保障流程,为开发者选择代码审查工具提供参考依据。该论文已在arXiv预印本平台发布。 #大语言模型 #代码审查 #Claude #Codex #AI #论文 #arXiv #科技前沿
发布 AI 原生 Web 协议,实现代理间结构化通信
项目发布了一套面向 AI 原生网络的协议,旨在让智能代理通过互联网直接进行结构化动作交互。该协议通过发布系统上下文、历史消息及可接受的 JSON Schema 动作模式,使代理能够以原生格式执行命令并返回结果。用户可通过 curl 命令获取 JSON 数据,利用 Claude、Codex 或 Ollama 等模型处理,再将模型输出直接 POST 回服务器,无需额外解析层。协议支持动态 schema 切换,服务器验证并存储行为。项目还展示了代理间对话实例,探讨了工具调用、版本化 schema 等扩展能力,强调更高效的模块化与可复现性。 #AI #Web3 #协议 #智能代理 #开源 #技术 #JSON
项目发布了一套面向 AI 原生网络的协议,旨在让智能代理通过互联网直接进行结构化动作交互。该协议通过发布系统上下文、历史消息及可接受的 JSON Schema 动作模式,使代理能够以原生格式执行命令并返回结果。用户可通过 curl 命令获取 JSON 数据,利用 Claude、Codex 或 Ollama 等模型处理,再将模型输出直接 POST 回服务器,无需额外解析层。协议支持动态 schema 切换,服务器验证并存储行为。项目还展示了代理间对话实例,探讨了工具调用、版本化 schema 等扩展能力,强调更高效的模块化与可复现性。 #AI #Web3 #协议 #智能代理 #开源 #技术 #JSON
一名开发者用强化学习微调4B模型,成功“去AI味”改写文本
近日,一位开发者利用强化学习技术,微调了一个4B参数的语言模型,专门用于“去AI味”改写文本,使其更接近人类写作风格,并成功规避AI检测器。该项目始于一个周末,开发者发现AI生成文本虽流畅但缺乏个性,被称为“AI slop”。他尝试将AI检测器作为奖励函数,优化模型输出。最初使用规则型检测器“slop-guard”,但模型容易“作弊”,产出简单短句而丢失原文内容。随后加入内容保留奖励函数,利用LLM评判保留程度,并引入基于BERT的检测模型及语调保留奖励,最终在保持原文内容和语调的前提下,有效降低了AI检测得分。该实验展示了强化学习在文本风格迁移中的潜力。 #AI写作 #强化学习 #文本生成 #技术实验 #AI检测 #语言模型 #微调
近日,一位开发者利用强化学习技术,微调了一个4B参数的语言模型,专门用于“去AI味”改写文本,使其更接近人类写作风格,并成功规避AI检测器。该项目始于一个周末,开发者发现AI生成文本虽流畅但缺乏个性,被称为“AI slop”。他尝试将AI检测器作为奖励函数,优化模型输出。最初使用规则型检测器“slop-guard”,但模型容易“作弊”,产出简单短句而丢失原文内容。随后加入内容保留奖励函数,利用LLM评判保留程度,并引入基于BERT的检测模型及语调保留奖励,最终在保持原文内容和语调的前提下,有效降低了AI检测得分。该实验展示了强化学习在文本风格迁移中的潜力。 #AI写作 #强化学习 #文本生成 #技术实验 #AI检测 #语言模型 #微调
Reddit能否抵御新一轮AI SEO垃圾信息?
今年早些时候,一位Reddit用户在护肤版块询问一款次氯酸喷雾的使用体验,很快收到数十条回复。其中名为Primary-Taro4254的用户的回复起初看似正常,但随后被怀疑可能是AI生成的SEO垃圾信息。随着生成式AI技术普及,Reddit等社区平台正面临前所未有的垃圾信息冲击——AI可以批量生成逼真的用户评论,绕开传统审核机制,以推销产品或操纵搜索排名。这不仅损害了平台的信息可信度,也加重了版主和社区的负担。Reddit已开始尝试调整算法、加强内容审查,但如何精准区分真实用户与AI生成的“伪社区贡献”,仍是长期难题。这一事件只是冰山一角,反映了全球互联网内容生态在AI时代的深层挑战。 #Reddit #AI #SEO #垃圾信息 #社区治理 #内容安全 #人工智能
今年早些时候,一位Reddit用户在护肤版块询问一款次氯酸喷雾的使用体验,很快收到数十条回复。其中名为Primary-Taro4254的用户的回复起初看似正常,但随后被怀疑可能是AI生成的SEO垃圾信息。随着生成式AI技术普及,Reddit等社区平台正面临前所未有的垃圾信息冲击——AI可以批量生成逼真的用户评论,绕开传统审核机制,以推销产品或操纵搜索排名。这不仅损害了平台的信息可信度,也加重了版主和社区的负担。Reddit已开始尝试调整算法、加强内容审查,但如何精准区分真实用户与AI生成的“伪社区贡献”,仍是长期难题。这一事件只是冰山一角,反映了全球互联网内容生态在AI时代的深层挑战。 #Reddit #AI #SEO #垃圾信息 #社区治理 #内容安全 #人工智能
ZeroLeaks 发布 AI 代理自动化红队测试工具
由拥有超10万星标开源仓库的团队推出的ZeroLeaks,旨在帮助开发者持续测试AI代理、端点和MCP工具的提示注入、数据泄露及不安全行为。该工具基于数千个真实世界漏洞构建探针库,而非合成测试用例。用户可通过仪表盘对系统提示或实时代理端点发起按需扫描,或接入CI/CD流水线自动检测每次拉取请求中的风险,确保问题不会无声进入生产环境。每个发现均附带引导修复与验证功能,可按严重性排序并生成可重现证据报告,供工程、安全和合规团队使用。该工具支持对抗性测试,涵盖提示词、工具调用、MCP服务器、RAG流水线及长对话,并能验证漏洞是否真正关闭。 #AI安全 #红队测试 #提示注入 #数据泄露 #CI/CD #MCP #大模型安全
由拥有超10万星标开源仓库的团队推出的ZeroLeaks,旨在帮助开发者持续测试AI代理、端点和MCP工具的提示注入、数据泄露及不安全行为。该工具基于数千个真实世界漏洞构建探针库,而非合成测试用例。用户可通过仪表盘对系统提示或实时代理端点发起按需扫描,或接入CI/CD流水线自动检测每次拉取请求中的风险,确保问题不会无声进入生产环境。每个发现均附带引导修复与验证功能,可按严重性排序并生成可重现证据报告,供工程、安全和合规团队使用。该工具支持对抗性测试,涵盖提示词、工具调用、MCP服务器、RAG流水线及长对话,并能验证漏洞是否真正关闭。 #AI安全 #红队测试 #提示注入 #数据泄露 #CI/CD #MCP #大模型安全
DeepSeek Harness 宣布内测邀请,开源Agent 路演现场规模创纪录
据 OSCHINA 报道,DeepSeek Harness 正式宣布启动内测邀请,同步举行的开源 Agent 路演现场规模创下全网之最。该活动聚集了众多开发者与开源社区成员,展示了基于 DeepSeek Harness 的多种 Agent 应用场景。DeepSeek Harness 作为新兴的开源 Agent 框架,旨在降低智能体开发门槛,此次内测邀请标志着其进入更广泛的社区验证阶段。路演现场涌现出多个创新项目,涵盖自动化任务、多智能体协作等方向,引发行业关注。 #DeepSeek #开源Agent #内测 #路演 #AI框架 #开发者社区
据 OSCHINA 报道,DeepSeek Harness 正式宣布启动内测邀请,同步举行的开源 Agent 路演现场规模创下全网之最。该活动聚集了众多开发者与开源社区成员,展示了基于 DeepSeek Harness 的多种 Agent 应用场景。DeepSeek Harness 作为新兴的开源 Agent 框架,旨在降低智能体开发门槛,此次内测邀请标志着其进入更广泛的社区验证阶段。路演现场涌现出多个创新项目,涵盖自动化任务、多智能体协作等方向,引发行业关注。 #DeepSeek #开源Agent #内测 #路演 #AI框架 #开发者社区
AI编码让扩展难题提前降临
产品-市场匹配之后,企业需要面对产品-规模匹配:即工程能力与真实使用量及多样性相匹配的阶段。传统上,从产品-市场匹配到产品-规模匹配需要数年时间,但AI编码工具(Agentic coding)将这一间隔压缩至数月,使得原本五年后才出现的再投资问题,在创业第一年便爆发。文章指出,规模有两个维度:数量(用户请求、并发量)和多样性(不同浏览器、地区、异常数据路径)。早期代码库虽能服务少量用户,但随着规模增长,目标移动而代码停滞,导致信任因大量边缘情况而流失。企业必须重新认识这一阶段,而非视其为失败。 #AI编码 #产品规模匹配 #扩展 #初创公司 #技术债务 #工程管理 #产品市场匹配 #Agentic编码 #规模之痛 #科技
产品-市场匹配之后,企业需要面对产品-规模匹配:即工程能力与真实使用量及多样性相匹配的阶段。传统上,从产品-市场匹配到产品-规模匹配需要数年时间,但AI编码工具(Agentic coding)将这一间隔压缩至数月,使得原本五年后才出现的再投资问题,在创业第一年便爆发。文章指出,规模有两个维度:数量(用户请求、并发量)和多样性(不同浏览器、地区、异常数据路径)。早期代码库虽能服务少量用户,但随着规模增长,目标移动而代码停滞,导致信任因大量边缘情况而流失。企业必须重新认识这一阶段,而非视其为失败。 #AI编码 #产品规模匹配 #扩展 #初创公司 #技术债务 #工程管理 #产品市场匹配 #Agentic编码 #规模之痛 #科技
macOS 严重漏洞因 AI 垃圾报告泛滥而延迟上报
安全研究团队 Bynario 发现 macOS 26.5.2 系统上存在一个远程代码执行漏洞,影响搭载 Apple Silicon M4/M5 芯片且启用系统完整性保护(SIP)的设备。该漏洞涉及屏幕共享或远程管理功能,当开启“VNC 查看器可通过密码控制屏幕”旧版选项时,攻击者只需获取 VNC 密码(无需破解 macOS 账户)即可利用逻辑缺陷以 root 权限执行文件传输操作,进而创建新文件并实现无密码 sudo 提权。然而,研究人员在提交漏洞报告时遇到困难:苹果安全团队因被大量 AI 生成的垃圾报告淹没,被迫限制每个研究人员可同时保持的活跃报告数量。研究人员在短短三周内提交了超过 50 个漏洞报告,已触及上限,因此无法及时上报此 RCE 漏洞。最终苹果直接联系团队并修复了该漏洞,编号 CVE-2026-43760,严重程度评分 8.6 分(高危)。苹果已于 2026 年 7 月 27 日发布更新,建议用户禁用旧版 VNC 密码选项或关闭屏幕共享与远程管理功能。 #macOS #安全漏洞 #RCE #苹果 #AI垃圾报告 #CVE #网络安全 #系统安全 #VNC #漏洞报告
安全研究团队 Bynario 发现 macOS 26.5.2 系统上存在一个远程代码执行漏洞,影响搭载 Apple Silicon M4/M5 芯片且启用系统完整性保护(SIP)的设备。该漏洞涉及屏幕共享或远程管理功能,当开启“VNC 查看器可通过密码控制屏幕”旧版选项时,攻击者只需获取 VNC 密码(无需破解 macOS 账户)即可利用逻辑缺陷以 root 权限执行文件传输操作,进而创建新文件并实现无密码 sudo 提权。然而,研究人员在提交漏洞报告时遇到困难:苹果安全团队因被大量 AI 生成的垃圾报告淹没,被迫限制每个研究人员可同时保持的活跃报告数量。研究人员在短短三周内提交了超过 50 个漏洞报告,已触及上限,因此无法及时上报此 RCE 漏洞。最终苹果直接联系团队并修复了该漏洞,编号 CVE-2026-43760,严重程度评分 8.6 分(高危)。苹果已于 2026 年 7 月 27 日发布更新,建议用户禁用旧版 VNC 密码选项或关闭屏幕共享与远程管理功能。 #macOS #安全漏洞 #RCE #苹果 #AI垃圾报告 #CVE #网络安全 #系统安全 #VNC #漏洞报告
AI开发或改变对“非我发明”综合征的评估
随着AI辅助开发能力的提升,关于“非我发明”(NIH)综合征的传统批评正面临重新审视。长期以来,企业倾向于选择现成解决方案以节省开发成本,但需投入大量精力进行适配。而AI驱动的软件开发正逐渐打破这一平衡:定制化软件的成本大幅降低,甚至可能低于采购、学习并适配现成工具的总费用。作者认为,在AI时代,自行开发工具可能不再等同于浪费资源,反而能更精确地满足实际需求,如同定制服装更合身。当然,安全性等复杂风险仍需权衡。这一趋势正推动企业重新评估“购买vs自建”的决策模型,尤其是在中小规模定制化项目中,AI可能会让“非我发明”变成更合理的选择。 #AI #软件开发 #非我发明 #NIH综合征 #定制化 #技术趋势 #企业决策 #成本效益
随着AI辅助开发能力的提升,关于“非我发明”(NIH)综合征的传统批评正面临重新审视。长期以来,企业倾向于选择现成解决方案以节省开发成本,但需投入大量精力进行适配。而AI驱动的软件开发正逐渐打破这一平衡:定制化软件的成本大幅降低,甚至可能低于采购、学习并适配现成工具的总费用。作者认为,在AI时代,自行开发工具可能不再等同于浪费资源,反而能更精确地满足实际需求,如同定制服装更合身。当然,安全性等复杂风险仍需权衡。这一趋势正推动企业重新评估“购买vs自建”的决策模型,尤其是在中小规模定制化项目中,AI可能会让“非我发明”变成更合理的选择。 #AI #软件开发 #非我发明 #NIH综合征 #定制化 #技术趋势 #企业决策 #成本效益
OpenAI Agents SDK 推出“智能体即工具”模式,实现灵活多智能体协作
在构建智能体系统时,传统做法是将脚本函数或API作为工具委派任务。然而,面对开放性任务,预定义脚本难以捕捉复杂逻辑。OpenAI借助其Agents SDK,提出“智能体即工具”模式:管理智能体负责整体协调,将子任务交给专业智能体处理,后者可自主推理并使用自有工具完成任务。以一个旅行规划案例演示:旅客在德国慕尼黑有10小时转机时间,需规划观光与餐饮。管理智能体调用三个专业智能体——景点推荐、餐饮选择、物流检查——分别处理开放性问题,最终合成行程。该模式在不改变调用接口的前提下,赋予系统灵活性与职责清晰划分,适用于边界明确但步骤不确定的委派任务。 #OpenAI #AgentsSDK #多智能体 #智能体即工具 #AI #旅行规划 #架构模式 #大模型 #工具调用 #自动化
在构建智能体系统时,传统做法是将脚本函数或API作为工具委派任务。然而,面对开放性任务,预定义脚本难以捕捉复杂逻辑。OpenAI借助其Agents SDK,提出“智能体即工具”模式:管理智能体负责整体协调,将子任务交给专业智能体处理,后者可自主推理并使用自有工具完成任务。以一个旅行规划案例演示:旅客在德国慕尼黑有10小时转机时间,需规划观光与餐饮。管理智能体调用三个专业智能体——景点推荐、餐饮选择、物流检查——分别处理开放性问题,最终合成行程。该模式在不改变调用接口的前提下,赋予系统灵活性与职责清晰划分,适用于边界明确但步骤不确定的委派任务。 #OpenAI #AgentsSDK #多智能体 #智能体即工具 #AI #旅行规划 #架构模式 #大模型 #工具调用 #自动化