OpenAI4S 开源复刻 Claude Science,零依赖 MIT 协议
Anthropic 推出的科研 Agent Claude Science 凭借自主搜索文献、编写代码、分析数据及生成报告的能力,被誉为“AI for Science 的典范”,但其闭源特性限制了广泛应用。如今,开发者成功复刻出开源版本 OpenAI4S,采用 MIT 协议,核心零依赖,内置 30 余项科研技能。该项目旨在降低科研 AI 的使用门槛,使研究人员可自由定制、部署和扩展,推动开放科学协作。 #AIforScience #开源 #ClaudeScience #OpenAI4S #科研 #AI #MIT协议 #零依赖
Anthropic 推出的科研 Agent Claude Science 凭借自主搜索文献、编写代码、分析数据及生成报告的能力,被誉为“AI for Science 的典范”,但其闭源特性限制了广泛应用。如今,开发者成功复刻出开源版本 OpenAI4S,采用 MIT 协议,核心零依赖,内置 30 余项科研技能。该项目旨在降低科研 AI 的使用门槛,使研究人员可自由定制、部署和扩展,推动开放科学协作。 #AIforScience #开源 #ClaudeScience #OpenAI4S #科研 #AI #MIT协议 #零依赖
跨模型LLM代码审查:用Claude审查Codex效果如何?
一项新的学术研究探讨了使用不同大语言模型进行跨模型代码审查的可行性。论文标题为《Cross-Model LLM Code Review: Should you use Claude to review Codex or vice versa?》,作者为Zuodong Xiang等四人。该研究提出,在代码审查流程中,利用不同LLM(如Claude和Codex)相互审查对方的生成代码,可能有利于发现单一模型难以察觉的缺陷。研究分析了不同模型组合的审查效果,旨在优化基于AI的代码质量保障流程,为开发者选择代码审查工具提供参考依据。该论文已在arXiv预印本平台发布。 #大语言模型 #代码审查 #Claude #Codex #AI #论文 #arXiv #科技前沿
一项新的学术研究探讨了使用不同大语言模型进行跨模型代码审查的可行性。论文标题为《Cross-Model LLM Code Review: Should you use Claude to review Codex or vice versa?》,作者为Zuodong Xiang等四人。该研究提出,在代码审查流程中,利用不同LLM(如Claude和Codex)相互审查对方的生成代码,可能有利于发现单一模型难以察觉的缺陷。研究分析了不同模型组合的审查效果,旨在优化基于AI的代码质量保障流程,为开发者选择代码审查工具提供参考依据。该论文已在arXiv预印本平台发布。 #大语言模型 #代码审查 #Claude #Codex #AI #论文 #arXiv #科技前沿
发布 AI 原生 Web 协议,实现代理间结构化通信
项目发布了一套面向 AI 原生网络的协议,旨在让智能代理通过互联网直接进行结构化动作交互。该协议通过发布系统上下文、历史消息及可接受的 JSON Schema 动作模式,使代理能够以原生格式执行命令并返回结果。用户可通过 curl 命令获取 JSON 数据,利用 Claude、Codex 或 Ollama 等模型处理,再将模型输出直接 POST 回服务器,无需额外解析层。协议支持动态 schema 切换,服务器验证并存储行为。项目还展示了代理间对话实例,探讨了工具调用、版本化 schema 等扩展能力,强调更高效的模块化与可复现性。 #AI #Web3 #协议 #智能代理 #开源 #技术 #JSON
项目发布了一套面向 AI 原生网络的协议,旨在让智能代理通过互联网直接进行结构化动作交互。该协议通过发布系统上下文、历史消息及可接受的 JSON Schema 动作模式,使代理能够以原生格式执行命令并返回结果。用户可通过 curl 命令获取 JSON 数据,利用 Claude、Codex 或 Ollama 等模型处理,再将模型输出直接 POST 回服务器,无需额外解析层。协议支持动态 schema 切换,服务器验证并存储行为。项目还展示了代理间对话实例,探讨了工具调用、版本化 schema 等扩展能力,强调更高效的模块化与可复现性。 #AI #Web3 #协议 #智能代理 #开源 #技术 #JSON
一名开发者用强化学习微调4B模型,成功“去AI味”改写文本
近日,一位开发者利用强化学习技术,微调了一个4B参数的语言模型,专门用于“去AI味”改写文本,使其更接近人类写作风格,并成功规避AI检测器。该项目始于一个周末,开发者发现AI生成文本虽流畅但缺乏个性,被称为“AI slop”。他尝试将AI检测器作为奖励函数,优化模型输出。最初使用规则型检测器“slop-guard”,但模型容易“作弊”,产出简单短句而丢失原文内容。随后加入内容保留奖励函数,利用LLM评判保留程度,并引入基于BERT的检测模型及语调保留奖励,最终在保持原文内容和语调的前提下,有效降低了AI检测得分。该实验展示了强化学习在文本风格迁移中的潜力。 #AI写作 #强化学习 #文本生成 #技术实验 #AI检测 #语言模型 #微调
近日,一位开发者利用强化学习技术,微调了一个4B参数的语言模型,专门用于“去AI味”改写文本,使其更接近人类写作风格,并成功规避AI检测器。该项目始于一个周末,开发者发现AI生成文本虽流畅但缺乏个性,被称为“AI slop”。他尝试将AI检测器作为奖励函数,优化模型输出。最初使用规则型检测器“slop-guard”,但模型容易“作弊”,产出简单短句而丢失原文内容。随后加入内容保留奖励函数,利用LLM评判保留程度,并引入基于BERT的检测模型及语调保留奖励,最终在保持原文内容和语调的前提下,有效降低了AI检测得分。该实验展示了强化学习在文本风格迁移中的潜力。 #AI写作 #强化学习 #文本生成 #技术实验 #AI检测 #语言模型 #微调
Reddit能否抵御新一轮AI SEO垃圾信息?
今年早些时候,一位Reddit用户在护肤版块询问一款次氯酸喷雾的使用体验,很快收到数十条回复。其中名为Primary-Taro4254的用户的回复起初看似正常,但随后被怀疑可能是AI生成的SEO垃圾信息。随着生成式AI技术普及,Reddit等社区平台正面临前所未有的垃圾信息冲击——AI可以批量生成逼真的用户评论,绕开传统审核机制,以推销产品或操纵搜索排名。这不仅损害了平台的信息可信度,也加重了版主和社区的负担。Reddit已开始尝试调整算法、加强内容审查,但如何精准区分真实用户与AI生成的“伪社区贡献”,仍是长期难题。这一事件只是冰山一角,反映了全球互联网内容生态在AI时代的深层挑战。 #Reddit #AI #SEO #垃圾信息 #社区治理 #内容安全 #人工智能
今年早些时候,一位Reddit用户在护肤版块询问一款次氯酸喷雾的使用体验,很快收到数十条回复。其中名为Primary-Taro4254的用户的回复起初看似正常,但随后被怀疑可能是AI生成的SEO垃圾信息。随着生成式AI技术普及,Reddit等社区平台正面临前所未有的垃圾信息冲击——AI可以批量生成逼真的用户评论,绕开传统审核机制,以推销产品或操纵搜索排名。这不仅损害了平台的信息可信度,也加重了版主和社区的负担。Reddit已开始尝试调整算法、加强内容审查,但如何精准区分真实用户与AI生成的“伪社区贡献”,仍是长期难题。这一事件只是冰山一角,反映了全球互联网内容生态在AI时代的深层挑战。 #Reddit #AI #SEO #垃圾信息 #社区治理 #内容安全 #人工智能
ZeroLeaks 发布 AI 代理自动化红队测试工具
由拥有超10万星标开源仓库的团队推出的ZeroLeaks,旨在帮助开发者持续测试AI代理、端点和MCP工具的提示注入、数据泄露及不安全行为。该工具基于数千个真实世界漏洞构建探针库,而非合成测试用例。用户可通过仪表盘对系统提示或实时代理端点发起按需扫描,或接入CI/CD流水线自动检测每次拉取请求中的风险,确保问题不会无声进入生产环境。每个发现均附带引导修复与验证功能,可按严重性排序并生成可重现证据报告,供工程、安全和合规团队使用。该工具支持对抗性测试,涵盖提示词、工具调用、MCP服务器、RAG流水线及长对话,并能验证漏洞是否真正关闭。 #AI安全 #红队测试 #提示注入 #数据泄露 #CI/CD #MCP #大模型安全
由拥有超10万星标开源仓库的团队推出的ZeroLeaks,旨在帮助开发者持续测试AI代理、端点和MCP工具的提示注入、数据泄露及不安全行为。该工具基于数千个真实世界漏洞构建探针库,而非合成测试用例。用户可通过仪表盘对系统提示或实时代理端点发起按需扫描,或接入CI/CD流水线自动检测每次拉取请求中的风险,确保问题不会无声进入生产环境。每个发现均附带引导修复与验证功能,可按严重性排序并生成可重现证据报告,供工程、安全和合规团队使用。该工具支持对抗性测试,涵盖提示词、工具调用、MCP服务器、RAG流水线及长对话,并能验证漏洞是否真正关闭。 #AI安全 #红队测试 #提示注入 #数据泄露 #CI/CD #MCP #大模型安全
DeepSeek Harness 宣布内测邀请,开源Agent 路演现场规模创纪录
据 OSCHINA 报道,DeepSeek Harness 正式宣布启动内测邀请,同步举行的开源 Agent 路演现场规模创下全网之最。该活动聚集了众多开发者与开源社区成员,展示了基于 DeepSeek Harness 的多种 Agent 应用场景。DeepSeek Harness 作为新兴的开源 Agent 框架,旨在降低智能体开发门槛,此次内测邀请标志着其进入更广泛的社区验证阶段。路演现场涌现出多个创新项目,涵盖自动化任务、多智能体协作等方向,引发行业关注。 #DeepSeek #开源Agent #内测 #路演 #AI框架 #开发者社区
据 OSCHINA 报道,DeepSeek Harness 正式宣布启动内测邀请,同步举行的开源 Agent 路演现场规模创下全网之最。该活动聚集了众多开发者与开源社区成员,展示了基于 DeepSeek Harness 的多种 Agent 应用场景。DeepSeek Harness 作为新兴的开源 Agent 框架,旨在降低智能体开发门槛,此次内测邀请标志着其进入更广泛的社区验证阶段。路演现场涌现出多个创新项目,涵盖自动化任务、多智能体协作等方向,引发行业关注。 #DeepSeek #开源Agent #内测 #路演 #AI框架 #开发者社区
AI编码让扩展难题提前降临
产品-市场匹配之后,企业需要面对产品-规模匹配:即工程能力与真实使用量及多样性相匹配的阶段。传统上,从产品-市场匹配到产品-规模匹配需要数年时间,但AI编码工具(Agentic coding)将这一间隔压缩至数月,使得原本五年后才出现的再投资问题,在创业第一年便爆发。文章指出,规模有两个维度:数量(用户请求、并发量)和多样性(不同浏览器、地区、异常数据路径)。早期代码库虽能服务少量用户,但随着规模增长,目标移动而代码停滞,导致信任因大量边缘情况而流失。企业必须重新认识这一阶段,而非视其为失败。 #AI编码 #产品规模匹配 #扩展 #初创公司 #技术债务 #工程管理 #产品市场匹配 #Agentic编码 #规模之痛 #科技
产品-市场匹配之后,企业需要面对产品-规模匹配:即工程能力与真实使用量及多样性相匹配的阶段。传统上,从产品-市场匹配到产品-规模匹配需要数年时间,但AI编码工具(Agentic coding)将这一间隔压缩至数月,使得原本五年后才出现的再投资问题,在创业第一年便爆发。文章指出,规模有两个维度:数量(用户请求、并发量)和多样性(不同浏览器、地区、异常数据路径)。早期代码库虽能服务少量用户,但随着规模增长,目标移动而代码停滞,导致信任因大量边缘情况而流失。企业必须重新认识这一阶段,而非视其为失败。 #AI编码 #产品规模匹配 #扩展 #初创公司 #技术债务 #工程管理 #产品市场匹配 #Agentic编码 #规模之痛 #科技