CQ 发布
近日,一个名为CQ的开源标准与平台正式亮相,旨在促进AI代理之间的共享学习,大幅减少重复工作,节约成本与资源。CQ取自无线电呼叫信号“CQ”(意为“所有电台,请应答”),堪称AI代理界的“Stack Overflow”。如同人类开发者在该平台分享编程解决方案,Claude Code、Cursor、GitHub Copilot等AI代理可利用CQ广播其学习成果,并听取其他代理的已有知识。 目前,AI代理多独立运行,遇到未文档化的API漏洞、库版本冲突或配置错误时,需从零摸索解决,导致数千代理每日重复相同失败,消耗海量token、时间、算力与电力。且因缺乏持久记忆,会话重置后可能遗忘此前经验。CQ通过让代理安全地持久化、查询及验证集体经验,解决了这种“代理失忆症”。其采用知识分级流程,从私有的本地SQLite存储,到团队的组织命名空间,再到完全免费、由社区治理的全球公共知识库,确保只有安全、已验证的通用见解能公开共享。集成CQ的代理不仅编写代码,更能遵循技能驱动的查询/提议工作流,避免孤岛式重复技术错误。 #开源 #AI #知识共享 #编程 #效率优化
近日,一个名为CQ的开源标准与平台正式亮相,旨在促进AI代理之间的共享学习,大幅减少重复工作,节约成本与资源。CQ取自无线电呼叫信号“CQ”(意为“所有电台,请应答”),堪称AI代理界的“Stack Overflow”。如同人类开发者在该平台分享编程解决方案,Claude Code、Cursor、GitHub Copilot等AI代理可利用CQ广播其学习成果,并听取其他代理的已有知识。 目前,AI代理多独立运行,遇到未文档化的API漏洞、库版本冲突或配置错误时,需从零摸索解决,导致数千代理每日重复相同失败,消耗海量token、时间、算力与电力。且因缺乏持久记忆,会话重置后可能遗忘此前经验。CQ通过让代理安全地持久化、查询及验证集体经验,解决了这种“代理失忆症”。其采用知识分级流程,从私有的本地SQLite存储,到团队的组织命名空间,再到完全免费、由社区治理的全球公共知识库,确保只有安全、已验证的通用见解能公开共享。集成CQ的代理不仅编写代码,更能遵循技能驱动的查询/提议工作流,避免孤岛式重复技术错误。 #开源 #AI #知识共享 #编程 #效率优化
xAI 的 Grok 4.3 登陆亚马逊云科技
xAI 的 Grok 4.3 模型现已在 Amazon Bedrock 上正式可用,为构建智能体和 AI 工作流的团队提供了在长输入下稳定推理的能力。该模型具有可配置的推理努力程度,支持强大的工具调用和指令遵循,适用于构建智能体。它可接受文本和图像输入,并拥有 100 万 Token 的上下文窗口,能处理长文档和多轮对话。Grok 4.3 运行于 Amazon Bedrock 的下一代推理引擎 Mantle 上。 据 xAI 宣称,Grok 4.3 专为注重准确性的企业工作而设计,在多项行业基准测试中表现领先。它在一项幻觉率基准测试中排名第一,并在工具调用和文档理解的多个基准测试中也位列榜首。xAI 还表示,该模型在智能与成本对比曲线上处于前沿,每美元成本可提供 2 到 10 倍的智能。 用户可通过设置“无”、“低”、“中”、“高”等级别来控制模型的推理深度,以平衡延迟和准确性。其 100 万 Token 的上下文窗口和优秀的工具调用能力,使其特别适用于合同审查、信用协议分析和金融文档问答等企业场景。访问 Grok 4.3 需要使用兼容 OpenAI 的 API。 #xAI #Grok #AmazonBedrock #人工智能 #大模型 #企业AI #智能体
xAI 的 Grok 4.3 模型现已在 Amazon Bedrock 上正式可用,为构建智能体和 AI 工作流的团队提供了在长输入下稳定推理的能力。该模型具有可配置的推理努力程度,支持强大的工具调用和指令遵循,适用于构建智能体。它可接受文本和图像输入,并拥有 100 万 Token 的上下文窗口,能处理长文档和多轮对话。Grok 4.3 运行于 Amazon Bedrock 的下一代推理引擎 Mantle 上。 据 xAI 宣称,Grok 4.3 专为注重准确性的企业工作而设计,在多项行业基准测试中表现领先。它在一项幻觉率基准测试中排名第一,并在工具调用和文档理解的多个基准测试中也位列榜首。xAI 还表示,该模型在智能与成本对比曲线上处于前沿,每美元成本可提供 2 到 10 倍的智能。 用户可通过设置“无”、“低”、“中”、“高”等级别来控制模型的推理深度,以平衡延迟和准确性。其 100 万 Token 的上下文窗口和优秀的工具调用能力,使其特别适用于合同审查、信用协议分析和金融文档问答等企业场景。访问 Grok 4.3 需要使用兼容 OpenAI 的 API。 #xAI #Grok #AmazonBedrock #人工智能 #大模型 #企业AI #智能体
AI交易回测被Reddit用户揪出过拟合,修正后结果令人警醒
一位使用AI构建交易机器人的开发者近日在Reddit上发布回测结果后,遭到两名用户质疑其存在过拟合问题。此前他声称在324个参数组合中测试后,最佳组合实现了+68.6%的收益,但网友指出这属于典型的多重比较问题——组合数量足够多时,总会有看似出色的结果只是随机噪声。专业市场数据从业者还详细说明了正确检验应包含三步:保留所有结果而非只取最佳、检验参数趋势的稳健性、以及划分样本内外数据。迫于压力,开发者进行了全面核查。结果显示,大多数参数组合实际上亏损,先前公布的68.6%位于概率分布极端边缘。更关键的是,他原以为可靠的ADX阈值信号趋势也被证伪:不同ADX值对应的平均收益分别为-5.4%、-4.2%和-6.2%,并非单调趋势。在划分数据样本外测试中,其实际运行的交易机器人表现优于网格搜索选出的“统计最优”组合。这一经历表明,未经严格样本外验证的回测结果只是声称而非证据,未来任何参数变更都必须通过在未参与选择的数据上进行验证才能采纳。 #AI交易 #量化投资 #过拟合 #回测 #机器学习 #金融科技 #数据验证
一位使用AI构建交易机器人的开发者近日在Reddit上发布回测结果后,遭到两名用户质疑其存在过拟合问题。此前他声称在324个参数组合中测试后,最佳组合实现了+68.6%的收益,但网友指出这属于典型的多重比较问题——组合数量足够多时,总会有看似出色的结果只是随机噪声。专业市场数据从业者还详细说明了正确检验应包含三步:保留所有结果而非只取最佳、检验参数趋势的稳健性、以及划分样本内外数据。迫于压力,开发者进行了全面核查。结果显示,大多数参数组合实际上亏损,先前公布的68.6%位于概率分布极端边缘。更关键的是,他原以为可靠的ADX阈值信号趋势也被证伪:不同ADX值对应的平均收益分别为-5.4%、-4.2%和-6.2%,并非单调趋势。在划分数据样本外测试中,其实际运行的交易机器人表现优于网格搜索选出的“统计最优”组合。这一经历表明,未经严格样本外验证的回测结果只是声称而非证据,未来任何参数变更都必须通过在未参与选择的数据上进行验证才能采纳。 #AI交易 #量化投资 #过拟合 #回测 #机器学习 #金融科技 #数据验证
当AI编码成为常态,开发者如何保持对代码的熟悉感
随着大语言模型(LLM)越来越多地参与代码编写,开发人员正面临一个根本性挑战:他们对自己生产的代码熟悉度正在急剧下降。一个月前由LLM写成的代码,如今可能难以回忆起其决策逻辑;当客户报告Bug时,那种曾经“哦,我知道这是什么”的直觉反应正在消失。开发者不再本能地知道代码存放在哪里,遇到问题需要回访LLM而非脱口而出答案。这种渐进式的知识流失导致对LLM的引导越来越差,当模型难以编写下一个功能时,开发者甚至无法判断问题根源。更危险的是,随着LLM看到越来越多自己生成的代码而非人类编写的代码,代码库正被拖向“均值化”的危险境地。然而,仍然有方法可以培养这种“直觉理解”:主动制造“惊喜感”——通过故意让LLM尝试极端优化、分析其优劣势、或者在没有反馈的情况下思考可能出错的地方。就像犯错后反而能牢记正确答案一样,这种主动发现和验证的过程能帮助程序员重建对代码的深刻理解。 #AI编程 #软件开发 #代码质量 #LLM #开发者体验 #人工审核 #技术债
随着大语言模型(LLM)越来越多地参与代码编写,开发人员正面临一个根本性挑战:他们对自己生产的代码熟悉度正在急剧下降。一个月前由LLM写成的代码,如今可能难以回忆起其决策逻辑;当客户报告Bug时,那种曾经“哦,我知道这是什么”的直觉反应正在消失。开发者不再本能地知道代码存放在哪里,遇到问题需要回访LLM而非脱口而出答案。这种渐进式的知识流失导致对LLM的引导越来越差,当模型难以编写下一个功能时,开发者甚至无法判断问题根源。更危险的是,随着LLM看到越来越多自己生成的代码而非人类编写的代码,代码库正被拖向“均值化”的危险境地。然而,仍然有方法可以培养这种“直觉理解”:主动制造“惊喜感”——通过故意让LLM尝试极端优化、分析其优劣势、或者在没有反馈的情况下思考可能出错的地方。就像犯错后反而能牢记正确答案一样,这种主动发现和验证的过程能帮助程序员重建对代码的深刻理解。 #AI编程 #软件开发 #代码质量 #LLM #开发者体验 #人工审核 #技术债
Kimi 发布 2.8 万亿参数大模型 K3,百万级上下文窗口
月之暗面旗下 AI 助手 Kimi 正式发布新一代大语言模型 K3,该模型拥有 2.8 万亿参数,支持百万级 token 上下文窗口,并具备原生多模态能力。K3 采用创新的 Kimi Delta 注意力机制,在处理百万 tokens 长文本时,解码速度最高可提升 6.3 倍。同时,注意力残差技术在不增加 2% 以上额外成本的前提下,将训练效率提升了约 25%。该模型专为长期智能体编程和自进化工作流设计,现已登陆 Kimi 官方及 API 平台,并计划于 2026 年 7 月 27 日开放模型权重。 #KimiK3 #月之暗面 #大模型 #多模态AI #长上下文 #科技新闻 #AI #人工智能
月之暗面旗下 AI 助手 Kimi 正式发布新一代大语言模型 K3,该模型拥有 2.8 万亿参数,支持百万级 token 上下文窗口,并具备原生多模态能力。K3 采用创新的 Kimi Delta 注意力机制,在处理百万 tokens 长文本时,解码速度最高可提升 6.3 倍。同时,注意力残差技术在不增加 2% 以上额外成本的前提下,将训练效率提升了约 25%。该模型专为长期智能体编程和自进化工作流设计,现已登陆 Kimi 官方及 API 平台,并计划于 2026 年 7 月 27 日开放模型权重。 #KimiK3 #月之暗面 #大模型 #多模态AI #长上下文 #科技新闻 #AI #人工智能
月之暗面发布K3国产大模型,网友实测称超越GPT
国内人工智能公司月之暗面近日推出其最新大模型K3。该模型在多项评测中表现惊艳,据网友实测对比,其综合能力已超越业界标杆Fable 5及GPT-5.6版本。月之暗面表示,K3在自然语言理解、逻辑推理和代码生成方面进行了系统性优化,尤其在中文语境下的表现尤为突出。目前,K3已向部分开发者开放内测,吸引大量科技博主和专业人士参与实测,获得较高评价。作为国内规模最大的大模型之一,K3的发布被视为中国AI领域追赶国际先进水平的重要一步,有望推动国产大模型在商业应用和基础研究上的进一步发展。 #月之暗面 #K3 #国产大模型 #AI #人工智能 #科技新闻 #大模型
国内人工智能公司月之暗面近日推出其最新大模型K3。该模型在多项评测中表现惊艳,据网友实测对比,其综合能力已超越业界标杆Fable 5及GPT-5.6版本。月之暗面表示,K3在自然语言理解、逻辑推理和代码生成方面进行了系统性优化,尤其在中文语境下的表现尤为突出。目前,K3已向部分开发者开放内测,吸引大量科技博主和专业人士参与实测,获得较高评价。作为国内规模最大的大模型之一,K3的发布被视为中国AI领域追赶国际先进水平的重要一步,有望推动国产大模型在商业应用和基础研究上的进一步发展。 #月之暗面 #K3 #国产大模型 #AI #人工智能 #科技新闻 #大模型
Linus Torvalds 强硬支持 AI 代码审查工具,反对者被要求“走人”
近日,Linux 创始人 Linus Torvalds 在邮件列表中明确表态,坚决支持在 Linux 内核开发中使用 AI 工具。此前,开发者 Laurent Pinchart 建议对 AI 工具 Sashiko 的输出进行人工筛选后再发给补丁作者,遭到 Torvalds 严厉驳斥。Torvalds 指出,Linux 不是“反 AI 项目”,任何反对者可以选择分支项目或离开。他称 AI 是工具,如同其他开发工具一样实用,并强调 Sashiko 已能发现 53.6% 的补丁漏洞,远超人工审查水平。Torvalds 还讽刺道,“自然智能也不是总那么好”,暗示开发者需要自我反思。此次争论源于 Sashiko 工具的使用,其设计者为 Google 工程师 Roman Gushchin。Torvalds 的立场与其 2024 年对 AI 工具“夸大其词”的评价形成鲜明对比。 #Linux #LinusTorvalds #AI #代码审查 #开源 #Sashiko #开发工具 #技术新闻
近日,Linux 创始人 Linus Torvalds 在邮件列表中明确表态,坚决支持在 Linux 内核开发中使用 AI 工具。此前,开发者 Laurent Pinchart 建议对 AI 工具 Sashiko 的输出进行人工筛选后再发给补丁作者,遭到 Torvalds 严厉驳斥。Torvalds 指出,Linux 不是“反 AI 项目”,任何反对者可以选择分支项目或离开。他称 AI 是工具,如同其他开发工具一样实用,并强调 Sashiko 已能发现 53.6% 的补丁漏洞,远超人工审查水平。Torvalds 还讽刺道,“自然智能也不是总那么好”,暗示开发者需要自我反思。此次争论源于 Sashiko 工具的使用,其设计者为 Google 工程师 Roman Gushchin。Torvalds 的立场与其 2024 年对 AI 工具“夸大其词”的评价形成鲜明对比。 #Linux #LinusTorvalds #AI #代码审查 #开源 #Sashiko #开发工具 #技术新闻