AI知识库 @ai521
687 subscribers
30.2K photos
59 videos
27 files
1.25K links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
Amazon Bedrock 推出自动策略改进功能,简化形式化验证流程

Amazon Bedrock 宣布其 Automated Reasoning 策略新增自动改进功能,替代以往手动诊断、编辑、测试的重复循环。该引擎可自动检测失败测试并生成形式逻辑修复方案,用户需批准每一项更改后方可生效。Automated Reasoning 检查利用形式化验证,通过将自然语言转换为形式逻辑,实现高达99%的验证准确率。此次发布包含两种改进模式:针对规则问题的迭代改进,以及针对语言问题的模糊变量改进。文章详细介绍了两种模式的API工作流和可重复的控制台操作,帮助用户将失败策略转化为通过策略。该功能旨在解决策略开发中最大的痛点——迭代调优。 #AmazonBedrock #AutomatedReasoning #形式化验证 #策略改进 #AWS #AI #机器学习
提示、上下文、循环

每个RAG系统都建立在单一LLM调用的三个工程层之上。提示工程负责调用本身:系统消息、指令、固定输出格式的模式。上下文工程决定模型窗口的内容:检索、压缩、筛选排除什么。循环工程处理调用周围的行为:何时触发下一次调用、何时停止循环、检查失败时如何恢复。几乎所有关于RAG的争论本质上都是关于你站在哪一层上的争论。明确层级后,大部分困惑便烟消云散。本文绘制了地图:每一层所负责的内容、它们如何映射到序列中,以及“一层取代另一层”的简洁叙事为何只有一半正确。这三大层叠在一起,描述了生产团队在超越“Hello World”后所做的大部分工作。提示工程从2022-2023年GPT-3.5和ChatGPT开始普及;上下文工程在2025年成为主流术语(Karpathy、Tobi Lütke公开使用,Anthropic发布《为AI代理有效进行上下文工程》);循环工程则在2026年5月随着Boris Cherny的“我不再提示Claude,而是运行循环”而正式确立。 #RAG #提示工程 #上下文工程 #循环工程 #AI #大模型 #工程架构
FutureSearch 上线

FutureSearch 是一个全新的AI预测平台,用户可对“2026年是否最热”“Anthropic年底ARR”等事件进行概率、数值、日期等多类型预测,单次费用0.15至2美元。该平台在Metaculus FutureEval基准测试中排名第一,在ForecastBench上排名第17,所有预测记录及研究过程全部公开,包括失败案例。平台提供API和MCP集成,支持Claude等AI工具,客户反馈称其准确性高、数据质量优异。FutureSearch旨在将AI转变为可验证的预测工具,适用于研究、投资和决策分析。 #AI预测 #FutureSearch #可验证预测 #Metaculus #ForecastBench #AI工具 #预测市场 #科技创新
用ChatGPT定时任务取代X,AI新闻获取新方式

作者指出AI社区仍严重依赖X平台获取最新动态,但频繁刷X令人疲惫且易沉迷。为此,他尝试利用ChatGPT的定时任务功能,设置定期任务抓取OpenAI和Anthropic员工的最新公开帖子,自动总结重要更新并附链接。该方案效果良好,能绕过X平台的登录限制。作者认为,这种由AI助手主动提供信息的方式将越来越普遍,类似于RSS阅读器帮助用户避免反复刷新网站。广告和算法驱动的社交媒体过于易上瘾,最佳策略是完全不接触主流社交平台,而RSS和AI助手将在帮助人们保持信息获取的同时,远离不良影响。 #AI #ChatGPT #社交媒体 #新闻获取 #RSS #OpenAI #Anthropic #科技生活 #效率工具 #信息过滤
AI 实现从头重写完整程序,MirrorCode 基准测试揭示新能力

近年来,AI 在软件工程基准测试中进步迅速,但多数任务聚焦于修复漏洞或实现单一功能。Anthropic 与 METR 联合推出的 MirrorCode 基准测试,要求 AI 模型在不接触原始源码的情况下,从头到尾重写整个程序,且输出必须与原始程序完全一致。该基准涵盖 Unix 工具、数据序列化、生物信息学、密码学等 25 个目标程序,并提供充足推理预算(单个任务最高花费 2600 美元、运行 19 天)。测试显示,Claude Opus 4.7 成功重写了约 1.6 万行 Go 代码的生物信息学工具包 gotree,耗时 14 小时、花费 251 美元,而人类工程师需 2 至 17 周。尽管存在数据污染风险(模型可能记忆过开源代码),但记忆筛查表明结果并非由记忆主导。目前 MirrorCode 尚未被完全攻克,排行榜持续更新中。 #AI #软件工程 #MirrorCode #基准测试 #大模型 #Claude #编程 #自动化
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_8247614025
David Crawshaw 引用的技术文章汇总

David Crawshaw 近期引用了一系列技术文章,涵盖多个话题。Stateless MCP 重新引发关注,并催生了 mcp-explorer 和 datasette-mcp 等工具。另一篇科幻风格的文章描述了 OpenAI 意外对 Hugging Face 发起网络攻击的设想。此外,还有一篇与 Claude Code 团队成员的炉边访谈。这些内容均发布于2026年7月,展现了AI领域在工具、安全与团队协作方面的多元动态。 #AI #MCP #OpenAI #HuggingFace #网络安全 #技术新闻 #AI安全 #工具开发
AI输出不受言论保护?法律争议聚焦人类身份证明

美国法律界正就人工智能输出是否受第一修正案保护展开激烈辩论。多篇法学论文主张,大语言模型输出不属于“言论”,因此可不受严格审查而直接监管。在Garcia诉Character Technologies案中,一名14岁少年与AI角色对话后自杀,法官Anne Conway裁定“不准备认定LLM输出为言论”,允许产品责任和过失索赔继续审理。该案虽于2026年1月和解,但类似诉讼仍在增加,指控AI输出导致医疗危机、暴力或向未成年人提供色情内容。若人类表达受保护而机器输出不受,法律需区分人机创作——但现有技术无法可靠识别文本来源。替代方案如身份验证会加重表达负担,可能削弱匿名性、增加监控压力。这一不确定性对用户和读者的影响可能大于模型开发者。 #AI #言论自由 #第一修正案 #法律 #人工智能 #监管 #隐私 #大语言模型
AI 正在杀死中国智能手机上的传统 APP

中国手机厂商正借助 AI 打破苹果和谷歌主导的手机应用范式。中兴推出搭载字节跳动豆包 AI 代理的 Nubia NaviX Ultra,该手机没有主屏幕和传统应用商店;另一家由前微软高管创立的 StepFun 发布了 StepX Neo,其系统内置 AI 代理,可将手机功能重组为用户所需的任务;荣耀则在 MagicOS 10 中集成了与阿里巴巴合作开发的 YOYO 智能代理。这些手机均使用 Anthropic 的模型上下文协议(MCP)实现系统级代理访问,但不会进入美国市场。与苹果、谷歌依赖 APP 收入分成不同,中国厂商没有 APP 生态利益,因此可以大胆用 AI 代理层替代 APP 层。这一趋势已导致手机应用内购买收入在 2026 年初下降约 40%。 #AI手机 #中国科技 #智能手机 #无APP #人工智能 #科技趋势
AI Agent 能力被严重低估:从 Claude Code 看当前 AI 实际水平

Google DeepMind 研究员 David P. Reichert 发文指出,许多人仍基于一年前的聊天机器人体验来评判 AI,严重低估了当前 AI agent 的能力。他以 Anthropic 的 Claude Code 为例,展示该代理自主完成了一系列机器学习实验,包括生成神经细胞自动机和迷宫等交互式演示。作者认为,对于数字工作,AI agent 至少已达到初级研究员或研究生水平,具备极快的知识检索和任务执行能力,但仍会犯奇怪错误;主要局限在于缺乏长期持续学习能力,难以执行超过一周的人类时间项目。他呼吁公众更新对 AI 现状的认知,正视其即将带来的深远影响。 #AI #人工智能 #Claude #AI代理 #机器学习 #技术前沿 #认知偏差