Anthropic 发布 Claude Opus 4.8,诚实度与工程执行力大幅跃升
距 Opus 4.7 发布仅 40 天,Anthropic 闪电推出 Claude Opus 4.8,被视为应对 OpenAI 和 Google 激烈竞争的市场反击。新版本在 SWE-Bench Pro 上得分 69.2%,领先 GPT-5.5 十个百分点;FrontierSWE 胜率 83%;谎报率降至 0%,模型学会承认不确定性和风险,提升了企业级安全可靠性。Agent 能力方面,Dynamic Workflows 可调度上百个子智能体并行作业,Bun 作者用其 11 天完成 75 万行 Zig 代码到 Rust 的迁移,测试通过率 99.8%。在 Artificial Analysis 榜单中排名第一。不过部分用户指出,其文学创作和文案润色能力略逊于 4.6 版本。实测显示,Opus 4.8 在逻辑推理、SVG 绘制、代码生成等任务上表现突出,但动态效果和感性发挥仍有改进空间。 #Anthropic #ClaudeOpus48 #AI #大模型 #编程 #Agent #诚实度 #基准测试
距 Opus 4.7 发布仅 40 天,Anthropic 闪电推出 Claude Opus 4.8,被视为应对 OpenAI 和 Google 激烈竞争的市场反击。新版本在 SWE-Bench Pro 上得分 69.2%,领先 GPT-5.5 十个百分点;FrontierSWE 胜率 83%;谎报率降至 0%,模型学会承认不确定性和风险,提升了企业级安全可靠性。Agent 能力方面,Dynamic Workflows 可调度上百个子智能体并行作业,Bun 作者用其 11 天完成 75 万行 Zig 代码到 Rust 的迁移,测试通过率 99.8%。在 Artificial Analysis 榜单中排名第一。不过部分用户指出,其文学创作和文案润色能力略逊于 4.6 版本。实测显示,Opus 4.8 在逻辑推理、SVG 绘制、代码生成等任务上表现突出,但动态效果和感性发挥仍有改进空间。 #Anthropic #ClaudeOpus48 #AI #大模型 #编程 #Agent #诚实度 #基准测试
实验微调LLM
一位技术作家尝试通过微调开源指令模型,使其模仿上世纪八九十年代软件技术文档的写作风格。他利用Bitsavers网站收录的微软旧手册(1977-2005年,超3700万词)作为训练数据,通过Python脚本清理OCR文本,并借助Gemma-4-26b模型对段落进行智能筛选,最终获得近20万条训练样本。作者选择微调而非检索增强生成(RAG),因为目标不是获取事实,而是让模型在风格和行为上贴合特定历史文档。整个实验成本较低,展示了在本地硬件上运行专用语言模型的可行性,也为未来技术写作工具的发展提供了实验方向。 #LLM #微调 #技术文档 #AI写作 #本地模型 #Bitsavers #技术史
一位技术作家尝试通过微调开源指令模型,使其模仿上世纪八九十年代软件技术文档的写作风格。他利用Bitsavers网站收录的微软旧手册(1977-2005年,超3700万词)作为训练数据,通过Python脚本清理OCR文本,并借助Gemma-4-26b模型对段落进行智能筛选,最终获得近20万条训练样本。作者选择微调而非检索增强生成(RAG),因为目标不是获取事实,而是让模型在风格和行为上贴合特定历史文档。整个实验成本较低,展示了在本地硬件上运行专用语言模型的可行性,也为未来技术写作工具的发展提供了实验方向。 #LLM #微调 #技术文档 #AI写作 #本地模型 #Bitsavers #技术史