AI知识库 @ai521
317 subscribers
21.9K photos
42 videos
19 files
839 links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
OpenAI 分析揭示编码基准测试 SWE

OpenAI 最新发布的一项分析指出,流行的编码能力评估基准 SWE-Bench Pro 存在显著缺陷,导致难以区分 AI 模型真实能力与测试中的噪声。该基准常用于衡量大模型在软件工程任务上的表现,但 OpenAI 发现其设计中的某些因素可能引入偏差,影响评估结果的准确性和可靠性。这一发现引发业界对当前 AI 编码评估方法有效性的广泛讨论,并可能推动更严谨的测试标准制定。 #OpenAI #SWEBench #编码评估 #AI模型 #基准测试 #可靠性 #准确性 #科技新闻
Anthropic 推出 Claude Cowork 全平台版本,AI 办公从编程转向业务流程

Anthropic 近日面向 Max 订阅用户正式上线 Claude Cowork 的网页版及移动端应用,使其从单一桌面编程工具升级为覆盖全场景的智能协作平台。用户可在电脑端创建任务,并通过手机随时跟踪进度,即便笔记本电脑关闭,后台任务仍能持续运行,仅在关键决策点向用户确认。这一“始终在线”特性让 Cowork 成为跨设备的 AI 行政同事。Anthropic 基于 60 万家机构、120 万次会话的数据分析显示,该工具实际核心应用并非代码编写(仅占 8.7%),而是业务流程运营(占 33.4%),包括整合报告、整理入职清单、对账及维护表格等,主要服务财务、人力资源及行政岗位。目前产品已开启移动端与网页端便捷接入,未来将统一聊天与协作功能,标志着 AI 代理竞争从代码编辑器转向更广阔的办公空间。 #Anthropic #ClaudeCowork #AI办公 #智能协作 #业务流程 #移动端 #科技新闻
公开LLM基准测试大多不可靠,专家揭露四大造假方式

OpenRouter吞吐量、Design Arena ELO和代币价格等指标显示应跳过Opus 4.7,但作者自建的3D评估套件却得出相反结论。专家指出,公开LLM基准测试存在四大欺骗手段:测试集污染(模型在训练时已见过题目)、评估指标选择偏差(只展示有利结果)、任务设计脱离实际应用场景、以及过度优化单一指标导致泛化能力下降。这些虚假基准误导开发者选择模型,实际表现与宣传严重不符。行业呼吁建立更透明、可复现的评估体系。 #LLM #基准测试 #AI评估 #模型欺骗 #科技新闻
AI时代印度科技业转型

印度依赖三十年的外包技术服务业实现了经济增长,但AI的扩张正迫使该行业转型。金融时报记者调查发现,印度正成为全球第二大AI劳动力市场,大量工人从事数据标注和机器人训练工作。在泰米尔纳德邦卡鲁尔的一家纺织厂,工人每天佩戴GoPro或Meta智能眼镜6-8小时,记录日常操作以训练机器人,每月额外获得1万卢比补贴。这种看似反乌托邦的工作模式,本质上是将人类行为转化为AI训练数据。尽管新工种涌现,但底层数据标注岗位缺乏技术含量,且面临被自动化取代的风险。印度虽自称拥有独特的AI发展路径,但缺乏西方和中国的资本与技术积累,仍主要为全球提供“后台服务”。AI技术设计上会集中权力,印度能否在AI时代真正繁荣仍是未知数。 #AI #印度科技 #数据标注 #机器人 #劳动力转型 #自动化 #外包 #科技新闻 #FT #人工智能
开源AI堆栈差距地图v0.1发布,揭示生态碎片化与机遇

Current AI 发布开源 AI 堆栈差距地图 v0.1,该地图调查了超过 24,626 个项目,深入评估了 421 个产品,包括 266 个软件工具、85 个模型、50 个数据集和 20 个硬件项目,涵盖模型组件、产品/用户体验和基础设施三个层次。地图通过开放性、能力和采用率三个维度评分,旨在识别开源 AI 生态中的关键空白,帮助开发者、投资者和政策制定者明确优先建设方向。项目源自哥伦比亚会议、MOF 和 Hugging Face 等专家推荐,并经过严格评分。该工具是 Current AI 系列工具的首个版本,旨在将复杂生态可视化,推动社区围绕集体路线图行动,解决当前开源 AI 堆栈碎片化、重复建设的问题。 #开源AI #差距地图 #AI堆栈 #CurrentAI #AI生态 #技术工具 #模型评估 #开放AI #AI基础设施
阶跃星辰将推出首款AI手机,国内大模型厂商布局硬件终端

继海外OpenAI等加速布局AI手机后,国内大模型独角兽阶跃星辰拟推出首款AI智能体手机,已有多家消费电子供应链厂商参与配套开发,产品有望近期落地。业内人士表示,手机牌照问题仍在等待,技术层面已无大碍。此前荣耀、谷歌等厂商已将AI Agent作为新一代操作系统方向,终端系统成为全球AI竞争新焦点。阶跃星辰多轮融资中已出现硬件产业链资本身影,包括华勤技术、龙旗科技、豪威集团、中兴通讯等。国内成熟的手机制造体系为大模型企业进入硬件提供了条件,AI产业竞争正从云端训练转向终端入口,模型厂商希望借助手机建立更稳定的用户入口和商业化能力。 #阶跃星辰 #AI手机 #大模型 #终端硬件 #科技新闻 #消费电子
AI炒作与现实的分裂

近年来,AI炒作与现实之间的巨大鸿沟终于达到临界点。许多企业高管因盲目相信AI的“魔法”而仓促裁员并大规模引入AI工具,结果却适得其反。福特汽车公司解雇大量工程师后,因AI在质量控制上频繁出错,不得不重新雇佣被裁员工。新闻机构为削减成本用AI替代记者,却导致大量事实错误、抄袭和虚假信息,最终需要花费更多人力编辑来修正。斯坦福大学一项研究指出,匆忙引入不成熟的AI不仅没有提升效率,反而增加了人类工作者的负担,引发“知识衰退”和组织恶性循环。这些案例表明,所谓的AI革命很大程度上是缺乏同理心、贪婪的既得利益者编织的谎言,企业们在亲历失败后正被迫重新审视AI的真实价值。 #AI #炒作 #科技 #福特 #新闻业 #效率 #工作 #现实 #斯坦福 #企业
诺贝尔奖得主化学家Yaghi离美赴华,执掌清华AI材料实验室

诺贝尔化学奖得主奥马尔·亚吉(Omar Yaghi)已离开美国,全职加入北京清华大学,领导新成立的人工智能辅助材料发现研究所。此举正值特朗普政府大幅削减美国科学经费、限制国际研究合作之际,包括中国在内的多国试图以资金支持吸引美国人才。亚吉早在2022年即为清华名誉教授,今年7月3日正式入职。他近日接受采访时表示,美国科研经费削减且未拥抱“AI革命”,这将危及美国先进研究体系。亚吉以开发金属有机框架(MOF)化合物闻名,该材料具有巨大内表面积,可用于储气、催化、空气中取水及体内药物输送等。他此前在加州大学伯克利分校任职,曾获沃尔夫化学奖、爱因斯坦世界科学奖,并于2023年分享诺贝尔化学奖。 #诺贝尔奖 #化学 #AI #材料科学 #清华大学 #人才流动 #美国科研
大量使用LLM后,开发者患上“大模型倦怠症”

一位深度依赖大语言模型(LLM)的开发者近日发文称,每日长时间与LLM交互正让他感到前所未有的疲惫。过去一年里,他的工作从亲自设计代码转变为设计思路、向LLM描述需求、审查其输出,最后再动手编写。LLM虽拓展了他的技术视野,但反复出现的错误模式——虚假假设、幻觉、短促而充满语气词的分段、过度使用emoji等——逐渐累积成厌烦情绪。作者表示,问题不在于LLM本身,而在于其写作风格和错误类型高度重复,即便启用个性化功能,某些怪癖依然顽固。这种“大模型倦怠症”正悄然影响许多高频用户,他们虽然因效率提升而难以放弃,却开始对LLM的输出产生抵触心理。 #LLM #大模型 #AI倦怠 #开发者 #技术写作 #AI幻觉 #AI模式 #职业体验
Anthropic Fable模型回归但限时试用,多家科技公司同步涨价

据科技评论员Corey Quinn分析,Anthropic于7月1日重新上线其前沿模型Fable(此前因安全漏洞被召回),但仅提供一周试用,后延长至7月12日。同时,Anthropic发布Sonnet 5模型,定价在8月31日前为优惠价,之后将上涨。GitHub、Google也于同一天安排了隐蔽的价格上调,Nvidia则直接涨价55%。此外,Fable回归后启用了更严格的安全分类器,导致更多误报,用户抱怨模型被削弱。更讽刺的是,导致Fable被召回的越狱漏洞(由Amazon研究人员发现)在其他廉价模型上同样存在。这一系列事件凸显了AI行业在定价、安全与能力之间的复杂博弈。 #AI #Anthropic #Fable #Sonnet5 #定价 #安全 #科技新闻