AI知识库 @ai521
332 subscribers
22.4K photos
42 videos
19 files
867 links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
CHI-Bench 开源基准测试揭示 AI 医疗 Agent 能力短板,最强模型任务通过率仅 28%

CHI-Bench 是一个专注于美国医疗系统的开源评估基准,近日在 ModelScope 魔搭社区正式发布。该项目设计了 75 个模拟医疗长程工作流的任务,涵盖从临床诊疗到保险理赔的完整流程,旨在测试前沿 AI Agent 的实际应用能力。研究人员使用该基准对包括 Claude Code 在内的 30 个先进 AI Agent 进行了压力测试。结果发现,表现最佳的 Claude Code 仅通过了 28% 的任务,而在涉及医院与保险公司直接协作的端到端任务中,所有 Agent 的得分均归零。这一结果凸显了当前 AI 技术在处理复杂医疗流程和跨机构协同工作时的显著局限性,为未来 AI 医疗系统的开发与优化提供了重要警示和参考方向。 #CHIBench #AI医疗 #基准测试 #人工智能 #医疗科技 #ClaudeCode #开源项目 #美国医疗 #Agent评估
学习AVA:可信任AI在政策与开发研究中的经验教训

一篇题为《学习AVA:可信任生成式AI在政策与开发研究中的早期经验教训》的学术论文于2026年4月20日在arXiv平台发布。该研究由Nimisha Karnatak等六位作者共同完成,聚焦于名为AVA的可信任生成式AI系统,探讨了其在政策制定和发展研究领域的实际应用。论文基于AVA项目的实践案例,深入分析了在复杂政策和开发环境中构建可信任AI所面临的挑战,包括数据策展、模型透明度以及用户交互等方面的关键经验。研究指出,确保AI系统的可信度对于推动其在公共政策和国际发展领域的负责任使用至关重要。这些初步教训为未来AI技术的集成提供了指导,有助于研究人员和决策者更安全、有效地利用生成式AI工具支持政策分析和开发项目。 #AI #可信任AI #政策研究 #开发研究 #生成式AI #arXiv #学术论文 #人工智能 #数据策展
iOS 27 Siri 或迎来重大改版,设计近似 ChatGPT

据彭博社曝光的渲染图显示,苹果计划在 iOS 27 系统中对 Siri 进行重大改版。新版界面采用了类似 ChatGPT 的对话形式,并融入了“液态玻璃”设计语言,呈现全新的应用与聊天交互界面。彭博社记者马克·古尔曼指出,这些设计基于苹果内部信息,但最终方案可能会在六月的WWDC全球开发者大会上正式公布,与现有渲染图存在差异。 #iOS27 #Siri #苹果 #人工智能 #科技新闻 #WWDC
AI教学意外发现

在教授高级AI核心前沿技术的过程中,作者Steve Repetti发现了一个意外现象。原本他试图让AI(如Claude)掌握其共同编写的FGL平台,并解决AI在无关问题上产生混淆回答的缺陷。通过与AI的迭代协作和学习,他不仅提升了AI的流畅度,还意外创建出一个可移植的纯文本文件。该文件为Markdown或普通文本格式,高度优化了AI的上下文窗口和令牌成本限制,无需任何安装、账户或平台配置,直接拖入任何现代AI聊天中,即可在几秒内使AI精通特定知识领域。这一发现揭示了知识传递的新方式:文件本身成为工具链,实现了领域特定知识的即时跨平台共享。与平台绑定的知识容器(如自定义GPT)不同,这种“可移植入门文件”更具通用性,适用于需要多AI工具协作的场景,代表了AI辅助学习的创新突破。 #AI #科技 #创新 #知识管理 #人工智能 #前沿技术 #可移植性 #教育 #协作学习
App智能广告监测工具上线,TikTok实时数据已接入

一款面向应用营销人员的新型广告智能工具(Ads Intelligence Beta)已启动测试,为行业提供关键广告数据监测能力。该工具整合了多平台的广告数据源,其中TikTok的广告数据已实现实时接入与监测。Meta(Facebook)的广告库数据接口处于测试阶段,而谷歌与苹果的搜索广告数据接入功能则标注为“即将推出”。该工具旨在帮助营销人员分析应用在各大平台的广告投放情况、受众覆盖及创意类型,提供包括官方广告主识别、品牌提及分析和广告素材库在内的多项功能,以优化广告策略。
企业部署AI代理面临安全风险,专家提出七大管理原则

2026年,AI代理(AI Agents)已从演示工具转变为企业实用解决方案。与传统“问答式”AI助手不同,AI代理能自主执行复杂任务,例如自动规划路径、处理实时交通状况。斯坦福HAI研究所数据显示,其基准测试准确率一年内从12%跃升至66%,其中Nous Research开源的Hermes Agent增长迅猛,已在GitHub获得超10万星标,并强调本地运行与零已知漏洞的安全优势。 然而,AI代理的强大自主性伴随显著风险。此前PocketOS代理曾于9秒内误删生产数据库,凸显了权限管理失控的严重后果。为此,行业专家提出七项核心管理原则:遵循最小权限原则、关键操作需人工审批、使用Docker等沙箱环境、避免向代理暴露敏感信息、审核第三方技能来源、全程日志审计,以及严格区分个人与企业代理使用场景。 业界认为,妥善管理AI代理风险的企业将获得竞争优势,而忽视安全则可能付出高昂代价。开源工具如Hermes Agent在提供强大功能的同时,也要求使用者对潜在错误负责。 #AI代理 #网络安全 #企业管理 #风险管理 #开源AI #HermesAgent #人工智能
Fosi Audio 推出 C3 游戏声卡,主打竞技优势

音频设备品牌 Fosi Audio 近日发布了一款专为玩家设计的 C3 外置游戏声卡。该声卡通过 USB-C 连接,并内置了其独有的 StepSense “音频增强技术”。这项技术由针对大量 FPS 游戏音频数据训练而成的人工智能模型驱动,能够自动识别并增强游戏中的关键声音,例如对手的脚步声、翻越障碍声等,使其不会被游戏背景音效所淹没,从而帮助玩家更早察觉敌人动向,获得竞技优势。 #游戏硬件 #音频技术 #AI #FPS #电竞 #科技新闻
IBM与红帽宣布50亿美元开源安全计划,应对AI时代漏洞挑战

IBM与红帽联合宣布启动“光井计划”,承诺投资50亿美元,利用前沿AI能力和超过2万名工程师的全球团队,帮助企业保障开源软件安全。该计划旨在建立全新的企业级开源使用模式,覆盖从上游开发到生产环境的整个生命周期。 计划核心是建立一个可信的企业级漏洞协调中心,结合全球工程师力量,大规模识别和修复漏洞。该中心将作为安全协调层,利用AI技术对海量开源代码进行测试和验证。这些能力将通过商业订阅提供,让企业能将经验证的安全补丁直接集成到现有供应链中。 目前,开源软件支撑着现代企业基础设施,超过90%的财富500强公司依赖开源软件。与此同时,AI技术的快速发展也加速了漏洞的发现与利用。IBM和红帽已与美国银行、花旗、高盛等十多家大型金融机构合作开展早期试点,共同塑造漏洞修复的新模式。 #IBM #红帽 #开源安全 #AI #光井计划 #企业级软件 #网络安全 #漏洞修复 #金融科技
Waymo自动驾驶出租车Ojai将在三大城市启动载客服务

经过数月测试,自动驾驶公司Waymo正式宣布,将开始邀请非员工乘客试乘其最新车型Ojai。该车型基于极氪RT小型货车打造并重新命名。初期服务将在旧金山、洛杉矶和凤凰城向“精选用户”开放,随后将逐步扩大服务范围和用户规模。为收集乘客体验数据,试运营期间所有行程将免费,未来会转为收费模式。 #Waymo #自动驾驶 #机器人出租车 #智能出行 #科技新闻
破解本地 AI 代理效能瓶颈

要在本地让大语言模型代理真正发挥效用,远不止简单运行模型那么简单。本文以构建用于自动化单细胞RNA测序分析的代理为例,指出本地代理面临的核心挑战:冗长的指令和工具定义导致推理缓慢,且长会话容易因上下文溢出而崩溃。作者认为,对于需要高度可复现性和过程追踪的科学工作流,必须自主构建底层基础设施。 为了解决这些问题,作者通过一系列优化措施改进了开源推理引擎 vLLM,显著提升了推理速度。同时,他们设计了更好的上下文管理和结构化的“世界状态”来保存关键分析信息,确保长会话的稳定性。实验表明,在A100和H100 GPU上,这些优化有效提升了代理的性能和实用性,使基于本地开放权重模型(如Qwen3.6–27B、Gemma 4–31B)构建可靠的科学代理成为可能。 #本地AI #大语言模型 #科学计算 #AI基础设施 #vLLM #单细胞分析 #人工智能 #科技新闻
AI揭示软件工程积弊

资深开发者发现,AI在应用过程中并非创造新问题,而是迫使团队直面长期被回避的系统缺陷。过去,开发者依靠个人经验绕过代码库中的历史包袱——如未记录的回调函数、过时的测试用例、隐含的服务限制知识。这些"机构记忆"随人员流动逐渐消失,却从未被固化为可靠的流程或文档。 当AI作为缺乏上下文记忆的"新手"介入开发时,会径直踏入人类早已学会规避的陷阱:触发已知漏洞、编写无人维护的代码模式、突破未经压力测试的服务边界。这迫使团队必须建立严格的测试规范、清晰的代码所有权和确定性验证机制——这些本应是软件工程的基础实践,却在快速迭代中被长期搁置。AI意外地成为了检验系统健康度的"混沌猴子",暴露出组织在知识传承和流程固化上的巨大漏洞。 #AI应用 #软件工程 #技术债 #系统可靠性 #开发实践 #知识管理 #混沌工程 #数字化转型
AI预测者最新更新

多位AI研究人员和预测平台近期对人工通用智能(AGI)的实现时间进行了追踪与更新。根据对Daniel Kokotajlo、Eli Lifland等专家的预测分析,从2023年至2025年,大多数预测者认为AGI将更早到来,但部分人士如Tamay Besilogru持保守态度。然而,2025年至2026年间,受xAI、Meta和Gemini等公司技术进展影响,预测者如Kokotajlo、Lifland及Metaculus社区成员Dario Amodei等将时间表推迟。进入2026年1月至4月,随着Anthropic技术的快速突破,所有更新预测的专家均将时间表调早,显示AGI实现可能加速。这一动态趋势表明,AI预测紧密依赖技术里程碑,从ChatGPT时代的乐观,到其他公司时代的谨慎,再到Anthropic时代的再次乐观,凸显了预测的易变性和对行业进展的高度敏感。 #AI #AGI #认知劳动自动化 #科技预测 #人工智能 #大模型 #预测更新 #技术进展
Wix裁员20%应对AI转型与货币升值压力

Wix公司宣布裁员约1000人,占员工总数的20%,创下公司历史最大规模裁员纪录。首席执行官阿维沙伊·亚伯拉罕指出,此次重组主要受两大因素驱动:以色列谢克尔对美元持续升值导致成本结构性上升,以及软件行业在AI时代需要根本性转变运营模式。Wix超过六成员工位于以色列,货币不匹配使其以美元计价的营收难以抵消以谢克尔支付的人力成本。公司股价在2026年已下跌逾50%。裁员后,员工规模将缩减至约4200人,受影响员工将获得个性化补偿方案。Wix正转向更扁平的组织结构,并引入“xEngineer”等AI原生岗位,以适应自动化工作流程。此次裁员反映了以色列科技行业普遍面临的货币挑战,类似重组也出现在ClickUp等其他科技公司中。 #Wix #裁员 #AI转型 #以色列科技 #货币升值 #科技新闻 #公司重组 #人力资源
Kirkland & Ellis律所斥资五亿美元打造专属AI平台

全球收入最高的律师事务所Kirkland & Ellis宣布,将拨出5亿美元用于创建自有的人工智能平台。该举措旨在通过先进技术优化法律服务流程,例如提升合同审查、法律研究和案例分析的效率与准确性。作为法律行业的领军者,此举不仅可能强化律所的市场竞争优势,还有望推动整个行业向数字化和智能化转型。投资AI技术也面临数据安全、伦理规范等挑战,律所需确保技术应用符合法律和行业标准。这一战略投资反映了顶级律所对AI赋能的高度关注,未来或引发行业跟进潮流。 #法律科技 #AI平台 #律师事务所 #人工智能 #投资 #数字化转型 #KirklandEllis #法律行业