Exponential Convex Calibration Dimension for the Multi-Label Jaccard Measure 论文在 arXiv 发布
近日,一篇题为《Exponential Convex Calibration Dimension for the Multi-Label Jaccard Measure》的学术论文在 arXiv 预印本平台公开。该论文由 Mingyuan Zhang 独立完成,提交日期为 2026 年 8 月 13 日。论文聚焦于多标签分类任务中 Jaccard 度量的理论分析,创新性地提出了“指数凸校准维度”这一概念,并系统研究了该维度与现有校准维度之间的关联。该工作为多标签学习中的性能度量和理论分析提供了新的视角,有望推动相关领域的发展。 #学术论文 #机器学习 #多标签分类 #Jaccard度量 #校准维度 #arXiv
近日,一篇题为《Exponential Convex Calibration Dimension for the Multi-Label Jaccard Measure》的学术论文在 arXiv 预印本平台公开。该论文由 Mingyuan Zhang 独立完成,提交日期为 2026 年 8 月 13 日。论文聚焦于多标签分类任务中 Jaccard 度量的理论分析,创新性地提出了“指数凸校准维度”这一概念,并系统研究了该维度与现有校准维度之间的关联。该工作为多标签学习中的性能度量和理论分析提供了新的视角,有望推动相关领域的发展。 #学术论文 #机器学习 #多标签分类 #Jaccard度量 #校准维度 #arXiv
智谱AI发布GLM
智谱AI(Z AI)正式发布GLM-5.3大模型,该模型基于743B参数基座进行后训练,在编码和智能体能力上达到顶尖水平,尤其在网络安全领域树立了开放模型的新标准。外界围绕其“刷榜”策略展开讨论:有分析指出,智谱AI相比OpenAI和Anthropic更注重公开基准测试以利于营销,但并未过度追求高分导致模型退化;其模型在智能体任务上表现突出,且因尚未支持多模态,单一模态训练难度更低;此外,智谱AI的迭代周期仅数天,远快于对手,这使其在效率上占据优势。总体来看,这是一条行之有效的策略,业界期待模型权重开源后接受更广泛测试。 #智谱AI #GLM5.3 #大模型 #编码 #网络安全 #AI #基准测试 #开源
智谱AI(Z AI)正式发布GLM-5.3大模型,该模型基于743B参数基座进行后训练,在编码和智能体能力上达到顶尖水平,尤其在网络安全领域树立了开放模型的新标准。外界围绕其“刷榜”策略展开讨论:有分析指出,智谱AI相比OpenAI和Anthropic更注重公开基准测试以利于营销,但并未过度追求高分导致模型退化;其模型在智能体任务上表现突出,且因尚未支持多模态,单一模态训练难度更低;此外,智谱AI的迭代周期仅数天,远快于对手,这使其在效率上占据优势。总体来看,这是一条行之有效的策略,业界期待模型权重开源后接受更广泛测试。 #智谱AI #GLM5.3 #大模型 #编码 #网络安全 #AI #基准测试 #开源
LLM 批量 API 定价
Google、OpenAI 和 Anthropic 三家前沿大模型厂商的批量 API 定价均统一为同步 API 的 50%,但多数成本预测仍按全价计算,导致预算误差高达一倍。xAI 的批量折扣仅为 20%,且仅限四款旧模型,旗舰模型 Grok 4.6 无折扣。此外,聚合器 OpenRouter 在非批量列表中误将 GPT-5.6 Luna 的批量价(0.10/0.60 美元)标为标准价,而 OpenAI 官方标准价为 0.20/1.20 美元,这一标价混淆可能误导用户按批量价取费却享受实时响应。本文梳理了四家厂商的批量定价机制,指出 50% 折扣已成为行业锚点,而 xAI 的差异化策略更像是对自身算力容量的表态。 #LLM #API #批量API #定价 #AI #OpenAI #Google #Anthropic #xAI #成本优化
Google、OpenAI 和 Anthropic 三家前沿大模型厂商的批量 API 定价均统一为同步 API 的 50%,但多数成本预测仍按全价计算,导致预算误差高达一倍。xAI 的批量折扣仅为 20%,且仅限四款旧模型,旗舰模型 Grok 4.6 无折扣。此外,聚合器 OpenRouter 在非批量列表中误将 GPT-5.6 Luna 的批量价(0.10/0.60 美元)标为标准价,而 OpenAI 官方标准价为 0.20/1.20 美元,这一标价混淆可能误导用户按批量价取费却享受实时响应。本文梳理了四家厂商的批量定价机制,指出 50% 折扣已成为行业锚点,而 xAI 的差异化策略更像是对自身算力容量的表态。 #LLM #API #批量API #定价 #AI #OpenAI #Google #Anthropic #xAI #成本优化
Meta 发布 Muse Glimmer 端侧 AI 模型,ExecuTorch 框架实现多后端部署
Meta 今日发布开源模型 Muse Glimmer,该模型拥有 300 亿参数,从 Muse Spark 蒸馏而来,专为设备端代理工作流设计。同时,ExecuTorch 框架新增对在 NVIDIA GPU 和 Apple Silicon Mac 上运行 Muse Glimmer 的端到端支持。ExecuTorch 采用 PyTorch 编写模型,通过预先编译优化整个执行路径,自动处理不同后端(如 CUDA 上的 Triton、Apple Silicon 上的 MLX 和 Metal)的适配。Muse Glimmer 支持文本和图像输入,具备 128K+ token 上下文,并集成 DFlash 并行扩散推测解码以实现低延迟。Meta 已在 Hugging Face 上发布预构建的 PTE 文件,用户可直接下载运行,或根据指南自行构建。这标志着设备端 AI 在复杂模型部署上的一大进步,降低了边缘计算中的推理门槛。 #Meta #MuseGlimmer #ExecuTorch #端侧AI #开源模型 #NVIDIA #AppleSilicon #AI推理 #设备端代理
Meta 今日发布开源模型 Muse Glimmer,该模型拥有 300 亿参数,从 Muse Spark 蒸馏而来,专为设备端代理工作流设计。同时,ExecuTorch 框架新增对在 NVIDIA GPU 和 Apple Silicon Mac 上运行 Muse Glimmer 的端到端支持。ExecuTorch 采用 PyTorch 编写模型,通过预先编译优化整个执行路径,自动处理不同后端(如 CUDA 上的 Triton、Apple Silicon 上的 MLX 和 Metal)的适配。Muse Glimmer 支持文本和图像输入,具备 128K+ token 上下文,并集成 DFlash 并行扩散推测解码以实现低延迟。Meta 已在 Hugging Face 上发布预构建的 PTE 文件,用户可直接下载运行,或根据指南自行构建。这标志着设备端 AI 在复杂模型部署上的一大进步,降低了边缘计算中的推理门槛。 #Meta #MuseGlimmer #ExecuTorch #端侧AI #开源模型 #NVIDIA #AppleSilicon #AI推理 #设备端代理
Joi AI 雇佣“自慰顾问”研究 AI 引导自慰效果
AI 伴侣公司 Joi AI 开展了一项为期 28 天的实验,雇佣 10 名男性“自慰顾问”,要求他们每天自慰(周日除外),其中每周两次使用平台的 AI 数字伴侣,其余时间自选方法。参与者需记录自慰前后的情绪、能量、专注力等数据。该公司旨在将自慰转化为“AI 引导的健康仪式”,以缓解男性孤独感。初步分析显示,参与者压力水平降低 25%,专注力提升 17%。此前调查发现,75% 的成年人通过自慰减压,37% 对 AI 引导自慰持开放态度。每位顾问获得 2000 美元报酬,平台提供付费订阅及内购服务。 #AI #自慰 #健康 #科技 #人工智能 #伴侣 #实验 #男性健康 #JoiAI
AI 伴侣公司 Joi AI 开展了一项为期 28 天的实验,雇佣 10 名男性“自慰顾问”,要求他们每天自慰(周日除外),其中每周两次使用平台的 AI 数字伴侣,其余时间自选方法。参与者需记录自慰前后的情绪、能量、专注力等数据。该公司旨在将自慰转化为“AI 引导的健康仪式”,以缓解男性孤独感。初步分析显示,参与者压力水平降低 25%,专注力提升 17%。此前调查发现,75% 的成年人通过自慰减压,37% 对 AI 引导自慰持开放态度。每位顾问获得 2000 美元报酬,平台提供付费订阅及内购服务。 #AI #自慰 #健康 #科技 #人工智能 #伴侣 #实验 #男性健康 #JoiAI
AI与问责制
关于AI将大规模取代人类工作的论调屡见不鲜。埃隆·马斯克声称,AI造成的失业规模将迫使社会实施全民基本收入;Citrini研究公司甚至预测,需求毁灭会引发严重通缩。然而,这些观点忽略了关键因素:人类员工的工作动力不仅来自正面激励(如做好工作),更源于生存压力、自我价值感等负面激励。AI模型没有房租、车贷、自尊心等“切身利益”,一旦犯错,员工可能失去工作,而AI无需承担任何后果。AI代理支付错误、架构缺陷等问题都可能给企业带来巨大麻烦,但人们往往对算法宽容有加。尽管AI技术会持续改进,但在缺乏人类独特激励机制的条件下,它不可能引发马斯克等人所描绘的极端社会变革。 #AI #人工智能 #就业 #问责制 #马斯克 #科技评论 #经济影响
关于AI将大规模取代人类工作的论调屡见不鲜。埃隆·马斯克声称,AI造成的失业规模将迫使社会实施全民基本收入;Citrini研究公司甚至预测,需求毁灭会引发严重通缩。然而,这些观点忽略了关键因素:人类员工的工作动力不仅来自正面激励(如做好工作),更源于生存压力、自我价值感等负面激励。AI模型没有房租、车贷、自尊心等“切身利益”,一旦犯错,员工可能失去工作,而AI无需承担任何后果。AI代理支付错误、架构缺陷等问题都可能给企业带来巨大麻烦,但人们往往对算法宽容有加。尽管AI技术会持续改进,但在缺乏人类独特激励机制的条件下,它不可能引发马斯克等人所描绘的极端社会变革。 #AI #人工智能 #就业 #问责制 #马斯克 #科技评论 #经济影响
AI 体验追踪网站上线:社区投票显示 Gemini 表现最佳,Grok 最差
一个名为“Is AI Dumber Today?”的社区驱动式AI体验指数正式上线。该网站每小时更新,从 Reddit、Hacker News 及中文社区收集用户反馈,让用户一键投票评价各模型在速度、智能、拒绝回答、幻觉等方面的表现。当前数据显示,Gemini 以 58.7 分(满分100)位居体验榜首,且较往常更敏锐;Grok 仅得 22.6 分,被标记为“比平时更笨”。按任务细分,GPT-5.6 Luna 在通用文本任务中领先,Claude Fable 5 在推理任务中夺冠,Grok 4.5 在编程任务中表现最佳。该指数并非标准能力基准,而是观察性体验排名,旨在反映大众对模型实时感受的变化。 #AI #大模型 #体验指数 #社区反馈 #Gemini #Grok #GPT #Claude
一个名为“Is AI Dumber Today?”的社区驱动式AI体验指数正式上线。该网站每小时更新,从 Reddit、Hacker News 及中文社区收集用户反馈,让用户一键投票评价各模型在速度、智能、拒绝回答、幻觉等方面的表现。当前数据显示,Gemini 以 58.7 分(满分100)位居体验榜首,且较往常更敏锐;Grok 仅得 22.6 分,被标记为“比平时更笨”。按任务细分,GPT-5.6 Luna 在通用文本任务中领先,Claude Fable 5 在推理任务中夺冠,Grok 4.5 在编程任务中表现最佳。该指数并非标准能力基准,而是观察性体验排名,旨在反映大众对模型实时感受的变化。 #AI #大模型 #体验指数 #社区反馈 #Gemini #Grok #GPT #Claude