日月小楚的投资交流空间(公告群)
Photo
日月小楚 |Building AI Agents
又踩了大坑~·
一直以为codex-gpt5.2-xhigh 是代码最强的,所以最近都在让它当牛马。
今天才发现它不擅长写数据分析的代码。比如可以用padas的apply函数可以搞定的,它却用一行一行for循环处理,速度相差好几倍倍。好几处这个地方,还是opus 4.5 纠正的
难怪当时跑这批数据的时候,运行了这么久。
现在看来,各个ai真的是各有所长。
真希望ai界的韩立到来啊。
tweet
又踩了大坑~·
一直以为codex-gpt5.2-xhigh 是代码最强的,所以最近都在让它当牛马。
今天才发现它不擅长写数据分析的代码。比如可以用padas的apply函数可以搞定的,它却用一行一行for循环处理,速度相差好几倍倍。好几处这个地方,还是opus 4.5 纠正的
难怪当时跑这批数据的时候,运行了这么久。
现在看来,各个ai真的是各有所长。
真希望ai界的韩立到来啊。
号外号外,今天上线了今年的第一个vibe coding项目:KOL Lens。
1 我为什么要做?
推特是币圈最重要的信息来源。所以,今年我的计划是找到一批优质的KOL列表,再结合AI进行深度分析。
这些目标主要包括:
1)擅长分析BTC走势的KOL
2)擅长挖掘早期Alpha的KOL
3)擅长链上数据分析的KOL
但我遇到了一个最大的问题:如何来评判KOL的“擅长”?
现在的KOL多如牛毛,而我要识别其中真正优质的账号。我研究了Kaito、Xhunt、Cookie等工具,发现都无法完全满足我的需求。如果人工查看,不仅费时费力,准确度也难以保证。
于是,数据分析出身的我,加上vibe coding的加持,决定亲手做这个KOL的综合数据分析工具。
这次我一共分析了3万多个KOL,基于将近900万条推文。好在我前段时间花大力气微调了一个专门分析币圈的模型,否则如果直接使用Gemini-3的API分析,光是做一轮实体命名识别,成本就要将近10万刀。
下面是各个数据维度的介绍:
2 推特的基本情况
挑选KOL,第一眼可以看的数据,是平均每日发推文的数量。
如果数量太高,比如每日超过8条,那么有很大的概率是AI写作在不停地发文。即使是人在写,如此高频的内容,有效信息的占比往往也不大。反之,如果数字太小,说明不怎么活跃,也没有关注的必要。
其次是推文字数分布。如果长篇和超长篇占比多,说明博主喜欢输出深度内容。而在截图中,短篇占比很大,文字较少。
再结合浏览量分布来看,截图中的账号推文浏览量基本在1K~5K之间。
所以,这个KOL的基本画像已经勾勒出来了:这是一个每天发很多推文(5条以上),但内容都很短,且浏览量不高的账号。如果是我,第一时间就会Pass了。
另外,通过各时段的发推时间,可以看到它的活跃规律。比如截图显示在0时区(UTC)的早上7点数量最多,大概率是定时发布的。而发推数量非常低的时段,应该是睡觉时间。
可以看出,这个账号并不在美国,睡觉时间大概是北京时间的早上7点左右。
3 区块链方面的分析
首先,我设置了两个指标,来分析KOL推文中“含币量”的成分:
推文平均字数:在上图中可以看到,涉及区块链的文字字数(444)远大于非区块链内容(142),说明这个KOL在写币圈内容时,篇幅更长,更用心。
区块链推文占比:截图显示为57%。这意味着,57%的推文是写区块链的。这个数据太低,在我这里是一票否决的。如果它小于10%,这意味着90%的推文都不是讲区块链的,那我觉得这个人的主要精力不在币圈。
其次,从图中还可以挖掘出更重要的信息:
讨论过的币的数量:截图中有393个。很明显太多了,这是一个喊单非常多项目的KOL。即使某些币涨幅很高,跟着他赚钱的概率也不大。
代币的市值分布:这可以很容易看出这个KOL的偏好成色。是喜欢大市值的,还是小市值的?在寻找不同类型的KOL时,这是极其重要的指标。如果是找BTC趋势大牛,那么一定要大市值占比高;如果是找早期Alpha的KOL,那么小市值的占比要非常高。
擅长的赛道分布:一眼就能看出这个KOL聊的项目的领域。比如图中的x402赛道都有11个项目,说明它是紧跟热点的。
从截图中可以看到,这个KOL追求早期Alpha,紧跟热点。但问题是分析的项目数量太多,并不是最理想的人选,只能放在待定列表吧。
4 PNL(盈亏分析)
KOL的战绩,是最直观体现其水平的指标。
看截图中的KOL,在过去的3个月,能有2个20倍的币,一个10多倍的币,战绩确实不错。我已经将其放入精选KOL列表了,哈哈哈哈
除了看直接的数据,还有一些角度也能看出门道:
上榜的代币:如果都是小市值的,说明这个KOL比较擅长抓早期Alpha项目。
7天最大ROI vs 30天最大ROI:如果两个数值一样,说明这个KOL推荐后的7天内收益达到最大,适合短平快操作。如果7天最大ROI较小,到了30天突然变大,说明这个KOL推荐的项目适合长期埋伏。
当然,PNL还能挖掘更多信息,我打算后面继续完善。
5 网站信息
目前 https://t.co/7dHl1TjRtt 已经可以访问。在网站的搜索栏里可以查看各类KOL的数据。
考虑到早期的网站功能可能还不完整,所以先进行限额测试,需要邀请码才能注册并使用。
需要邀请码的朋友,可以在这里留言。 - 日月小楚 |Building AI Agentstweet
日月小楚 |Building AI Agents
优质KOL推荐第一波:
通过KOl Lens数据,寻找能挖掘早期Alpha暴富的人
在大量数据的第一轮挑选后,还经过我人工审核,广告营销、撸嘴的、推荐太多币、MeMe信号等一律去除。
只保留真人,有真内容,并且推荐过多个高倍数项目。的kol
@YuGuan1209
鱼人#鱼馆代表作:Aster开盘就喊买入,COAI, STBL几乎是最早推荐的。
@CryptoLady_M
LADY M是英文区的kol,主要讨论项目居多,MEME占比少。并且谈的很多项目跟中文区差异很大。可以扩宽视野。这最近6个月来,推荐的TROLL、RAGE、AVNT都有10倍以上。
@xincctnnq
币圈女菩萨发文频率不高,但是战绩非常优秀的。其中xdog、TOTAKEKE在推荐后最高有20倍的涨幅
@Eveningtraders
这是一个经常用nansen数据做分析的英文区账号。很多分析的非常的准确。对PIPPIN MYX GIGGLE的推荐时间都把握的非常好,推荐有最高有10多倍的涨幅。
@gongyue777
这个一个喜欢链上MEMe的kol,推荐的MeMe经常有二段的机会。
@kaylyn_0x
凯林拥有独到的见解,并且紧跟时时热点。钟情于virtual生态。PRXVT FACY FREDI都有非常不错的涨幅
@Cryptoaeon
Aeon是英文区研究早起ALpha的项目,发文频率不高,推荐的项目也相对比较少。但是成绩很优秀,比如Nock有12倍的涨幅,AVICI TRWA GAI都有5~8倍的涨幅。
@Rafi_0x
Rafi_0x 是英文期喜欢研究早起alpha项目的kol,(似乎纯链上MeMe的不多)。推荐的项目质地不多。XVM ASTER AVICI HYDX 都有5~13倍的涨幅。
tweet
优质KOL推荐第一波:
通过KOl Lens数据,寻找能挖掘早期Alpha暴富的人
在大量数据的第一轮挑选后,还经过我人工审核,广告营销、撸嘴的、推荐太多币、MeMe信号等一律去除。
只保留真人,有真内容,并且推荐过多个高倍数项目。的kol
@YuGuan1209
鱼人#鱼馆代表作:Aster开盘就喊买入,COAI, STBL几乎是最早推荐的。
@CryptoLady_M
LADY M是英文区的kol,主要讨论项目居多,MEME占比少。并且谈的很多项目跟中文区差异很大。可以扩宽视野。这最近6个月来,推荐的TROLL、RAGE、AVNT都有10倍以上。
@xincctnnq
币圈女菩萨发文频率不高,但是战绩非常优秀的。其中xdog、TOTAKEKE在推荐后最高有20倍的涨幅
@Eveningtraders
这是一个经常用nansen数据做分析的英文区账号。很多分析的非常的准确。对PIPPIN MYX GIGGLE的推荐时间都把握的非常好,推荐有最高有10多倍的涨幅。
@gongyue777
这个一个喜欢链上MEMe的kol,推荐的MeMe经常有二段的机会。
@kaylyn_0x
凯林拥有独到的见解,并且紧跟时时热点。钟情于virtual生态。PRXVT FACY FREDI都有非常不错的涨幅
@Cryptoaeon
Aeon是英文区研究早起ALpha的项目,发文频率不高,推荐的项目也相对比较少。但是成绩很优秀,比如Nock有12倍的涨幅,AVICI TRWA GAI都有5~8倍的涨幅。
@Rafi_0x
Rafi_0x 是英文期喜欢研究早起alpha项目的kol,(似乎纯链上MeMe的不多)。推荐的项目质地不多。XVM ASTER AVICI HYDX 都有5~13倍的涨幅。
tweet
❤2
日月小楚 |Building AI Agents
twitter刚刚开源了算法,我仔细了研究了一下,并且总结了一些获得阅读量和发帖的关键要点
第一部分 算法的核心
x推荐推文会分为三个步骤
第一步,从亿条推文中进行筛选
对于用户,会根据下面几个原则中
a 关注者:首先是从你关注的人中的推文
b 协同过滤(Collaborative Filtering):比如跟你有类似行为的用户点赞,简单来说,就是跟你臭味相投的人的中推荐
c 二度人脉的人:就是跟你二度人脉的人关注或者喜欢的帖子
d 语义向量搜索:** 算法将“用户”和“帖子”都转化为高维空间中的向量。如果你的兴趣向量和某条帖子的内容向量在空间上非常接近,它就会被选中。
这一步会筛选出1000~5000条推文,这里可以看出,推特根据兴趣,以及相似行为的进行推荐。而关注者的推文只占其中的4分之一。这也就解释了为何很多十几万的大V,有时候推文的阅读量并不高。
*第二步:排序阶段(Ranking)
在这一步,系统会 Phoenix这样的大型深度学习模型,对每一条帖子进行精密打分,。而指标是多维度的,基本上涵盖了我们所见的内容了,一共有15个正向:
1. **Favorite** (点赞)
2. **Reply** (回复)
3. **Retweet** (转推)
4. **Quote** (引用/转发并评论)
5. **Photo Expand** (点击查看大图)
6. **Click** (点击链接/卡片)
7. **Profile Click** (点击头像进主页)
8. **VQV** (Video Quality View - 有效视频播放)
9. **Share** (分享)
10. **Share via DM** (通过私信分享)
11. **Share via Copy Link** (复制链接分享)
12. **Dwell** (停留/驻足,指在这个推文上停下来)
13. **Dwell Time** (停留时长,这是连续变量,停得越久分越高)
14. **Quoted Click** (点击了引用推文中的原推文)
15. **Follow Author** (看完推文后关注了作者)
但是,github上面并没有公布权重。所以我们没办法猜测哪些维度更加重要。或者说,推特可能动态的调整这些维度的权重。
第三步:过滤与重排
这是对上一步排列的帖子做最后的过滤。一般都是合规类的,安全合规:自动剔除仇恨言论、色情、暴力或已删除的内容。去重:过滤掉你已经看过,或者内容高度重复的推文。
需要注意的是:如果排名靠前的都是同一个作者,算法会强制压低后续相同作者的分数,让你看到更丰富的内容。
第二部分:几个要点总结
1 出爆款要跨过一个门槛。
在代码中,直接写明了Prioritize in-network candidates over out-of-network candidates。也就是在推荐系统中,路人的系数是要打一个折扣的,虽然这个折扣的系数并没有公布。但是代码中明确指出,推荐给路人要比粉丝要难。那么这就意味着,要让路人看到,就需要积累一定的数据
2 Blue Check(蓝标认证)权重加成。
在 IneligibleSubscriptionFilter 中,系统会检查订阅状态。虽然具体的加权数值(Weight)隐藏在 params 里,但将“是否订阅”作为一个独立特征(Feature)输入给模型,本身就说明了它对打分有直接影响。
而且马斯克公开表示过,为了对抗 Bot,未认证用户的推文在“For You”中的可见性会被通过算法大幅压制。
3 发文频率有时候很重要
发推频率是一个比较容易踩坑的地方。代码里有一个叫 `AuthorDiversityScorer`(作者多样性打分器)的家伙。 它的逻辑非常“铁面无私”:如果你在短时间内连发好几条,系统就会认为你在刷屏,第 2 条以后的分数会直接被**乘上一个衰减系数**。
也就是说,如果你发帖太过频繁,而且是坏事
4 在你粉丝活跃的时间发帖
这条不是玄学,而是可以确定的事实了。虽然不在直接的算法代码中。但是可以从逻辑中推理出这条重要的规则。具体来说。
twitter推荐的算法中,包含了评论、点赞等一系列的指标。如果发文章的时候,粉丝都在睡觉,那么这些数据就很小。而当粉丝刷推特的时候,这篇文章将跟其他的数据来的一起排序,那么最后肯定被排在很后面。
5 把握“黄金一小时”:启动速度决定上限
算法会先将你的帖子推送给一小部分活跃粉丝,观察他们的 **Engagement Velocity(互动速率)**。并且结合第四点,所以建议把握黄金一小时 在你的**粉丝最活跃的时间点**发布内容。如果前 30-60 分钟互动数据惨淡,算法会判定该帖质量一般,停止向 Out-of-Network 扩散。
可以考虑发布后,立即在其他社交频道(如 Telegram/Discord)引导核心粉丝来互动,人为制造一个初始的脉冲信号。
6 重视:回复、评论、用户停留时间
虽然代码中没有公布各个指标的权重。但是埃隆·马斯克(Elon Musk)的公开解释:他在 X 上多次公开解释过这套算法的逻辑,明确说过“回复的权重是非常高的”。并且按照推荐系统的通用工业标准,稀疏行为(如回复)的权重必然远大于稠密行为(如点赞),否则模型无法收敛。
tweet
twitter刚刚开源了算法,我仔细了研究了一下,并且总结了一些获得阅读量和发帖的关键要点
第一部分 算法的核心
x推荐推文会分为三个步骤
第一步,从亿条推文中进行筛选
对于用户,会根据下面几个原则中
a 关注者:首先是从你关注的人中的推文
b 协同过滤(Collaborative Filtering):比如跟你有类似行为的用户点赞,简单来说,就是跟你臭味相投的人的中推荐
c 二度人脉的人:就是跟你二度人脉的人关注或者喜欢的帖子
d 语义向量搜索:** 算法将“用户”和“帖子”都转化为高维空间中的向量。如果你的兴趣向量和某条帖子的内容向量在空间上非常接近,它就会被选中。
这一步会筛选出1000~5000条推文,这里可以看出,推特根据兴趣,以及相似行为的进行推荐。而关注者的推文只占其中的4分之一。这也就解释了为何很多十几万的大V,有时候推文的阅读量并不高。
*第二步:排序阶段(Ranking)
在这一步,系统会 Phoenix这样的大型深度学习模型,对每一条帖子进行精密打分,。而指标是多维度的,基本上涵盖了我们所见的内容了,一共有15个正向:
1. **Favorite** (点赞)
2. **Reply** (回复)
3. **Retweet** (转推)
4. **Quote** (引用/转发并评论)
5. **Photo Expand** (点击查看大图)
6. **Click** (点击链接/卡片)
7. **Profile Click** (点击头像进主页)
8. **VQV** (Video Quality View - 有效视频播放)
9. **Share** (分享)
10. **Share via DM** (通过私信分享)
11. **Share via Copy Link** (复制链接分享)
12. **Dwell** (停留/驻足,指在这个推文上停下来)
13. **Dwell Time** (停留时长,这是连续变量,停得越久分越高)
14. **Quoted Click** (点击了引用推文中的原推文)
15. **Follow Author** (看完推文后关注了作者)
但是,github上面并没有公布权重。所以我们没办法猜测哪些维度更加重要。或者说,推特可能动态的调整这些维度的权重。
第三步:过滤与重排
这是对上一步排列的帖子做最后的过滤。一般都是合规类的,安全合规:自动剔除仇恨言论、色情、暴力或已删除的内容。去重:过滤掉你已经看过,或者内容高度重复的推文。
需要注意的是:如果排名靠前的都是同一个作者,算法会强制压低后续相同作者的分数,让你看到更丰富的内容。
第二部分:几个要点总结
1 出爆款要跨过一个门槛。
在代码中,直接写明了Prioritize in-network candidates over out-of-network candidates。也就是在推荐系统中,路人的系数是要打一个折扣的,虽然这个折扣的系数并没有公布。但是代码中明确指出,推荐给路人要比粉丝要难。那么这就意味着,要让路人看到,就需要积累一定的数据
2 Blue Check(蓝标认证)权重加成。
在 IneligibleSubscriptionFilter 中,系统会检查订阅状态。虽然具体的加权数值(Weight)隐藏在 params 里,但将“是否订阅”作为一个独立特征(Feature)输入给模型,本身就说明了它对打分有直接影响。
而且马斯克公开表示过,为了对抗 Bot,未认证用户的推文在“For You”中的可见性会被通过算法大幅压制。
3 发文频率有时候很重要
发推频率是一个比较容易踩坑的地方。代码里有一个叫 `AuthorDiversityScorer`(作者多样性打分器)的家伙。 它的逻辑非常“铁面无私”:如果你在短时间内连发好几条,系统就会认为你在刷屏,第 2 条以后的分数会直接被**乘上一个衰减系数**。
也就是说,如果你发帖太过频繁,而且是坏事
4 在你粉丝活跃的时间发帖
这条不是玄学,而是可以确定的事实了。虽然不在直接的算法代码中。但是可以从逻辑中推理出这条重要的规则。具体来说。
twitter推荐的算法中,包含了评论、点赞等一系列的指标。如果发文章的时候,粉丝都在睡觉,那么这些数据就很小。而当粉丝刷推特的时候,这篇文章将跟其他的数据来的一起排序,那么最后肯定被排在很后面。
5 把握“黄金一小时”:启动速度决定上限
算法会先将你的帖子推送给一小部分活跃粉丝,观察他们的 **Engagement Velocity(互动速率)**。并且结合第四点,所以建议把握黄金一小时 在你的**粉丝最活跃的时间点**发布内容。如果前 30-60 分钟互动数据惨淡,算法会判定该帖质量一般,停止向 Out-of-Network 扩散。
可以考虑发布后,立即在其他社交频道(如 Telegram/Discord)引导核心粉丝来互动,人为制造一个初始的脉冲信号。
6 重视:回复、评论、用户停留时间
虽然代码中没有公布各个指标的权重。但是埃隆·马斯克(Elon Musk)的公开解释:他在 X 上多次公开解释过这套算法的逻辑,明确说过“回复的权重是非常高的”。并且按照推荐系统的通用工业标准,稀疏行为(如回复)的权重必然远大于稠密行为(如点赞),否则模型无法收敛。
We have open-sourced our new 𝕏 algorithm, powered by the same transformer architecture as xAI's Grok model.
Check it out here: https://t.co/3WKwZkdgmB - Engineeringtweet
日月小楚 |Building AI Agents
每过一段时间,你就会突然发现又冒出了好几个神器。
然后去网上一查,自媒体博主都说是神器。只是,感觉又是似曾相似的味道。
如果停下手上的项目去试试吧。测试一圈下来要话不少的时间。
如果不去试试吧。就担心自己落后了。总感觉别人的vibe coding的效率是自己的10倍。
又是ai让人焦虑的日子
tweet
每过一段时间,你就会突然发现又冒出了好几个神器。
然后去网上一查,自媒体博主都说是神器。只是,感觉又是似曾相似的味道。
如果停下手上的项目去试试吧。测试一圈下来要话不少的时间。
如果不去试试吧。就担心自己落后了。总感觉别人的vibe coding的效率是自己的10倍。
又是ai让人焦虑的日子
tweet
🤣2👍1
日月小楚的投资交流空间(公告群)
Photo
日月小楚 |Building AI Agents
ClawdBot这种,如果你不是很空,没必要尝试的。
我可以大胆的语言一下,就是一时火热的大号玩具。
核心问题,不在ClawdBot,而是现在AI的错误率依然很高。
现在很多人只在vibe coding,并没有在生产环境的经验。实际情况是,以我个人的项目尽管采用了复杂的prompt工程进行约束,但是依然有1~5%左右的错误率。
这个错误率,当让它操作钱包、个人数据、个人重要的账号是非常糟糕的。结果可以非常严重的。
这也是当时Alpha Arena非常火爆的时候,我不建议去弄的原因。
所以,当这个问题不解决之前,ClawdBot也好,其他任何自动化操作也好。都只能在有限场景的应用。
tweet
ClawdBot这种,如果你不是很空,没必要尝试的。
我可以大胆的语言一下,就是一时火热的大号玩具。
核心问题,不在ClawdBot,而是现在AI的错误率依然很高。
现在很多人只在vibe coding,并没有在生产环境的经验。实际情况是,以我个人的项目尽管采用了复杂的prompt工程进行约束,但是依然有1~5%左右的错误率。
这个错误率,当让它操作钱包、个人数据、个人重要的账号是非常糟糕的。结果可以非常严重的。
这也是当时Alpha Arena非常火爆的时候,我不建议去弄的原因。
所以,当这个问题不解决之前,ClawdBot也好,其他任何自动化操作也好。都只能在有限场景的应用。
最近AI交易特别的火,身边不少朋友知道我一直弄AI,也来问我。
我给建议是不要弄,因为没有结果。
当我深入AI开发后,遇到的第一个头疼的事情,就是不确定性。
简单来说,当你问AI一个稍微复杂一点的问题(比如怎么样让人自己变成万人迷),其实问10次,10次的答案并不是一样的。
这样就是为何出现了复杂的prompt工程来约束AI的回答。但是即便如此,以我现在做的产品为例,依然需要用第二AI来检查答案,然后再用第三个AI来检查输出格式。
所以,可以看到,现在AI的应用在两个方面
1 是代码:因为代码有非常明确的语法规范,
2 是写作/视频等,因为它结果没有统一标准,很多个答案都可以达到优秀。
归根到底,AI是对人类进行大量学习后,成为全能的专家,但不是神。当你问是不是会涨的时候?因为没有标准答案的,结果就是10次回答可能会有不一样。而你只是随机拿到它其中的一个答案
而要解决这个问题,是需要给AI一个交易的标准,比如到120均线可以买等等。所以,最终还是你是交易者,AI是帮你干活的苦力。 - 日月小楚 |Building AI Agentstweet
🔥2❤1
日月小楚 |Building AI Agents
最近涌现了一类vibe coding增强的项目/工具,其中Superpowers,spec-kit、openSpec、BMAD最为有名,github上几个月就有万星。
我花了一些时间对他们进行了研究和测试。下面是我的建议
1 codex、claude code、open code等编程工具已经是非常强大了,记得第一步是先要善用他们,他们基本已经满足90%的需求场景。不要听信哪些自媒体的,为了凸显这些增强工具的好用,故意贬低他们。
2 如果是做一些自己用小工具,或者做一些修改。完全没有必要折腾这些。
3 如果你现在只是一些想法,并没有具体的细节。建议可以从superpowers开始,它会进行头脑风暴,并且一步步完善。
4 spec-kit和BMAD适合大型的比较复杂的项目。他们上来会书写比较复杂的文档规范。同时适合团队协作,项目的持久话运行和迭代。
5 OpenSpec是比较适合在已有的项目进行修改。但是如果是项目不大的小改动,用claude code这些就够了。但是很多人有个情况,是使用不同模型和ide。比如我写项目会让opus4.5写,修bug用codex。而且有时候antigravity抽风了,会用cursor。那么这时候他们的代码风格和写法可能差别比较大,这个时候,就要考虑使用openspec,或者找个skill。
1 Superpowers
Superpowers比较适合从0开始构建项目的场景。它是一个完整的软件开发工作流程,它更像是给现在 AI coding装上的“外挂大脑”和“多功能工具带”,或者更加通俗一点理解,就是组装了一个个专业的skills。
它可以安装在claude code、codex、open code。安装后,可以进行三个场景
1 第一步“头脑风暴
适合在项目的开始前的阶段,当你只有一个初步的想法,可以跟它进行讨论。它会问你一些问题,也是在满满将项目明确话
2 第二步:编写计划
根据上一步的设计方案。将工作分解成易于处理的小任务。而它的任务,比现在claude code,cursor等自己细分的任务往往更小,更细
3 第三步:执行计划
为每个任务派遣新的子代理,并进行两阶段审查(先检查规范符合性,再检查代码质量),或者分批执行,并设置人工检查点。
即使不适用superpowers,它github仓库里面的skills也值得来学习和借鉴。它里面有十几个精心设计的skills,覆盖一个开发的各个阶段。
2 spec-kit
spec-kit是github官方团队推出SDD(规范驱动开发),它是最具结构化、最像“工业级标准”的框架。它的特点,规范、详细。它适合比较复杂的项目、或者多人协作、或者需要长期维护的项目
而它的规范文档也是所有sdd中要求最高,数量最多的。简单来说,它认为在ai时代,由于代码将由ai来替代,所以最重要应该从ai代码的编写,转换为规范的定义。
spec-kit同样遵循,从定义规则,制定计划,执行计划并测试等过程。 spec-kit 区别于其他框架最大的亮点。它要求你在项目根目录维护一个 https://t.co/9m7C8CarC5(或者在 `.cursorrules` 中定义)。
--技术栈死规矩:比如“必须使用 Tailwind CSS,禁止使用 CSS Modules。”
-- *代码风格: “所有后端接口必须包含异常处理块,并返回标准的 JSON 格式。”
- 目录结构:“所有的业务逻辑必须写在 `services/` 目录下,Controller 层只负责转发。”
3 OpenSpec
openSpec 也是SSD,相对于spec-kit而言,它更轻量。它以“增量变更为核心,核心理念是:**既然项目是不断演进的,那么 AI 就不应该每次都去读几百行的完整文档,而应该只关注“这次改动了什么”。
除了更加轻量,它的另外一个有点极高的 Token 效率 (Token-Efficient):由于采用“增量(Delta)”模式,AI 只需要阅读和处理与本次改动相关的片段,而不是整个庞大的文档。这在处理大型老项目(Brownfield Projects)时能节省大量 API 开销,并减少 AI 的“幻觉”。
它更加适合边做边改的场景,并且**支持“倒推规范”:** 如果现在的项目还没有文档,OpenSpec 允许 AI 先阅读现有代码,反向生成(Reverse-engineer)出最初的规格文档。
4 BMAD
BMAD 是一套由 BMAD Code Org 推出的开源开发方法论。如果说 OpenSpec 和 spec-kit 是具体的“工具包”,那么 BMAD 更像是一本“现代 AI 软件工程教科书”。
实际上,BMAD跟上面的三个是不一样的,它更适合跟claude code等工程学的工具作为一类。他拥有12 位以上领域专家的agent,并且内部拥有34个工作流
它旨在解决一个核心矛盾:**如何在大规模、复杂的企业级项目中,让 AI 像一个成熟的开发团队一样工作,而不是像一个只会写代码片段的实习生。**
它的缺点也是太重,适合产生的代码极其稳健,适合金融、SaaS 等对安全性要求高的领域。并且不适合个人或者小型项目。
tweet
最近涌现了一类vibe coding增强的项目/工具,其中Superpowers,spec-kit、openSpec、BMAD最为有名,github上几个月就有万星。
我花了一些时间对他们进行了研究和测试。下面是我的建议
1 codex、claude code、open code等编程工具已经是非常强大了,记得第一步是先要善用他们,他们基本已经满足90%的需求场景。不要听信哪些自媒体的,为了凸显这些增强工具的好用,故意贬低他们。
2 如果是做一些自己用小工具,或者做一些修改。完全没有必要折腾这些。
3 如果你现在只是一些想法,并没有具体的细节。建议可以从superpowers开始,它会进行头脑风暴,并且一步步完善。
4 spec-kit和BMAD适合大型的比较复杂的项目。他们上来会书写比较复杂的文档规范。同时适合团队协作,项目的持久话运行和迭代。
5 OpenSpec是比较适合在已有的项目进行修改。但是如果是项目不大的小改动,用claude code这些就够了。但是很多人有个情况,是使用不同模型和ide。比如我写项目会让opus4.5写,修bug用codex。而且有时候antigravity抽风了,会用cursor。那么这时候他们的代码风格和写法可能差别比较大,这个时候,就要考虑使用openspec,或者找个skill。
1 Superpowers
Superpowers比较适合从0开始构建项目的场景。它是一个完整的软件开发工作流程,它更像是给现在 AI coding装上的“外挂大脑”和“多功能工具带”,或者更加通俗一点理解,就是组装了一个个专业的skills。
它可以安装在claude code、codex、open code。安装后,可以进行三个场景
1 第一步“头脑风暴
适合在项目的开始前的阶段,当你只有一个初步的想法,可以跟它进行讨论。它会问你一些问题,也是在满满将项目明确话
2 第二步:编写计划
根据上一步的设计方案。将工作分解成易于处理的小任务。而它的任务,比现在claude code,cursor等自己细分的任务往往更小,更细
3 第三步:执行计划
为每个任务派遣新的子代理,并进行两阶段审查(先检查规范符合性,再检查代码质量),或者分批执行,并设置人工检查点。
即使不适用superpowers,它github仓库里面的skills也值得来学习和借鉴。它里面有十几个精心设计的skills,覆盖一个开发的各个阶段。
2 spec-kit
spec-kit是github官方团队推出SDD(规范驱动开发),它是最具结构化、最像“工业级标准”的框架。它的特点,规范、详细。它适合比较复杂的项目、或者多人协作、或者需要长期维护的项目
而它的规范文档也是所有sdd中要求最高,数量最多的。简单来说,它认为在ai时代,由于代码将由ai来替代,所以最重要应该从ai代码的编写,转换为规范的定义。
spec-kit同样遵循,从定义规则,制定计划,执行计划并测试等过程。 spec-kit 区别于其他框架最大的亮点。它要求你在项目根目录维护一个 https://t.co/9m7C8CarC5(或者在 `.cursorrules` 中定义)。
--技术栈死规矩:比如“必须使用 Tailwind CSS,禁止使用 CSS Modules。”
-- *代码风格: “所有后端接口必须包含异常处理块,并返回标准的 JSON 格式。”
- 目录结构:“所有的业务逻辑必须写在 `services/` 目录下,Controller 层只负责转发。”
3 OpenSpec
openSpec 也是SSD,相对于spec-kit而言,它更轻量。它以“增量变更为核心,核心理念是:**既然项目是不断演进的,那么 AI 就不应该每次都去读几百行的完整文档,而应该只关注“这次改动了什么”。
除了更加轻量,它的另外一个有点极高的 Token 效率 (Token-Efficient):由于采用“增量(Delta)”模式,AI 只需要阅读和处理与本次改动相关的片段,而不是整个庞大的文档。这在处理大型老项目(Brownfield Projects)时能节省大量 API 开销,并减少 AI 的“幻觉”。
它更加适合边做边改的场景,并且**支持“倒推规范”:** 如果现在的项目还没有文档,OpenSpec 允许 AI 先阅读现有代码,反向生成(Reverse-engineer)出最初的规格文档。
4 BMAD
BMAD 是一套由 BMAD Code Org 推出的开源开发方法论。如果说 OpenSpec 和 spec-kit 是具体的“工具包”,那么 BMAD 更像是一本“现代 AI 软件工程教科书”。
实际上,BMAD跟上面的三个是不一样的,它更适合跟claude code等工程学的工具作为一类。他拥有12 位以上领域专家的agent,并且内部拥有34个工作流
它旨在解决一个核心矛盾:**如何在大规模、复杂的企业级项目中,让 AI 像一个成熟的开发团队一样工作,而不是像一个只会写代码片段的实习生。**
它的缺点也是太重,适合产生的代码极其稳健,适合金融、SaaS 等对安全性要求高的领域。并且不适合个人或者小型项目。
tweet
🔥3
日月小楚的投资交流空间(公告群)
Photo
日月小楚 |Building AI Agents
AI降智的实锤数据 claude Opus 4.5
这是Marginlab团队,每日使用claude code的Opus 4.5 对SWE-Bench-Pro 的50到题目进行通过性测试。
从数据看到,从1月初的60%,下降到现在54%。降智率为10%。 https://t.co/DhVXymg4ei
tweet
AI降智的实锤数据 claude Opus 4.5
这是Marginlab团队,每日使用claude code的Opus 4.5 对SWE-Bench-Pro 的50到题目进行通过性测试。
从数据看到,从1月初的60%,下降到现在54%。降智率为10%。 https://t.co/DhVXymg4ei
tweet
👍1
日月小楚的投资交流空间(公告群)
Photo
日月小楚 |Building AI Agents
今天上线了vibe coding的第二个产品:热点分析
让AI分析币圈热点,5分钟就可以掌握币圈的最热话题
这个功能现在很常见,那我花时间做的有何不同呢?
1 说人话的有趣AI
让AI写的报告有人味,文字的可读性更强。这是我精心调教的结果,经历了三次版本的迭代。第一版是在刚开始做AI分析的时候,我像大部分人一样,重心在功能的实现。
完工后我发现,AI写的报告平平无奇,并且带有很多晦涩难懂的专业名词。于是我进行改进,开始测试十几个不同的大模型,以及不同的Prompt工程。
因为我发现模型拥有不同的性格,有的输出文字细腻,有的严谨,有的喜欢自由发挥。在这个过程中,我自己也改变了想法,将原先追求专业深度的报告,转变为注重阅读体验的报告。
在我打算完工的时候,读着第二版的报告,总觉得内容不错但是表现力不够。于是,我开始调试temperature等参数,以及Prompt的微调,这是一次小心翼翼的尝试。需要允许AI有自己的个性,但是要防止它过于放飞。
因为AI的分析需要基于提供的数据,而不是它自己的知识库。同时允许它表达推文数据中的情感。比如当市场弥漫着恐惧情绪时,AI的文字就不能写得仿佛大家都很高兴。
最终的效果还可以,AI具有人情味,比如它昨天的分析,最后会开玩笑的说:
别想着什么“别人恐惧我贪婪”,搞不好是“别人恐惧你破产”。
2 精心挑选的Top 1000 kol
我们都知道,数据的质量决定了结果。对于信息总结,KOL的选择也至关重要。这个时候KOL-Lens就发挥了它的价值。根据它的数据,我们挑选了币圈有影响力、战绩好、数据表现优异的KOL。
3 分析策略
当分析的推文数量达到几千条时,就无法一次性投喂给AI了。一方面涉及输入token超过最大限制;另一方面,由于几千条推文是非常凌乱的信息,AI对其信息的整合处理能力较弱。实测下来,准确度并不高。所以,我采用了一种新的分析方法。具体步骤如下:
第一步:数据清洗,去除无用的垃圾数据,提高AI的准确度
第二步:对每条推文进行实体命名分析,用于分类
第三步:对未命中实体的推文进行主题分类
第四步:分类报告分析
第五步:综合性去重
经过5步处理的方案,可以在大量数据的情况下,实现综合的分析。
网站:https://t.co/48vs0pf5xq
注册账户需要邀请码,请在此留言。(注,kol-lens的账号通用,不需要另外注册)
tweet
今天上线了vibe coding的第二个产品:热点分析
让AI分析币圈热点,5分钟就可以掌握币圈的最热话题
这个功能现在很常见,那我花时间做的有何不同呢?
1 说人话的有趣AI
让AI写的报告有人味,文字的可读性更强。这是我精心调教的结果,经历了三次版本的迭代。第一版是在刚开始做AI分析的时候,我像大部分人一样,重心在功能的实现。
完工后我发现,AI写的报告平平无奇,并且带有很多晦涩难懂的专业名词。于是我进行改进,开始测试十几个不同的大模型,以及不同的Prompt工程。
因为我发现模型拥有不同的性格,有的输出文字细腻,有的严谨,有的喜欢自由发挥。在这个过程中,我自己也改变了想法,将原先追求专业深度的报告,转变为注重阅读体验的报告。
在我打算完工的时候,读着第二版的报告,总觉得内容不错但是表现力不够。于是,我开始调试temperature等参数,以及Prompt的微调,这是一次小心翼翼的尝试。需要允许AI有自己的个性,但是要防止它过于放飞。
因为AI的分析需要基于提供的数据,而不是它自己的知识库。同时允许它表达推文数据中的情感。比如当市场弥漫着恐惧情绪时,AI的文字就不能写得仿佛大家都很高兴。
最终的效果还可以,AI具有人情味,比如它昨天的分析,最后会开玩笑的说:
别想着什么“别人恐惧我贪婪”,搞不好是“别人恐惧你破产”。
2 精心挑选的Top 1000 kol
我们都知道,数据的质量决定了结果。对于信息总结,KOL的选择也至关重要。这个时候KOL-Lens就发挥了它的价值。根据它的数据,我们挑选了币圈有影响力、战绩好、数据表现优异的KOL。
3 分析策略
当分析的推文数量达到几千条时,就无法一次性投喂给AI了。一方面涉及输入token超过最大限制;另一方面,由于几千条推文是非常凌乱的信息,AI对其信息的整合处理能力较弱。实测下来,准确度并不高。所以,我采用了一种新的分析方法。具体步骤如下:
第一步:数据清洗,去除无用的垃圾数据,提高AI的准确度
第二步:对每条推文进行实体命名分析,用于分类
第三步:对未命中实体的推文进行主题分类
第四步:分类报告分析
第五步:综合性去重
经过5步处理的方案,可以在大量数据的情况下,实现综合的分析。
网站:https://t.co/48vs0pf5xq
注册账户需要邀请码,请在此留言。(注,kol-lens的账号通用,不需要另外注册)
号外号外,今天上线了今年的第一个vibe coding项目:KOL Lens。
1 我为什么要做?
推特是币圈最重要的信息来源。所以,今年我的计划是找到一批优质的KOL列表,再结合AI进行深度分析。
这些目标主要包括:
1)擅长分析BTC走势的KOL
2)擅长挖掘早期Alpha的KOL
3)擅长链上数据分析的KOL
但我遇到了一个最大的问题:如何来评判KOL的“擅长”?
现在的KOL多如牛毛,而我要识别其中真正优质的账号。我研究了Kaito、Xhunt、Cookie等工具,发现都无法完全满足我的需求。如果人工查看,不仅费时费力,准确度也难以保证。
于是,数据分析出身的我,加上vibe coding的加持,决定亲手做这个KOL的综合数据分析工具。
这次我一共分析了3万多个KOL,基于将近900万条推文。好在我前段时间花大力气微调了一个专门分析币圈的模型,否则如果直接使用Gemini-3的API分析,光是做一轮实体命名识别,成本就要将近10万刀。
下面是各个数据维度的介绍:
2 推特的基本情况
挑选KOL,第一眼可以看的数据,是平均每日发推文的数量。
如果数量太高,比如每日超过8条,那么有很大的概率是AI写作在不停地发文。即使是人在写,如此高频的内容,有效信息的占比往往也不大。反之,如果数字太小,说明不怎么活跃,也没有关注的必要。
其次是推文字数分布。如果长篇和超长篇占比多,说明博主喜欢输出深度内容。而在截图中,短篇占比很大,文字较少。
再结合浏览量分布来看,截图中的账号推文浏览量基本在1K~5K之间。
所以,这个KOL的基本画像已经勾勒出来了:这是一个每天发很多推文(5条以上),但内容都很短,且浏览量不高的账号。如果是我,第一时间就会Pass了。
另外,通过各时段的发推时间,可以看到它的活跃规律。比如截图显示在0时区(UTC)的早上7点数量最多,大概率是定时发布的。而发推数量非常低的时段,应该是睡觉时间。
可以看出,这个账号并不在美国,睡觉时间大概是北京时间的早上7点左右。
3 区块链方面的分析
首先,我设置了两个指标,来分析KOL推文中“含币量”的成分:
推文平均字数:在上图中可以看到,涉及区块链的文字字数(444)远大于非区块链内容(142),说明这个KOL在写币圈内容时,篇幅更长,更用心。
区块链推文占比:截图显示为57%。这意味着,57%的推文是写区块链的。这个数据太低,在我这里是一票否决的。如果它小于10%,这意味着90%的推文都不是讲区块链的,那我觉得这个人的主要精力不在币圈。
其次,从图中还可以挖掘出更重要的信息:
讨论过的币的数量:截图中有393个。很明显太多了,这是一个喊单非常多项目的KOL。即使某些币涨幅很高,跟着他赚钱的概率也不大。
代币的市值分布:这可以很容易看出这个KOL的偏好成色。是喜欢大市值的,还是小市值的?在寻找不同类型的KOL时,这是极其重要的指标。如果是找BTC趋势大牛,那么一定要大市值占比高;如果是找早期Alpha的KOL,那么小市值的占比要非常高。
擅长的赛道分布:一眼就能看出这个KOL聊的项目的领域。比如图中的x402赛道都有11个项目,说明它是紧跟热点的。
从截图中可以看到,这个KOL追求早期Alpha,紧跟热点。但问题是分析的项目数量太多,并不是最理想的人选,只能放在待定列表吧。
4 PNL(盈亏分析)
KOL的战绩,是最直观体现其水平的指标。
看截图中的KOL,在过去的3个月,能有2个20倍的币,一个10多倍的币,战绩确实不错。我已经将其放入精选KOL列表了,哈哈哈哈
除了看直接的数据,还有一些角度也能看出门道:
上榜的代币:如果都是小市值的,说明这个KOL比较擅长抓早期Alpha项目。
7天最大ROI vs 30天最大ROI:如果两个数值一样,说明这个KOL推荐后的7天内收益达到最大,适合短平快操作。如果7天最大ROI较小,到了30天突然变大,说明这个KOL推荐的项目适合长期埋伏。
当然,PNL还能挖掘更多信息,我打算后面继续完善。
5 网站信息
目前 https://t.co/7dHl1TjRtt 已经可以访问。在网站的搜索栏里可以查看各类KOL的数据。
考虑到早期的网站功能可能还不完整,所以先进行限额测试,需要邀请码才能注册并使用。
需要邀请码的朋友,可以在这里留言。 - 日月小楚 |Building AI Agentstweet
👍2
日月小楚的投资交流空间(公告群)
Photo
日月小楚 |Building AI Agents
看来Opus 4.5降智是在为4.6准备的。
先说 一下,Opus4.6牛逼,。我决定给它授权"AI老中医"称号。
我的项目中有一个疑难杂症,就是在程序启动时候会打印很多检测信息。程序是完成正常运行的,就是每次打印长长的内容,看着心烦。
从sonnet3.7开始,各种选手包括gpt5.1-2-3,gemini,还用各种工具cc、antigravity、opencode等等都不能解决。
今天尝试了一下opus4.6,结果找对老中医了,哈哈哈
tweet
看来Opus 4.5降智是在为4.6准备的。
先说 一下,Opus4.6牛逼,。我决定给它授权"AI老中医"称号。
我的项目中有一个疑难杂症,就是在程序启动时候会打印很多检测信息。程序是完成正常运行的,就是每次打印长长的内容,看着心烦。
从sonnet3.7开始,各种选手包括gpt5.1-2-3,gemini,还用各种工具cc、antigravity、opencode等等都不能解决。
今天尝试了一下opus4.6,结果找对老中医了,哈哈哈
AI降智的实锤数据 claude Opus 4.5
这是Marginlab团队,每日使用claude code的Opus 4.5 对SWE-Bench-Pro 的50到题目进行通过性测试。
从数据看到,从1月初的60%,下降到现在54%。降智率为10%。 https://t.co/DhVXymg4ei - 日月小楚 |Building AI Agentstweet
日月小楚 |Building AI Agents
打开网站,看见了AI分析的头条,笑喷了:
【MegaETH主网虽至但代币难产,撸毛党心碎一地】
MegaETH这次的操作,在现在的行情下简直是“头铁”的代表。
大家原本期待的是主网一上,空投到账,大家开开心心过个肥年。结果呢?项目方直接摊牌了。根据 stacy_muur 的总结,MegaETH虽然宣称压力测试处理了107亿笔交易,比以太坊十年加起来还多,但他们决定暂不发币。为啥?因为他们设定了三个硬性指标:USDM流通量要达到5亿且25%在应用里、或者有10个应用达到10万+交易量、或者有3个应用连续30天日赚5万美金。只有达到其中之一,才会启动TGE(代币生成)。
这招真的是绝了。对于此时此刻急需回血的散户和工作室来说,这简直是“画饼充饥”。正如 munchPRMR 吐槽的那样,等了几个月,结果等到个寂寞。但从行业角度看,我不得不给项目方点个赞。现在的市场全是“波一波流”的垃圾项目,上线即巅峰,随后一路阴跌。MegaETH这种倒逼生态建设、拒绝过早被吸血的做法,虽然得罪了现在的空投猎人,但对于项目的长期生命力来说,绝对是负责任的表现。就像 TrustlessState 说的,在糟糕的市场环境下发布,反而是一种优势,因为这能过滤掉投机者。不过,对于那些指望靠它翻身的兄弟们,只能说一声:惨。
tweet
打开网站,看见了AI分析的头条,笑喷了:
【MegaETH主网虽至但代币难产,撸毛党心碎一地】
MegaETH这次的操作,在现在的行情下简直是“头铁”的代表。
大家原本期待的是主网一上,空投到账,大家开开心心过个肥年。结果呢?项目方直接摊牌了。根据 stacy_muur 的总结,MegaETH虽然宣称压力测试处理了107亿笔交易,比以太坊十年加起来还多,但他们决定暂不发币。为啥?因为他们设定了三个硬性指标:USDM流通量要达到5亿且25%在应用里、或者有10个应用达到10万+交易量、或者有3个应用连续30天日赚5万美金。只有达到其中之一,才会启动TGE(代币生成)。
这招真的是绝了。对于此时此刻急需回血的散户和工作室来说,这简直是“画饼充饥”。正如 munchPRMR 吐槽的那样,等了几个月,结果等到个寂寞。但从行业角度看,我不得不给项目方点个赞。现在的市场全是“波一波流”的垃圾项目,上线即巅峰,随后一路阴跌。MegaETH这种倒逼生态建设、拒绝过早被吸血的做法,虽然得罪了现在的空投猎人,但对于项目的长期生命力来说,绝对是负责任的表现。就像 TrustlessState 说的,在糟糕的市场环境下发布,反而是一种优势,因为这能过滤掉投机者。不过,对于那些指望靠它翻身的兄弟们,只能说一声:惨。
tweet
❤1