Muyun99的杂谈
135 subscribers
734 photos
13 videos
16 files
435 links
Download Telegram
个人成长其实就是经验驱动的游戏系统,也可以理解为数据量不断扩充的机器学习系统,在模型容量不太能扩充的情况下,如何能保证对某个特定场景的性能强是我们需要考虑的问题。

找工作时我们需要算法题和对应岗位能力的积累,这是需要刻意练习的。而对应实习和工作场景,需要模型快速适应新数据的输入并将无用的知识块腾出空间给新知识的学习,往往知识遗忘的过程是自然的,如何保持有效神经元的快速迭代很重要。这其实是元学习的理论,在学校中大量的时间应当花在学习如何学习上,这一点好难

今年算法秋招形势太tm紧张了,俩师兄现在一个确定的offer都没有,他们其实挺能卷的了,不知道是因为卷的方向错了还是效率不高,开始焦虑了。明年找工作想卷自动驾驶领域去,最近看 Momenta 的信息,感觉跟我想做的有点像,都是以数据为出发点,希望能偷偷出去实习。百度智能驾驶事业部IDG好香啊,但是好难进,我又不做3D点云,又不做SLAM,纯2D视觉能卷的过吗😭

碎碎念,如有叨扰见谅
坚守安全,拒绝坏蛋!
Muyun99的杂谈
坚守安全,拒绝坏蛋!
不过是网购凑单买了点鸡蛋罢了,没想到拿快递的一瞬间正能量爆棚了!
笑死我了
明天整个讨论去 ୧⍢⃝୨
分享完了,抛了一个观点引发了不少讨论啊。我认为是“data-centric 的进步倒逼 model-centric 的进步”。

我的观点是:深度学习数据和模型这两条腿,我认为都是需要去关注的,但是目前业界对数据的关注程度是不够的。现有的模型容量已经足够大了,举一个例子:一张图像在计算机内建模为3x224x224的张量,现在上亿参数级别的模型已经有能力记住每张图像的所有像素点了。所以在如今模型容量是足够大的前提下,我们应该努力去提升数据的信息量以及更多地去对现在的数据定义做一些质疑,例如样本除了它本身的信息,我们至少还应该建模每个样本的权重来体现其生而不等的特性。

从创业的角度上去讲,除了huggingface,好像以模型为出发点的创业公司就很少了,现在的算法都是开源的,很多模型都在往落地的反方向去推进而数据是一个企业最重要的财富,为什么google 可以开源他的pagerank的算法,因为他有数据在手,不怕你抄算法。而基于数据的一些创业公司我认为近几年会大量的出现,例如做联邦学习,做云原生的开源向量数据库等等。

我认为还有一个好处是,数据上的理解是有很大复用价值的,我们其实都是在不断地增长经验,做特征工程的经验,做对应场景的经验,这种经验的泛化能力是很强的。而改模型,就是无底洞。

综上,我的观点是:现在业界对于数据的重视程度不够,我觉得在这个时间点我们能应当更加关注数据,在搭建好了基础设施(例如云原生向量数据库,联邦学习)后,我们将数据慢慢地去逼近模型的上限,再去总结经验做模型侧的突破,使得整个产业和生态更加健康(当然,这两条腿都不会停止自己的发展的,只是希望整个产业慢慢变好吧
今天跟阳总出来整生蚝,只可惜供大于求了,浪费了🙈
https://www.kaggle.com/c/petfinder-pawpularity-score/

https://t.co/Rc3HSZTta7?amp=1

两个竞赛的相关资讯,第一个是多模态,任务很有意思,最近准备摸一摸,第二个是吴恩达举办的 Data-centric 竞赛的分享
如何看待李沐老师提出的「用随机梯度下降来优化人生」? - 电光幻影炼金术的回答 - 知乎
https://www.zhihu.com/question/489380225/answer/2143256952

特别有意思,身处这一行不可避免的来从不同的角度来思考这样的问题,最终结果如何,都是训一把才知道,对于学术上就是一次实验,对于个人这就是整个人生
吃午饭也被论文 Poster 包围着,还是很有氛围的🙈
活动手腕三部曲,希望大家爱护好自己
Swin Transformer 获得了 ICCV 2021 的 Best Paper!
今年 MLA 阵容没有去年的强大呀,南航还是没牌面。去年的阵容相当于一次小型 VALSE 了🙈

http://parnec.nuaa.edu.cn/mla21/#/home

http://www.lamda.nju.edu.cn/conf/mla20/program.html