分享完了,抛了一个观点引发了不少讨论啊。我认为是“data-centric 的进步倒逼 model-centric 的进步”。
我的观点是:深度学习数据和模型这两条腿,我认为都是需要去关注的,但是目前业界对数据的关注程度是不够的。现有的模型容量已经足够大了,举一个例子:一张图像在计算机内建模为3x224x224的张量,现在上亿参数级别的模型已经有能力记住每张图像的所有像素点了。所以在如今模型容量是足够大的前提下,我们应该努力去提升数据的信息量以及更多地去对现在的数据定义做一些质疑,例如样本除了它本身的信息,我们至少还应该建模每个样本的权重来体现其生而不等的特性。
从创业的角度上去讲,除了huggingface,好像以模型为出发点的创业公司就很少了,现在的算法都是开源的,很多模型都在往落地的反方向去推进而数据是一个企业最重要的财富,为什么google 可以开源他的pagerank的算法,因为他有数据在手,不怕你抄算法。而基于数据的一些创业公司我认为近几年会大量的出现,例如做联邦学习,做云原生的开源向量数据库等等。
我认为还有一个好处是,数据上的理解是有很大复用价值的,我们其实都是在不断地增长经验,做特征工程的经验,做对应场景的经验,这种经验的泛化能力是很强的。而改模型,就是无底洞。
综上,我的观点是:现在业界对于数据的重视程度不够,我觉得在这个时间点我们能应当更加关注数据,在搭建好了基础设施(例如云原生向量数据库,联邦学习)后,我们将数据慢慢地去逼近模型的上限,再去总结经验做模型侧的突破,使得整个产业和生态更加健康(当然,这两条腿都不会停止自己的发展的,只是希望整个产业慢慢变好吧
我的观点是:深度学习数据和模型这两条腿,我认为都是需要去关注的,但是目前业界对数据的关注程度是不够的。现有的模型容量已经足够大了,举一个例子:一张图像在计算机内建模为3x224x224的张量,现在上亿参数级别的模型已经有能力记住每张图像的所有像素点了。所以在如今模型容量是足够大的前提下,我们应该努力去提升数据的信息量以及更多地去对现在的数据定义做一些质疑,例如样本除了它本身的信息,我们至少还应该建模每个样本的权重来体现其生而不等的特性。
从创业的角度上去讲,除了huggingface,好像以模型为出发点的创业公司就很少了,现在的算法都是开源的,很多模型都在往落地的反方向去推进而数据是一个企业最重要的财富,为什么google 可以开源他的pagerank的算法,因为他有数据在手,不怕你抄算法。而基于数据的一些创业公司我认为近几年会大量的出现,例如做联邦学习,做云原生的开源向量数据库等等。
我认为还有一个好处是,数据上的理解是有很大复用价值的,我们其实都是在不断地增长经验,做特征工程的经验,做对应场景的经验,这种经验的泛化能力是很强的。而改模型,就是无底洞。
综上,我的观点是:现在业界对于数据的重视程度不够,我觉得在这个时间点我们能应当更加关注数据,在搭建好了基础设施(例如云原生向量数据库,联邦学习)后,我们将数据慢慢地去逼近模型的上限,再去总结经验做模型侧的突破,使得整个产业和生态更加健康(当然,这两条腿都不会停止自己的发展的,只是希望整个产业慢慢变好吧
Paper: https://arxiv.org/abs/2110.00476
Code: https://github.com/rwightman/pytorch-image-models
新时代的调参指南,Ross Wightman 是真的牛,timm 开发速度真的绝了
Code: https://github.com/rwightman/pytorch-image-models
新时代的调参指南,Ross Wightman 是真的牛,timm 开发速度真的绝了
GitHub
GitHub - huggingface/pytorch-image-models: The largest collection of PyTorch image encoders / backbones. Including train, eval…
The largest collection of PyTorch image encoders / backbones. Including train, eval, inference, export scripts, and pretrained weights -- ResNet, ResNeXT, EfficientNet, NFNet, Vision Transformer (V...
https://www.kaggle.com/c/petfinder-pawpularity-score/
https://t.co/Rc3HSZTta7?amp=1
两个竞赛的相关资讯,第一个是多模态,任务很有意思,最近准备摸一摸,第二个是吴恩达举办的 Data-centric 竞赛的分享
https://t.co/Rc3HSZTta7?amp=1
两个竞赛的相关资讯,第一个是多模态,任务很有意思,最近准备摸一摸,第二个是吴恩达举办的 Data-centric 竞赛的分享
Kaggle
PetFinder.my - Pawpularity Contest
Predict the popularity of shelter pet photos
如何看待李沐老师提出的「用随机梯度下降来优化人生」? - 电光幻影炼金术的回答 - 知乎
https://www.zhihu.com/question/489380225/answer/2143256952
特别有意思,身处这一行不可避免的来从不同的角度来思考这样的问题,最终结果如何,都是训一把才知道,对于学术上就是一次实验,对于个人这就是整个人生
https://www.zhihu.com/question/489380225/answer/2143256952
特别有意思,身处这一行不可避免的来从不同的角度来思考这样的问题,最终结果如何,都是训一把才知道,对于学术上就是一次实验,对于个人这就是整个人生
今年 MLA 阵容没有去年的强大呀,南航还是没牌面。去年的阵容相当于一次小型 VALSE 了🙈
http://parnec.nuaa.edu.cn/mla21/#/home
http://www.lamda.nju.edu.cn/conf/mla20/program.html
http://parnec.nuaa.edu.cn/mla21/#/home
http://www.lamda.nju.edu.cn/conf/mla20/program.html