有人想去合肥讯飞1024玩的吗,我这边自己搞到票了,还有想去的同学可以在下面链接上白嫖。这次讯飞竞赛一百多个题目,报了好几个没人组队一起打,然后赶论文进度,有两三个进复赛就没提交放弃了草,只能说是拓宽了cv知识广度,对基础任务怎么做有了更多的了解
如果学校能放我过去的话,估计我主要会听一波竞赛方案,国内竞赛平台分享这方面确实没有kaggle做的好,多学习下拓宽点思路(顺便和ustc的同学约个饭哈哈
http://bbs.xfyun.cn/topic/index?id=46774
如果学校能放我过去的话,估计我主要会听一波竞赛方案,国内竞赛平台分享这方面确实没有kaggle做的好,多学习下拓宽点思路(顺便和ustc的同学约个饭哈哈
http://bbs.xfyun.cn/topic/index?id=46774
个人成长其实就是经验驱动的游戏系统,也可以理解为数据量不断扩充的机器学习系统,在模型容量不太能扩充的情况下,如何能保证对某个特定场景的性能强是我们需要考虑的问题。
找工作时我们需要算法题和对应岗位能力的积累,这是需要刻意练习的。而对应实习和工作场景,需要模型快速适应新数据的输入并将无用的知识块腾出空间给新知识的学习,往往知识遗忘的过程是自然的,如何保持有效神经元的快速迭代很重要。这其实是元学习的理论,在学校中大量的时间应当花在学习如何学习上,这一点好难
今年算法秋招形势太tm紧张了,俩师兄现在一个确定的offer都没有,他们其实挺能卷的了,不知道是因为卷的方向错了还是效率不高,开始焦虑了。明年找工作想卷自动驾驶领域去,最近看 Momenta 的信息,感觉跟我想做的有点像,都是以数据为出发点,希望能偷偷出去实习。百度智能驾驶事业部IDG好香啊,但是好难进,我又不做3D点云,又不做SLAM,纯2D视觉能卷的过吗😭
碎碎念,如有叨扰见谅
找工作时我们需要算法题和对应岗位能力的积累,这是需要刻意练习的。而对应实习和工作场景,需要模型快速适应新数据的输入并将无用的知识块腾出空间给新知识的学习,往往知识遗忘的过程是自然的,如何保持有效神经元的快速迭代很重要。这其实是元学习的理论,在学校中大量的时间应当花在学习如何学习上,这一点好难
今年算法秋招形势太tm紧张了,俩师兄现在一个确定的offer都没有,他们其实挺能卷的了,不知道是因为卷的方向错了还是效率不高,开始焦虑了。明年找工作想卷自动驾驶领域去,最近看 Momenta 的信息,感觉跟我想做的有点像,都是以数据为出发点,希望能偷偷出去实习。百度智能驾驶事业部IDG好香啊,但是好难进,我又不做3D点云,又不做SLAM,纯2D视觉能卷的过吗😭
碎碎念,如有叨扰见谅
分享完了,抛了一个观点引发了不少讨论啊。我认为是“data-centric 的进步倒逼 model-centric 的进步”。
我的观点是:深度学习数据和模型这两条腿,我认为都是需要去关注的,但是目前业界对数据的关注程度是不够的。现有的模型容量已经足够大了,举一个例子:一张图像在计算机内建模为3x224x224的张量,现在上亿参数级别的模型已经有能力记住每张图像的所有像素点了。所以在如今模型容量是足够大的前提下,我们应该努力去提升数据的信息量以及更多地去对现在的数据定义做一些质疑,例如样本除了它本身的信息,我们至少还应该建模每个样本的权重来体现其生而不等的特性。
从创业的角度上去讲,除了huggingface,好像以模型为出发点的创业公司就很少了,现在的算法都是开源的,很多模型都在往落地的反方向去推进而数据是一个企业最重要的财富,为什么google 可以开源他的pagerank的算法,因为他有数据在手,不怕你抄算法。而基于数据的一些创业公司我认为近几年会大量的出现,例如做联邦学习,做云原生的开源向量数据库等等。
我认为还有一个好处是,数据上的理解是有很大复用价值的,我们其实都是在不断地增长经验,做特征工程的经验,做对应场景的经验,这种经验的泛化能力是很强的。而改模型,就是无底洞。
综上,我的观点是:现在业界对于数据的重视程度不够,我觉得在这个时间点我们能应当更加关注数据,在搭建好了基础设施(例如云原生向量数据库,联邦学习)后,我们将数据慢慢地去逼近模型的上限,再去总结经验做模型侧的突破,使得整个产业和生态更加健康(当然,这两条腿都不会停止自己的发展的,只是希望整个产业慢慢变好吧
我的观点是:深度学习数据和模型这两条腿,我认为都是需要去关注的,但是目前业界对数据的关注程度是不够的。现有的模型容量已经足够大了,举一个例子:一张图像在计算机内建模为3x224x224的张量,现在上亿参数级别的模型已经有能力记住每张图像的所有像素点了。所以在如今模型容量是足够大的前提下,我们应该努力去提升数据的信息量以及更多地去对现在的数据定义做一些质疑,例如样本除了它本身的信息,我们至少还应该建模每个样本的权重来体现其生而不等的特性。
从创业的角度上去讲,除了huggingface,好像以模型为出发点的创业公司就很少了,现在的算法都是开源的,很多模型都在往落地的反方向去推进而数据是一个企业最重要的财富,为什么google 可以开源他的pagerank的算法,因为他有数据在手,不怕你抄算法。而基于数据的一些创业公司我认为近几年会大量的出现,例如做联邦学习,做云原生的开源向量数据库等等。
我认为还有一个好处是,数据上的理解是有很大复用价值的,我们其实都是在不断地增长经验,做特征工程的经验,做对应场景的经验,这种经验的泛化能力是很强的。而改模型,就是无底洞。
综上,我的观点是:现在业界对于数据的重视程度不够,我觉得在这个时间点我们能应当更加关注数据,在搭建好了基础设施(例如云原生向量数据库,联邦学习)后,我们将数据慢慢地去逼近模型的上限,再去总结经验做模型侧的突破,使得整个产业和生态更加健康(当然,这两条腿都不会停止自己的发展的,只是希望整个产业慢慢变好吧
Paper: https://arxiv.org/abs/2110.00476
Code: https://github.com/rwightman/pytorch-image-models
新时代的调参指南,Ross Wightman 是真的牛,timm 开发速度真的绝了
Code: https://github.com/rwightman/pytorch-image-models
新时代的调参指南,Ross Wightman 是真的牛,timm 开发速度真的绝了
GitHub
GitHub - huggingface/pytorch-image-models: The largest collection of PyTorch image encoders / backbones. Including train, eval…
The largest collection of PyTorch image encoders / backbones. Including train, eval, inference, export scripts, and pretrained weights -- ResNet, ResNeXT, EfficientNet, NFNet, Vision Transformer (V...
https://www.kaggle.com/c/petfinder-pawpularity-score/
https://t.co/Rc3HSZTta7?amp=1
两个竞赛的相关资讯,第一个是多模态,任务很有意思,最近准备摸一摸,第二个是吴恩达举办的 Data-centric 竞赛的分享
https://t.co/Rc3HSZTta7?amp=1
两个竞赛的相关资讯,第一个是多模态,任务很有意思,最近准备摸一摸,第二个是吴恩达举办的 Data-centric 竞赛的分享
Kaggle
PetFinder.my - Pawpularity Contest
Predict the popularity of shelter pet photos
如何看待李沐老师提出的「用随机梯度下降来优化人生」? - 电光幻影炼金术的回答 - 知乎
https://www.zhihu.com/question/489380225/answer/2143256952
特别有意思,身处这一行不可避免的来从不同的角度来思考这样的问题,最终结果如何,都是训一把才知道,对于学术上就是一次实验,对于个人这就是整个人生
https://www.zhihu.com/question/489380225/answer/2143256952
特别有意思,身处这一行不可避免的来从不同的角度来思考这样的问题,最终结果如何,都是训一把才知道,对于学术上就是一次实验,对于个人这就是整个人生