AI探索指南
36.2K subscribers
14.1K photos
1.87K videos
557 files
6.14K links
关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
Download Telegram
Open AI CEO Sam 昨天还发了一篇《我希望有人告诉我的事情》应该是他今年的一些思考,我这里翻译一下,每一句加上一些自己的看法,顺便当自己的总结:

Sam:乐观、专注、自信、强大的驱动力和个人关系是启动事务的关键。

我:第一句看起来有点正确的废话,这里感觉驱动力和个人关系是他想要强调的事情。驱动力这个我今年感触很深,以前我是不可能省下玩游戏的时间写东西的。

Sam:协作的团队、冷静与紧迫感的完美结合,以及超乎寻常的承诺,才是完成任务的真谛。长远的视角不多见;尽量不要为短期内别人的看法所困扰,随着时间推移,这会变得更加容易。

我:后半句可能更重要一些,如果坚信自己做的事情是正确的一些无关人的看法确实不重要,当做出成绩时,别人的看法自然会转变。

Sam:对一个团队来说,做一件真正重要的难事比做一件不那么重要的容易事更容易;大胆的想法能够激发人们的动力。

我:这也是他今年反复强调的,需要给团队正确的目标,目标必须是困难并且正确的,这样才能激发团队的能力。

Sam:激励措施就像超能力,需要谨慎设定。

我:这个我只能浅显的理解为,激励措施的时间和力度都是需要精准把握的,太多和太少都有可能出问题。

Sam:将资源集中在少数你深信不疑的重要项目上;这听起来容易,但实际上却很难。你可以删除的东西比你想的还要多。

我:前半句很多人都知道,后半句应该说的是抛弃不重要的事情要更加坚决和彻底。这点我今年想的和做的都不太够。

Sam:清晰而简洁地进行沟通。

我:感觉是一项需要练习的能力,我激动的时候废话不自觉的就很多。

Sam:每当遇到废话和官僚主义时,都要挑战它们,并鼓励他人也这样做。不要让组织架构阻碍人们有效地协同工作。

我:这个感觉得看环境,当整个组织的环境是相对健康的时候是有用的,当环境变得恶劣可能更需要的是换个环境。

Sam:成果至上;不要让良好的流程成为糟糕结果的借口。

我:实事求是,只看结果。

Sam:投入更多时间于招聘。对那些潜力巨大且进步迅速的人冒险。除了智力,还要寻找完成任务的实际证据。

我:依然是后半句是重点,面试的时候更要看到做事的证据。

Sam:超级明星员工比你认为的还要宝贵,但你必须根据他们对整个组织绩效的净影响来评估他们。

我:之前老罗说过类似的话,就是厉害的人往往也会有些其他问题,负责人要把这部分问题对组织的影响评估好。
👍21
AI探索指南
Open AI CEO Sam 昨天还发了一篇《我希望有人告诉我的事情》应该是他今年的一些思考,我这里翻译一下,每一句加上一些自己的看法,顺便当自己的总结: Sam:乐观、专注、自信、强大的驱动力和个人关系是启动事务的关键。 我:第一句看起来有点正确的废话,这里感觉驱动力和个人关系是他想要强调的事情。驱动力这个我今年感触很深,以前我是不可能省下玩游戏的时间写东西的。 Sam:协作的团队、冷静与紧迫感的完美结合,以及超乎寻常的承诺,才是完成任务的真谛。长远的视角不多见;尽量不要为短期内别人的看法所困扰…
Sam:快速迭代可以弥补很多缺陷;通常情况下,如果你能迅速迭代,犯错也是可以接受的。计划应以十年为单位,执行则应以周为单位。

我:快速上线吸收反馈,快速修复迭代,继续收集反馈。前几年是大家的共识,这几年慢慢变了,Sam重新强调这件事情。

Sam:不要与商业版的物理定律作斗争。

我:在商业上我没啥理解缺失比较多,没办法举这种类似于物理定律的商业规则。

Sam:灵感是易逝的,生活是短暂的。不采取行动是一种特别狡猾的风险。

我:当有灵感的时候立刻就要开始行动,不需要做好,甚至不需要完成,先做起来。

Sam:规模往往会产生出人意料的新特性。

我:感觉是尝到了规模化的甜头,不管是组织架构上的,还是训练规模上的。

Sam:复利效应就像魔法。特别是,你确实想要建立一个随规模增长而获得复合优势的业务。

我:复利效应每个人都在提,但是能够践行和理解的人不太多。

Sam:不断地重新站起来,继续前进。

我:不只是失败之后重新站起来,也是上一个阶段结束后,要尽快开启下一个阶段。

Sam:与杰出的人一起工作是生活中最美好的部分之一。

我:跟一个好团队工作确实可以非常大的激发创造力和工作积极性。

来源:https://blog.samaltman.com/what-i-wish-someone-had-told-me
👍2
不得不感叹一下,字节的Coze太牛x了,不但可以无限量白嫖GPT4-8K,还能把制作好的Bot封装成一个Discord Bot发布,直接加入Discord频道里面随时召唤,这样也算间接解决了它目前没有移动端App的短板。

我已经把自己做的俩Bot:Philosophize This!(哲学伴读书童) 和Babel(全网最强英译中翻译)都植入了我们的Discord群,如果你感兴趣可以直接去群里使用。

数字游民部落Discord群邀请链接:

https://jarodise.com/discord

使用方法:
入群后,在群里任意文字聊天频道,或者直接在私信中 @Coze,选中你想要的使用那一个Bot,发信息与它进行对话即可。

另外,如果你也想尝试把自己创建的Coze Bot封装发布成为一个Discord Bot,可以参考下面链接这篇Coze的官方文档:

https://www.coze.com/docs/discord.html

目前唯一的疑问是,Coze这场慷慨的GPT4白嫖派对还能持续多久?
👍71
卧槽,字节昨天发布这个项目DreamTuner,可以一举解决图像生成中角色一致性的问题。

效果也太好了,可以将输入图片的角色在生成新图是完美保留,并且融合度非常好,这下小说、漫画和视频的人物一致性和商品一致性问题彻底解决了。

并且可以和ContorlNet联动确保动画的稳定,间接实现了前段时间的让单张图片动起来的功能。

项目简介:
我们提出了一种新颖的方法DreamTurner,该方法将定制主题的参考信息从粗到细注入。首先提出了一个主题编码器,用于粗略主题身份保留,通过额外的注意力层在视觉-文本交叉注意力之前引入了压缩的一般主题特征。
然后,注意到预训练的文本到图像模型中的自注意力层自然地执行了详细的空间上下文关联功能,我们将其修改为自主题注意力层,以细化目标主题的细节,生成的图像从参考图像和自身查询详细特征。
值得强调的是,自主题注意力是一种优雅、有效且无需训练的方法,用于保持定制概念的详细特征,可在推断过程中作为即插即用的解决方案。
最后,通过对单个图像进行额外微调,DreamTurner 在受主题驱动的图像生成方面取得了显著的表现,可由文本或其他条件(如姿势)进行控制。

项目地址:https://dreamtuner-diffusion.github.io/
👍1
机器人商业化的唯一路径可能是“硬件刚性+软件柔性”,对应产品标准化和任务多样化/复杂化,由此ROI提高,渗透率提高。

这么看的话,AI+Robot和Robot+AI两种提法其实都不错。
🧪来了,昨天很多人问我那个国风CG的提示词,所以整理了一下,那套风景的挺简单的。我还顺便用这套词的图做了一个黑神话·悟空音乐《戒网》的MV,感觉风格超级像,哈哈。

提示词的结构为:
[scenery],[season], [weather], [mood]::3, Chinese style, mist, natural lighting, Epic, realistic, octane render, beautifully detailed, light diffusion, cinematic shading, cinematic elements。

[]括号括起来的分别是景物,季节,天气还有气氛,这几个去掉一个或者两个也没问题有可能效果更好,就是抽卡。

举个例子:moon, river, autumn, wind, sad atmosphere::3 , Chinese style, mist, natural lighting, Epic, realistic, octane render, beautifully detailed, light diffusion, cinematic shading, cinematic elements --ar 16:9 --v 6.0

顺便介绍一下我和 @lyson_ober 一起做的提示词收集网站Catjourney 也同步更新了这些提示词,不再是只有风格词。

里面所有的提示词和图片都是我们人工挑选和生成的,绝对不会踩坑,没有货不对板的情况。下面放几张这套提示词生成的放大图片。

所有的提示词和图片都在这里:https://catjourney.life/

Invalid media: video
👏6👍4
我司AI真的甩某🦆一百条街
👍14🤡6😁3
求问:
互联网上或者你自己,有看到用AIGC或者AI工具,做出来像样的项目或者作品了吗?
或者是切实的解决了工作中、生活中的痛点,解放了生产力?
4
This media is not supported in your browser
VIEW IN TELEGRAM
用手柄控制人脸表情,什么赛博肉体飞升控制论……😂

{ROS-Face是一个利用ROS游戏手柄系统操控人类面部肌肉,从而控制面部表情的项目。}

链接:https//github.com/maHidaka/ros_face/tree/master

- 😯 反常识观点:ROS-Face项目使得人脸表情可以像操控机器人一样被控制,这打破了传统认为面部表情只能自然形成的观念。
👍3
全人类的体力很接近,无论博尔特还是黄渤,跑百米都只有几秒钟差距(只要不是老幼病残)反正都不如飞机汽车
人类的智力其实也很接近,无论北大毕业还是小学辍学,不靠专门数数都无法一眼认清一把豆子的数量,能一眼认清的上限也就是6-7颗。算力反正都不如计算机
我们喜欢夸大人与人的差距,是因为构建阶级秩序要从任何细微的差异里争个高下。实际上180cm巨人的身高也只是170cm残废的1.05倍而已
但寻求生产力革新,需要我们跳出这种视野束缚,哪怕快如博尔特,也仍然需要汽车

你做数学题时,可以轻易算出1133x3355等于几,但你跟人聊天时,就无法随口说出答案
你乘飞机可以日行万里,但博尔特跑步也只能在地图蠕动,有辆车就很方便
我们也不会因为汽车速度不如飞机,就觉得飞机是更高频killer场景。所以,要多去寻找在人需要随口表达的场合提供小学数学级别的辅助,而不是端正做高数题时的科学家级辅助

你可能忽视这个问题,是因为你以为人脑具有完全思考算力。但你现在遇到一首歌难听,你甚至都无法用顺畅逻辑分析出它为什么难听。
因为人类的脑原理决定了,哪怕科学家,日常也只能在少数时间调用复杂逻辑运算,大部分时候仍只能用直觉来面对生活,无非是直觉里的训练集比别人多一点而已
(语音转文字发表,可能条理有点乱)
👍19👎1
圣诞连着三天,写脚本+作图+导出视频+剪辑,用Midjourney+runway+elevenlabs生成,做出来一个开脑洞的耶稣与佛陀穿越相遇的视频。

祝大家圣诞快乐!🧑‍🎄

Invalid media: video
👍9👎8
Gemini Pro + 自定义 prompt = 更沉浸的沉浸式翻译。

浏览器自带的全文翻译效果,读起来像吃了苍蝇一样。除了机翻感和没有原文对照之外,主要原因还在于很多词汇的翻译不准确,或者说在当前的上下文里不准确,导致读起来有些莫名其妙。

沉浸式翻译插件把网页翻译的阅读体验推到了一个新的高度。根据当前网页结构,巧妙地在原文段落后面显示翻译结果。这样在读的时候,就有原文可以对照了。很沉浸。

昨天在用的时候,发现已经支持 Gemini 作为翻译引擎了。看了一下,还支持自定义翻译 prompt, 我想这正好可以用来解决有些词汇翻译不准确的问题。

于是,顺手申请了一个 Gemini 的 Key, 然后咔咔写了一段 prompt.

图一可以看到,默认用 Google Translate 翻译的话,LLM 经常会被翻译为法学硕士。图二是使用 Gemini + 自定义 prompt 之后的效果。

Prompt 也很简单,主要就是根据自己经常读的文章类型,做一个词汇翻译对照表,让 Gemini 按照这个对照表翻译。

参考 prompt (可能需要替换成你自己的词汇表):
https://docs.qq.com/doc/DSUJ0bGppUlJ6aHJZ

沉浸式翻译浏览器插件:
https://immersivetranslate.com

Gemini API Key 申请步骤(免费):
https://immersivetranslate.com/docs/services/gemini/

参考图三、图四,分别在插件设置页面里填写 Gemini Key 和 prompt 即可。
👍123
机器未来3-5年智能化所需的能力

模拟:模型能加速模拟环境开发,连接3D开发人员,构建场景、环境,生成资产。这些GenAI资产能广泛应用于合成数据生成、机器人技能训练和软件测试;
多模态大模型接入:基于Transformer的模型能帮助机器人更好地理解周围世界,让它们可以在更多环境中工作,完成复杂任务。
机器人(重新)编程:能更简单地用简单语言定义任务和功能,让机器人更加通用和多用途,通用机器人永远要和场景适配
执行:为了提高效率,结合新颖的机械设计,比如末端执行器\灵巧手(目前成本比较高可控性还不够)提升使用工具的能力
#AI #机器人
这个工具有点牛逼,让gpt4生成图片,gpt4直接调用mj
👀34
接了个GLG的电话访谈,
聊了不到10分钟给我挂了……
不开心,必须记录下!

对方要写报告,写一份AIGC--创意平台未来可能的市场空间/规模的预估报告……
对方希望撰写的方式是看各个内容板块的行业规模,考量AI的渗透率,再加总;
比如长视频-长视频生产成本-AI解决哪些环节--替代多少人力和提升效率;
游戏多少、短视频多少、直播多少、游戏多少等等。

我说:
1、这种从需求端倒推的方式可能对于目前阶段的AIGC行业而言是不太合适的,因为还太早了,很多所谓的乘数现在哪怕是拍脑袋都没办法拍;(生产环节有哪些可以用AI,多大程度用AI,是不是未来会有新的环节产生,以及产业规模因此的放大乘数等等)

2、相对合理一点点的,可以有一定验证逻辑的应该是从供给端拆,就是这一波大模型在各个多模态领域(文字、图片、3D素材、视频、音乐等)的进展,先给一些偏感性的阶段划分(还在找最优技术路线、已经到了GPT时刻、开始进入生产管线等),然后再根据这个节奏和阶段往后推一点点;
(如图)

3、如果非要写在这个报告,最后你只能拍大框,非常大的框架,就不能往细分环节上抠,因为不可能抠出来。

对方听完,电话里说:
哎,我想开了,我放弃了,不TM写了……

然后就给我挂了……
留下我在风中默默哭泣……
这TM10分钟的钱,
还不够我吃碗拉面呢,
艹~~~~
👍2