当前位置:读零零>其他类型>大白话聊透人工智能> OpenAI:从“会聊天的机器人”到改变世界的公司
阅读设置(推荐配合 快捷键[F11] 进入全屏沉浸式阅读)

设置X

OpenAI:从“会聊天的机器人”到改变世界的公司(3 / 5)

,我想去公园”这句话,算法会让它明白“‘天气好’是‘去公园’的原因”——相当于教ai“怎么理解文字的意思,怎么组织语言”。

这个“做饭”的过程,叫“训练模型”。训练一次gpt-3,大概要花几个星期,电费就得几千万美金;训练gpt-4,成本更高,有人估算得几亿美金——这也是为啥只有微软这样的大公司,才能撑得起openai的研发。

而且“做饭”不是一次就能成功的:比如第一次训练出来的ai,可能会“答非所问”(你问“今天吃啥”,它答“地球是圆的”),这时候工程师就得调整“菜谱”(改算法),再重新“炒一次”(重新训练),有时候得反复几十次,才能让ai“说话正常”。

第三步:“试吃”——让人类教ai“怎么说话更得体”

饭做好了,得有人试吃,看看咸不咸、辣不辣;ai训练好了,也得有人“试聊”,教它“怎么说话更得体”——这一步叫“人类反馈强化学习(rlhf)”,说穿了就是“让人类当ai的老师”。

具体怎么做?openai会找一群“标注员”(普通人也能做,只要通过考核),让他们跟ai聊天,然后给ai的回答打分:

- 如果ai回答得好(比如你问“怎么缓解焦虑”,ai说“可以试试深呼吸、听音乐,要是严重的话建议看医生”

- 如果ai回答得不好(比如你问“怎么缓解焦虑”,ai说“别焦虑,焦虑没用”),就给低分,还得告诉ai“为啥不好,应该怎么改”。

然后openai会把这些“打分数据”再喂给ai,让ai学习“什么样的回答更受欢迎”——相当于你试吃后说“太咸了,下次少放盐”,厨师下次就会调整。

这一步虽然“技术含量不高”,但很关键:比如早期的ai,可能会说脏话、传播谣言,经过人类的“打分调教”后,它会慢慢学会“说文明话、说正确的话”;再比如,你让ai“推荐电影”,早期的ai可能只推荐老电影,但经过人类反馈后,它会知道“现在的人更喜欢看新电影”,推荐的内容就更贴合需求。

就这么三步:收集数据(买菜)、训练模型(做饭)、人类反馈(试吃),openai花了8年,才从gpt-1做到gpt-4,最终搞出了火遍全球的chatgpt。

四、openai跟咱们普通人有啥关系?已经在发生

可能有人会说:“openai是大公司,chatgpt是高科技,跟我这种普通人有啥关系?”其实不然——它已经在悄悄改变咱们的工作、学习和生活,只是你可能没注意到。

1 工作:不是“取代人”,而是“帮人省时间”

很多人怕“ai抢工作”,比如“文案被chatgpt取代”“程序员被ai编代码取代”——但实际情况是,ai更多是“帮人干活,不是抢人饭碗”。

- 做文案的:以前写一篇“产品推广文案”,得查资料、想标题、改内容,可能要花一下午;现在用chatgpt,你说“帮我写一篇‘无线耳机’的推广文案,突出‘续航长、音质好’,适合年轻人”,它5分钟就能写出3个版本,你再改改细节,半小时就能搞定——省下来的时间,你可以去做更有创意的事(比如策划营销活动)。

- 做行政的:以前整理“会议记录”,得边听边记,还容易漏内容;现在用chatgpt的“语音转文字+总结”功能,会议结束后,它能自动把录音转成文字,还能提炼出“会议重点、待办事项、负责人”——你不用再熬夜整理记录。

- 做老师的:以前批改“作文作业”,得一篇篇看,写评语,一个班40个学生,可能要改一晚上;现在用gpt-4,你把作文拍给它,它能自动指出“语法错误、逻辑问题”,还能给“改进建议”(比如“这里可以加个例子,让内容更生动”)——老师只要再核对一遍,就能省很多时间,多花点精力在“辅导学生”上。

简单说:ai会取代“重复、机械的工作”,但不会取代“需要创意、情感、思考的工作”——它更像你的“助理”,帮你干杂活,让你有更多时间做“更有价值的事”。

2 学习:从“死记硬背”到“有人帮你答疑”

对于学生或者想“自学新知识”的人来说,openai的产品简直是“免费的老师”。

- 学英语:你跟chatgpt说“我想练口语,你当我的对话伙伴,聊‘周末计划’这个话题,我要是说错了,你帮我纠正”,它会跟你一句一句聊。你说“i pn go to park”,它会温柔指出“应该是‘i pn to go to the park’,这里需要加‘to’哦”,还会延伸说“‘pn to do sth’是固定搭配,比如‘i pn to read a book’(我计划读一本书)”,比死记语法书有趣多了;要是你想练写作,让它“给我出一道英语作文题,主题是‘我的环保小行动’,我写完你帮我批改”,它

上一页 目录 +书签 下一页