ChatGPT能否取代Google、Baidu，成为下一代搜索引擎？一文了解最近火出圈的ChatGPT

2023年11月4日上午1:25 • Python • 阅读 55

前言

OpenAI这家公司又放大招了，继发布GPT、GPT2和GPT3模型后，本月初发布了ChatGPT模型【也被称为GPT3.5】，结合大家的测试效果来看，该模型效果确实很震撼，在人工智能圈子引起了不小的轰动。在AI发展相对处于低谷期的今天，如此震撼的模型发布出来，确实为该行业带来一阵暖风，本文就详细解读一下该模型。

ChatGPT能否取代Google、Baidu，成为下一代搜索引擎？一文了解最近火出圈的ChatGPT

官方并没有公开ChatGPT的原始Paper，但提到 InstructGPT; 是该模型的兄弟模型，因此，本文主要来解读InstructGPT模型。

部分测试截图

; InstructGPT 模型解读

摘要

把语言模型做大并不能本质上让它们更贴合用户的意图。例如，大型语言模型可能生成不真实、有害或对用户没有帮助的输出。换言之，这些模型与它们的用户并不是对齐的 (Aligned)。本文提出了一种方法，通过使用人类反馈进行微调，使语言模型在广泛的任务中与用户意图保持一致。我们从一组由人工撰写以及通过 OpenAI API 所提交的提示 (Prompt)开始，整理了一个人工给模型作出示范的数据集，并将其应用到微调GPT-3的监督学习任务中去。然后，我们采集了模型输出的排名，并利用该数据集，结合人类反馈进行强化学习，进一步微调这个监督模型。我们将最终的模型称为 InstructGPT。在对提示分布的人类评估中，尽管参数量少了 100 倍，13 亿参数的 InstructGPT 模型表现仍要好于 1750 亿参数的 GPT-3。此外，InstructGPT 模型在提高真实性并减少有害输出的同时，在公共 NLP 数据集上表现出了最优的性能。尽管 InstructGPT 仍然会犯一些简单的错误，但我们的研究结果表明，通过人类反馈微调，将语言模型与人类意图对齐是一个有前景的方向。

引言

模型整体框架：

在”人工标注数据+强化学习”框架下，具体而言，InstructGPT的训练过程分为以下三个阶段：

第一阶段：冷启动阶段的监督策略模型
靠GPT 3本身，尽管它很强，但是它很难理解人类不同类型指令中蕴含的不同意图，也很难判断生成内容是否是高质量的结果。为了让GPT 3初步具备理解指令中蕴含的意图，首先会从测试用户提交的prompt(就是指令或问题)中随机抽取一批，靠专业的标注人员，给出指定prompt的高质量答案，然后用这些人工标注好的
第二阶段：训练回报模型（Reward Model,RM）
这个阶段的主要目的是通过人工标注训练数据，来训练回报模型。具体而言，随机抽样一批用户提交的prompt(大部分和第一阶段的相同)，使用第一阶段Fine-tune好的冷启动模型，对于每个prompt，由冷启动模型生成K个不同的回答，于是模型产生出了
第三阶段：采用强化学习来增强预训练模型的能力
本阶段无需人工标注数据，而是利用上一阶段学好的RM模型，靠RM打分结果来更新预训练模型参数。具体而言，首先，从用户提交的prompt里随机采样一批新的命令（指的是和第一第二阶段不同的新的prompt，这个其实是很重要的，对于提升LLM模型理解instruct指令的泛化能力很有帮助），且由冷启动模型来初始化PPO模型的参数。然后，对于随机抽取的prompt，使用PPO模型生成回答answer，并用上一阶段训练好的RM模型给出answer质量评估的回报分数score，这个回报分数就是RM赋予给整个回答（由单词序列构成）的整体reward。有了单词序列的最终回报，就可以把每个单词看作一个时间步，把reward由后往前依次传递，由此产生的策略梯度可以更新PPO模型参数。这是标准的强化学习过程，目的是训练LLM产生高reward的答案，也即是产生符合RM标准的高质量回答。

如果我们不断重复第二和第三阶段，很明显，每一轮迭代都使得LLM模型能力越来越强。因为第二阶段通过人工标注数据来增强RM模型的能力，而第三阶段，经过增强的RM模型对新prompt产生的回答打分会更准，并利用强化学习来鼓励LLM模型学习新的高质量内容，这起到了类似利用伪标签扩充高质量训练数据的作用，于是LLM模型进一步得到增强。显然，第二阶段和第三阶段有相互促进的作用，这是为何不断迭代会有持续增强效果的原因。

Original: https://blog.csdn.net/qq_32275289/article/details/128234845
Author: NLP_wendi
Title: ChatGPT能否取代Google、Baidu，成为下一代搜索引擎？一文了解最近火出圈的ChatGPT

原创文章受到原创版权保护。转载请注明出处：https://www.johngo689.com/811172/

转载文章受原作者版权保护。转载请注明原作者出处！

python

【自取】最近整理的，有需要可以领取学习：

Linux核心资料大放送~

全栈面试题汇总（持续更新&可下载）

一个提高学习100%效率的工具！

【超详细】深度学习面试题目！

LeetCode Python刷题答案下载！

LeetCode Java版刷题答案下载！

LeetCode C++ 版本，抓紧保存！

LeetCode GO语言刷题答案下载！

新手小白第一次安装pytorch心路历程-win、conda安装

第一次安装pytorch，记录一下，希望能帮助到有需要的人。 1、安装anaconda，官网教程安装_Anaconda 中文网 2、在pytorch安装中，最重要问题在于版本，和自…

Python 2023年9月9日
0055
论文阅读：《Probabilistic Neural-symbolic Models for Interpretable Visual Question Answering》

标题：可解释的视觉问题回答的概率神经符号模型来源：ICML 2019https://proceedings.mlr.press/v97/vedantam19a.html代码：htt…

Python 2023年10月26日
0064
整理：Github上最受欢迎的仓库（截至2021年12月26日）

1. Public APIs 仓库名： public-apis作者： public-apisStars: 172335Repository网址： https://github.co…

Python 2023年8月4日
0037
PYG 包安装踩坑经验+conda 虚拟环境安装Pytorch+cuda+cudnn

安装环境：conda 虚拟环境！！！踩坑安装流程！！！（不要照以下内容操作！！！）在torch官网进行conda安装 conda install pytorch==1.9.1 …

Python 2023年9月9日
0059
python筛选csv文件中特定的行（指定条件的数据）

文章目录参考网址资料 python使用csv库对csv文件特定行进行筛选 * 筛选csv文件中特定的行使用pandas和numpy库对数据进行提取与筛选参考网址资料 (自己整…

Python 2023年8月2日
0047
K8s nginx-ingress 如何配置二级目录转发远程静态服务器基于Vue路由history模式打包的应用程序

背景首先这标题有点绕，我先解释下：首先我们有静态服务器，上面某个目录有 Vue路由 history模式打包的应用程序(也就是build后的产物)；但是静态服务器一般不做对外域…

Python 2023年10月21日
0028
Django Admin快速美化详解

Django的后台快速美化详解一直听说别人一天搞出来一个后端管理系统，今天发现了新大陆，哈哈哈 1.Django中admin设置中文在settings.py中设置 LANGUA…

Python 2023年8月5日
0051
国外学者将500万篇CS论文搬进了毕业论文，结论：学海无涯“卷”作舟

文 | python 各位在CS（计算机）科研的苦海中挣扎的亲们，有没有觉得这些年科研越来越卷，论文越来越难发？实锤了！用数据说话，计算机领域的论文真的越来越卷了！最近，一篇德…

Python 2023年10月27日
0040
django中的视图层

1.什么是视图层简单来说，就是用来接收路由层传来的请求，从而做出相应的响应返回给浏览器 2.视图层的格式与参数说明 2.1基本格式 from django.http import…

Python 2023年6月9日
0077
numba优化踩坑记录

众所周知，python的运行很慢。最近遇到一个需要中等频率处理百亿条数据的工作（还没办法直接用numpy的矩阵操作）。但我c++水平有限，加上读取、处理数据的API（ArcPy）只…

Python 2023年8月29日
0045
Python笔记（1）——字符串（Python编程：从入门到实践）

字符串一、使用方法修改字符串大小写方法：变量.tittle()：首字母大学显示字符串中的每个英文单词方法：变量.upper()：字符串全改为大写方法：变量.lower()：…

Python 2023年10月30日
0043
python 网站爬虫（四） Scrapy讲解

python 网站爬虫（四） Scrapy讲解 ; 1、Spider类 Spider 类是 Scrapy 中的主要核心类，它定义了如何爬取某个(或某些)网站。包括爬取的动作（例如是…

Python 2023年10月5日
0023
【教程】FastAPI-Amis-Admin注册SQLModel模型管理类,快速实现数据的增删改查(CRUD)

fastapi-amis-admin中的模型管理类 ModelAdmin与 Django-admin中的 ModelAdmin使用方法非常相似,也具备 django-admin中的…

Python 2023年8月4日
0044
RK3568平台开发系列讲解（音视频篇）FFmpeg公共基础参数

🚀返回专栏总目录; 文章目录一、公共操作部分二、每个文件主要操作部分三、视频操作部分四、音频操作部分沉淀、分享、成长，让自己和他人都能有所收获！😄 📢当我们使用 FFmp…

Python 2023年11月6日
0038
pandas后几行_Pandas 行/列操作

Series 和 Dataframe pandas的基本数据结构有两个：Series 和 Dataframe Series 是一维数据结构，它由index和value组成。例如 i…

Python 2023年8月9日
0082
charles爬取数据储存mysql_Scrapy利用Redis实现消重存入MySQL（增量爬取）

官方去重： scrapy官方文档的去重模块，只能实现对当前抓取数据的去重，并不会和数据库里的数据做对比。也就是说如果你抓了100条数据，里面有10条重复了，它会丢掉这10条，但10…

Python 2023年10月5日
0046

2024 年 5 月
一	二	三	四	五	六	日
		1	2	3	4	5
6	7	8	9	10	11	12
13	14	15	16	17	18	19
20	21	22	23	24	25	26
27	28	29	30	31

ChatGPT能否取代Google、Baidu，成为下一代搜索引擎？一文了解最近火出圈的ChatGPT

前 言

部分测试截图

; InstructGPT 模型解读

摘要

引言

大家都在看

前言