Chat with Wiki - 目前主流的AI大模型有哪些

Answer

目前主流的 AI 大模型主要有以下几种：

OpenAI 系列：包括 GPT-3.5 和 GPT-4 等。GPT-3.5 在 11 月启动了当前的 AI 热潮，GPT-4 功能更强大。ChatGPT 也属于 OpenAI 系列。
微软 Bing：使用 GPT-4 和 GPT-3.5 的混合，通常是 GPT-4 家族中首个推出新功能的模型，能创建和查看图像，还能在网页浏览器中阅读文档，并连接到互联网。
谷歌 Bard：由各种基础模型驱动，最近是 PaLM 2 模型。
Anthropic Claude 2：其特点是有非常大的上下文窗口，不太可能恶意行事。

此外，大模型的架构也有所不同，如 encoder-only 模型（代表模型是 BERT）、encoder-decoder 模型（代表是 google 的 T5）、decoder-only 模型（适用于自然语言生成任务，如故事写作和博客生成，众多 AI 助手包括 ChatGPT 都属于此类）。大模型的“大”体现在预训练数据量大（往往来自互联网，包括论文、代码、公开网页等，一般用 TB 级别的数据进行预训练）和参数多（如 OpenAI 在 2020 年发布的 GPT-3 就已达到 170B 的参数）。

Content generated by AI large model, please carefully verify (powered by aily)

References

Ranger：【AI 大模型】非技术背景，一文读懂大模型（长文）

首先为方便大家对大模型有一个整体的认知，我们先从大模型的整体架构着手，来看看大模型的组成是怎么样的。下面是我大致分的个层。从整体分层的角度来看，目前大模型整体架构可以分为以下几层：[heading3]1.基础层：为大模型提供硬件支撑，数据支持等[content]例如A100、数据服务器等等。[heading3]2.数据层[content]这里的数据层指的不是用于基层模型训练的数据基集，而是企业根据自己的特性，维护的垂域数据。分为静态的知识库，和动态的三方数据集[heading3]3.模型层：LLm或多模态模型[content]LLm这个大家应该都知道，large-language-model，也就是大语言模型，例如GPT，一般使用transformer算法来实现。多模态模型即市面上的文生图、图生图等的模型，训练所用的数据与llm不同，用的是图文或声音等多模态的数据集[heading3]4.平台层：模型与应用间的平台部分[content]比如大模型的评测体系，或者langchain平台等，提供模型与应用间的组成部分[heading3]5.表现层：也就是应用层，用户实际看到的地方[content]这个就很好理解了，就不用我多作解释了吧

如何使用 AI 来做事：一份带有观点的指南

前四个（包括Bing）都是OpenAI系统。今天有两大主要的OpenAI AI：3.5和4。3.5模型在11月启动了当前的AI热潮，4.0模型在春季首次发布，功能更强大。一个新的变种使用插件连接到互联网和其他应用程序。有很多插件，其中大部分不是很有用，但你应该随需要自由探索它们。Code Interpreter是一个非常强大的ChatGPT版本，可以运行Python程序。如果您从未为OpenAI付费，那么您只能使用3.5。除了插件变种和一个暂时停用的带有浏览功能的GPT-4版本之外，这些模型都没有连接到互联网。微软的Bing使用4和3.5的混合，通常是GPT-4家族中首个推出新功能的模型。例如，它既可以创建也可以查看图像，而且它可以在网页浏览器中阅读文档。它连接到互联网。[Bing使用有点奇怪，但功能强大。](https://oneusefulthing.substack.com/p/power-and-weirdness-how-to-use-bing)谷歌一直在测试自己的人工智能供消费者使用，他们称之为Bard，但是由各种基础模型驱动，最近是一个名叫PaLM 2的模型。对于开发出LLM技术的公司来说，他们非常令人失望，尽管昨天宣布的改进表明他们仍在研究基础技术，所以有希望。它已经获得了运行有限代码和解释图像的能力，但我目前通常会避免它。最后一家公司Anthropic发布了Claude 2。Claude最值得注意的是有一个非常大的上下文窗口-本质上是LLM的记忆。Claude几乎可以保存一整本书或许多PDF。与其他大型语言模型相比，它不太可能恶意行事，这意味着，在实际上，它倾向于对你做一些事情进行责骂。现在，来看看一些用途：

从 0 到 1 了解大模型安全，看这篇就够了

encoder-only:这些模型通常适用于可以自然语言理解任务，例如分类和情感分析.最知名的代表模型是BERTencoder-decoder:此类模型同时结合了Transformer架构的encoder和decoder来理解和生成内容。该架构的一些用例包括翻译和摘要。encoder-decoder的代表是google的T5decoder-only:此类模型更擅长自然语言生成任务。典型使用包括故事写作和博客生成。这也是我们现在所熟知的众多AI助手的结构我们目前耳熟能详的AI助手基本都来自左侧的灰色分支,当然也包括ChatGPT。这些架构都是根据谷歌2017年发布的论文“attention is all you need”中提出的transformer衍生而来的，在transformer中，包括Encoder，Decoder两个结构目前的大型语言模型就是右侧只使用Decoder的Decoder-only架构的模型大模型又大在哪呢？第一，大模型的预训练数据非常大，这些数据往往来自于互联网上，包括论文，代码，以及可进行爬取的公开网页等等，一般来说，现在最先进的大模型一般都是用TB级别的数据进行预训练。第二，参数非常多，Open在2020年发布的GPT-3就已经达到170B的参数在GPT3中，模型可以根据用户输入的任务描述，或给出详细的例子，完成任务但这与我们熟知的ChatGPT仍然有着很大的差距，使用ChatGPT只需要像和人类一样对话，就可以完成任务。除了形式上的不同之外，还有一个更加重要的差距，那就是安全性上的差别。