基础架构
奠定现代 AI 的底层技术范式。
- Transformer —
特点
Attention Is All You Need。Google 提出的基于自注意力机制的神经网络架构,彻底改变了 NLP 领域,成为后续几乎所有大模型的基础。
Link to original - BERT —
特点
Bidirectional Encoder Representations from Transformers。Google 提出的双向编码器预训练模型,通过 Masked Language Model 和 Next Sentence Prediction 进行预训练,在多项 NLP 任务上取得突破。
Link to original - GPT-1 —
特点
Generative Pre-trained Transformer。OpenAI 提出的生成式预训练 Transformer 模型,采用单向解码器架构,通过无监督预训练 + 有监督微调的两阶段训练范式。
Link to original
闭源大语言模型
由头部 AI 公司开发,通过 API 或产品提供服务。
- GPT-3 —
特点
Generative Pre-trained Transformer 3。拥有 1750 亿参数,展示了强大的少样本学习(few-shot learning)能力,无需微调即可执行多种 NLP 任务,标志着大模型时代的真正到来。
Link to original - GPT-4 —
特点
OpenAI 发布的大规模多模态语言模型,支持文本和图像输入。在多种专业和学术基准上达到人类水平,是 ChatGPT Plus 和 API 的核心模型。
Link to original - GPT-4o —
特点
GPT-4o(omni)是 OpenAI 发布的全模态模型,原生支持文本、音频、图像的任意组合输入和输出,响应速度比 GPT-4 Turbo 更快,成本更低。
Link to original - Claude —
特点
Anthropic 开发的大语言模型系列,强调安全性和有用性(Constitutional AI)。Claude 3 系列(Opus、Sonnet、Haiku)在多模态理解和长上下文处理方面表现出色。
Link to original - Gemini —
特点
Google DeepMind 开发的多模态大语言模型系列,原生支持文本、代码、图像、音频和视频。Gemini 1.5 Pro 支持 100 万 token 的超长上下文窗口。
Link to original - todo gpt6-astra
开源大语言模型
权重或代码完全开放,社区可自由使用和微调。
- Llama —
特点
Large Language Model Meta AI。Meta 发布的开源大语言模型系列,Llama 2 和 Llama 3 在开源社区广泛使用,催生了大量微调变体(如 Alpaca、Vicuna)。
Link to original - Mistral —
特点
Mistral AI 发布的开源大语言模型,采用稀疏混合专家(Mixture of Experts, MoE)架构。Mixtral 8x7B 和 Mistral Large 在性能和效率之间取得了良好平衡。
Link to original - Qwen —
特点
通义千问。阿里巴巴达摩院开发的大语言模型系列,开源了 Qwen、Qwen1.5、Qwen2 等多个版本,支持多语言和长上下文,在开源社区影响力巨大。
Link to original - DeepSeek —
特点
深度求索(DeepSeek)开发的大语言模型系列,以极高的训练效率和开源策略著称。DeepSeek-V2/V3 采用 MLA(Multi-head Latent Attention)架构,大幅降低推理成本。
Link to original - Grok —
特点
xAI(Elon Musk 创办)开发的大语言模型,集成于 X(Twitter)平台。Grok 特点是能够实时访问网络信息,回答风格较为幽默和非政治正确。Grok-1 已开源。
Link to original
多模态模型
同时理解和生成多种模态(文本、图像、音频、视频)。
- CLIP —
特点
Contrastive Language-Image Pre-training。OpenAI 提出的对比学习视觉-语言模型,通过自然语言监督学习视觉表示,实现了零样本图像分类,是后续多模态模型的基础。
Link to original - DALL-E —
特点
OpenAI 发布的文本到图像生成模型系列。DALL-E 使用 GPT 架构生成图像 token,DALL-E 2 引入扩散模型和 CLIP,DALL-E 3 大幅提升了图像质量和文本对齐能力。
Link to original - Stable Diffusion —
特点
Stability AI 与慕尼黑大学合作发布的开源文本到图像扩散模型。 latent diffusion 架构在潜在空间进行扩散,大幅降低计算需求,催生了庞大的开源生态(LoRA、ControlNet 等)。
Link to original - Sora —
特点
OpenAI 发布的文本到视频生成模型,能够根据文本提示生成长达 60 秒的高质量视频。基于扩散 Transformer 架构,将视频压缩为时空潜在 patch 进行处理。
Link to original
推理模型
专为复杂推理任务设计,强调思维链和逻辑推导。
- OpenAI o1 —
特点
OpenAI 发布的推理模型系列(原代号 Strawberry),通过强化学习训练模型在回答前进行链式思考(chain-of-thought)。o1 在数学、编程和科学推理任务上表现突出。
Link to original - DeepSeek-R1 —
特点
DeepSeek 发布的开源推理模型,通过强化学习(RL)驱动模型自发产生推理能力,无需监督微调(SFT)。在数学和代码任务上达到 OpenAI o1 水平,且完全开源。
Link to original
代码与编程
辅助软件开发和代码生成的专用模型。
issue: 存在codex这个模型吗?
- GitHub Copilot —
特点
GitHub 与 OpenAI 合作开发的 AI 编程助手,基于 Codex 模型。能够根据上下文自动生成代码建议、注释和文档,支持 Visual Studio Code、JetBrains 等主流 IDE。
Link to original
图像生成
专注艺术创作和视觉内容生成。
- Midjourney —
特点
Midjourney 公司开发的文本到图像生成 AI,以极高的艺术质量和美学风格著称。通过 Discord 平台提供服务,在设计和创意领域广受欢迎。
Link to original