基础架构

奠定现代 AI 的底层技术范式。

  • Transformer

    特点

    Attention Is All You Need。Google 提出的基于自注意力机制的神经网络架构,彻底改变了 NLP 领域,成为后续几乎所有大模型的基础。

    Link to original
  • BERT

    特点

    Bidirectional Encoder Representations from Transformers。Google 提出的双向编码器预训练模型,通过 Masked Language Model 和 Next Sentence Prediction 进行预训练,在多项 NLP 任务上取得突破。

    Link to original
  • GPT-1

    特点

    Generative Pre-trained Transformer。OpenAI 提出的生成式预训练 Transformer 模型,采用单向解码器架构,通过无监督预训练 + 有监督微调的两阶段训练范式。

    Link to original

闭源大语言模型

由头部 AI 公司开发,通过 API 或产品提供服务。

  • GPT-3

    特点

    Generative Pre-trained Transformer 3。拥有 1750 亿参数,展示了强大的少样本学习(few-shot learning)能力,无需微调即可执行多种 NLP 任务,标志着大模型时代的真正到来。

    Link to original
  • GPT-4

    特点

    OpenAI 发布的大规模多模态语言模型,支持文本和图像输入。在多种专业和学术基准上达到人类水平,是 ChatGPT Plus 和 API 的核心模型。

    Link to original
  • GPT-4o

    特点

    GPT-4o(omni)是 OpenAI 发布的全模态模型,原生支持文本、音频、图像的任意组合输入和输出,响应速度比 GPT-4 Turbo 更快,成本更低。

    Link to original
  • Claude

    特点

    Anthropic 开发的大语言模型系列,强调安全性和有用性(Constitutional AI)。Claude 3 系列(Opus、Sonnet、Haiku)在多模态理解和长上下文处理方面表现出色。

    Link to original
  • Gemini

    特点

    Google DeepMind 开发的多模态大语言模型系列,原生支持文本、代码、图像、音频和视频。Gemini 1.5 Pro 支持 100 万 token 的超长上下文窗口。

    Link to original
  • todo gpt6-astra

开源大语言模型

权重或代码完全开放,社区可自由使用和微调。

  • Llama

    特点

    Large Language Model Meta AI。Meta 发布的开源大语言模型系列,Llama 2 和 Llama 3 在开源社区广泛使用,催生了大量微调变体(如 Alpaca、Vicuna)。

    Link to original
  • Mistral

    特点

    Mistral AI 发布的开源大语言模型,采用稀疏混合专家(Mixture of Experts, MoE)架构。Mixtral 8x7B 和 Mistral Large 在性能和效率之间取得了良好平衡。

    Link to original
  • Qwen

    特点

    通义千问。阿里巴巴达摩院开发的大语言模型系列,开源了 Qwen、Qwen1.5、Qwen2 等多个版本,支持多语言和长上下文,在开源社区影响力巨大。

    Link to original
  • DeepSeek

    特点

    深度求索(DeepSeek)开发的大语言模型系列,以极高的训练效率和开源策略著称。DeepSeek-V2/V3 采用 MLA(Multi-head Latent Attention)架构,大幅降低推理成本。

    Link to original
  • Grok

    特点

    xAI(Elon Musk 创办)开发的大语言模型,集成于 X(Twitter)平台。Grok 特点是能够实时访问网络信息,回答风格较为幽默和非政治正确。Grok-1 已开源。

    Link to original

多模态模型

同时理解和生成多种模态(文本、图像、音频、视频)。

  • CLIP

    特点

    Contrastive Language-Image Pre-training。OpenAI 提出的对比学习视觉-语言模型,通过自然语言监督学习视觉表示,实现了零样本图像分类,是后续多模态模型的基础。

    Link to original
  • DALL-E

    特点

    OpenAI 发布的文本到图像生成模型系列。DALL-E 使用 GPT 架构生成图像 token,DALL-E 2 引入扩散模型和 CLIP,DALL-E 3 大幅提升了图像质量和文本对齐能力。

    Link to original
  • Stable Diffusion

    特点

    Stability AI 与慕尼黑大学合作发布的开源文本到图像扩散模型。 latent diffusion 架构在潜在空间进行扩散,大幅降低计算需求,催生了庞大的开源生态(LoRA、ControlNet 等)。

    Link to original
  • Sora

    特点

    OpenAI 发布的文本到视频生成模型,能够根据文本提示生成长达 60 秒的高质量视频。基于扩散 Transformer 架构,将视频压缩为时空潜在 patch 进行处理。

    Link to original

推理模型

专为复杂推理任务设计,强调思维链和逻辑推导。

  • OpenAI o1

    特点

    OpenAI 发布的推理模型系列(原代号 Strawberry),通过强化学习训练模型在回答前进行链式思考(chain-of-thought)。o1 在数学、编程和科学推理任务上表现突出。

    Link to original
  • DeepSeek-R1

    特点

    DeepSeek 发布的开源推理模型,通过强化学习(RL)驱动模型自发产生推理能力,无需监督微调(SFT)。在数学和代码任务上达到 OpenAI o1 水平,且完全开源。

    Link to original

代码与编程

辅助软件开发和代码生成的专用模型。

issue: 存在codex这个模型吗?

  • GitHub Copilot

    特点

    GitHub 与 OpenAI 合作开发的 AI 编程助手,基于 Codex 模型。能够根据上下文自动生成代码建议、注释和文档,支持 Visual Studio Code、JetBrains 等主流 IDE。

    Link to original

图像生成

专注艺术创作和视觉内容生成。

  • Midjourney

    特点

    Midjourney 公司开发的文本到图像生成 AI,以极高的艺术质量和美学风格著称。通过 Discord 平台提供服务,在设计和创意领域广受欢迎。

    Link to original