1. OpenAI
NXAI 文档
  • 引言
    • 获取令牌
    • 一个完整的请求案例
    • 关于缓存创建与命中
    • 联系客服
    • 定价说明
    • 常见接口错误类型说明
    • 关于 AI 大模型鉴别真伪的系统性方案
    • 在TRAE中使用自定义模型
    • 模型质量监控与保障说明
  • 模型介绍
    • GPT 系列
    • Claude 系列
    • Gemini 系列
    • DeepSeek系列
    • 百度文心一言
    • 阿里通义千问
  • 模型接口
    • 火山豆包模型调用说明
    • 模型查询相关
      • 计费日志开放API
      • 模型列表查询
      • 令牌用量查询
      • 获取账号信息
    • 聊天(Chat)
      • OpenAI
        • 基础聊天(ChatCompletions格式)
          • 基础文本对话
          • 流式响应
          • 内容补全(早期接口)
          • PDF文件分析
          • 代码生成(codex)
          • 结构化输出
          • 联网搜索
          • GPTs对话
        • 会话聊天(Responses格式)
          • 基础文本响应
          • 图像分析响应
          • 网络搜索工具
          • 文件搜索工具
          • 计算机模拟
          • 深度研究
          • 函数调用
          • 推理能力
      • Google Gemini
        • 文本聊天
        • 媒体识别
        • 视频理解
      • Anthropic Claude
        • 文本生成
        • 图片理解
        • 深度思考
        • 函数调用
        • 联网搜索
        • 带缓存创建的文本对话
    • 图像(Images)
      • Midjourney
        • 文生图(Imagine)接口
        • 按钮点击(Action)接口
        • 图片融合(Blend)接口
        • 窗口执行(Modal)接口
        • 图生文(Describe)接口
        • 缩短提示词(Shorten)接口
        • 换脸(FaceSwap)接口
        • 上传(upload)接口
        • 查询接口
        • 批量查询接口
        • 获取种子(Seed)接口
        • 编辑图片(Edit)接口
        • 生成视频(Video)接口
      • OpenAI
        • gpt-image-2
        • 图片生成 / gpt-image-1.5
          POST
        • 图片生成 / dall-e-3
          POST
        • 图片编辑 / edits接口
          POST
        • 图片变体生成
          POST
        • gpt-4-all(生成图片)
          POST
      • Google Gemini
        • OpenAI聊天格式
          • 图片生成(Nano-banana2)
          • 图片生成 / Imagen 4
        • Gemini原生格式
          • 图像生成
      • 豆包(Doubao)
        • 文生图(纯文本输入单图输出)
        • 图文生图(单图输入单图输出)
        • 多图融合(多图输入单图输出)
        • 组图输出(多图输出)
      • 阿里通义千问
        • 文生图-Z-Image
        • 文生图
        • 文生图V2版
        • 文生图V1版
    • 视频(Videos)
      • OpenAI兼容接口
        • Veo 视频生成(OpenAI 兼容格式)
        • 查询视频生成状态 Copy
        • luma
        • runway
      • Veo 3
        • Veo 视频生成
        • 查询视频生成状态
      • Sora-2
        • Sora-2(创建视频)
        • Sora2官方接口(Chat格式)
        • 查询视频(异步任务)
        • 获取视频内容
      • 阿里通义千问
        • 通义万相2.6(创建视频)
        • 查询视频(异步任务)
      • 豆包(Doubao)
        • 豆包-文生视频
        • 查询视频
      • 可灵AI(Kling)
        • 可灵AI-文生视频
        • 可灵AI-文生视频kling-video-o1
        • 可灵AI-图生视频
      • 即梦(Jimeng)
        • 即梦AI-文生视频S2.0Pro
    • 音频(Audio)
      • 原生OpenAI格式
        • 文本转语音 / TTS
        • 语音转文本 / whisper-1
        • 语音转文本 / gpt-4o-transcribe
        • 音频翻译
        • Audio接口 / 输出
        • Audio接口 / 输入
        • MiniMax语音合成TTS
        • 豆包语音2.0
      • 原生Gemini格式
    • 音乐(Music)
      • Suno
        • 生成歌曲
        • 生成歌词
        • 上传音乐
        • 歌曲拼接
        • 单个查询任务
        • 批量查询任务
      • Udio
        • Udio(Chat格式)
    • 嵌入(Embeddings)
      • 创建文本嵌入(OpenAI)
      • 批量创建嵌入(OpenAI)
      • 创建文本嵌入(Gemini)
    • 重排序 (Rerank)
      • Jina AI 重排序格式
      • Cohere 重排序格式
      • Xinference 重排序格式
    • 审查(Moderations)
      • 创建内容审核
  1. OpenAI

gpt-image-2

GPT Image 2 API 对接指南#

更新日期:2026-07-21
适用模型:gpt-image-2、固定快照 gpt-image-2-2026-04-21
适用接口:POST /v1/images/generations、POST /v1/images/edits
适用场景:OpenAI 官方 API,以及兼容 OpenAI Images API 的 new-api 网关
gpt-image-2 是 OpenAI 当前推荐的新建图片生成与编辑工作流默认模型,支持文本生成图片、单图或多图编辑、遮罩编辑、任意合规分辨率,以及 PNG、JPEG、WebP 输出。模型会自动以高保真方式处理输入参考图。
本文示例不包含真实密钥。调用前请将网关地址和令牌写入环境变量:
PowerShell:
$env:AI_BASE_URL = "https://your-new-api.example.com"
$env:AI_API_KEY = "sk-your-token"
如果直接调用 OpenAI 官方 API,将 AI_BASE_URL 设置为 https://api.openai.com,并使用 OpenAI API Key。

1. 接入前检查#

1.1 网关配置#

管理员需要先完成以下配置:
1.
创建或选择 OpenAI 类型渠道,上游地址配置正确。
2.
渠道模型列表包含 gpt-image-2;需要固定行为时,也可以加入 gpt-image-2-2026-04-21。
3.
如果外部模型名与上游模型名不同,配置模型映射。
4.
令牌所在分组可以访问该渠道和模型,并已配置正确的计费策略。
5.
上游 OpenAI 组织可能需要先完成 API Organization Verification。
不要通过 /v1/chat/completions 直接调用 gpt-image-2。单次生成或编辑应使用 Images API;需要多轮对话式改图时,使用 Responses API 的 image_generation 工具,详见第 8 节。

1.2 模型能力#

项目gpt-image-2 行为
输入文本;编辑接口还支持一张或多张图片
输出图片,Images API 响应中以 Base64 返回
生成接口POST /v1/images/generations
编辑接口POST /v1/images/edits
输出质量low、medium、high、auto
输出格式png、jpeg、webp
透明背景不支持;不要发送 background: "transparent"
输入保真度始终高保真;不要发送 input_fidelity
批量张数n 为 1~10,默认 1
提示词长度最长 32,000 字符
Images API 流式输出OpenAI 官方支持;当前仓库网关图片链路暂不建议开启,见第 7 节
模型别名可能随官方升级而变化。要求可复现时使用固定快照;希望自动获得当前版本改进时使用 gpt-image-2。

2. 文本生成图片#

2.1 最小请求#

Images API 不返回长期有效的图片 URL。gpt-image-2 的图片位于 data[].b64_json,应用需要解码并自行保存。
Linux/macOS:
PowerShell:
$response = Get-Content -Raw .\response.json | ConvertFrom-Json
[IO.File]::WriteAllBytes(
  (Join-Path $PWD "output.png"),
  [Convert]::FromBase64String($response.data[0].b64_json)
)

2.2 完整参数示例#

{
修改于 2026-07-21 03:22:26
上一页
生成视频(Video)接口
下一页
图片生成 / gpt-image-1.5
Built with