定向邀请使用:OpenAI Decisions API进入 Playground

DecisionsApi · 聚焦问题,从预设答案中做选择

OpenAI Decisions APILuna 模型评估指南

OpenAI Decisions API 使用 Luna 的能力回答你定义的问题,并从有限的预设答案中选择结果。官方公告介绍了文本或图片上下文,以及分类、请求路由和 Agent 决策等用途。在这里了解评估方法,再通过本站独立服务支持的模型测试实际工作流。

阅读 OpenAI 官方 DevDay 公告
明确预期答案使用同一组案例比较检查不确定的结果

本站输出格式示例

静态示意

客户消息

“我今天早上被重复扣款了,请尽快退回多扣的款项。”

一条消息 → 三项实用判断

Choice

账单问题

选择对应客服队列

是 / 否

96%

是否属于紧急请求

Score

2.8 / 3

在明确的 0–3 量表上判断紧急度

这是本站决策格式的静态示例。数值不是 Luna 的响应、实时调用结果或准确率基准。

01 / 动手测试

使用本站支持的模型建立基线

输入自己的文本,定义预期答案,并检查请求和响应。工作台实际调用模型选择器中的模型;此页面不提供 Luna 在线演示。

运行请求前,请确认所选模型及工作台当前的使用规则。

工作台

你想判断什么?

选择场景即可加载输入与规则,加载示例不消耗积分。

示例只会加载到当前草稿,不会保存配置或运行历史。

状态

输入所选模型需要、且所有问题共享的上下文。

文本

所有问题都会基于这份状态独立回答。

问题

为同一份状态定义最多 8 个类型化问题。

3 / 8

3. 运行判断

运行判断请求。

结果预览

Subject: Charged twice again!! Hi — this is the SECOND month in a row I've been billed twice for the Pro plan. I already emailed last month and nobody replied. I run my whole business on this. If it's not refunded today I'm cancelling and disputing the charge with my bank.

↓一段输入 → 多个结构化判断

点击“生成结构化决策”,查看带概率的类型化输出。

结果会以结构化格式返回,方便直接接入你的业务逻辑。

02 / 规划评估

把模型调研变成可重复的测试。

有效的比较需要固定任务、清晰标签和有代表性的输入。评估账号可以访问的不同模型时,应尽量保持这些标准一致。

01

收集真实输入

从业务流程中选择消息与记录,同时包含短请求、上下文缺失和边界模糊的案例。

state = ticket.text
02

定义正确答案

在比较模型响应之前,先写清允许的标签、每档评分的标准,或是与否各自代表什么。

questions = { intent, urgent }
03

逐项检查结果

用人工核对过的答案评估输出,记录每个模型的错误、响应时间和实际用量。

answer = result.answers.route
04

设定执行边界

上线前明确哪些结果可以直接触发动作,哪些需要补充信息或交给人工复核。

if result.urgent: escalate()

03 / 选择实用任务

评估产品本来就需要做出的判断

OpenAI 公告重点介绍了分类、请求路由和 Agent 下一步选择。可以从以下相关场景出发,为 OpenAI Decisions API Luna model 的评估准备实用测试集。

01

路由客户请求

定义账单、技术、账号和其他队列。加入同时涉及多个问题的消息,统计模型是否选中了预期队列。

02

选择 Agent 的下一步

比较查记录、调用工具、生成文本与人工复核几类动作,并加入信息不完整或缺少执行授权的案例。

03

核对主张与证据

把主张与来源段落配对,标记为支持、反驳或无法确定,避免将证据不足直接等同于主张错误。

04 / 确定输出形式

在本站测试三种决策输出

明确的输出形式更容易比较,也更容易接入代码。请选择当前模型支持的类型;OpenAI 模型具体的输出约定应以其官方文档为准。

Choice:选择一个明确标签

定义少量相互区分的选项,并说明它们的边界。案例可能无法归类时,保留其他或人工复核选项。

Score:使用清晰的评分尺度

逐档描述紧急度、相关性或完整性。按偏差等级检查结果,区分轻微分歧与可能影响业务的严重错误。

Noul:聚焦一个是非问题

写清是与否各自代表什么,再使用未参与调试的案例检查返回概率,最后选择适合业务的自动执行阈值。

从评估走向接入

查看本站的 API 接入方式

这段服务端示例调用本站 /v1/systemone 接口,使用 typesafe/jev-1.13 模型,展示 state、questions、认证与类型化答案的配合方式。接入 OpenAI 时,请从可访问模型的官方文档获取模型 ID 和请求格式。

阅读本站 API 文档
服务端 REST 请求
类型化决策答案
本站 API 密钥

POST /v1/systemone · 本站接口

JavaScript 示例 · typesafe/jev-1.13 · 非 Luna API 请求

POST /v1/systemone
const response = await fetch(
  "https://decisionapi.net/v1/systemone",
  {
    method: "POST",
    headers: {
      "Authorization": `Bearer ${DECISIONS_API_KEY}`,
      "Content-Type": "application/json"
    },
    body: JSON.stringify({
      model: "typesafe/jev-1.13",
      state: ticket,
      questions: { route: { type: "choice", criteria } }
    })
  }
);

05 / 了解服务

开始使用 Decisions API

赠送测试积分

注册后即可获得用于测试的赠送积分,创建账号、加载示例、检查预算,并运行你的第一组问题。

所有实时调用共用一个钱包

Playground、API 与评估工作流共用同一积分余额,购买的积分长期有效。

用量清晰可查

查看请求历史与积分变动,并用请求 ID 将 API 调用和用量记录对应起来。

本站独立服务套餐

以下套餐适用于本站服务及已支持的模型。请根据测试与接入需求选择;页面金额不是 OpenAI Luna 模型的官方价格。

购买本站套餐不会授予 OpenAI 模型访问权限。模型可用性、开放资格和价格请通过 OpenAI 官方文档及你的 OpenAI 账号确认。

重要说明:Decisions API 目前处于小范围测试阶段

Decisions API 尚未全面开放,目前仅提供小范围测试。我们会按照付款顺序逐步开放调用权限,并通过邮件通知。等待期间,你可以先使用 Jev AI 等其他 Decision API。

入门版

$10

适合验证一个真实工作流,从在线测试走到第一次 API 调用

  • 100,000 积分,长期有效
  • 1 个工作区
  • 3 并发
  • 正常速度
  • choice、score、noul 三类问题
  • 类型化决策输出
  • 概率与置信度结果
  • 在线测试台
  • API key 管理
  • 邮件支持
推荐

专业版

$100

适合将分类、路由和安全判断稳定接入线上产品

  • 1,000,000 积分,长期有效
  • 无限工作区
  • 10 并发
  • 快速通道
  • choice、score、noul 三类问题
  • 类型化决策输出
  • 一次请求并行提问
  • API 访问
  • 用量与调用记录
  • 优先支持

企业版

$1,000

适合多工作区、团队协作与定制化生产集成,额外赠送 10% 额度

  • 11,000,000 积分(含额外赠送 10%)
  • 包含专业版全部功能
  • 并发不限制
  • 独立快速通道
  • 团队工作区与协作
  • 定制集成支持
  • 安全与权限配置建议
  • 专属支持
  • 生产级优先处理
  • 产品路线反馈通道

用自己的数据比较

用实际结果筛选模型

先测试本站可用模型,再把同一套经过人工核对的测试集用于其他有权限访问的模型。分别记录决策质量、响应时间和实际成本,不要把不同提供商返回的概率值直接视为同一种指标。

已核对案例上的决策质量实测响应时间实际单次决策成本
查看可用模型对比

Jev

为分类、评分和是非判断任务建立基线

01

Laya

使用相同输入和判断标准比较结果

02

Kev、Solar 与 Span

加入其他可用模型,并检查各自支持的问题类型

03

OpenAI Decisions API Luna model 常见问题

了解已公布的能力、实用的比较步骤,以及适合当前工作流的接入方式。