A OpenAI apresentou o GPT‑Realtime‑2 e duas novas variantes de voz, disponíveis apenas via API
OpenAI expande as capacidades da API de voz
A empresa anunciou o lançamento de novos recursos para sua API, que permitirão aos desenvolvedores criar aplicativos de voz mais “vivos”: eles poderão conversar com os usuários, transcrever fala em texto e traduzir conversas em tempo real.
Novos modelos Realtime
Por meio da interface Realtime, agora estão disponíveis três modelos:
| Modelo | Propósito | Características principais |
|---|---|---|
| GPT‑Realtime‑2 | Interação de voz em tempo real | Análise de solicitações, chamada de ferramentas, processamento de correções e continuação suave do diálogo. Baseado na lógica GPT‑5, permitindo lidar com tarefas mais complexas comparado ao GPT‑Realtime‑1.5. |
| GPT‑Realtime‑Translate | Tradução em tempo real | Suporta 70+ idiomas de entrada e 13 idiomas de saída. Mantém o sentido mesmo com mudança de contexto, sotaques regionais ou terminologia especializada. |
| GPT‑Realtime‑Whisper | Transcrição de fala | Modelo em fluxo com baixa latência que converte áudio em texto quase instantaneamente. |
> “Nossos novos modelos traduzem áudio em tempo real a partir de uma conversa simples para interfaces de voz que realmente podem funcionar: ouvir, raciocinar, traduzir, transcrever e agir à medida que a conversa evolui”, disse a empresa.
Custos
Modelo | Preço
---|---
GPT‑Realtime‑2 | US$32 por 1 milhões de tokens de áudio de entrada, US$0.40 por 1 milhão de tokens em cache e US$64 por 1 milhão de tokens de áudio de saída
GPT‑Realtime‑Translate | US$0.034 por minuto
GPT‑Realtime‑Whisper | US$0.017 por minuto
Como experimentar
Os desenvolvedores podem testar os novos modelos na plataforma online OpenAI Playground e ver imediatamente como eles funcionam em tempo real.
Comentários (0)
Compartilhe sua opinião — por favor, seja educado e mantenha-se no tema.
Faça login para comentar