
Deepgram
31 de agosto de 2026
Investigador en Fundamentos de Voice AI
Pionera investigación en Modelos de Espacio Latente para revolucionar la tecnología de voz con IA. Únete a Deepgram, la plataforma líder en la economía emergente de Voice AI.
Comparte esta vacante
Esta vacante es para ti si:
eres investigador o investigadora en aprendizaje profundo con experiencia publicada en conferencias de élite, te fascinan los problemas fundamentales de audio y IA generativa, y quieres trabajar en la frontera de nuevos paradigmas (no solo escalar lo existente). Si dominás PyTorch, entendés compresión neural y modelos de flujo, y te sentís cómodo experimentando con herramientas de IA de vanguardia, este rol te permite contribuir a revolucionar cómo interactuamos con máquinas mediante voz.
Descripción del Puesto
Sobre esta oportunidad
Deepgram es la plataforma líder que impulsa la economía emergente de Voice AI, valorada en billones de dólares. Estamos buscando investigadores excepcionales para pionear el desarrollo de Modelos de Espacio Latente (LSMs), un enfoque completamente nuevo que resolver los desafíos fundamentales de datos, escala y costo en la construcción de IA de voz robusta y contextualizada.
Más de 200,000 desarrolladores y 1,300+ organizaciones crean soluciones impulsadas por Deepgram, incluyendo Twilio, Cloudflare, Vapi y Jack in the Box. Nuestros modelos de fundación nativos de voz se acceden mediante APIs en la nube o como software autohospedado, con precisión incomparable, baja latencia y eficiencia de costos. Hemos procesado más de 50,000 años de audio y transcrito más de 1 billón de palabras.
En Deepgram operamos con una mentalidad centrada en IA. Esperamos que cada miembro del equipo use activamente herramientas de IA avanzada, experimente constantemente e integre nuevas capacidades en su trabajo diario. Nos movemos al ritmo de la IA: los cambios son rápidos y tu trabajo evolucionará constantemente. Este rol requiere entusiasmo por experimentar, adaptarse, pensar rápidamente y aprender continuamente.
Perfil buscado
Buscamos investigadores profundamente comprometidos con resolver problemas fundamentales en IA de audio. Eres alguien que combina rigor científico con creatividad, capaz de trabajar en la frontera de lo que es posible. Debes tener experiencia sólida en aprendizaje profundo, procesamiento de audio y modelado generativo. Tu curiosidad te impulsa a explorar nuevos paradigmas que vayan más allá del enfoque tradicional de escalar conjuntamente modelos y datos.
Requisitos clave
- Expertise demostrada en redes neuronales profundas, transformers y modelos generativos
- Experiencia práctica en procesamiento y síntesis de audio o aprendizaje de representaciones
- Publicaciones de investigación en conferencias de alto nivel (ICML, NeurIPS, ICLR, INTERSPEECH, ICASSP, etc.) o track record equivalente
- Dominio de frameworks como PyTorch o TensorFlow
- Familiaridad con métodos de cuantización, compresión neural y modelos de flujo
- Capacidad de trabajar en problemas de escala: datasets masivos, computación distribuida, TPUs
- Pensamiento crítico, rigor metodológico y capacidad para comunicar hallazgos complejos claramente
- Mentalidad experimental y disposición para adoptar rápidamente nuevas herramientas y modelos de IA
- Habilidades sólidas en inglés para colaboración global y presentación de investigación
Áreas de investigación principales
- Códecs de audio neural de próxima generación: Desarrollar códecs que logren compresión extrema a baja tasa de bits con reconstrucción de alta fidelidad en un corpus de audio a escala mundial
- Modelos generativos direccionables: Pionear modelos que sinteticen toda la diversidad del habla humana—desde conversación casual hasta expresión altamente emocional, escenarios multihablante con ruido ambiental y superposición de habla
- Sistemas de embedding interpretables: Desarrollar sistemas que factorizen claramente el espacio latente del códec en dimensiones interpretables: hablante, contenido, estilo, ambiente y efectos de canal, permitiendo control preciso y amplificación masiva de datasets mediante "recombinación latente"
- Síntesis de datos sintéticos: Leveragear recombinación latente para generar datos de audio sintéticos a escala anteriormente imposible
Beneficios de la posición
- Acceso a infraestructura computacional de clase mundial para investigación de audio a escala
- Colaboración con un equipo de investigadores y engineers de élite enfocados en problemas fundamentales
- Libertad y apoyo para publicar investigación y presentar en conferencias de alto nivel
- Modelo de trabajo completamente remoto con flexibilidad horaria
- Ambiente de innovación acelerada donde el impacto de tu investigación se materializa rápidamente en productos reales
- Oportunidad de formar la futura de la interacción voz-humano
¿Por qué considerar esta empresa?
Deepgram es el referente global en IA de voz. Con inversión reciente de Series C liderada por inversores globales de élite y socios estratégicos, estamos en el epicentro de una economía de IA de voz que está apenas comenzando. No hay otra organización en el mundo que entienda la voz como lo hace Deepgram. Si buscas hacer investigación con propósito real y ver tu trabajo impactando a millones de usuarios, este es el lugar.
Rango salarial
No especificado por la empresa.
¿Te interesa? Aplica directamente desde el enlace de la vacante.
Vacante originalmente detectada en Jobicy. Descripción adaptada por el equipo de Vacantes Remotas.
