ChatGPT kann jetzt sehen, hören und sprechen

OpenAI führt neue Sprach- und Bildfunktionen in ChatGPT ein, die es den Nutzern ermöglichen, Sprachgespräche zu führen und der KI Bilder zu zeigen. Diese Funktionen bieten intuitivere Möglichkeiten, mit ChatGPT in verschiedenen Szenarien zu interagieren, z. B. um Sehenswürdigkeiten zu besprechen, Mahlzeiten zu planen oder bei Matheaufgaben zu helfen. Sprachunterhaltungen können eingeleitet werden, indem die Funktion in den Einstellungen der mobilen App aktiviert wird und eine bevorzugte Stimme aus fünf Optionen ausgewählt wird. Die Sprachfunktion wird von einem Text-to-Speech-Modell und professionellen Sprechern unterstützt. Benutzer können auch ChatGPT-Bilder anzeigen und das Zeichenwerkzeug verwenden, um sich auf bestimmte Teile zu konzentrieren. Das Bildverständnis wird durch multimodale GPT-Modelle ermöglicht. OpenAI setzt diese Fähigkeiten schrittweise ein, um die Sicherheit zu gewährleisten und die Risikominderung zu verfeinern. Die Sprachtechnologie hat das Potenzial für kreative und barrierefreie Anwendungen, birgt aber auch Risiken, weshalb sie speziell für Voice-Chat eingesetzt wird. Auf dem Sehvermögen basierende Modelle sollen die Benutzer in ihrem täglichen Leben unterstützen und wurden in Zusammenarbeit mit Organisationen wie Be My Eyes entwickelt. OpenAI macht die Grenzen der Modelle deutlich und rät von bestimmten Anwendungsfällen ab. Plus- und Enterprise-Benutzer werden zunächst Zugang zu den Sprach- und Bildfunktionen haben, wobei geplant ist, den Zugang in Zukunft auf andere Benutzergruppen auszuweiten.

Ganzer Artikel

Einen Kommentar hinterlassen