← артқа

Деректер мен лицензиялар

Data sources and licenses

Дауысты тану / Speech recognition

Модель: abilmansplus/whisper-turbo-ksc2 (MIT) — OpenAI Whisper large-v3-turbo (MIT) негізінде Қазақ тілінің сөйлеу корпусы 2 (KSC2) деректерімен қосымша оқытылған.

Дауыс синтезі / Speech synthesis

F5-TTS архитектурасы (код — MIT). Бастапқы салмақтар: OpenF5-TTS (Apache 2.0, ағылшын тілінде оқытылған), одан кейін KSC2 корпусымен қазақ тіліне бейімделген.

Ескерту: SWivid ұсынған дайын F5-TTS салмақтары CC-BY-NC лицензиясымен таралады — біз оларды қолданбаймыз, тек Apache 2.0 лицензиялы OpenF5-TTS салмақтарынан бастап оқыттық.

Дереккөз: KSC2

Kazakh Speech Corpus 2 — Назарбаев Университетінің ISSAI институты жасаған ашық корпус (Creative Commons Attribution 4.0 International). Осы жобадағы қазақ тілін тану да, дауыс синтезі де сол корпуссыз мүмкін болмас еді.

Our product uses ISSAI Kazakh Speech Corpus 2 (https://doi.org/10.48342/m90y-aj02), which is available under a Creative Commons Attribution 4.0 International License.

S. Mussakhojayeva, Y. Khassanov, H. A. Varol. «KSC2: An Industrial-Scale Open-Source Kazakh Speech Corpus». Interspeech, 2022. Y. Khassanov, S. Mussakhojayeva, A. Mirzakhmetov, A. Adiyev, M. Nurpeiissov, H. A. Varol. «A Crowdsourced Open-Source Kazakh Speech Corpus and Initial Speech Recognition Baseline». EACL, 2021. doi:10.18653/v1/2021.eacl-main.58

Дауыс тембрі / Voice

Томиристің дауысы ElevenLabs Voice Design арқылы мәтіндік сипаттамадан жасалған — нақты адамның дауысы клондалмаған.

Жауап мәтіні / Language model

DeepSeek API.

Бұл — сынақ нұсқасы (эксперимент). Жазбалар сақталмайды.