Data sources and licenses
Модель: abilmansplus/whisper-turbo-ksc2 (MIT) — OpenAI Whisper large-v3-turbo (MIT) негізінде Қазақ тілінің сөйлеу корпусы 2 (KSC2) деректерімен қосымша оқытылған.
F5-TTS архитектурасы (код — MIT). Бастапқы салмақтар: OpenF5-TTS (Apache 2.0, ағылшын тілінде оқытылған), одан кейін KSC2 корпусымен қазақ тіліне бейімделген.
Ескерту: SWivid ұсынған дайын F5-TTS салмақтары CC-BY-NC лицензиясымен таралады — біз оларды қолданбаймыз, тек Apache 2.0 лицензиялы OpenF5-TTS салмақтарынан бастап оқыттық.
Kazakh Speech Corpus 2 — Назарбаев Университетінің ISSAI институты жасаған ашық корпус (Creative Commons Attribution 4.0 International). Осы жобадағы қазақ тілін тану да, дауыс синтезі де сол корпуссыз мүмкін болмас еді.
Our product uses ISSAI Kazakh Speech Corpus 2 (https://doi.org/10.48342/m90y-aj02), which is available under a Creative Commons Attribution 4.0 International License.
S. Mussakhojayeva, Y. Khassanov, H. A. Varol. «KSC2: An Industrial-Scale Open-Source Kazakh Speech Corpus». Interspeech, 2022. Y. Khassanov, S. Mussakhojayeva, A. Mirzakhmetov, A. Adiyev, M. Nurpeiissov, H. A. Varol. «A Crowdsourced Open-Source Kazakh Speech Corpus and Initial Speech Recognition Baseline». EACL, 2021. doi:10.18653/v1/2021.eacl-main.58Томиристің дауысы ElevenLabs Voice Design арқылы мәтіндік сипаттамадан жасалған — нақты адамның дауысы клондалмаған.
DeepSeek API.
Бұл — сынақ нұсқасы (эксперимент). Жазбалар сақталмайды.