Datasets:
audio
audio
| transcription
string
|
|---|---|
"Π΄ΠΆΠΎΠΉ ΠΈΡΡΠΎΡΠ½ΠΈΠΊΠΈ ΠΈΡΡΠΎΡΠΈΠΈ ΡΡΡΡΠΈΠΈ" |
|
"ΡΠ±Π΅Ρ ΠΊΠΎΠ³Π΄Π° Π½Π°ΡΠ°Π»ΡΡ ΠΌΠΎΡΠΊΠΎΠ²ΡΠΊΠ°Ρ ΠΏΠ°Π½ΠΈΠΊΠ° ΡΡΡΡΡΠ° Π΄Π΅Π²ΡΡΡΡΠΎΡ ΡΠΎΡΠΎΠΊ ΠΏΠ΅ΡΠ²ΠΎΠ³ΠΎ Π³ΠΎΠ΄Π°" |
|
"ΡΠΊΠΎΠ»ΡΠΊΠΎ Π΄Π΅Π½Π΅Π³ ΠΎΡΡΠ°Π»ΠΎΡΡ Π½Π° ΡΠ±Π΅ΡΠ±Π°Π½ΠΊΠ΅" |
|
"Π°ΡΠΈΠ½Π° Π²ΡΡΡΠ±ΠΈ ΠΎΡΠ²Π΅ΡΠ΅Π½ΠΈΠ΅" |
|
"ΡΠ±Π΅Ρ ΠΊΠ°ΠΊΠΎΠΉ ΡΠ΅Π³ΠΎΠ΄Π½Ρ Π΄Π΅Π½Ρ Π½Π΅Π΄Π΅Π»ΠΈ" |
|
"ΡΠ±Π΅Ρ Π·Π°ΠΊΠΈΠ½Ρ Π½Π° ΠΌΠΎΠ±ΠΈΠ»Ρ ΡΡΠΈ ΡΠΎΡΠΊΠΈ" |
|
"Π°ΡΠΈΠ½Π° ΠΎΠΊΡΡΠ±ΡΡΡΠΊΠ°Ρ ΡΠ΅Π²ΠΎΠ»ΡΡΠΈΡ Π² ΡΠ΅ΡΡΡ ΠΊΠΎΠ³ΠΎ Π½Π°Π·Π²Π°Π»ΠΈ" |
|
"Π°ΡΠΈΠ½Π° ΠΏΠΎΠΏΠΎΠ»Π½ΠΈ Π±Π°Π»Π°Π½Ρ ΠΌΠΎΠ΅Π³ΠΎ ΠΌΠΎΠ±ΠΈΠ»ΡΠ½ΠΎΠ³ΠΎ ΠΏΡΡΡΡΠΎΡ ΡΡΠ±Π»Π΅ΠΉ" |
|
"Π°Π»ΠΈΡΠ° Π½Π°ΠΉΠ΄ΠΈ ΡΠΈΠ»ΡΠΌ ΠΏΡΠΈΠ·ΡΠ°ΡΠ½ΡΠΉ Π³ΠΎΠ½ΡΠΈΠΊ Π΄Π²Π°" |
|
"Ρ ΠΊΠΎΠ³ΠΎ Π΅ΡΡΡ ΠΈΠ·ΠΎΠΏΡΠΎΠΏΠ°Π»ΠΎΠ½" |
|
"ΡΠ°Π»ΡΡ ΡΡΠ΅Π΄Π½ΡΡ ΠΏΡΠΎΠ΄ΠΎΠ»ΠΆΠΈΡΠ΅Π»ΡΠ½ΠΎΡΡΡ ΠΆΠΈΠ·Π½ΠΈ Π² Π½ΠΎΠ²ΠΎΠΉ Π·Π΅Π»Π°Π½Π΄ΠΈΠΈ" |
|
"Π°ΡΠΈΠ½Π° ΡΠΊΠΎΠ»ΡΠΊΠΎ Π²ΡΠ΅ΠΌΠ΅Π½ΠΈ ΡΠ΅ΠΉΡΠ°Ρ Π² Π΄ΡΠ±Π°Π΅" |
|
"Π΄ΠΆΠΎΠΉ ΠΌΠΎΠ³ΡΡ Π»ΠΈ ΡΠΎΡΠ΅Π΄ΠΈ Π²ΡΠ·Π²Π°ΡΡ ΠΏΠΎΠ»ΠΈΡΠΈΡ" |
|
"Π΄ΠΆΠΎΠΉ ΠΈΠ³ΡΠ°ΠΉ ΠΌΡΠ·ΡΠΊΡ Π² ΠΆΠ°Π½ΡΠ΅ ΠΏΠ°Π½ΠΊ ΡΠΎΠΊ" |
|
"ΡΠ±Π΅Ρ ΡΡΠΎ ΠΏΠΎΠ΄Π΄Π΅ΡΠΆΠΈΠ²Π°Π΅ΡΡΡ Π² Π³Π΅ΡΠΌΠΎΠΊΠ°Π±ΠΈΠ½Π°Ρ
ΠΏΡΠΈ ΠΏΠΎΠ»Π΅ΡΠ΅ Π½Π° Π±ΠΎΠ»ΡΡΠΈΡ
Π²ΡΡΠΎΡΠ°Ρ
" |
|
"ΡΠ±Π΅Ρ Π²ΠΊΠ»ΡΡΠΈΡΡ ΠΊΠ°Π½Π°Π» ΡΡΠ±Π»Ρ ΡΠ²" |
|
"ΡΠ±Π΅Ρ Π»Π΅ΠΎΠ½Π°ΡΠ΄ΠΎ Π΄ΠΈ ΠΊΠ°ΠΏΡΠΈΠΎ ΡΠΈΠ»ΡΠΌ ΠΎΡΠΊΠ°Ρ" |
|
"ΡΠ±Π΅Ρ ΠΌΠ½Π΅ Π½ΡΠΆΠ½Π° ΠΆΠ΅Π½ΡΠΊΠ°Ρ ΡΡΡΠΈΠΆΠΊΠ° Π² ΠΊΠ°ΠΊΠΎΠΌ Π½ΠΈΠ±ΡΠ΄Ρ Ρ
ΠΎΡΠΎΡΠ΅ΠΌ ΡΠ°Π»ΠΎΠ½Π΅ Π·Π°ΠΏΠΈΡΠΈ ΠΏΠΎΠΆΠ°Π»ΡΠΉΡΡΠ°" |
|
"Π΄ΠΆΠΎ Π²ΠΊΠ»ΡΡΠΈ ΠΆΠΎΠΆΠΎ ΡΠΎΠΊΠΊΠΈ" |
|
"ΠΊΡΠΎ Π²Π»Π°Π΄Π΅Π΅Ρ Π½ΠΎΠ²ΠΎΠ»ΠΈΠΏΠ΅ΡΠΊΠΈΠΌ ΠΌΠ΅ΡΠ°Π»Π»ΡΡΠ³ΠΈΡΠ΅ΡΠΊΠΈΠΌ ΠΊΠΎΠΌΠ±ΠΈΠ½Π°ΡΠΎΠΌ" |
|
"Ρ ΠΏΠΎΡΠ΅ΡΡΠ»Π° ΠΊΠ°ΡΡΡ ΡΠ±Π΅ΡΠ±Π°Π½ΠΊΠ°" |
|
"ΡΠ°Π»ΡΡ ΠΊΠ°ΠΊ Π½Π°Π·ΡΠ²Π°Π΅ΡΡΡ ΡΡΠΎΠ»ΠΈΡΠ° Π³Π΅ΡΠΌΠ°Π½ΠΈΠΈ" |
|
"ΡΠ°Π»ΡΡ Π²ΠΊΠ»ΡΡΠΈ ΠΌΡΠ·ΡΠΊΡ Π² ΠΆΠ°Π½ΡΠ΅ Π»Π°ΡΠ½Π΄ΠΆ" |
|
"ΠΊΠ°ΠΊΠΈΠ΅ Π²ΠΎΠΉΠ½Π° ΡΠ΅ΡΡΡ ΠΊΠΎΠ°Π»ΠΈΡΠΈΠΉ ΡΡ Π·Π½Π°Π΅ΡΡ" |
|
"ΡΠ°Π»ΡΡ Π±Π°Π·Π°ΡΠΎΠ² Π°Π»Π΅ΠΊΡΠ°Π½Π΄Ρ ΠΏΡΠ΅Ρ ΠΊΠΎΡΠ΅" |
|
"Π°ΡΠΈΠ½Π° ΠΏΠΎΡΠ΅ΠΌΡ Π½Π΅ΠΊΠΎΡΠΎΡΡΠ΅ Π»ΡΠ΄ΠΈ ΡΠΌΠΎΡΡΡΡ Π²Π²Π΅ΡΡ
ΠΊΠΎΠ³Π΄Π° ΠΏΡΡΠ°ΡΡΡΡ ΡΡΠΎ ΡΠΎ Π²ΡΠΏΠΎΠΌΠ½ΠΈΡΡ" |
|
"ΡΠ΅Π½ΡΡΠ°Π»ΠΈΠ·ΠΎΠ²Π°Π½Π½ΡΠΉ ΡΠΎΠ½Π΄" |
|
"ΡΠ°Π»ΡΡ ΠΊΠΎΠ³Π΄Π° Π±ΡΠ»Π° ΠΎΠ΄ΠΎΠΌΠ°ΡΠ½Π΅Π½Π° ΡΠΎΠ±Π°ΠΊΠ°" |
|
"Π΄ΠΆΠΎΠΉ Π΄Π°Π²Π°ΠΉ ΠΊΡΠΏΠΈΠΌ ΠΌΠ½Π΅ ΡΡΡΠΏΡΠΈΠ·" |
|
"Π΄ΠΆΠΎΠΉ Π²ΠΊΠ»ΡΡΠΈ Π±ΡΠ΄ΠΈΠ»ΡΠ½ΠΈΠΊ Π½Π° ΡΠ΅ΡΡΡ ΡΡΡΠ° Π½Π° Π±ΡΠ΄Π½ΠΈ" |
|
"Π²ΡΠ± ΡΠ°ΠΉΡ Π΅Π²ΡΠΎΠΏΠ΅ΠΉΡΠΊΠΈΠΉ ΡΠΎΠ²Π΅Ρ" |
|
"Π°ΡΠΈΠ½Π° ΠΏΠΎΡΠ΅ΠΌΡ ΠΊΠ»Π°ΡΡΠΈΡΠ΅ΡΠΊΠ°Ρ Π»ΠΈΡΠ΅ΡΠ°ΡΡΡΠ° ΡΠΆΠ΅ ΠΏΠΎΡΠ΅ΡΡΠ²ΡΠ°Ρ ΡΠ²ΠΎΡ Π°ΠΊΡΡΠ°Π»ΡΠ½ΠΎΡΡΡ" |
|
"Π΄ΠΆΠΎΠΉ Π²ΠΊΠ»ΡΡΠΈ ΠΏΠΎΠΆΠ°Π»ΡΠΉΡΡΠ° ΡΠΈΠ»ΡΠΌ ΠΆΠ΅Π»Π΅Π·Π½ΡΠΉ ΡΠ΅Π»ΠΎΠ²Π΅ΠΊ" |
|
"ΡΠ±Π΅Ρ ΠΏΠΎΡΠ΅ΠΌΡ Π½Π°Π»ΠΎΠΆΠ΅Π½ Π°ΡΠ΅ΡΡ Π½Π° ΠΌΠΎΠΉ ΡΡΠ΅Ρ" |
|
"Π΄ΠΆΠΎΠΉ ΠΊΠ°ΠΊ ΠΌΠ½Π΅ ΡΠ·Π½Π°ΡΡ Π±Π°Π»Π°Π½Ρ ΡΠΏΠ°ΡΠΈΠ±ΠΎ" |
|
"ΡΠ±Π΅Ρ Π½Π°ΠΉΠ΄ΠΈ ΡΠΈΠ»ΡΠΌ ΠΊΠ°Π²ΠΊΠ°Π·ΡΠΊΠ°Ρ ΠΏΠ»Π΅Π½Π½ΠΈΡΠ°" |
|
"ΠΊΠΎΠΌΠΈΡΡΠΈΡ Π·Π° ΡΠ½ΡΡΠΈΠ΅ ΠΊΠΎΠΌΠΈΡΡΠΈΠΈ ΡΠ΅ΡΠ΅Π· Π±Π°Π½ΠΊΠΎΠΌΠ°Ρ" |
|
"Π΄ΠΆΠΎΠΉ ΠΏΠ΅ΡΠ΅Π²Π΅Π΄ΠΈ ΡΡΠΈ ΡΡΡΡΡΠΈ ΠΌΠ°ΠΌΠ΅" |
|
"Π΄ΠΆΠΎΠΉ Π²ΠΊΠ»ΡΡΠ°ΠΉ Π΄ΠΆΠ°Π·" |
|
"Π΄ΠΆΠΎΠΉ ΡΠΏΠ°ΡΠΈΠ±ΠΎ ΠΏΠ°ΠΏΠ°" |
|
"Π°ΡΠΈΠ½Π° Π²ΠΊΠ»ΡΡΠΈ ΠΌΡΠ·ΡΠΊΡ Π² ΠΆΠ°Π½ΡΠ΅ Ρ
Π°ΡΡ" |
|
"ΡΠ±Π΅Ρ ΠΏΠΎΠΌΠΎΠ»ΡΠΈ ΠΏΠΎΠΆΠ°Π»ΡΠΉΡΡΠ° Π·Π°ΠΌΠΎΠ»ΡΠΈ Π²ΠΎΠΎΠ±ΡΠ΅" |
|
"ΡΠ°Π»ΡΡ ΡΠ»ΡΡΠ°ΠΉΠ½ΠΎ ΡΠΎΠΎΠ±ΡΠΈΠ»Π° ΠΌΠΎΡΠ΅Π½Π½ΠΈΠΊΡ Π»ΠΈΡΠ½ΡΠ΅ Π΄Π°Π½Π½ΡΠ΅ ΠΊΠ°ΠΊ Π΄Π΅ΠΉΡΡΠ²ΠΎΠ²Π°ΡΡ" |
|
"ΡΠ±Π΅Ρ ΡΡΠΈ ΠΏΡΠΎΡΠ΅Π½ΡΠ° ΠΎΡ Π΄Π²Π°Π΄ΡΠ°ΡΠΈ ΡΡΡΡΡ" |
|
"ΠΊΠ°ΠΊ Π½Π°ΡΠ°ΡΡ ΡΠ°Π±ΠΎΡΠ°ΡΡ Ρ Π²Π°Ρ" |
|
"Π΄ΠΆΠΎΠΉ ΠΏΠ΅ΡΠ΅ΡΠΈΡΠ»ΠΈ Π΄Π΅Π½ΡΠ³ΠΈ Π½Π° ΡΡΠ΅Ρ ΠΌΡΡ ΠΌΠ°ΠΌΠ° Π»Π΅ΡΠΈ" |
|
"ΡΠ±Π΅Ρ ΠΏΠ΅ΡΠ²Π°Ρ ΡΠΎΠ»Ρ Π² ΠΊΠΈΠ½ΠΎ Π΄ΠΆΠ°ΡΡΠΈΠ½Π° Π±ΠΈΠ±Π΅ΡΠ°" |
|
"ΠΊΠ°ΠΊ Π½Π°Π·ΡΠ²Π°Π΅ΡΡΡ Π²Π°Π»ΡΡΠ° Π² Π±ΡΡΡΠ½Π΄ΠΈΠΈ" |
|
"Π΄ΠΆΠΎΠΉ ΠΊΡΠΎ Π½ΠΈΠ±ΡΠ΄Ρ Π·Π½Π°Π΅Ρ ΠΏΡΠΎΠ³ΡΠ°ΠΌΠΌΡ ΡΡΠΎΠ±Ρ ΡΠ΄Π°Π»Π΅Π½Π½ΠΎ ΠΏΡΠΎΡΠΌΠ°ΡΡΠΈΠ²Π°ΡΡ ΡΠ°ΠΉΠ»Ρ" |
|
"ΠΏΠΎΡΡΠ°Π²Ρ Π±ΡΠ΄ΠΈΠ»ΡΠ½ΠΈΠΊ Π½Π° ΡΠ΅ΡΡΡ ΡΠ°ΡΠΎΠ² Π΄Π΅ΡΡΡΡ ΠΌΠΈΠ½ΡΡ" |
|
"Π΄ΠΆΠΎΠΉ ΠΊΠ°ΠΊ ΡΡΠΈΡΡΡΡ Π² ΡΠΊΠΎΠ»Π΅ Ρ
Π°ΡΠΈΡ" |
|
"Π°ΡΠΈΠ½Π° Ρ Ρ
ΠΎΡΡ Π·Π°ΠΊΡΡΡΡ ΠΊΠ°ΡΡΡ" |
|
"Π΄ΠΆΠΎΠΉ ΡΠΌΠΎΡΡΠ΅ΡΡ ΠΊΠ°Π½Π°Π» ΡΠΎΠ΄Π½ΠΎΠ΅ ΠΊΠΈΠ½ΠΎ" |
|
"ΡΠ°Π»ΡΡ ΠΊΠ°ΠΊΠ°Ρ ΡΡΠΎΠ»ΠΈΡΠ° ΡΠ°Π»ΡΠ²Π°Π΄ΠΎΡΠ°" |
|
"ΠΌΠ½Π΅ Π½Π°Π΄ΠΎ Π²ΡΡΠ°ΡΡ Π² ΡΠ΅ΡΡΡ ΡΡΡΠ°" |
|
"Π°ΡΠΈΠ½Π° ΡΠ΄Π΅Π»Π°ΠΉ ΠΌΠ΅Π½ΡΡΠ΅ Π·Π²ΡΠΊ" |
|
"ΡΠ±Π΅Ρ Π³Π΄Π΅ ΠΏΠΎΡΠΌΠΎΡΡΠ΅ΡΡ Π±ΠΎΠ½ΡΡΡ" |
|
"ΡΠ±Π΅Ρ ΡΡΠΎ ΠΏΠΎΠ²Π»ΠΈΡΠ»ΠΎ Π½Π° Π²ΡΠ±ΠΎΡ ΠΏΡΠΎΡΠ΅ΡΡΠΈΠΈ ΠΊΠ°Π·ΠΈΠ½ΡΠ΅Π²Π°" |
|
"ΡΠ°Π»ΡΡ Π³Π΄Π΅ ΠΌΠΎΠΉ ΠΏΠ΅ΡΠ΅Π²ΠΎΠ΄ Π΄Π΅Π½Π΅Π³" |
|
"Π΄ΠΆΠΎΠΉ ΠΏΠΎΠΏΠΎΠ»Π½ΠΈ Π±Π°Π»Π°Π½Ρ ΠΌΠΎΠ΅Π³ΠΎ Π²ΡΠΎΡΠΎΠ³ΠΎ ΡΠ΅Π»Π΅ΡΠΎΠ½Π°" |
|
"ΡΠ±Π΅Ρ ΠΊ ΠΊΠ°ΠΊΠΎΠΌΡ ΡΠ΅ΡΡΠΈΡΠΎΡΠΈΠ°Π»ΡΠ½ΠΎΠΌΡ Π±Π°Π½ΠΊΡ ΠΎΡΠ½ΠΎΡΠΈΡΡΡ ΡΠ°ΡΠ°ΡΠΎΠ²" |
|
"ΡΠ±Π΅Ρ ΠΊΠΎΠ³Π΄Π° ΠΆΠ΅ ΠΏΡΠΈΠ΄ΡΡ Π΄Π΅Π½ΡΠ³ΠΈ" |
|
"Π΄ΠΆΠΎΠΉ ΡΡΠΎ ΡΡΠΎ ΡΠ°ΠΊΠΎΠ΅" |
|
"ΡΠ±Π΅Ρ Π² ΡΠΎΡΡΠ°Π² ΡΠ΅Π³ΠΎ Π²Ρ
ΠΎΠ΄ΠΈΡ Π΄Π°Π½ΠΈΡ Π²ΠΎ Π²ΡΠΎΡΠΎΠΉ ΠΌΠΈΡΠΎΠ²ΠΎΠΉ Π²ΠΎΠΉΠ½Π΅" |
|
"Π°ΡΠΈΠ½Π° ΠΏΠ΅ΡΠ΅ΠΌΠΎΡΠ°ΠΉ Π½Π° Π΄Π΅ΡΡΡΡ ΡΠ΅ΠΊΡΠ½Π΄ Π²ΠΏΠ΅ΡΠ΅Π΄" |
|
"ΡΠ°Π»ΡΡ ΠΊΠ°ΠΊΠ°Ρ Π»ΡΠ±ΠΈΠΌΠ°Ρ ΠΊΠ½ΠΈΠ³Π° Ρ Π»ΡΠ²Π° Ρ
Π°ΡΠΈΡΠ°" |
|
"ΡΠ±Π΅Ρ ΠΊΠ°ΠΊΠΈΠ΅ Π²ΠΈΠ΄Ρ Π·ΠΈΡ ΡΡΠΎ Π΄Π΅ΡΡΡΡ ΡΡ Π·Π½Π°Π΅ΡΡ" |
|
"ΠΌΠΈΠ½ΠΈ ΠΌΠΎΠΏΠ΅Π΄Ρ" |
|
"ΡΠ΄Π΅Π»Π°ΠΉ Π²ΡΠΏΠΈΡΠΊΡ Π·Π° ΠΌΠ°ΡΡ" |
|
"Π»ΡΠ±ΠΈΠΌΡΠ΅ ΠΏΠ΅ΡΠ½ΠΈ ΡΠ²Π΅ΡΠ»Π°Π½Ρ Π²Π°Π»Π΅ΡΡΠ΅Π²Π½Ρ" |
|
"ΡΠ°Π»ΡΡ ΠΊΠΎΠ³Π΄Π° ΠΌΡΡΠΎΠΌΠΎ ΡΡΠ·Π°Π½ΡΠΊΠΎΠ΅ ΠΊΠ½ΡΠΆΠ΅ΡΡΠ²ΠΎ ΠΏΡΠ΅ΠΊΡΠ°ΡΠΈΠ»ΠΎ ΡΠ²ΠΎΠ΅ ΡΡΡΠ΅ΡΡΠ²ΠΎΠ²Π°Π½ΠΈΠ΅" |
|
"Π΄ΠΆΠΎΠΉ ΠΏΠΎΠΊΠ°Π·Π°ΡΡ ΠΊΠ°Π½Π°Π» ΡΠ² ΡΡΠΈ" |
|
"Π΄ΠΆΠΎΠΉ ΡΡΠΎ ΡΠ°ΠΊΠΎΠ΅ ΠΏΠΎΡΡΠ°" |
|
"ΡΠ±Π΅Ρ ΠΌΠΎΠΆΠ½ΠΎ Π»ΠΈ Π·Π°Π²ΡΡΠ° Π·Π°ΠΏΠΈΡΠ°ΡΡΡΡ Π½Π° ΠΆΠ΅Π½ΡΠΊΡΡ ΡΡΡΠΈΠΆΠΊΡ Π² ΡΠ°Π»ΠΎΠ½ ΠΊΡΠ°ΡΠΎΡΡ" |
|
"Π΄ΠΆΠΎΠΉ ΠΏΠΎΠ»ΠΎΠΆΠΈ Π΄Π²Π΅ΡΡΠΈ ΡΡΠ±Π»Π΅ΠΉ Π½Π° ΠΌΠΎΠΉ Π½ΠΎΠΌΠ΅Ρ" |
|
"ΡΠ±Π΅Ρ ΠΊΠ°ΠΊΠΎΠ΅ Π±ΡΠ΄Π΅Ρ Π°ΡΠΌΠΎΡΡΠ΅ΡΠ½ΠΎΠ΅ Π΄Π°Π²Π»Π΅Π½ΠΈΠ΅ Π΄Π²Π°Π΄ΡΠ°ΡΡ ΠΏΡΡΠΎΠ³ΠΎ Π΄Π΅ΠΊΠ°Π±ΡΡ" |
|
"ΡΠ±Π΅Ρ ΠΊΠ°ΠΊΠΎΠΉ Π²Π°Π»ΡΡΠΎΠΉ ΡΠ°ΡΠΏΠ»Π°ΡΠΈΠ²Π°ΡΡΡΡ Π² Π·Π°ΠΌΠ±ΠΈΠΈ" |
|
"Π΄ΠΆΠΎΠΉ ΠΏΠΎΡΡΠ°Π²Ρ ΡΠ΅Π»Π΅Π²ΠΈΠ·ΠΈΠΎΠ½Π½ΡΠΉ ΠΊΠ°Π½Π°Π» ΠΏΡΡΠ½ΠΈΡΠ°" |
|
"ΡΠ±Π΅Ρ ΠΊΠ°ΠΊΠΈΠ΅ ΠΊΠΎΠΎΡΠ΄ΠΈΠ½Π°ΡΡ Ρ Π»ΠΎΠ½Π΄ΠΎΠ½ΡΠΊΠΎΠ³ΠΎ ΠΌΠ΅ΡΡΠΎΠΏΠΎΠ»ΠΈΡΠ΅Π½Π°" |
|
"Π°ΡΠΈΠ½Π° ΡΡΡΠ°Π½ΠΎΠ²ΠΈ Π±ΡΠ΄ΠΈΠ»ΡΠ½ΠΈΠΊ Π½Π° ΡΠ΅ΠΌΡ ΡΡΡΠ°" |
|
"ΡΠ±Π΅Ρ ΡΡΠΎ ΡΠ΅Π³ΠΎΠ΄Π½Ρ ΠΈΠ΄Π΅Ρ Π² ΠΊΠΈΠ½ΠΎΡΠ΅Π°ΡΡΠ΅" |
|
"Π΄ΠΆΠΎΠΉ ΠΊΠ°ΠΊΠ°Ρ ΠΌΡΠ·ΡΠΊΠ° Π½ΡΠ°Π²ΠΈΡΡΡ Π½Π°ΡΠ°Π»ΡΠ΅ Π²Π»Π°Π΄ΠΈΠΌΠΈΡΠΎΠ²Π½Π΅" |
|
"Π°ΡΠΈΠ½Π° ΠΊΠΎΠ³Π΄Π° ΠΌΠ½Π΅ Π·Π°Π±ΡΠ°ΡΡ ΠΊΠ°ΡΡΡ" |
|
"Π°ΡΠΈΠ½Π° Π²ΠΊΠ»ΡΡΠΈ Π΄ΠΆΠ΅ΠΊΠ° ΠΏΠΈΡΠ΅ΡΠ°" |
|
"Π΄ΠΆΠΎΠΉ ΠΎΡΠΌΠ΅Π½ΠΈ ΠΏΠΎΠΆΠ°Π»ΡΠΉΡΡΠ° ΠΌΠΎΡ Π·Π°ΠΏΠΈΡΡ Π½Π° ΡΠΏΠΈΠ»ΡΡΠΈΡ Π½Π° Π΄Π΅ΡΡΡΠΎΠ΅ Π°ΠΏΡΠ΅Π»Ρ" |
|
"ΡΠ±Π΅Ρ Π² ΠΊΠ°ΠΊΠΈΡ
ΠΈΡΡΠΎΡΠ½ΠΈΠΊΠ°Ρ
ΠΎΠΏΠΈΡΡΠ²Π°Π΅ΡΡΡ ΠΆΠΈΠ²ΠΎΠΏΠΈΡΡ" |
|
"Π΄ΠΆΠΎΠΉ ΠΌΠΎΠΆΠ½ΠΎ Π»ΠΈ ΠΈΠ·Π΄Π°ΡΡ ΠΊΠ½ΠΈΠ³Ρ Π±Π΅ΡΠΏΠ»Π°ΡΠ½ΠΎ" |
|
"ΡΠΈΠΏ Π΄Π²ΠΈΠ³Π°ΡΠ΅Π»Ρ Π³Π°Π· Π°Π°" |
|
"ΠΊΡΠΎ ΡΠ½ΡΠ» ΡΠΈΠ»ΡΠΌ Π»ΡΠ±ΠΎΠ²Ρ ΠΈ Π³ΠΎΠ»ΡΠ±ΠΈ" |
|
"ΡΠ°Π»ΡΡ Ρ
ΠΎΡΡ ΠΏΠΎΡΠΌΠΎΡΡΠ΅ΡΡ ΠΈΠ½ΡΠ΅ΡΠ΅ΡΠ½ΡΡ Π²Π΅ΡΠ΅Π»ΡΡ ΡΠΌΠ΅ΡΠ½ΡΡ ΠΊΠΎΠΌΠ΅Π΄ΠΈΡ ΠΏΡΡΠΌΠΎ ΡΠ΅ΠΉΡΠ°Ρ" |
|
"ΡΠ±Π΅Ρ ΠΏΠΎΡΠ»Π΅Π΄Π½ΠΈΠΉ ΡΠΈΠ»ΡΠΌ Ρ Π·Π΅Π»Π΅Π½ΡΠΊΠΈΠΌ" |
|
"ΡΠ°Π»ΡΡ Π½Π°ΠΉΠ΄ΠΈ ΠΌΡΠ·ΡΠΊΡ Π² ΠΆΠ°Π½ΡΠ΅ ΡΡΡΡΠΊΠΈΠΉ ΡΠ°Π½ΡΠΎΠ½" |
|
"Π³ΠΎΠ΄Ρ ΠΈΠ²Π°Π½ ΠΈΠ²Π°Π½ΠΎΠ²ΠΈΡ Π±ΡΠ» Π·Π°ΠΊΠ»ΡΡΠ΅Π½ ΠΏΠΎΠ΄ ΡΡΡΠ°ΠΆΡ Π² ΠΌΠΎΡΠΊΠ²Π΅" |
|
"ΠΊΠΎΡΠΎΡΡΠΉ ΡΠΎΠ±ΡΠ°Π» Π½Π°ΠΈΠ±ΠΎΠ»ΡΡΡΡ ΠΊΠ°ΡΡΡ ΡΡΠΎΠΉ Π·ΠΈΠΌΠΎΠΉ" |
|
"Π°ΡΠΈΠ½Π° ΠΎΡΠΈΠ³ΠΈΠ½Π°Π»ΡΠ½ΠΎΠ΅ Π½Π°Π·Π²Π°Π½ΠΈΠ΅ ΡΠ΅Π΄Π΅ΡΠ°ΡΠΈΠ²Π½Π°Ρ ΡΠ΅ΡΠΏΡΠ±Π»ΠΈΠΊΠ° Π½ΠΈΠ³Π΅ΡΠΈΡ" |
|
"ΡΠ°Π»ΡΡ ΠΊΠ°ΠΊΠΎΠΉ Π²Π°Π»ΡΡΠΎΠΉ ΠΏΠΎΠ»ΡΠ·ΡΡΡΡΡ ΡΡΡΠΈΡΡΡ Π² ΠΌΠΈΠ½ΡΠΊΠ΅" |
|
"ΠΏΠΎΠΌΠ΅Π½ΡΠΉ ΠΏΠΎΠΆΠ°Π»ΡΠΉΡΡΠ° ΠΌΠ΅ΡΡΠ°ΠΌΠΈ ΠΌΡΠ·ΡΠΊΡ Π² ΠΏΠ»Π΅ΠΉΠ»ΠΈΡΡΠ΅" |
|
"ΡΠ΅ΡΡΡΡΠΊΡΡΡΠΈΠ·Π°ΡΠΈΡ ΠΈ ΡΠΎΠΌΡ ΠΏΠΎΠ΄ΠΎΠ±Π½ΡΠ΅ Π²Π΅ΡΠΈ" |
|
"ΠΊΠ°ΠΊ Π²Ρ Π΄ΡΠΌΠ°Π΅ΡΠ΅ ΠΏΡΠΎΠ΄ΡΡΠ΅Ρ ΡΠΈΠ»ΡΠΌΠ° Π³ΠΎΠ³ΠΎΠ»Ρ ΠΈΠ·Π²Π΅ΡΡΠ½ΡΠΉ ΡΠ΅Π»ΠΎΠ²Π΅ΠΊ" |
|
"ΡΠ²Π΅Ρ Π² ΠΌΠ°ΡΡΠ΅ΡΡΠΊΠΎΠΉ" |
Dataset Card for sberdevices_golos_100h_farfield
Dataset Summary
Sberdevices Golos is a corpus of approximately 1200 hours of 16kHz Russian speech from crowd (reading speech) and farfield (communication with smart devices) domains, prepared by SberDevices Team (Alexander Denisenko, Angelina Kovalenko, Fedor Minkin, and Nikolay Karpov). The data is derived from the crowd-sourcing platform, and has been manually annotated. Authors divide all dataset into train and test subsets. The training subset includes approximately 1000 hours. For experiments with a limited number of records, authors identified training subsets of shorter length: 100 hours, 10 hours, 1 hour, 10 minutes. This dataset is a simpler version of the above mentioned Golos:
- it includes the farfield domain only (without any sound from the crowd domain);
- validation split is built on the 10-hour training subset;
- training split corresponds to the 100-hour training subset without sounds from the 10-hour training subset;
- test split is a full original test split.
Supported Tasks and Leaderboards
automatic-speech-recognition: The dataset can be used to train a model for Automatic Speech Recognition (ASR). The model is presented with an audio file and asked to transcribe the audio file to written text. The most common evaluation metric is the word error rate (WER). The task has an active Model Database leaderboard which can be found at https://huggingface.co/spaces/huggingface/hf-speech-bench. The leaderboard ranks models uploaded to the Hub based on their WER.
Languages
The audio is in Russian.
Dataset Structure
Data Instances
A typical data point comprises the audio data, usually called audio and its transcription, called transcription. Any additional information about the speaker and the passage which contains the transcription is not provided.
{'audio': {'path': None,
'array': array([ 1.22070312e-04, 1.22070312e-04, 9.15527344e-05, ...,
6.10351562e-05, 6.10351562e-05, 3.05175781e-05]), dtype=float64),
'sampling_rate': 16000},
'transcription': 'Π΄ΠΆΠΎΠΉ ΠΈΡΡΠΎΡΠ½ΠΈΠΊΠΈ ΠΈΡΡΠΎΡΠΈΠΈ ΡΡΡΡΠΈΠΈ'}
Data Fields
- audio: A dictionary containing the path to the downloaded audio file, the decoded audio array, and the sampling rate. Note that when accessing the audio column:
dataset[0]["audio"]the audio file is automatically decoded and resampled todataset.features["audio"].sampling_rate. Decoding and resampling of a large number of audio files might take a significant amount of time. Thus it is important to first query the sample index before the"audio"column, i.e.dataset[0]["audio"]should always be preferred overdataset["audio"][0]. - transcription: the transcription of the audio file.
Data Splits
This dataset is a simpler version of the original Golos:
- it includes the farfield domain only (without any sound from the crowd domain);
- validation split is built on the 10-hour training subset;
- training split corresponds to the 100-hour training subset without sounds from the 10-hour training subset;
- test split is a full original test split.
Train Validation Test examples 9570 933 1916 hours 10.3h 1.0h 1.4h
Dataset Creation
Curation Rationale
[Needs More Information]
Source Data
Initial Data Collection and Normalization
[Needs More Information]
Who are the source language producers?
[Needs More Information]
Annotations
Annotation process
All recorded audio files were manually annotated on the crowd-sourcing platform.
Who are the annotators?
[Needs More Information]
Personal and Sensitive Information
The dataset consists of people who have donated their voice. You agree to not attempt to determine the identity of speakers in this dataset.
Considerations for Using the Data
Social Impact of Dataset
[More Information Needed]
Discussion of Biases
[More Information Needed]
Other Known Limitations
[Needs More Information]
Additional Information
Dataset Curators
The dataset was initially created by Alexander Denisenko, Angelina Kovalenko, Fedor Minkin, and Nikolay Karpov.
Licensing Information
Public license with attribution and conditions reserved
Citation Information
@misc{karpov2021golos,
author = {Karpov, Nikolay and Denisenko, Alexander and Minkin, Fedor},
title = {Golos: Russian Dataset for Speech Research},
publisher = {arXiv},
year = {2021},
url = {https://arxiv.org/abs/2106.10161}
}
Contributions
Thanks to @bond005 for adding this dataset.
- Downloads last month
- 103
Models trained or fine-tuned on bond005/sberdevices_golos_100h_farfield