Машинно самообучение: тренировъчен и тестов набор
Машинното самообучение (machine learning) е подход, при който компютърът сам открива закономерности от примерни данни, вместо всички правила да се програмират ръчно. Данните се разделят на тренировъчен набор, с който моделът се обучава, и тестов набор, с който проверяваме как се справя с примери, които не е виждал. Ако моделът запомни тренировъчните данни, но греши с нови, говорим за преобучение (overfitting). Качеството често се измерва с точност: дял на верните отговори при теста.
Какво да запомним
- Машинно обучение: компютърът открива закономерности от примери.
- Тренировъчен набор: за обучение; тестов набор: за проверка с нови данни.
- Преобучение (overfitting): моделът запомня примерите, но греши с нови.
- Точност = верни отговори / всички тестови примери.
- Едностранчиви данни водят до лоши резултати при различни случаи.
Пример
Модел е тестван с 200 снимки и е познал 180. Точността му е 180 / 200 = 0,9, тоест 90%.
Проверете се: 15 въпроса
Натиснете въпроса, за да видите верния отговор и обяснението.
Какво е машинно самообучение (machine learning)?
- Компютърът се учи сам да се включва
- Ръчно въвеждане на всички отговори
- Компютърът открива закономерности от примерни данни
- Копиране на файлове от интернет
Отговор: Компютърът открива закономерности от примерни данни
Правилата не се програмират едно по едно, а моделът ги извлича от много примери.
Защо данните се разделят на тренировъчен и тестов набор?
- За да се намали размерът на файла
- За да се ускори интернетът
- За да се изтрият грешните данни
- За да се провери моделът с данни, които не е виждал
Отговор: За да се провери моделът с данни, които не е виждал
Тестовият набор показва колко добре моделът се справя с нови примери.
Какво е преобучение (overfitting)?
- Моделът запомня тренировъчните данни, но греши с нови
- Моделът се обучава твърде кратко
- Моделът изтрива данните
- Моделът работи само без интернет
Отговор: Моделът запомня тренировъчните данни, но греши с нови
Такъв модел има отличен резултат на тренировъчния набор, но слаб на тестовия.
Модел е обучен само със снимки на кучета от една порода. Какъв е вероятният проблем?
- Ще работи по-бързо
- Ще разпознава всички животни
- Ще разпознава зле кучета от други породи
- Няма да има проблем
Отговор: Ще разпознава зле кучета от други породи
Тренировъчните данни не са представителни, затова моделът не обобщава добре.
Модел е тестван с 200 примера и е познал 180 от тях. Каква е точността му?
- 80%
- 18%
- 90%
- 180%
Отговор: 90%
Точността е 180 / 200 = 0,9, тоест 90%.
С кой набор от данни се обучава моделът?
- Тестовия
- Тренировъчния
- Празния
- Изтрития
Отговор: Тренировъчния набор
Тренировъчният набор е за обучение, а тестовият за проверка.
Кое е пример за машинно обучение в ежедневието?
- Калкулатор
- Препоръки за филми
- Обикновен часовник
- Хартиен речник
Отговор: Препоръки за филми
Платформите се учат от това, което гледаме, и предлагат подобни филми.
Какво показва точността на модела?
- Броя на примерите
- Скоростта на модела
- Размера на файла
- Дял на верните отговори
Отговор: Дял на верните отговори
Точност = верни отговори / всички тестови примери.
Как обикновено се разделят данните на тренировъчни и тестови?
- 80% и 20%
- 10% и 90%
- 50% и 0%
- 100% и 100%
Отговор: 80% и 20%
По-голямата част е за обучение, а по-малка част се пази за тест.
Модел познава 40 от 50 тестови примера. Каква е точността му?
- 80%
- 40%
- 90%
- 10%
Отговор: 80%
40 / 50 = 0,8, тоест 80%.
Как се нарича обучение с примери, които имат етикети (верни отговори)?
- Обучение без учител
- Обучение с учител
- Преобучение
- Тестване
Отговор: Обучение с учител
При обучение с учител всеки пример има известен верен отговор.
Модел има 99% точност с тренировъчните и 60% с тестовите данни. Какъв е проблемът?
- Липса на ток
- Твърде много тест
- Няма проблем
- Преобучение
Отговор: Преобучение
Моделът е запомнил примерите, но не обобщава за нови данни.
Кое помага да се намали преобучението?
- Същите данни отново
- По-малко примери
- Изтриване на теста
- Повече разнообразни данни
Отговор: Повече разнообразни данни
С повече и по-разнообразни примери моделът учи общи закономерности.
Тестовият набор има 400 примера, а точността е 75%. Колко са грешните отговори?
- 100
- 300
- 75
- 25
Отговор: 100
Верни са 75% от 400 = 300, грешни са 400 − 300 = 100.
Модел определя дали на снимката има котка или куче. Какъв тип задача е това?
- Регресия
- Класификация
- Сортиране
- Шифроване
Отговор: Класификация
Класификацията избира категория (клас), а регресията предсказва число.