Информационни технологии · 10 клас · урок 5 от 8

Обработка на набор от данни със скриптов език

С помощта на скриптов език като Python можем бързо да обработим голям набор от данни. Вграденият модул csv чете файлове CSV, а библиотеката pandas зарежда данните в таблица (DataFrame) с read_csv. След това можем да филтрираме редове, да сортираме и да изчисляваме статистики като средна стойност (mean). Преди анализа данните се почистват: поправят се или се махат грешни, липсващи и повтарящи се записи.

Работен лист за печат

Какво да запомним

  • import csv: вграден модул за CSV файлове.
  • pandas.read_csv("data.csv") зарежда данните в DataFrame.
  • df["оценка"].mean() дава средната стойност на колоната.
  • df[df["оценка"] > 5] избира редовете с оценка над 5.
  • Почистване на данни: премахване на грешни, липсващи и повтарящи се записи.

Пример

df = pandas.read_csv("klas.csv"); print(df["оценка"].mean()) извежда средната оценка на класа.

Проверете се: 15 въпроса

Натиснете въпроса, за да видите верния отговор и обяснението.

  1. В Python с библиотеката pandas: какво прави df["оценка"].mean()?
    • Намира най-голямата оценка
    • Брои редовете
    • Сортира таблицата
    • Изчислява средната стойност на колоната „оценка“

    Отговор: Изчислява средната стойност на колоната „оценка“

    mean() връща средното аритметично на стойностите в колоната.

  2. Какво е „почистване на данни“?
    • Изтриване на целия набор
    • Форматиране на диска
    • Поправяне или премахване на грешни, липсващи и повтарящи се записи
    • Смяна на шрифта

    Отговор: Поправяне или премахване на грешни, липсващи и повтарящи се записи

    Грешните данни водят до грешни изводи, затова се почистват преди анализа.

  3. Кой вграден модул на Python служи за четене на CSV файлове?
    • math
    • random
    • turtle
    • csv

    Отговор: csv

    Модулът csv чете и записва CSV файлове; math е за математика, random за случайни числа, turtle за рисуване.

  4. Какво прави pandas.read_csv("data.csv")?
    • Зарежда данните от файла в таблица (DataFrame)
    • Изтрива файла
    • Създава празен файл
    • Изпраща файла по имейл

    Отговор: Зарежда данните от файла в таблица (DataFrame)

    DataFrame е таблична структура с редове и колони, с която се правят анализи.

  5. Как в pandas се избират редовете, в които оценката е над 5?
    • df["оценка" > 5]
    • df[df["оценка"] > 5]
    • df.mean() > 5
    • df.head(5)

    Отговор: df[df["оценка"] > 5]

    Вътрешният израз дава True/False за всеки ред, а df[...] оставя само редовете с True.

  6. Коя библиотека на Python често се използва за работа с таблични данни?
    • pandas
    • turtle
    • random
    • math

    Отговор: pandas

    pandas е създадена за четене, филтриране и анализ на таблици.

  7. Как се нарича таблицата с данни в pandas?
    • List
    • DataFrame
    • Tuple
    • String

    Отговор: DataFrame

    pandas зарежда таблицата в обект DataFrame.

  8. Как в Python се включва библиотеката pandas?
    • include pandas
    • use pandas
    • import pandas
    • load pandas

    Отговор: import pandas

    Библиотеки и модули се включват с ключовата дума import.

  9. Какво прави df.head() в pandas?
    • Изтрива първия ред
    • Сортира таблицата
    • Показва последния ред
    • Показва първите редове

    Отговор: Показва първите редове

    head() показва началото на таблицата, по подразбиране 5 реда.

  10. Какво дава df["оценка"].max()?
    • Най-голямата оценка
    • Най-малката оценка
    • Средната оценка
    • Броя на оценките

    Отговор: Най-голямата оценка

    max() връща най-голямата стойност в колоната.

  11. Какво прави df.sort_values("оценка")?
    • Изтрива колоната оценка
    • Сортира по колоната оценка
    • Събира оценките
    • Брои оценките

    Отговор: Сортира по колоната оценка

    sort_values подрежда редовете по стойностите на дадена колона.

  12. Кой израз дава броя на редовете в DataFrame df?
    • df.mean()
    • df.max()
    • len(df)
    • df.sum()

    Отговор: len(df)

    len(df) връща броя на записите (редовете).

  13. Какво прави df.dropna()?
    • Маха повтарящите се редове
    • Маха първия ред
    • Попълва празните с нули
    • Маха редове с липсващи данни

    Отговор: Маха редове с липсващи данни

    dropna() премахва редовете, в които има липсващи стойности.

  14. Кой метод премахва повтарящите се записи в pandas?
    • df.drop_duplicates()
    • df.dropna()
    • df.head()
    • df.mean()

    Отговор: df.drop_duplicates()

    drop_duplicates() оставя само по един екземпляр от еднаквите редове.

  15. Таблицата има колони „клас“ и „оценка“. Какво дава df.groupby("клас")["оценка"].mean()?
    • Общата средна оценка
    • Средна оценка по класове
    • Броя на класовете
    • Най-високата оценка

    Отговор: Средна оценка по класове

    groupby групира редовете по клас, а mean() смята средната оценка за всяка група.