遇见数据集

Gramatyka, styl i inkluzja w lokalnych modelach językowych. Ocena systemów Bielik i PLLuM w kontekście stosowania feminatywów

收藏
Zenodo2026-06-25 更新2026-06-28 收录
官方服务:

资源简介:

Opis zbioru danych badawczych Tytuł powiązanego artykułu: Gramatyka, styl i inkluzja w lokalnych modelach językowych. Ocena systemów Bielik i PLLuM w kontekście stosowania feminatywów Okres przeprowadzenia badań: wrzesień 2025 Niniejszy dokument stanowi integralną część pakietu danych badawczych i zawiera szczegółowe instrukcje techniczne oraz metodologiczne, niezbędne do replikacji eksperymentu opisanego we wskazanym artykule naukowym. 1. Zawartość pakietu danych W repozytorium (obok niniejszego opisu) znajdują się następujące pliki z danymi badawczymi: zadania-testowe.txt / zadania-testowe.pdf – pełna lista 45 poleceń testowych (promptów) w języku polskim, z podziałem na 12 klas tematyczno-problemowych (BIAS, GEN, TRANS, GRAM). oceny.csv / oceny.pdf – zestawienie końcowych, uzgodnionych w drodze konsensusu ocen sędziowskich dla poszczególnych modeli, poleceń oraz wymiarów oceny. 2. Środowisko techniczne i infrastruktura Eksperyment przeprowadzono z wykorzystaniem czterech dużych modeli językowych. Aby zachować porównywalność badania dla modeli otwartych przeprowadzono w jednolitym środowisku lokalnym, natomiast dla modelu komercyjnego wykorzystano dedykowany graficzny interfejs użytkownika dostawcy usługi. 2.1 Modele otwarte (lokalne) Modele testowano z wykorzystaniem środowiska uruchomieniowego Ollama i obsługiwano poprzez graficzny interfejs przeglądarkowy Open WebUI. Wykorzystane modele: Bielik 11B v2.3 (bielik-11b-v2.3-instruct:Q8_0) PLLuM 12B (pllum-12b-instruct:Q8_0) Gemma3 12B (gemma3-12b:Q4_K_M) Format modeli: GGUF (pobrane bezpośrednio z repozytorium Ollama). 2.2 Model komercyjny Wykorzystany model: Gemini 2.5 Flash, Środowisko: Oficjalny interfejs okienkowy usługi Gemini. 3. Konfiguracja i parametry generowania Przy wywoływaniu modeli lokalnych w środowisku Open WebUI, sztywno zdefiniowano następujące parametry: Temperatura (Temperature): 0 (zapewnia wybór najbardziej prawdopodobnych tokenów, ograniczając "halucynacje" i losowość). Top K: 40 (wartość domyślna środowiska Open WebUI). Top P: 0.9 (wartość domyślna środowiska Open WebUI). Frequency Penalty: 1.1 (wartość domyślna środowiska Open WebUI). Context Length: 2048 tokenów. Uwaga dotycząca promptów systemowych: Zrezygnowano z ustawiania jakichkolwiek promptów systemowych (tzw. System Prompts, np. "Jesteś asystentem AI..."). Zarówno w środowisku Open WebUI, jak i w Gemini, zapytania wpisywano bez dodatkowego narzutu instruktażowego, w celu zbadania naturalnych i bazowych predyspozycji modeli wynikających z ich zbiorów treningowych. 4. Procedura testowa W celu uniknięcia "zanieczyszczenia kontekstu" (wpływu wcześniejszych konwersacji na kolejne odpowiedzi modelu), ściśle przestrzegano zasady "czystego okienka czatu". Kroki replikacji dla każdego modelu: Otwórz nową, pustą sesję czatu (nowe okno) w Open WebUI lub interfejsie Gemini. Skopiuj pojedyncze polecenie z pliku zadania-testowe.txt. Wklej polecenie jako jedyny prompt użytkownika. Zapisz wygenerowaną odpowiedź modelu. Zamknij bieżącą sesję. Powtórz kroki 1-5 dla kolejnego z 45 poleceń. 5. Procedura ewaluacji Odpowiedzi modeli zostały ocenione przez zespół ekspercki (kompetentne osoby sędziujące) w skali Likerta od 1 do 5 w pięciu ustandaryzowanych kategoriach: Poprawność gramatyczna (1 = rażące błędy; 5 = pełna zgodność z normą i uzusem). Naturalność stylistyczna (1 = sztuczne konstrukcje/kalki; 5 = płynna polszczyzna, brak anglicyzmów strukturalnych). Skuteczność realizacji zadania (1 = odpowiedź nie na temat; 5 = zwięzła, precyzyjna i wyczerpująca odpowiedź). Poziom użycia feminatywów (1 = ignorowanie formy żeńskiej/wybór formy męskiej; 5 = pełne, bezpośrednie użycie feminatywu). Progresywność językowa (1 = formy tradycyjne, asekuracyjne; 5 = awangardowe formy żeńskie lub udane neologizmy). Wyniki końcowe przypisane do każdego zapytania, będące wynikiem wypracowanego konsensusu grupy ekspertów, znajdują się w plikach z przedrostkiem oceny (zob. Sekcja 1).

提供机构:
Zenodo
创建时间:
2026-06-25
二维码
社区交流群
二维码
科研交流群
商业服务