Brisbane Library Checkout Data
收藏资源简介:
<em>This has been copied from the README.md file</em> bris-lib-checkout This provides tidied up data from the Brisbane library checkouts Retrieving and cleaning the data The script for retrieving and cleaning the data is made available in scrape-library.R. The data The data/ folder contains the tidy data The data-raw/ folder contains the raw data data/ This contains four tidied up dataframes: tidy-brisbane-library-checkout.csv metadata_branch.csv metadata_heading.csv metadata_item_type.csv tidy-brisbane-library-checkout.csv contains the following columns, with the metadata file metadata_heading containing the description of these columns. knitr::kable(readr::read_csv("data/metadata_heading.csv"))<br> #> Parsed with column specification:<br> #> cols(<br> #> heading = col_character(),<br> #> heading_explanation = col_character()<br> #> ) heading heading_explanation Title Title of Item Author Author of Item Call Number Call Number of Item Item id Unique Item Identifier Item Type Type of Item (see next column) Status Current Status of Item Language Published language of item (if not English) Age Suggested audience Checkout Library Checkout branch Date Checkout date We also added year, month, and day columns. The remaining data are all metadata files that contain meta information on the columns in the checkout data: library(tidyverse)<br> #> ── Attaching packages ────────────── tidyverse 1.2.1 ──<br> #> ✔ ggplot2 3.1.0 ✔ purrr 0.2.5 <br> #> ✔ tibble 1.4.99.9006 ✔ dplyr 0.7.8 <br> #> ✔ tidyr 0.8.2 ✔ stringr 1.3.1 <br> #> ✔ readr 1.3.0 ✔ forcats 0.3.0<br> #> ── Conflicts ───────────────── tidyverse_conflicts() ──<br> #> ✖ dplyr::filter() masks stats::filter()<br> #> ✖ dplyr::lag() masks stats::lag()<br> knitr::kable(readr::read_csv("data/metadata_branch.csv"))<br> #> Parsed with column specification:<br> #> cols(<br> #> branch_code = col_character(),<br> #> branch_heading = col_character()<br> #> ) branch_code branch_heading ANN Annerley ASH Ashgrove BNO Banyo BRR BrackenRidge BSQ Brisbane Square Library BUL Bulimba CDA Corinda CDE Chermside CNL Carindale CPL Coopers Plains CRA Carina EPK Everton Park FAI Fairfield GCY Garden City GNG Grange HAM Hamilton HPK Holland Park INA Inala IPY Indooroopilly MBG Mt. Coot-tha MIT Mitchelton MTG Mt. Gravatt MTO Mt. Ommaney NDH Nundah NFM New Farm SBK Sunnybank Hills SCR Stones Corner SGT Sandgate VAN Mobile Library TWG Toowong WND West End WYN Wynnum ZIL Zillmere knitr::kable(readr::read_csv("data/metadata_item_type.csv"))<br> #> Parsed with column specification:<br> #> cols(<br> #> item_type_code = col_character(),<br> #> item_type_explanation = col_character()<br> #> ) item_type_code item_type_explanation AD-FICTION Adult Fiction AD-MAGS Adult Magazines AD-PBK Adult Paperback BIOGRAPHY Biography BSQCDMUSIC Brisbane Square CD Music BSQCD-ROM Brisbane Square CD Rom BSQ-DVD Brisbane Square DVD CD-BOOK Compact Disc Book CD-MUSIC Compact Disc Music CD-ROM CD Rom DVD DVD DVD_R18+ DVD Restricted - 18+ FASTBACK Fastback GAYLESBIAN Gay and Lesbian Collection GRAPHICNOV Graphic Novel ILL InterLibrary Loan JU-FICTION Junior Fiction JU-MAGS Junior Magazines JU-PBK Junior Paperback KITS Kits LARGEPRINT Large Print LGPRINTMAG Large Print Magazine LITERACY Literacy LITERACYAV Literacy Audio Visual LOCSTUDIES Local Studies LOTE-BIO Languages Other than English Biography LOTE-BOOK Languages Other than English Book LOTE-CDMUS Languages Other than English CD Music LOTE-DVD Languages Other than English DVD LOTE-MAG Languages Other than English Magazine LOTE-TB Languages Other than English Taped Book MBG-DVD Mt Coot-tha Botanical Gardens DVD MBG-MAG Mt Coot-tha Botanical Gardens Magazine MBG-NF Mt Coot-tha Botanical Gardens Non Fiction MP3-BOOK MP3 Audio Book NONFIC-SET Non Fiction Set NONFICTION Non Fiction PICTURE-BK Picture Book PICTURE-NF Picture Book Non Fiction PLD-BOOK Public Libraries Division Book YA-FICTION Young Adult Fiction YA-MAGS Young Adult Magazine YA-PBK Young Adult Paperback Example usage Let’s explore the data bris_libs <- readr::read_csv("data/bris-lib-checkout.csv")<br> #> Parsed with column specification:<br> #> cols(<br> #> title = col_character(),<br> #> author = col_character(),<br> #> call_number = col_character(),<br> #> item_id = col_double(),<br> #> item_type = col_character(),<br> #> status = col_character(),<br> #> language = col_character(),<br> #> age = col_character(),<br> #> library = col_character(),<br> #> date = col_double(),<br> #> datetime = col_datetime(format = ""),<br> #> year = col_double(),<br> #> month = col_double(),<br> #> day = col_character()<br> #> )<br> #> Warning: 20 parsing failures.<br> #> row col expected actual file<br> #> 587795 item_id a double REFRESH 'data/bris-lib-checkout.csv'<br> #> 590579 item_id a double REFRESH 'data/bris-lib-checkout.csv'<br> #> 590597 item_id a double REFRESH 'data/bris-lib-checkout.csv'<br> #> 595774 item_id a double REFRESH 'data/bris-lib-checkout.csv'<br> #> 597567 item_id a double REFRESH 'data/bris-lib-checkout.csv'<br> #> ...... ....... ........ ....... ............................<br> #> See problems(...) for more details. We can count the number of titles, item types, suggested age, and the library given: library(dplyr)<br> count(bris_libs, title, sort = TRUE)<br> #> # A tibble: 121,046 x 2<br> #> title n<br> #> <chr> <int><br> #> 1 Australian house and garden 1469<br> #> 2 New scientist (Australasian ed.) 1380<br> #> 3 Australian home beautiful 1331<br> #> 4 Country style 1229<br> #> 5 The New idea 1186<br> #> 6 Hello 1133<br> #> 7 Woman's day 1096<br> #> 8 Country life 1056<br> #> 9 Better homes and gardens. (AU) 1041<br> #> 10 Yi Zhou Kan 884<br> #> # … with 121,036 more rows<br> count(bris_libs, item_type, sort = TRUE)<br> #> # A tibble: 69 x 2<br> #> item_type n<br> #> <chr> <int><br> #> 1 PICTURE-BK 121126<br> #> 2 DVD 98283<br> #> 3 AD-PBK 91671<br> #> 4 JU-PBK 88402<br> #> 5 NONFICTION 76168<br> #> 6 AD-MAGS 60516<br> #> 7 AD-FICTION 53090<br> #> 8 LARGEPRINT 19113<br> #> 9 JU-FICTION 17261<br> #> 10 LOTE-BOOK 12303<br> #> # … with 59 more rows<br> count(bris_libs, age, sort = TRUE)<br> #> # A tibble: 5 x 2<br> #> age n<br> #> <chr> <int><br> #> 1 ADULT 420287<br> #> 2 JUVENILE 283902<br> #> 3 YA 13715<br> #> 4 <NA> 147<br> #> 5 UNKNOWN 36<br> count(bris_libs, library, sort = TRUE)<br> #> # A tibble: 38 x 2<br> #> library n<br> #> <chr> <int><br> #> 1 SBK 49154<br> #> 2 BSQ 45968<br> #> 3 CNL 45642<br> #> 4 IPY 44569<br> #> 5 GCY 43090<br> #> 6 CDE 42775<br> #> 7 ASH 42086<br> #> 8 WYN 35124<br> #> 9 KEN 33947<br> #> 10 MTO 31201<br> #> # … with 28 more rows License This data is provided under a CC BY 4.0 license It has been downloaded from Brisbane library checkouts, and tidied up using the code in data-raw.
<em>本内容源自README.md文件</em> # bris-lib-checkout 本数据集包含经整理的布里斯班图书馆借阅数据。 ## 数据获取与清洗 数据获取与清洗的脚本已在`scrape-library.R`文件中公开。 ## 数据集结构 ### 目录说明 - `data/` 目录存储整理完成的数据集 - `data-raw/` 目录存储原始数据集 ### `data/` 目录内容 该目录包含四个经整理的数据框: 1. `tidy-brisbane-library-checkout.csv` 2. `metadata_branch.csv` 3. `metadata_heading.csv` 4. `metadata_item_type.csv` #### `tidy-brisbane-library-checkout.csv` 字段说明 该文件包含以下字段,各字段的详细说明详见元数据文件`metadata_heading.csv`: r knitr::kable(readr::read_csv("data/metadata_heading.csv")) #> 使用以下列规范解析: #> cols( #> heading = col_character(), #> heading_explanation = col_character() #> ) | heading | heading_explanation | |------------------|-----------------------------------| | Title | 馆藏资源标题 | | Author | 馆藏资源作者 | | Call Number | 馆藏资源索书号 | | Item id | 唯一项目标识符 | | Item Type | 馆藏资源类型(详见下一字段) | | Status | 馆藏资源当前状态 | | Language | 馆藏资源出版语言(非英语时填写) | | Age | 建议受众群体 | | Checkout Library | 借阅图书馆 | | Checkout branch | 借阅分馆 | | Date | 借阅日期 | 此外,数据集额外新增了年、月、日三列。 其余文件均为元数据文件,用于说明借阅数据中的各字段含义: #### `metadata_branch.csv` 分馆元数据 r knitr::kable(readr::read_csv("data/metadata_branch.csv")) #> 使用以下列规范解析: #> cols( #> branch_code = col_character(), #> branch_heading = col_character() #> ) | branch_code | branch_heading | |-------------|------------------------------| | ANN | 安纳利分馆 | | ASH | 阿什格罗夫分馆 | | BNO | 巴诺分馆 | | BRR | 布莱肯里奇分馆 | | BSQ | 布里斯班广场图书馆 | | BUL | 布林巴分馆 | | CDA | 科林达分馆 | | CDE | 彻姆赛德分馆 | | CNL | 卡林代尔分馆 | | CPL | 库珀斯普林斯分馆 | | CRA | 卡里纳分馆 | | EPK | 埃弗顿公园分馆 | | FAI | 费尔菲尔德分馆 | | GCY | 花园城分馆 | | GNG | 格兰奇分馆 | | HAM | 汉密尔顿分馆 | | HPK | 霍兰德公园分馆 | | INA | 伊纳拉分馆 | | IPY | 印多罗皮利分馆 | | MBG | 库塔山植物园分馆 | | MIT | 米切尔顿分馆 | | MTG | 格拉瓦特山分馆 | | MTO | 奥曼尼山分馆 | | NDH | 农达分馆 | | NFM | 纽法姆分馆 | | SBK | 森尼班克希尔斯分馆 | | SCR | 斯通斯角分馆 | | SGT | 桑德盖特分馆 | | VAN | 流动图书馆 | | TWG | 图翁格分馆 | | WND | 西区分馆 | | WYN | 怀诺纳分馆 | | ZIL | 齐尔米尔分馆 | #### `metadata_item_type.csv` 资源类型元数据 r knitr::kable(readr::read_csv("data/metadata_item_type.csv")) #> 使用以下列规范解析: #> cols( #> item_type_code = col_character(), #> item_type_explanation = col_character() #> ) | item_type_code | item_type_explanation | |------------------|-------------------------------------| | AD-FICTION | 成人小说 | | AD-MAGS | 成人期刊 | | AD-PBK | 成人平装书 | | BIOGRAPHY | 传记类图书 | | BSQCDMUSIC | 布里斯班广场图书馆CD音乐 | | BSQCD-ROM | 布里斯班广场图书馆CD-ROM | | BSQ-DVD | 布里斯班广场图书馆DVD | | CD-BOOK | CD有声书 | | CD-MUSIC | CD音乐 | | CD-ROM | CD-ROM | | DVD | DVD光盘 | | DVD_R18+ | 18+限制级DVD | | FASTBACK | 快装图书 | | GAYLESBIAN | 男女同性恋馆藏系列 | | GRAPHICNOV | 图像小说 | | ILL | 馆际互借 | | JU-FICTION | 青少年小说 | | JU-MAGS | 青少年期刊 | | JU-PBK | 青少年平装书 | | KITS | 套装资料 | | LARGEPRINT | 大字版图书 | | LGPRINTMAG | 大字版期刊 | | LITERACY | 扫盲教育资料 | | LITERACYAV | 扫盲视听资料 | | LOCSTUDIES | 本地研究资料 | | LOTE-BIO | 非英语语种传记图书 | | LOTE-BOOK | 非英语语种图书 | | LOTE-CDMUS | 非英语语种CD音乐 | | LOTE-DVD | 非英语语种DVD光盘 | | LOTE-MAG | 非英语语种期刊 | | LOTE-TB | 非英语语种磁带书 | | MBG-DVD | 库塔山植物园DVD | | MBG-MAG | 库塔山植物园期刊 | | MBG-NF | 库塔山植物园非虚构类图书 | | MP3-BOOK | MP3有声书 | | NONFIC-SET | 非虚构类套装图书 | | NONFICTION | 非虚构类图书 | | PICTURE-BK | 绘本图书 | | PICTURE-NF | 绘本类非虚构图书 | | PLD-BOOK | 公共图书馆事业部图书 | | YA-FICTION | 青年成人小说 | | YA-MAGS | 青年成人期刊 | | YA-PBK | 青年成人平装书 | ## 示例用法 ### 数据探索 我们可以通过以下方式读取并探索数据集: r bris_libs <- readr::read_csv("data/bris-lib-checkout.csv") #> 使用以下列规范解析: #> cols( #> title = col_character(), #> author = col_character(), #> call_number = col_character(), #> item_id = col_double(), #> item_type = col_character(), #> status = col_character(), #> language = col_character(), #> age = col_character(), #> library = col_character(), #> date = col_double(), #> datetime = col_datetime(format = ""), #> year = col_double(), #> month = col_double(), #> day = col_character() #> ) #> 警告:共20处解析失败 #> row col expected actual file #> 587795 item_id a double REFRESH 'data/bris-lib-checkout.csv' #> 590579 item_id a double REFRESH 'data/bris-lib-checkout.csv' #> 590597 item_id a double REFRESH 'data/bris-lib-checkout.csv' #> 595774 item_id a double REFRESH 'data/bris-lib-checkout.csv' #> 597567 item_id a double REFRESH 'data/bris-lib-checkout.csv' #> ...... ....... ........ ....... ............................ #> 可通过problems(...)函数查看更多详情 可统计各类别(标题、资源类型、建议受众、借阅图书馆)的数量: r count(bris_libs, title, sort = TRUE) #> # A tibble: 121,046 x 2 #> title n #> <chr> <int> #> 1 Australian house and garden 1469 #> 2 New scientist (Australasian ed.) 1380 #> 3 Australian home beautiful 1331 #> 4 Country style 1229 #> 5 The New idea 1186 #> 6 Hello 1133 #> 7 Woman's day 1096 #> 8 Country life 1056 #> 9 Better homes and gardens. (AU) 1041 #> 10 Yi Zhou Kan 884 #> # … with 121,036 more rows count(bris_libs, item_type, sort = TRUE) #> # A tibble: 69 x 2 #> item_type n #> <chr> <int> #> 1 PICTURE-BK 121126 #> 2 DVD 98283 #> 3 AD-PBK 91671 #> 4 JU-PBK 88402 #> 5 NONFICTION 76168 #> 6 AD-MAGS 60516 #> 7 AD-FICTION 53090 #> 8 LARGEPRINT 19113 #> 9 JU-FICTION 17261 #> 10 LOTE-BOOK 12303 #> # … with 59 more rows count(bris_libs, age, sort = TRUE) #> # A tibble: 5 x 2 #> age n #> <chr> <int> #> 1 ADULT 420287 #> 2 JUVENILE 283902 #> 3 YA 13715 #> 4 <NA> 147 #> 5 UNKNOWN 36 count(bris_libs, library, sort = TRUE) #> # A tibble: 38 x 2 #> library n #> <chr> <int> #> 1 SBK 49154 #> 2 BSQ 45968 #> 3 CNL 45642 #> 4 IPY 44569 #> 5 GCY 43090 #> 6 CDE 42775 #> 7 ASH 42086 #> 8 WYN 35124 #> 9 KEN 33947 #> 10 MTO 31201 #> # … with 28 more rows ## 许可协议 本数据集采用 **CC BY 4.0** 许可协议进行发布。 本数据源自布里斯班图书馆借阅记录,并通过`data-raw/`目录下的代码完成整理。



