<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Notebooks on Ye Joo Park's Blog</title><link>https://park.is/notebooks/</link><description>Recent content in Notebooks on Ye Joo Park's Blog</description><generator>Hugo</generator><language>en-US</language><lastBuildDate>Mon, 08 Sep 2025 00:00:00 +0000</lastBuildDate><atom:link href="https://park.is/notebooks/index.xml" rel="self" type="application/rss+xml"/><item><title>Using GPT to Generate Paper Feedback</title><link>https://park.is/notebooks/20250908_generate_paper_feedback_using_gpt/</link><pubDate>Mon, 08 Sep 2025 00:00:00 +0000</pubDate><guid>https://park.is/notebooks/20250908_generate_paper_feedback_using_gpt/</guid><description>&lt;div&#10; class="cell border-box-sizing text_cell rendered"&#10; id="cell-id=cec6d515-3cbc-4cf7-a028-dd970afe0740"&#10;&gt;&#10; &lt;div class="prompt input_prompt"&gt;&lt;/div&gt;&#10; &lt;div class="inner_cell"&gt;&#10; &lt;div class="text_cell_render border-box-sizing rendered_html"&gt;&#10; &lt;p&gt;&#10; In 2012, I graded hundreds of papers as a teaching assistant. This was a&#10; time-consuming and subjective process, and I often spent days grading&#10; just to meet deadlines.&#10; &lt;/p&gt;&#10; &lt;p&gt;&#10; Large language models (LLMs) like GPT-5 are transforming education,&#10; including the grading of written assignments. LLMs provide an efficient&#10; and scalable way to assess students' writing while also generating&#10; personalized feedback. However, my experience using LLMs for grading has&#10; been unreliable for the following reasons:&#10; &lt;/p&gt;</description></item><item><title>Analyzing College Town Landlords at UIUC, BYU, and PSU</title><link>https://park.is/notebooks/20250130_analysis_of_college_town_landlords/</link><pubDate>Thu, 30 Jan 2025 00:00:00 +0000</pubDate><guid>https://park.is/notebooks/20250130_analysis_of_college_town_landlords/</guid><description>&lt;div class="cell border-box-sizing text_cell rendered" id="cell-id=4161515d-2e69-4fe4-8d08-5be823210676"&gt;&lt;div class="prompt input_prompt"&gt;&#10;&lt;/div&gt;&lt;div class="inner_cell"&gt;&#10;&lt;div class="text_cell_render border-box-sizing rendered_html"&gt;&#10;&lt;h2 id="%E2%9C%A8-Background"&gt;✨ Background&lt;a class="anchor-link" href="#%E2%9C%A8-Background"&gt;¶&lt;/a&gt;&lt;/h2&gt;&lt;p&gt;I first moved into an apartment at UIUC during the summer of 2007. The apartment was Gregory Place under a management company called &lt;a href="https://jsmliving.com/"&gt;JSM&lt;/a&gt;. Here is a photo of the apartment from 2007. The construction site shows the second building being built.&lt;/p&gt;&#10;&lt;p&gt;&lt;img alt="Gregory Place 2007" src="https://github.com/user-attachments/assets/1ea504b8-5737-459d-96ac-1a8a49b49d5d"/&gt;&lt;/p&gt;&#10;&lt;p&gt;Back in 2007, JSM was regarded as one of the better management companies, along with Royse Brinkmeyer and Roland. Almost two decades later, JSM is still highly regraded. Prospective tenants lining up from the early morning in front of JSM's office to secure a lease was a sight to see in recent years.&lt;/p&gt;</description></item><item><title>Sentiment Analysis using spaCy and DistilBERT</title><link>https://park.is/notebooks/20250123_sentiment_analysis_with_spacy_and_distilbert/</link><pubDate>Thu, 23 Jan 2025 00:00:00 +0000</pubDate><guid>https://park.is/notebooks/20250123_sentiment_analysis_with_spacy_and_distilbert/</guid><description>&lt;div&#10; class="cell border-box-sizing text_cell rendered"&#10; id="cell-id=0d6e4426-8fbd-4434-a2cf-32e7f6116cc3"&#10;&gt;&#10; &lt;div class="prompt input_prompt"&gt;&lt;/div&gt;&#10; &lt;div class="inner_cell"&gt;&#10; &lt;div class="text_cell_render border-box-sizing rendered_html"&gt;&#10; &lt;p&gt;&#10; Natural language processing (NLP) aims to give computers the ability to&#10; understand, process, and even generate human language. This notebook&#10; introduces the common preprocessing steps and demonstrates how to use a&#10; widely used transformer model&#10; (&lt;code&gt;distilbert-base-uncased-finetuned-sst-2-english&lt;/code&gt;) to&#10; perfrom a sentiment analysis. 😀😦🙁&#10; &lt;/p&gt;&#10; &lt;/div&gt;&#10; &lt;/div&gt;&#10;&lt;/div&gt;&#10;&lt;div&#10; class="cell border-box-sizing code_cell rendered"&#10; id="cell-id=a31b7a34-007c-4e89-8916-a07406598896"&#10;&gt;&#10; &lt;div class="input"&gt;&#10; &lt;div class="prompt input_prompt"&gt;In [1]:&lt;/div&gt;&#10; &lt;div class="inner_cell"&gt;&#10; &lt;div class="input_area"&gt;&#10; &lt;div class="highlight hl-ipython3"&gt;&#10; &lt;pre&gt;&lt;span&gt;&lt;/span&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;pandas&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="nn"&gt;pd&lt;/span&gt;&#10;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;numpy&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="nn"&gt;np&lt;/span&gt;&#10;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;plotly.express&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="nn"&gt;px&lt;/span&gt;&#10;&lt;/pre&gt;&#10; &lt;/div&gt;&#10; &lt;/div&gt;&#10; &lt;/div&gt;&#10; &lt;/div&gt;&#10;&lt;/div&gt;&#10;&lt;div&#10; class="cell border-box-sizing code_cell rendered"&#10; id="cell-id=8d48c8d9-b347-4596-afe2-acbe54df942c"&#10;&gt;&#10; &lt;div class="input"&gt;&#10; &lt;div class="prompt input_prompt"&gt;In [2]:&lt;/div&gt;&#10; &lt;div class="inner_cell"&gt;&#10; &lt;div class="input_area"&gt;&#10; &lt;div class="highlight hl-ipython3"&gt;&#10; &lt;pre&gt;&lt;span&gt;&lt;/span&gt;&lt;span class="n"&gt;pd&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;set_option&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="s1"&gt;'display.max_columns'&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="mi"&gt;100&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&#10;&lt;/pre&gt;&#10; &lt;/div&gt;&#10; &lt;/div&gt;&#10; &lt;/div&gt;&#10; &lt;/div&gt;&#10;&lt;/div&gt;&#10;&lt;div&#10; class="cell border-box-sizing text_cell rendered"&#10; id="cell-id=fa8fe7ba-291c-4abc-b95a-f80f4d6bba1f"&#10;&gt;&#10; &lt;div class="prompt input_prompt"&gt;&lt;/div&gt;&#10; &lt;div class="inner_cell"&gt;&#10; &lt;div class="text_cell_render border-box-sizing rendered_html"&gt;&#10; &lt;h2 id="%F0%9F%97%83%EF%B8%8F-Load-data"&gt;&#10; 🗃️ Load data&lt;a&#10; class="anchor-link"&#10; href="#%F0%9F%97%83%EF%B8%8F-Load-data"&#10; &gt;¶&lt;/a&#10; &gt;&#10; &lt;/h2&gt;&#10; &lt;p&gt;&#10; This exercise uses a small dataset that contains reviews of two&#10; apartments at Indiana University Bloomington.&#10; &lt;/p&gt;</description></item><item><title>Evaluating LLMs' DataViz Code Generation and Refinement Capabilities</title><link>https://park.is/notebooks/evaluating-llms-dataviz-code-generation-and-refinement-capabilities/</link><pubDate>Sun, 29 Sep 2024 00:00:00 +0000</pubDate><guid>https://park.is/notebooks/evaluating-llms-dataviz-code-generation-and-refinement-capabilities/</guid><description>&lt;div class="cell border-box-sizing text_cell rendered"&gt;&lt;div class="prompt input_prompt"&gt;&#10;&lt;/div&gt;&lt;div class="inner_cell"&gt;&#10;&lt;div class="text_cell_render border-box-sizing rendered_html"&gt;&#10;&lt;p&gt;Refining a visual often involves getting rid of unnecessary elements and directing a viewer's attention to specific elements. The process to enhance clearity, readability, and effectiveness is a iterative process that requires constant self-evaluations. This process requires many hours, although the output may look simple.&lt;/p&gt;&#10;&lt;p&gt;Can Large Language Models (LLMs) be used as a tool for generating visuals? While LLMs excel at text-based tasks, their ability to understand and generate complex concepts can be leveraged to assist in writing code to create visuals. But can LLMs be used to &lt;em&gt;refine&lt;/em&gt; visuals? This post tests LLM's ability to refine Plotly visuals.&lt;/p&gt;</description></item><item><title>Benford's Law Application and Interpretation</title><link>https://park.is/notebooks/benfords-analysis/</link><pubDate>Sat, 10 Feb 2024 00:00:00 +0000</pubDate><guid>https://park.is/notebooks/benfords-analysis/</guid><description>&lt;div&#10; class="cell border-box-sizing text_cell rendered"&#10; id="cell-id=94818c56-0367-444d-bfc4-7d7d05296165"&#10;&gt;&#10; &lt;div class="prompt input_prompt"&gt;&lt;/div&gt;&#10; &lt;div class="inner_cell"&gt;&#10; &lt;div class="text_cell_render border-box-sizing rendered_html"&gt;&#10; &lt;p&gt;&#10; Benford's Law, also known as the Newcomb-Benford law or the first-digit&#10; law, is a surprising observation about the leading digits of numbers in&#10; real-world datasets. In many naturally occurring collections of data,&#10; smaller leading digits (like 1 and 2) are significantly more common than&#10; larger ones (like 8 and 9).&#10; &lt;/p&gt;&#10; &lt;ul&gt;&#10; &lt;li&gt;Financial records&lt;/li&gt;&#10; &lt;li&gt;Scientific measurements&lt;/li&gt;&#10; &lt;li&gt;Astronomical distances&lt;/li&gt;&#10; &lt;li&gt;Street addresses&lt;/li&gt;&#10; &lt;/ul&gt;&#10; &lt;h3 id="Why-does-this-happen?"&gt;&#10; Why does this happen?&lt;a&#10; class="anchor-link"&#10; href="#Why-does-this-happen?"&#10; &gt;¶&lt;/a&#10; &gt;&#10; &lt;/h3&gt;&#10; &lt;p&gt;&#10; Real-world data often involves growth, multiplication, and comparisons&#10; across different scales. This "scaling invariance" creates a natural&#10; bias towards smaller leading digits.&#10; &lt;/p&gt;</description></item><item><title>An In-depth Comparison of Pandas String dtypes</title><link>https://park.is/notebooks/comparing-pandas-string-dtypes/</link><pubDate>Sat, 27 May 2023 00:00:00 +0000</pubDate><guid>https://park.is/notebooks/comparing-pandas-string-dtypes/</guid><description>&lt;div class="cell border-box-sizing code_cell rendered"&gt;&#10;&lt;div class="input"&gt;&#10;&lt;div class="prompt input_prompt"&gt;In&amp;nbsp;[1]:&lt;/div&gt;&#10;&lt;div class="inner_cell"&gt;&#10; &lt;div class="input_area"&gt;&#10;&lt;div class=" highlight hl-ipython3"&gt;&lt;pre&gt;&lt;span&gt;&lt;/span&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;sys&lt;/span&gt;&#10;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;pandas&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="nn"&gt;pd&lt;/span&gt;&#10;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;numpy&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="nn"&gt;np&lt;/span&gt;&#10;&#10;&lt;span class="nb"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="s2"&gt;"python version &lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;sys&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;version_info&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;major&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s2"&gt;.&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;sys&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;version_info&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;minor&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s2"&gt;.&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;sys&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;version_info&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;micro&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&#10;&lt;span class="nb"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="s2"&gt;"pandas version &lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;pd&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;__version__&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&#10;&lt;span class="nb"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="s2"&gt;"numpy version &lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;np&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;__version__&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&#10;&lt;/pre&gt;&lt;/div&gt;&#10;&#10; &lt;/div&gt;&#10;&lt;/div&gt;&#10;&lt;/div&gt;&#10;&#10;&lt;div class="output_wrapper"&gt;&#10;&lt;div class="output"&gt;&#10;&#10;&#10;&lt;div class="output_area"&gt;&#10;&#10; &lt;div class="prompt"&gt;&lt;/div&gt;&#10;&#10;&#10;&lt;div class="output_subarea output_stream output_stdout output_text"&gt;&#10;&lt;pre&gt;python version 3.10.11&#10;pandas version 1.5.2&#10;numpy version 1.23.5&#10;&lt;/pre&gt;&#10;&lt;/div&gt;&#10;&lt;/div&gt;&#10;&#10;&lt;/div&gt;&#10;&lt;/div&gt;&#10;&#10;&lt;/div&gt;&#10;&lt;div class="cell border-box-sizing text_cell rendered"&gt;&lt;div class="prompt input_prompt"&gt;&#10;&lt;/div&gt;&lt;div class="inner_cell"&gt;&#10;&lt;div class="text_cell_render border-box-sizing rendered_html"&gt;&#10;&lt;p&gt;The default data type for strings in Pandas DataFrames is the &lt;code&gt;object&lt;/code&gt; type. However, &lt;a href="https://pandas.pydata.org/pandas-docs/stable/user_guide/text.html"&gt;pandas' documentation&lt;/a&gt; recommendeds explicitly using the &lt;code&gt;StringDtype&lt;/code&gt; for storing strings as it's more efficient and allows for more specific string operations.&lt;/p&gt;&#10;&lt;p&gt;&lt;code&gt;pd.StringDtype()&lt;/code&gt; is a dedicated data type for storing strings. It is an It allows for more specific string operations. &lt;code&gt;StringDtype&lt;/code&gt; is still considered experimental as of &lt;code&gt;pandas&lt;/code&gt; 2.0.1.&lt;/p&gt;</description></item><item><title>Retrieve tweets using Twitter API</title><link>https://park.is/notebooks/retrieve-tweets/</link><pubDate>Wed, 08 Feb 2023 00:00:00 +0000</pubDate><guid>https://park.is/notebooks/retrieve-tweets/</guid><description>&lt;div class="cell border-box-sizing text_cell rendered"&gt;&lt;div class="prompt input_prompt"&gt;&#10;&lt;/div&gt;&lt;div class="inner_cell"&gt;&#10;&lt;div class="text_cell_render border-box-sizing rendered_html"&gt;&#10;&lt;p&gt;A &lt;a href="https://developer.twitter.com/"&gt;Twitter Developer account&lt;/a&gt; is required to run this script.&lt;/p&gt;&#10;&#10;&lt;/div&gt;&#10;&lt;/div&gt;&#10;&lt;/div&gt;&#10;&lt;div class="cell border-box-sizing code_cell rendered"&gt;&#10;&lt;div class="input"&gt;&#10;&lt;div class="prompt input_prompt"&gt;In&amp;nbsp;[1]:&lt;/div&gt;&#10;&lt;div class="inner_cell"&gt;&#10; &lt;div class="input_area"&gt;&#10;&lt;div class=" highlight hl-ipython3"&gt;&lt;pre&gt;&lt;span&gt;&lt;/span&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;tweepy&lt;/span&gt;&#10;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;json&lt;/span&gt;&#10;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;pandas&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="nn"&gt;pd&lt;/span&gt;&#10;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;numpy&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="nn"&gt;np&lt;/span&gt;&#10;&lt;/pre&gt;&lt;/div&gt;&#10;&#10; &lt;/div&gt;&#10;&lt;/div&gt;&#10;&lt;/div&gt;&#10;&#10;&lt;/div&gt;&#10;&lt;div class="cell border-box-sizing code_cell rendered"&gt;&#10;&lt;div class="input"&gt;&#10;&lt;div class="prompt input_prompt"&gt;In&amp;nbsp;[2]:&lt;/div&gt;&#10;&lt;div class="inner_cell"&gt;&#10; &lt;div class="input_area"&gt;&#10;&lt;div class=" highlight hl-ipython3"&gt;&lt;pre&gt;&lt;span&gt;&lt;/span&gt;&lt;span class="n"&gt;pd&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;set_option&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="s1"&gt;'display.max_colwidth'&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="mi"&gt;150&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&#10;&lt;span class="n"&gt;pd&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;set_option&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="s1"&gt;'display.max_rows'&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="mi"&gt;20&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&#10;&lt;/pre&gt;&lt;/div&gt;&#10;&#10; &lt;/div&gt;&#10;&lt;/div&gt;&#10;&lt;/div&gt;&#10;&#10;&lt;/div&gt;&#10;&lt;div class="cell border-box-sizing text_cell rendered"&gt;&lt;div class="prompt input_prompt"&gt;&#10;&lt;/div&gt;&lt;div class="inner_cell"&gt;&#10;&lt;div class="text_cell_render border-box-sizing rendered_html"&gt;&#10;&lt;h2 id="Read-Twitter-API-credentials"&gt;Read Twitter API credentials&lt;a class="anchor-link" href="#Read-Twitter-API-credentials"&gt;&amp;#182;&lt;/a&gt;&lt;/h2&gt;&#10;&lt;/div&gt;&#10;&lt;/div&gt;&#10;&lt;/div&gt;&#10;&lt;div class="cell border-box-sizing text_cell rendered"&gt;&lt;div class="prompt input_prompt"&gt;&#10;&lt;/div&gt;&lt;div class="inner_cell"&gt;&#10;&lt;div class="text_cell_render border-box-sizing rendered_html"&gt;&#10;&lt;p&gt;Read Twitter API credentials from &lt;code&gt;twitter-credentials.json&lt;/code&gt;. The JSON file should contain the following key/values:&lt;/p&gt;&#10;&lt;div class="highlight"&gt;&lt;pre&gt;&lt;span&gt;&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&#10;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="nt"&gt;&amp;quot;consumer_key&amp;quot;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;&amp;quot;YOUR_CONSUMER_KEY&amp;quot;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&#10;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="nt"&gt;&amp;quot;consumer_secret&amp;quot;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;&amp;quot;YOUR_CONSUMER_SECRET&amp;quot;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&#10;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="nt"&gt;&amp;quot;access_token&amp;quot;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;&amp;quot;YOUR_ACCESS_TOKEN&amp;quot;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&#10;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="nt"&gt;&amp;quot;access_token_secret&amp;quot;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;&amp;quot;YOUR_ACCESS_TOKEN_SECRET&amp;quot;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&#10;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="nt"&gt;&amp;quot;bearer_token&amp;quot;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;&amp;quot;BEARER_TOKEN&amp;quot;&lt;/span&gt;&#10;&lt;span class="p"&gt;}&lt;/span&gt;&#10;&lt;/pre&gt;&lt;/div&gt;&#10;&lt;p&gt;Create the &lt;code&gt;twitter-credentials.json&lt;/code&gt; with your own keys and tokens in the same folder as this Jupyter notebook.&lt;/p&gt;</description></item><item><title>Cleaning Chicago Ridesharing Registered Vehicles Dataset</title><link>https://park.is/notebooks/cleaning-chicago-ridesharing-vehicles-dataset/</link><pubDate>Fri, 12 Mar 2021 00:00:00 +0000</pubDate><guid>https://park.is/notebooks/cleaning-chicago-ridesharing-vehicles-dataset/</guid><description>&lt;div class="cell border-box-sizing text_cell rendered"&gt;&lt;div class="prompt input_prompt"&gt;&#10;&lt;/div&gt;&lt;div class="inner_cell"&gt;&#10;&lt;div class="text_cell_render border-box-sizing rendered_html"&gt;&#10;&lt;p&gt;All vehicles 🚗 reported by Transportation Network Providers (sometimes called rideshare companies) to the City of Chicago as part of routine reporting required by ordinance. Inclusion of a vehicle in a monthly report indicates that the vehicle was eligible for trips in Chicago in that month for at least one day, regardless of whether it actually provided any rides. If a vehicle is eligible in multiple months, which is common, it will have records in each of these reporting months.&lt;/p&gt;</description></item><item><title>COVID-19 Exploratory Data Analysis</title><link>https://park.is/notebooks/covid-19-eda/</link><pubDate>Mon, 01 Jun 2020 00:00:00 +0000</pubDate><guid>https://park.is/notebooks/covid-19-eda/</guid><description>&lt;div class="cell border-box-sizing text_cell rendered"&gt;&lt;div class="prompt input_prompt"&gt;&#10;&lt;/div&gt;&lt;div class="inner_cell"&gt;&#10;&lt;div class="text_cell_render border-box-sizing rendered_html"&gt;&#10;&lt;p&gt;This is a notebook from the live coding session by &lt;a href="https://www.datacamp.com/instructors/hugobowne"&gt;Dr Hugo Bowne-Anderson&lt;/a&gt; on April 10, 2020 via DataCamp.&lt;/p&gt;&#10;&#10;&lt;/div&gt;&#10;&lt;/div&gt;&#10;&lt;/div&gt;&#10;&lt;div class="cell border-box-sizing text_cell rendered"&gt;&lt;div class="prompt input_prompt"&gt;&#10;&lt;/div&gt;&lt;div class="inner_cell"&gt;&#10;&lt;div class="text_cell_render border-box-sizing rendered_html"&gt;&#10;&lt;h3 id="Imports-and-data"&gt;Imports and data&lt;a class="anchor-link" href="#Imports-and-data"&gt;&amp;#182;&lt;/a&gt;&lt;/h3&gt;&#10;&lt;/div&gt;&#10;&lt;/div&gt;&#10;&lt;/div&gt;&#10;&lt;div class="cell border-box-sizing text_cell rendered"&gt;&lt;div class="prompt input_prompt"&gt;&#10;&lt;/div&gt;&lt;div class="inner_cell"&gt;&#10;&lt;div class="text_cell_render border-box-sizing rendered_html"&gt;&#10;&lt;p&gt;Let's import the necessary packages from the SciPy stack and get &lt;a href="https://github.com/CSSEGISandData/COVID-19"&gt;the data&lt;/a&gt;.&lt;/p&gt;&#10;&#10;&lt;/div&gt;&#10;&lt;/div&gt;&#10;&lt;/div&gt;&#10;&lt;div class="cell border-box-sizing code_cell rendered"&gt;&#10;&lt;div class="input"&gt;&#10;&lt;div class="prompt input_prompt"&gt;In&amp;nbsp;[1]:&lt;/div&gt;&#10;&lt;div class="inner_cell"&gt;&#10; &lt;div class="input_area"&gt;&#10;&lt;div class=" highlight hl-ipython3"&gt;&lt;pre&gt;&lt;span&gt;&lt;/span&gt;&lt;span class="c1"&gt;# Import packages&lt;/span&gt;&#10;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;numpy&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="nn"&gt;np&lt;/span&gt;&#10;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;pandas&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="nn"&gt;pd&lt;/span&gt;&#10;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;matplotlib.pyplot&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="nn"&gt;plt&lt;/span&gt;&#10;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;seaborn&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="nn"&gt;sns&lt;/span&gt;&#10;&lt;span class="c1"&gt;# Set style &amp;amp; figures inline&lt;/span&gt;&#10;&lt;span class="n"&gt;sns&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;set&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;&#10;&lt;span class="o"&gt;%&lt;/span&gt;&lt;span class="k"&gt;matplotlib&lt;/span&gt; inline&#10;&lt;/pre&gt;&lt;/div&gt;&#10;&#10; &lt;/div&gt;&#10;&lt;/div&gt;&#10;&lt;/div&gt;&#10;&#10;&lt;/div&gt;&#10;&lt;div class="cell border-box-sizing code_cell rendered"&gt;&#10;&lt;div class="input"&gt;&#10;&lt;div class="prompt input_prompt"&gt;In&amp;nbsp;[2]:&lt;/div&gt;&#10;&lt;div class="inner_cell"&gt;&#10; &lt;div class="input_area"&gt;&#10;&lt;div class=" highlight hl-ipython3"&gt;&lt;pre&gt;&lt;span&gt;&lt;/span&gt;&lt;span class="c1"&gt;# Data urls&lt;/span&gt;&#10;&lt;span class="n"&gt;base_url&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="s1"&gt;'https://raw.githubusercontent.com/CSSEGISandData/COVID-19/master/csse_covid_19_data/csse_covid_19_time_series/'&lt;/span&gt;&#10;&lt;span class="n"&gt;confirmed_cases_data_url&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;base_url&lt;/span&gt; &lt;span class="o"&gt;+&lt;/span&gt; &lt;span class="s1"&gt;'time_series_covid19_confirmed_global.csv'&lt;/span&gt;&#10;&lt;span class="n"&gt;death_cases_data_url&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;base_url&lt;/span&gt; &lt;span class="o"&gt;+&lt;/span&gt; &lt;span class="s1"&gt;'time_series_covid19_deaths_global.csv'&lt;/span&gt;&#10;&lt;span class="n"&gt;recovery_cases_data_url&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;base_url&lt;/span&gt;&lt;span class="o"&gt;+&lt;/span&gt; &lt;span class="s1"&gt;'time_series_covid19_recovered_global.csv'&lt;/span&gt;&#10;&lt;span class="c1"&gt;# Import datasets as pandas dataframes&lt;/span&gt;&#10;&lt;span class="n"&gt;raw_data_confirmed&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;pd&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;read_csv&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;confirmed_cases_data_url&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&#10;&lt;span class="n"&gt;raw_data_deaths&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;pd&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;read_csv&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;death_cases_data_url&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&#10;&lt;span class="n"&gt;raw_data_recovered&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;pd&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;read_csv&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;recovery_cases_data_url&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&#10;&lt;/pre&gt;&lt;/div&gt;&#10;&#10; &lt;/div&gt;&#10;&lt;/div&gt;&#10;&lt;/div&gt;&#10;&#10;&lt;/div&gt;&#10;&lt;div class="cell border-box-sizing text_cell rendered"&gt;&lt;div class="prompt input_prompt"&gt;&#10;&lt;/div&gt;&lt;div class="inner_cell"&gt;&#10;&lt;div class="text_cell_render border-box-sizing rendered_html"&gt;&#10;&lt;h3 id="Confirmed-cases-of-COVID-19"&gt;Confirmed cases of COVID-19&lt;a class="anchor-link" href="#Confirmed-cases-of-COVID-19"&gt;&amp;#182;&lt;/a&gt;&lt;/h3&gt;&#10;&lt;/div&gt;&#10;&lt;/div&gt;&#10;&lt;/div&gt;&#10;&lt;div class="cell border-box-sizing text_cell rendered"&gt;&lt;div class="prompt input_prompt"&gt;&#10;&lt;/div&gt;&lt;div class="inner_cell"&gt;&#10;&lt;div class="text_cell_render border-box-sizing rendered_html"&gt;&#10;&lt;p&gt;We'll first check out the confirmed cases data by looking at the head of the dataframe:&lt;/p&gt;</description></item></channel></rss>