<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Pandas on Ye Joo Park's Blog</title><link>https://park.is/categories/pandas/</link><description>Recent content in Pandas on Ye Joo Park's Blog</description><generator>Hugo</generator><language>en-US</language><lastBuildDate>Sat, 10 Feb 2024 00:00:00 +0000</lastBuildDate><atom:link href="https://park.is/categories/pandas/index.xml" rel="self" type="application/rss+xml"/><item><title>Benford's Law Application and Interpretation</title><link>https://park.is/notebooks/benfords-analysis/</link><pubDate>Sat, 10 Feb 2024 00:00:00 +0000</pubDate><guid>https://park.is/notebooks/benfords-analysis/</guid><description>&lt;div&#10; class="cell border-box-sizing text_cell rendered"&#10; id="cell-id=94818c56-0367-444d-bfc4-7d7d05296165"&#10;&gt;&#10; &lt;div class="prompt input_prompt"&gt;&lt;/div&gt;&#10; &lt;div class="inner_cell"&gt;&#10; &lt;div class="text_cell_render border-box-sizing rendered_html"&gt;&#10; &lt;p&gt;&#10; Benford's Law, also known as the Newcomb-Benford law or the first-digit&#10; law, is a surprising observation about the leading digits of numbers in&#10; real-world datasets. In many naturally occurring collections of data,&#10; smaller leading digits (like 1 and 2) are significantly more common than&#10; larger ones (like 8 and 9).&#10; &lt;/p&gt;&#10; &lt;ul&gt;&#10; &lt;li&gt;Financial records&lt;/li&gt;&#10; &lt;li&gt;Scientific measurements&lt;/li&gt;&#10; &lt;li&gt;Astronomical distances&lt;/li&gt;&#10; &lt;li&gt;Street addresses&lt;/li&gt;&#10; &lt;/ul&gt;&#10; &lt;h3 id="Why-does-this-happen?"&gt;&#10; Why does this happen?&lt;a&#10; class="anchor-link"&#10; href="#Why-does-this-happen?"&#10; &gt;¶&lt;/a&#10; &gt;&#10; &lt;/h3&gt;&#10; &lt;p&gt;&#10; Real-world data often involves growth, multiplication, and comparisons&#10; across different scales. This "scaling invariance" creates a natural&#10; bias towards smaller leading digits.&#10; &lt;/p&gt;</description></item><item><title>An In-depth Comparison of Pandas String dtypes</title><link>https://park.is/notebooks/comparing-pandas-string-dtypes/</link><pubDate>Sat, 27 May 2023 00:00:00 +0000</pubDate><guid>https://park.is/notebooks/comparing-pandas-string-dtypes/</guid><description>&lt;div class="cell border-box-sizing code_cell rendered"&gt;&#10;&lt;div class="input"&gt;&#10;&lt;div class="prompt input_prompt"&gt;In&amp;nbsp;[1]:&lt;/div&gt;&#10;&lt;div class="inner_cell"&gt;&#10; &lt;div class="input_area"&gt;&#10;&lt;div class=" highlight hl-ipython3"&gt;&lt;pre&gt;&lt;span&gt;&lt;/span&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;sys&lt;/span&gt;&#10;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;pandas&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="nn"&gt;pd&lt;/span&gt;&#10;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;numpy&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="nn"&gt;np&lt;/span&gt;&#10;&#10;&lt;span class="nb"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="s2"&gt;"python version &lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;sys&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;version_info&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;major&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s2"&gt;.&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;sys&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;version_info&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;minor&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s2"&gt;.&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;sys&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;version_info&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;micro&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&#10;&lt;span class="nb"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="s2"&gt;"pandas version &lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;pd&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;__version__&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&#10;&lt;span class="nb"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="s2"&gt;"numpy version &lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;np&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;__version__&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&#10;&lt;/pre&gt;&lt;/div&gt;&#10;&#10; &lt;/div&gt;&#10;&lt;/div&gt;&#10;&lt;/div&gt;&#10;&#10;&lt;div class="output_wrapper"&gt;&#10;&lt;div class="output"&gt;&#10;&#10;&#10;&lt;div class="output_area"&gt;&#10;&#10; &lt;div class="prompt"&gt;&lt;/div&gt;&#10;&#10;&#10;&lt;div class="output_subarea output_stream output_stdout output_text"&gt;&#10;&lt;pre&gt;python version 3.10.11&#10;pandas version 1.5.2&#10;numpy version 1.23.5&#10;&lt;/pre&gt;&#10;&lt;/div&gt;&#10;&lt;/div&gt;&#10;&#10;&lt;/div&gt;&#10;&lt;/div&gt;&#10;&#10;&lt;/div&gt;&#10;&lt;div class="cell border-box-sizing text_cell rendered"&gt;&lt;div class="prompt input_prompt"&gt;&#10;&lt;/div&gt;&lt;div class="inner_cell"&gt;&#10;&lt;div class="text_cell_render border-box-sizing rendered_html"&gt;&#10;&lt;p&gt;The default data type for strings in Pandas DataFrames is the &lt;code&gt;object&lt;/code&gt; type. However, &lt;a href="https://pandas.pydata.org/pandas-docs/stable/user_guide/text.html"&gt;pandas' documentation&lt;/a&gt; recommendeds explicitly using the &lt;code&gt;StringDtype&lt;/code&gt; for storing strings as it's more efficient and allows for more specific string operations.&lt;/p&gt;&#10;&lt;p&gt;&lt;code&gt;pd.StringDtype()&lt;/code&gt; is a dedicated data type for storing strings. It is an It allows for more specific string operations. &lt;code&gt;StringDtype&lt;/code&gt; is still considered experimental as of &lt;code&gt;pandas&lt;/code&gt; 2.0.1.&lt;/p&gt;</description></item></channel></rss>