<?xml version="1.0" encoding="UTF-8"?>

<rss version="2.0" xmlns:dc="http://purl.org/dc/elements/1.1/" >

  <channel>
    <title><![CDATA[Комментарии / Профиль hashbash]]></title>
    <link>https://habr.com/ru/users/hashbash/comments/</link>
    <description><![CDATA[Хабр: комментарии пользователя hashbash]]></description>
    <language>ru</language>
    <managingEditor>editor@habr.com</managingEditor>
    <generator>habr.com</generator>
    <pubDate>Thu, 20 Aug 2026 16:30:44 GMT</pubDate>
    
    
      <image>
        <link>https://habr.com/ru/</link>
        <url>https://habrastorage.org/webt/ym/el/wk/ymelwk3zy1gawz4nkejl_-ammtc.png</url>
        <title>Хабр</title>
      </image>
    

    
      

      
        
  
    <item>
      <title>04.05.2022 15:40:56</title>
      <guid isPermaLink="true">https://habr.com/ru/news/664182/#comment_24318530</guid>
      <link>https://habr.com/ru/news/664182/#comment_24318530</link>
      <description><![CDATA[<p>Расходимся. Это снова только обещания, нигде такую ипотеку сегодня не оформить, даже если кто-то сильно захочет.</p><p></p>]]></description>
      <pubDate>Wed, 04 May 2022 15:40:56 GMT</pubDate>
      
    </item>
  

  
    <item>
      <title>27.04.2022 19:24:13</title>
      <guid isPermaLink="true">https://habr.com/ru/news/663326/#comment_24303306</guid>
      <link>https://habr.com/ru/news/663326/#comment_24303306</link>
      <description><![CDATA[<blockquote><p>19 тыс. сотрудников на общую суммы 5,9 млрд рублей</p></blockquote><p>Получается, что в Яндексе средний оклад - 310 тыс. рублей. Это сильно не сходится со статистикой хабра: </p><figure class="full-width "><img src="https://habrastorage.org/getpro/habr/upload_files/d68/d25/551/d68d255516821c94ad52d7721c33b69a.png" width="1568" height="626"><figcaption></figcaption></figure><p></p><p></p>]]></description>
      <pubDate>Wed, 27 Apr 2022 19:24:13 GMT</pubDate>
      
    </item>
  

  
    <item>
      <title>15.03.2022 19:13:19</title>
      <guid isPermaLink="true">https://habr.com/ru/news/655859/#comment_24169329</guid>
      <link>https://habr.com/ru/news/655859/#comment_24169329</link>
      <description><![CDATA[<p>и закроет их окончательно... </p>]]></description>
      <pubDate>Tue, 15 Mar 2022 19:13:19 GMT</pubDate>
      
    </item>
  

  
    <item>
      <title>25.02.2022 16:40:24</title>
      <guid isPermaLink="true">https://habr.com/ru/articles/653467/#comment_24113871</guid>
      <link>https://habr.com/ru/articles/653467/#comment_24113871</link>
      <description><![CDATA[<blockquote><p>В Интернете есть много мест, где эти вопросы можно обобсудить</p></blockquote><p>Приведите, пожалуйста, несколько примеров</p>]]></description>
      <pubDate>Fri, 25 Feb 2022 16:40:24 GMT</pubDate>
      
    </item>
  

  
    <item>
      <title>06.02.2022 19:18:59</title>
      <guid isPermaLink="true">https://habr.com/ru/articles/650007/#comment_24039175</guid>
      <link>https://habr.com/ru/articles/650007/#comment_24039175</link>
      <description><![CDATA[<p>Использую аналогичный подход, когда графы в постгресе. Только с 2-мя отличающимися нюансами, которые, возможно, вам будут полезны:</p><pre><code class="sql">WHERE g.node1 = sg.node2
AND not (g.node1 = ANY(sg.path)) -- тоже самое, но останавливаемся на первом вхождении
AND ((sg.depth = 1) 
     or (sg.depth &gt; 2 and sg.node1 &gt; g.node1)
    ) -- исключаем логические повторы
      -- актуально если 30 2 3 1003 и 30 3 2 1003 - одно и тоже
      -- оставляем только одну последовательность (30 2 3 1003)</code></pre>]]></description>
      <pubDate>Sun, 06 Feb 2022 19:18:59 GMT</pubDate>
      
    </item>
  

  
    <item>
      <title>20.01.2022 11:58:17</title>
      <guid isPermaLink="true">https://habr.com/ru/companies/tensor/articles/646439/#comment_23966235</guid>
      <link>https://habr.com/ru/companies/tensor/articles/646439/#comment_23966235</link>
      <description><![CDATA[<p>Нет, выполнение те же 3 секунды </p><pre><code>public&gt; select count(*) from (select clientid from tbl_fact
            where dt between '2021-01-01' and '2021-12-01' group by clientid) q
[2022-01-20 14:57:33] 1 row retrieved starting from 1 in 3 s 322 ms (execution: 3 s 302 ms, fetching: 20 ms)</code></pre>]]></description>
      <pubDate>Thu, 20 Jan 2022 11:58:17 GMT</pubDate>
      
    </item>
  

  
    <item>
      <title>20.01.2022 11:23:05</title>
      <guid isPermaLink="true">https://habr.com/ru/companies/tensor/articles/646439/#comment_23966009</guid>
      <link>https://habr.com/ru/companies/tensor/articles/646439/#comment_23966009</link>
      <description><![CDATA[<p>Не ломает</p><pre><code>create index tbl_fact_idx2 on tbl_fact(clientid, dt);
explain analyze
select count(*) from (select clientid from tbl_fact
where dt between '2021-01-01' and '2021-12-01' group by clientid) q;</code></pre><pre><code>Aggregate  (cost=641207.12..641207.13 rows=1 width=8) (actual time=5522.464..5522.466 rows=1 loops=1)
  -&gt;  Group  (cost=0.44..594183.54 rows=3761887 width=4) (actual time=55.265..5263.736 rows=4817602 loops=1)
        Group Key: tbl_fact.clientid
        -&gt;  Index Only Scan using tbl_fact_idx2 on tbl_fact  (cost=0.44..552706.71 rows=16590731 width=4) (actual time=0.095..3838.740 rows=16545711 loops=1)
              Index Cond: ((dt &gt;= '2021-01-01'::date) AND (dt &lt;= '2021-12-01'::date))
              Heap Fetches: 0
</code></pre>]]></description>
      <pubDate>Thu, 20 Jan 2022 11:23:05 GMT</pubDate>
      
    </item>
  

  
    <item>
      <title>20.01.2022 10:53:06</title>
      <guid isPermaLink="true">https://habr.com/ru/companies/tensor/articles/646439/#comment_23965811</guid>
      <link>https://habr.com/ru/companies/tensor/articles/646439/#comment_23965811</link>
      <description><![CDATA[<p>Тогда бы и первый стал бы работать быстрее при повторных запусках, а этого не происходит. Ну плюс план разный, первый seq скан, второй index scan only. + сортировка перед каунтом.</p>]]></description>
      <pubDate>Thu, 20 Jan 2022 10:53:06 GMT</pubDate>
      
    </item>
  

  
    <item>
      <title>20.01.2022 10:50:11</title>
      <guid isPermaLink="true">https://habr.com/ru/companies/tensor/articles/646439/#comment_23965789</guid>
      <link>https://habr.com/ru/companies/tensor/articles/646439/#comment_23965789</link>
      <description><![CDATA[<p>Второй не сортирует. По поводу даты, разумеется, или индекс по дате или составной с датой должен быть. При этом разница между этими индексами тоже будет сильной.</p>]]></description>
      <pubDate>Thu, 20 Jan 2022 10:50:11 GMT</pubDate>
      
    </item>
  

  
    <item>
      <title>20.01.2022 09:38:27</title>
      <guid isPermaLink="true">https://habr.com/ru/companies/tensor/articles/646439/#comment_23965265</guid>
      <link>https://habr.com/ru/companies/tensor/articles/646439/#comment_23965265</link>
      <description><![CDATA[<p>Хотел показать, что есть более простые варианты считать уников. В данном случае, вариант, в котором нет необходимости в сортировке значений. Для вашего распределения числа уникальных записей должно быть быстрее. </p>]]></description>
      <pubDate>Thu, 20 Jan 2022 09:38:27 GMT</pubDate>
      
    </item>
  

  
    <item>
      <title>19.01.2022 21:34:17</title>
      <guid isPermaLink="true">https://habr.com/ru/companies/tensor/articles/646439/#comment_23963439</guid>
      <link>https://habr.com/ru/companies/tensor/articles/646439/#comment_23963439</link>
      <description><![CDATA[<p>Мне кажется, вы слишком усложняете себе задачу, а потом ее зачем-то решаете...</p><pre><code>...
CREATE INDEX tbl_fact_idx ON tbl_fact (clientid);
vacuum analyze  tbl_fact;

-- 10 s 72 ms
public&gt; select count(distinct clientid) from tbl_fact
[2022-01-20 00:32:34] 1 row retrieved starting from 1 in 10 s 72 ms (execution: 10 s 31 ms, fetching: 41 ms)


--3 s 712 ms
public&gt; select count(*) from (select clientid from tbl_fact group by clientid) q
[2022-01-20 00:33:45] 1 row retrieved starting from 1 in 3 s 712 ms (execution: 3 s 672 ms, fetching: 40 ms)</code></pre>]]></description>
      <pubDate>Wed, 19 Jan 2022 21:34:17 GMT</pubDate>
      
    </item>
  

  
    <item>
      <title>01.04.2020 08:21:30</title>
      <guid isPermaLink="true">https://habr.com/ru/articles/490762/#comment_21448336</guid>
      <link>https://habr.com/ru/articles/490762/#comment_21448336</link>
      <description><![CDATA[1. Публично такие данные никто не поставляет, насколько мне известно, но могу поделиться своими, если в личке объясните зачем<br>
2. Не совсем понял вопрос. Как связан объем данных, который не помещается в память, и детектор переобучения?<br>
3. Не вариант, так как у меня всего одна нода с 16 гб памяти. Он возможно помог бы если был бы кластер. К тому же, catboost не умеет пока обучаться распределенно — все равно собирать все на одной ноде.]]></description>
      <pubDate>Wed, 01 Apr 2020 08:21:30 GMT</pubDate>
      
    </item>
  

  
    <item>
      <title>04.03.2020 10:55:06</title>
      <guid isPermaLink="true">https://habr.com/ru/articles/489510/#comment_21354358</guid>
      <link>https://habr.com/ru/articles/489510/#comment_21354358</link>
      <description><![CDATA[<a href="https://habr.com/ru/users/thegodfather/" class="user_link">TheGodfather</a> теперь оно умеет предсказывать, посмотрите <a href="https://habr.com/ru/post/490762/">следующий пост</a>]]></description>
      <pubDate>Wed, 04 Mar 2020 10:55:06 GMT</pubDate>
      
    </item>
  

  
    <item>
      <title>03.03.2020 14:13:29</title>
      <guid isPermaLink="true">https://habr.com/ru/articles/490762/#comment_21350528</guid>
      <link>https://habr.com/ru/articles/490762/#comment_21350528</link>
      <description><![CDATA[Обучение на истории без последнего месяца, метрики считаю только на последнем месяце. По поводу того, как оно будет себя вести на новых данных — логгирую все предикты, потом посмотрим, пока рано (этот функционал только вчера выкатил в прод).]]></description>
      <pubDate>Tue, 03 Mar 2020 14:13:29 GMT</pubDate>
      
    </item>
  

  
    <item>
      <title>28.02.2020 09:19:17</title>
      <guid isPermaLink="true">https://habr.com/ru/articles/489510/#comment_21333134</guid>
      <link>https://habr.com/ru/articles/489510/#comment_21333134</link>
      <description><![CDATA[Поправил на сайте и обновил первую картинку.]]></description>
      <pubDate>Fri, 28 Feb 2020 09:19:17 GMT</pubDate>
      
    </item>
  

  
    <item>
      <title>23.02.2020 21:20:07</title>
      <guid isPermaLink="true">https://habr.com/ru/articles/489510/#comment_21313942</guid>
      <link>https://habr.com/ru/articles/489510/#comment_21313942</link>
      <description><![CDATA[Мне кажется это единственный вариант. К тому же современный ml предлагает варианты, которые могут лучше чем «в среднем по больнице». <br>
Вы видите какой-либо другой?<br>
<br>
На secretflying (fly4free.com, vandrouki.ru и других, их много) — там вручную. Это как правило очень-очень горячие билеты (часто запрашивают их у агрегаторов) — и в кэше агрегаторов они будут почти с 100% вероятностью, а следовательно, они есть и здесь. Чтобы их уже сейчас мониторить вполне подойдет страница <a href="https://cheapster.travel/simple" rel="nofollow">Simple flights</a> с параметром Сортировка=Цена за км. (также скоро появится сортировка по «Отклонению от средней цены», чтобы можно было убрать дешевые, которые всегда дешевые)<br>
<br>]]></description>
      <pubDate>Sun, 23 Feb 2020 21:20:07 GMT</pubDate>
      
    </item>
  

  
    <item>
      <title>23.02.2020 20:22:05</title>
      <guid isPermaLink="true">https://habr.com/ru/articles/489510/#comment_21313818</guid>
      <link>https://habr.com/ru/articles/489510/#comment_21313818</link>
      <description><![CDATA[&gt;&gt; (читай «только на популярные направления») — это самая большая ложка дегтя. <br>
Все так. С оговоркой, что на непопулярные направления билеты все же чаще есть, но не на все даты (иногда незначительно малое кол-во дат). <br>
<br>
Эта проблема пока не решена. Сейчас у меня есть две идеи, как это можно сделать:<br>
<ul>
<li> Добавить кэш от еще нескольких агрегаторов (сейчас только один). Этот вариант понятно как реализовывать, но он все равно не решит проблему до конца, всегда будут оставаться «белые пятна»;</li>
<li> Предсказывать цены на билеты, если они сейчас отсутствуют в кэше для их использования в комбинаторе (для того, чтобы забить всю сетку origin/destination/date). Здесь у меня больше вопросов, чем ответов, но интуитивно кажется, что это единственный вариант.</li>
</ul><br>
<br>
Комментарии к заметкам:<br>
 — Там есть селектор «Корректировка фильтра по максимальной цене», поменяв значение можно добиться того, чтобы фильтр по максимальной цене оставался на заданном уровне. <br>
 — все так, как ни парадоксально<br>
 — Лимит только на схему — 50. Максимум значений может быть 200 (4 схемы для RT x 50), но намек понял :)]]></description>
      <pubDate>Sun, 23 Feb 2020 20:22:05 GMT</pubDate>
      
    </item>
  

  
    <item>
      <title>23.02.2020 09:49:41</title>
      <guid isPermaLink="true">https://habr.com/ru/articles/489510/#comment_21312240</guid>
      <link>https://habr.com/ru/articles/489510/#comment_21312240</link>
      <description><![CDATA[Да, такое может быть, к сожалению. Сейчас сетка (origin/destination/date) для США достаточно скудная — из-за отсутствия пользователей, которые запрашивают цены по этим направления.<br>
<br>
Это сайт про цены из кэша (skyscanner/jetradar). Почему приходится ограничиваться только им описано <a href="https://habr.com/ru/post/484222/#comment_21142350">в этой ветке.</a><br>
<br>
Если вам нужен только билет, где все переменные заранее определены (отправление/назначение/даты и к тому же без пересадок) — лучше сразу переходить на jetradar/skyscanner/kayak/expedia.<br>
<br>
Здесь я не ставлю перед собой задачу сделать копию таких гигантов, как <br>
jetradar/skyscanner/kayak/expedia. А <b>только</b> сделать тот функционал, которого там нет. <br>
<br>]]></description>
      <pubDate>Sun, 23 Feb 2020 09:49:41 GMT</pubDate>
      
    </item>
  

  
    <item>
      <title>23.02.2020 09:20:52</title>
      <guid isPermaLink="true">https://habr.com/ru/articles/489510/#comment_21312160</guid>
      <link>https://habr.com/ru/articles/489510/#comment_21312160</link>
      <description><![CDATA[Там автокомлит от skyscanner:<br>
<img src="https://habrastorage.org/webt/j-/vn/xt/j-vnxtxe3w_eru7exsz_xxfe2e0.png" alt="image"><br>
<br>
Если вы находитесь в Dusseldorf и видите NRN(Weeze) в списке — это из-за того, что при первом входе определяются 5 ближайших аэропортов в радиусе 300км, которые становятся значениями по умолчанию. Их можно ввести вручную, введенные значения сохранятся в куках для следующих визитов.]]></description>
      <pubDate>Sun, 23 Feb 2020 09:20:52 GMT</pubDate>
      
    </item>
  

  
    <item>
      <title>19.02.2020 14:10:28</title>
      <guid isPermaLink="true">https://habr.com/ru/companies/otus/articles/489062/#comment_21297818</guid>
      <link>https://habr.com/ru/companies/otus/articles/489062/#comment_21297818</link>
      <description><![CDATA[Было бы здорово увидеть сравнение с чем то похожим, например, с orc.]]></description>
      <pubDate>Wed, 19 Feb 2020 14:10:28 GMT</pubDate>
      
    </item>
  


      

      

    
  </channel>
</rss>
