<!-- mobian-agent-page publisher="dailydev" canonical="https://daily.dev/posts/evaluating-llms-for-my-personal-use-case-4iopyant3" -->

---
title: Evaluating LLMs for my personal use case | daily.dev
description: A developer conducted a personal evaluation of 11 LLMs using 130 real prompts from their bash history, covering programming, sysadmin, technical explanations,...
canonical: https://daily.dev/posts/evaluating-llms-for-my-personal-use-case-4iopyant3
twitter:card: summary_large_image
twitter:site: @dailydotdev
og:type: website
og:site_name: daily.dev
og:title: Evaluating LLMs for my personal use case | daily.dev
og:description: A developer conducted a personal evaluation of 11 LLMs using 130 real prompts from their bash history, covering programming, sysadmin, technical explanations,...
og:url: https://daily.dev/posts/evaluating-llms-for-my-personal-use-case-4iopyant3
og:image: https://api.daily.dev/og/posts/4iOPyAnT3.png
og:image:alt: Evaluating LLMs for my personal use case
og:image:width: 1200
og:image:height: 630
og:locale: en
---

> ## Documentation Index
> Fetch the complete documentation index at: https://daily.dev/llms.txt
> Use this file to discover all available pages before exploring further.

# Evaluating LLMs for my personal use case

**[Hacker News](https://daily.dev/sources/hn)** · 11 min read · 1 upvotes · 0 comments

## Summary

A developer conducted a personal evaluation of 11 LLMs using 130 real prompts from their bash history, covering programming, sysadmin, technical explanations, and general knowledge tasks. The evaluation found that open models like DeepSeek and Qwen3 often outperformed expensive closed models like Claude Sonnet and Gemini Pro in terms of accuracy, cost, and speed. Key findings include that reasoning models rarely help for simple tasks, Gemini Flash is exceptionally fast, and closed models are overpriced. The author now uses multiple models simultaneously via tmux scripts for different use cases.

## Full article

daily.dev links to this article rather than hosting it. Read it at the original source: <https://darkcoding.net/software/personal-ai-evals-aug-2025/>

## Similar posts on daily.dev

- [Don’t just attend KubeCon \+ CloudNativeCon, Merge Forward your experience\!](https://daily.dev/posts/don-t-just-attend-kubecon-cloudnativecon-merge-forward-your-experience--l0rpp73x8) · CNCF · 1 upvotes · 0 comments
- [Announcing H2 2026 KCDs](https://daily.dev/posts/announcing-h2-2026-kcds-m96goajm1) · CNCF · 1 upvotes · 0 comments
- [Two months of Open Community Groups](https://daily.dev/posts/two-months-of-open-community-groups-asf52zhbs) · CNCF · 0 upvotes · 0 comments
- [CNCF Unveils Schedule for KubeCon \+ CloudNativeCon Europe 2026](https://daily.dev/posts/cncf-unveils-schedule-for-kubecon-cloudnativecon-europe-2026-ikhcoa5cb) · CNCF · 2 upvotes · 0 comments
- [CNCF Debuts KubeCon \+ CloudNativeCon Japan 2026 Schedule](https://daily.dev/posts/cncf-debuts-kubecon-cloudnativecon-japan-2026-schedule-xp5pyudub) · CNCF · 1 upvotes · 0 comments

---

Tags: [#llm](https://daily.dev/tags/llm), [#rust](https://daily.dev/tags/rust), [#deepseek](https://daily.dev/tags/deepseek)

[View this post on daily.dev](https://daily.dev/posts/evaluating-llms-for-my-personal-use-case-4iopyant3)

```json
{"@context":"https://schema.org","@graph":[{"@type":"Organization","@id":"https://daily.dev/#organization","name":"daily.dev","url":"https://daily.dev","logo":{"@type":"ImageObject","url":"https://daily.dev/apple-touch-icon.png","width":180,"height":180},"sameAs":["https://twitter.com/dailydotdev","https://github.com/dailydotdev","https://www.linkedin.com/company/daily-dev-ltd"]},{"@type":"WebSite","@id":"https://daily.dev/#website","url":"https://daily.dev","name":"daily.dev","publisher":{"@id":"https://daily.dev/#organization"},"potentialAction":{"@type":"SearchAction","target":{"@type":"EntryPoint","urlTemplate":"https://daily.dev/search?q={search_term_string}"},"query-input":"required name=search_term_string"}}]}
{"@context":"https://schema.org","@type":"TechArticle","headline":"Evaluating LLMs for my personal use case","url":"https://daily.dev/posts/evaluating-llms-for-my-personal-use-case-4iopyant3","mainEntityOfPage":{"@type":"WebPage","@id":"https://daily.dev/posts/evaluating-llms-for-my-personal-use-case-4iopyant3"},"datePublished":"2025-08-24T14:28:15.055Z","dateModified":"2025-08-24T14:28:47.153Z","description":"A developer conducted a personal evaluation of 11 LLMs using 130 real prompts from their bash history, covering programming, sysadmin, technical explanations,...","image":"https://media.daily.dev/image/upload/f_auto,q_auto/v1/posts/b006a2ec5164d39e690ce1739857d14d?_a=AQAEulh","thumbnailUrl":"https://media.daily.dev/image/upload/f_auto,q_auto/v1/posts/b006a2ec5164d39e690ce1739857d14d?_a=AQAEulh","isAccessibleForFree":true,"articleSection":"Hacker News","inLanguage":"en","publisher":{"@type":"Organization","name":"daily.dev","url":"https://daily.dev","logo":{"@type":"ImageObject","url":"https://daily.dev/apple-touch-icon.png","width":180,"height":180}},"author":{"@type":"Organization","name":"Hacker News","logo":"https://media.daily.dev/image/upload/t_logo,f_auto/v1/logos/hn","url":"https://daily.dev/sources/hn"},"commentCount":0,"discussionUrl":"https://daily.dev/posts/evaluating-llms-for-my-personal-use-case-4iopyant3","interactionStatistic":[{"@type":"InteractionCounter","interactionType":{"@type":"LikeAction"},"userInteractionCount":1},{"@type":"InteractionCounter","interactionType":{"@type":"CommentAction"},"userInteractionCount":0}],"keywords":"llm,rust,deepseek","timeRequired":"PT11M"}
{"@context":"https://schema.org","@type":"BreadcrumbList","itemListElement":[{"@type":"ListItem","position":1,"name":"Home","item":"https://daily.dev"},{"@type":"ListItem","position":2,"name":"Hacker News","item":"https://daily.dev/sources/hn"},{"@type":"ListItem","position":3,"name":"Evaluating LLMs for my personal use case"}]}
```

