<!-- mobian-agent-page publisher="dailydev" canonical="https://daily.dev/posts/snyk-vulnbench-js-1-0-llm-bug-repeatability-2fg3i1ojj" -->

---
title: Snyk VulnBench JS 1.0: LLM Bug Repeatability | daily.dev
description: Snyk ran 300 repeated vulnerability-finding scans across 10 JavaScript fixtures to measure how repeatable LLM-based security reviews are compared to...
canonical: https://daily.dev/posts/snyk-vulnbench-js-1-0-llm-bug-repeatability-2fg3i1ojj
twitter:card: summary_large_image
twitter:site: @dailydotdev
og:type: website
og:site_name: daily.dev
og:title: Snyk VulnBench JS 1.0: LLM Bug Repeatability | daily.dev
og:description: Snyk ran 300 repeated vulnerability-finding scans across 10 JavaScript fixtures to measure how repeatable LLM-based security reviews are compared to...
og:url: https://daily.dev/posts/snyk-vulnbench-js-1-0-llm-bug-repeatability-2fg3i1ojj
og:image: https://api.daily.dev/og/posts/2fG3I1ojJ.png
og:image:alt: Snyk VulnBench JS 1.0: LLM Bug Repeatability
og:image:width: 1200
og:image:height: 630
og:locale: en
---

> ## Documentation Index
> Fetch the complete documentation index at: https://daily.dev/llms.txt
> Use this file to discover all available pages before exploring further.

# Snyk VulnBench JS 1.0: LLM Bug Repeatability

**[Snyk](https://daily.dev/sources/snyk)** · 16 min read · 0 upvotes · 0 comments

## Summary

Snyk ran 300 repeated vulnerability-finding scans across 10 JavaScript fixtures to measure how repeatable LLM-based security reviews are compared to deterministic SAST. Key findings: LLM reference-matched findings were highly stable (85% consistent across all 5 runs), but extra LLM-only reports were highly inconsistent — nearly 50% appeared in only 1 of 5 identical runs. The best LLM configuration (Claude Opus 4.6 Medium) reached 75.4% F1 against Snyk Code's reference set, leaving a 24.6-point gap. More expensive models (Claude Opus 4.7 Max) cost 5.7x more but scored lower. LLMs excelled at high-signal exploit shapes (command injection, SQLi, SSRF) but missed systematic patterns like repeated path traversal sinks and resource-limit findings. The data supports combining LLM review with SAST rather than replacing one with the other.

## Full article

daily.dev links to this article rather than hosting it. Read it at the original source: <https://snyk.io/blog/snyk-vulnbench-js-1-0-llm-security-review-repeatability>

## Similar posts on daily.dev

- [LLM Security Automation Isn’t a Drop-In Scanner Yet](https://daily.dev/posts/llm-security-automation-isn-t-a-drop-in-scanner-yet-08iduwsiq) · Liran Tal · 0 upvotes · 0 comments
- [Benchmarking Secure-and-Functional Remediation and How Snyk Agent Fix Lifts Frontier-Model Fix Rates by over 14%](https://daily.dev/posts/benchmarking-secure-and-functional-remediation-and-how-snyk-agent-fix-lifts-frontier-model-fix-rates-mf6qp3xp5) · Snyk · 0 upvotes · 0 comments
- [Don't Let the AI Find Your Bugs. Let It Judge Them.](https://daily.dev/posts/don-t-let-the-ai-find-your-bugs-let-it-judge-them--fpqkjl4lo) · Awesome Java Newsletter · 2 upvotes · 1 comments

---

Tags: [#security](https://daily.dev/tags/security), [#llm](https://daily.dev/tags/llm), [#appsec](https://daily.dev/tags/appsec)

[View this post on daily.dev](https://daily.dev/posts/snyk-vulnbench-js-1-0-llm-bug-repeatability-2fg3i1ojj)

```json
{"@context":"https://schema.org","@graph":[{"@type":"Organization","@id":"https://daily.dev/#organization","name":"daily.dev","url":"https://daily.dev","logo":{"@type":"ImageObject","url":"https://daily.dev/apple-touch-icon.png","width":180,"height":180},"sameAs":["https://twitter.com/dailydotdev","https://github.com/dailydotdev","https://www.linkedin.com/company/daily-dev-ltd"]},{"@type":"WebSite","@id":"https://daily.dev/#website","url":"https://daily.dev","name":"daily.dev","publisher":{"@id":"https://daily.dev/#organization"},"potentialAction":{"@type":"SearchAction","target":{"@type":"EntryPoint","urlTemplate":"https://daily.dev/search?q={search_term_string}"},"query-input":"required name=search_term_string"}}]}
{"@context":"https://schema.org","@type":"TechArticle","headline":"Snyk VulnBench JS 1.0: LLM Bug Repeatability","url":"https://daily.dev/posts/snyk-vulnbench-js-1-0-llm-bug-repeatability-2fg3i1ojj","mainEntityOfPage":{"@type":"WebPage","@id":"https://daily.dev/posts/snyk-vulnbench-js-1-0-llm-bug-repeatability-2fg3i1ojj"},"datePublished":"2026-06-29T12:04:39.257Z","dateModified":"2026-06-29T12:05:03.596Z","description":"Snyk ran 300 repeated vulnerability-finding scans across 10 JavaScript fixtures to measure how repeatable LLM-based security reviews are compared to...","image":"https://media.daily.dev/image/upload/f_auto,q_auto/v1/posts/1fafe9cd32d8df3fd7e2194cf812149a?_a=AQAEuop","thumbnailUrl":"https://media.daily.dev/image/upload/f_auto,q_auto/v1/posts/1fafe9cd32d8df3fd7e2194cf812149a?_a=AQAEuop","isAccessibleForFree":true,"articleSection":"Snyk","inLanguage":"en","publisher":{"@type":"Organization","name":"daily.dev","url":"https://daily.dev","logo":{"@type":"ImageObject","url":"https://daily.dev/apple-touch-icon.png","width":180,"height":180}},"author":{"@type":"Organization","name":"Snyk","logo":"https://media.daily.dev/image/upload/t_logo,f_auto/v1/logos/8fb2a7b471c04bac9af29fbeb3ed1cf6","url":"https://daily.dev/sources/snyk"},"commentCount":0,"discussionUrl":"https://daily.dev/posts/snyk-vulnbench-js-1-0-llm-bug-repeatability-2fg3i1ojj","interactionStatistic":[{"@type":"InteractionCounter","interactionType":{"@type":"LikeAction"},"userInteractionCount":0},{"@type":"InteractionCounter","interactionType":{"@type":"CommentAction"},"userInteractionCount":0}],"keywords":"security,llm,appsec","timeRequired":"PT16M"}
{"@context":"https://schema.org","@type":"BreadcrumbList","itemListElement":[{"@type":"ListItem","position":1,"name":"Home","item":"https://daily.dev"},{"@type":"ListItem","position":2,"name":"Snyk","item":"https://daily.dev/sources/snyk"},{"@type":"ListItem","position":3,"name":"Snyk VulnBench JS 1.0: LLM Bug Repeatability"}]}
```

