0a9ff16dfc
v3 rewrites the search engine from the ground up: - Intelligent pre-research: resolves X handles, GitHub repos, subreddits, TikTok hashtags, and YouTube channels before searching - GitHub person-mode: PR velocity, top repos by stars, release notes - GitHub project-mode: live star counts, README, releases, top issues - ELI5 mode: plain language synthesis, no jargon - 13+ sources: Reddit, X, YouTube, TikTok, Instagram, HN, Polymarket, GitHub, Threads, Pinterest, Perplexity, Bluesky, Web - Free Reddit comments via public JSON (no API key needed) - Fun judge v2: humor scoring baked into narrative - Cookie consent before browser scanning - 10,000 free ScrapeCreators calls - 1,012 tests Thank you to the community contributors whose issues and PRs shaped v3: @uppinote20 (#143), @zerone0x (#134, #136), @thinkun (#116), @thomasmktong (#124), @fanispoulinakisai-boop (#100), @pejmanjohn (#78), @zl190 (#115), @hnshah (#84, #85, #86) Co-Authored-By: Claude Opus 4.6 (1M context) <noreply@anthropic.com>
53 lines
1.9 KiB
Python
53 lines
1.9 KiB
Python
import sys
|
|
import unittest
|
|
from pathlib import Path
|
|
|
|
sys.path.insert(0, str(Path(__file__).resolve().parents[1] / "scripts"))
|
|
|
|
from lib import relevance
|
|
|
|
|
|
class RelevanceCoreV3Tests(unittest.TestCase):
|
|
def test_tokenize_removes_stopwords_and_expands_synonyms(self):
|
|
tokens = relevance.tokenize("How to use JS for hip hop apps")
|
|
self.assertIn("js", tokens)
|
|
self.assertIn("javascript", tokens)
|
|
self.assertIn("hiphop", tokens)
|
|
self.assertNotIn("how", tokens)
|
|
|
|
def test_token_overlap_relevance_returns_neutral_for_stopword_only_query(self):
|
|
self.assertEqual(0.5, relevance.token_overlap_relevance("how to", "anything at all"))
|
|
|
|
def test_token_overlap_relevance_returns_zero_for_no_overlap(self):
|
|
self.assertEqual(0.0, relevance.token_overlap_relevance("openclaw", "corsair gaming mouse"))
|
|
|
|
def test_token_overlap_relevance_rewards_exact_phrase_matches(self):
|
|
phrase_score = relevance.token_overlap_relevance(
|
|
"openclaw nanoclaw",
|
|
"A detailed openclaw nanoclaw comparison for agents.",
|
|
)
|
|
partial_score = relevance.token_overlap_relevance(
|
|
"openclaw nanoclaw",
|
|
"A detailed openclaw comparison for agents.",
|
|
)
|
|
self.assertGreater(phrase_score, partial_score)
|
|
|
|
def test_token_overlap_relevance_caps_generic_only_matches(self):
|
|
score = relevance.token_overlap_relevance(
|
|
"anthropic odds",
|
|
"Latest odds and prediction updates for markets",
|
|
)
|
|
self.assertLessEqual(score, 0.24)
|
|
|
|
def test_token_overlap_relevance_splits_concatenated_hashtags(self):
|
|
score = relevance.token_overlap_relevance(
|
|
"claude code",
|
|
"Agent workflow discussion",
|
|
hashtags=["ClaudeCode", "BuildInPublic"],
|
|
)
|
|
self.assertGreater(score, 0.0)
|
|
|
|
|
|
if __name__ == "__main__":
|
|
unittest.main()
|