Anvend semantisk afbildning og NLP teknikker til at berige annonce kategorisering

Glenn OZ1HFT
14/07/26, 10:17

Jeg mener jeg for flere år siden lavede et forslag som jeg lagde i det gamle forum (formentlig radioamatør) (søgeordsforslag: glenn forslag) - kig på det og brug det evt til inspiration - send meget gerne indholdet til mig fx via email. . Jeg tror en af mine primære mål med forslaget var følgende: De fastfrasede annoncesektioner blev suppleret af dynamisk lister genererede af et (eller flere) brugersøgeord fx elektronik, transformator eller bord. Sagt med andre ord; annoncer og søgninger får normaliserede metadata - matching af annoncør og bruger bliver i højere grad datadreven. I sitet er der noget som har en funktion af en datalogisk ontologi ( https://da.wikipedia.org/wiki/Ontologi_(datalogi) måske mener jeg https://da.wikipedia.org/wiki/Semantisk_web - det er længe siden jeg arbejde med det). Her er en open source ontologi som frit (CC BY-SA 4.0) kan anvendes: https://wordnet.dk/dannet/page/downloads Der findes også open source ontologier til fx engelsk og tysk - og jeg mener der er sproguafhængige identifikatorer. Engelsk er her (CC BY-SA 4.0): https://en-word.net/ https://github.com/globalwordnet/english-wordnet Når en person opretter en annonce, skriver vedkommende de tekstord (incl. egentlige/tilvalgte nøgleord) og klassificerer annonce efter nøgleord og autogenererede (via opslag i ontologi/Semantisk_web) nøgleord/klasser og kun ord som fx giver en vægt større_end 50% (fx skal brede ord sorteres fra: radio, is, af...). Ontologien/Semantisk_web formodes anvendt som en slags nøgleordsnormalisering - vælge den klasse som giver mest værdi for annoncør og bruger. Når jeg så søger på "transformator", "trafo" eller "transformer" laves et opslag som fx giver nøgleordene "transformator", "elektronik". Alle annoncer som har nøgleordet "transformator" (evt. elektronik) findes frem. (udfordringen i dag er at "transformator", "trafo" eller "transformer" giver hvert deres mængde af annoncefund (og trådfund)). Fx Yaesu FT-897 finder disse normaliserede/bredere klasse ord (fiktive vægte): radiotransceiver (vægt 90%) radiosender (vægt 70%) radiomodtager (vægt 70%) radioamatør (vægt 100%) kortbølge (vægt 70%) VHF (vægt 70%) UHF (vægt 70%) elektronik (vægt 80%) radiokommunikation (vægt 80%) Mulig søgning: radio, radioamatør, VHF radio er meget bredt med mange meninger så systemet kunne foreslå et bedre søgeord: radiotransceiver (90% muligvis grundet "radioamatør") radiokommunikation (60%) Samme søgefunktion kunne laves på foratråde (men på tråden som helhed dvs trådvis). Evt. kunne det (javascript?) køre i brugeren browser, så serveren belastes så lidt som muligt (hvis det er et mål). Søg fx på følgende via google.com så svarer AI (uden konto - brug evt privat vindue). Det er med vilje jeg anvender en engelsk prompt for at få et bedre svar: How do I integrate DanNet (an ontology) with an advertisement site? Lille citat: "... Example: If an ad lists "mountainbike," use DanNet to map it to the broader semantic class "cykel" (bicycle). This ensures that searches for "cykel" also show the mountainbike ad. ..." Til inspiration og for at kunne læse noget på dansk - dansk prompt: Hvordan integrerer jeg DanNet (ontologi) med et annonce site? PS: Med NLP menes: https://da.wikipedia.org/wiki/Natural_Language_Processing

0
0
Christiane
14/07/26, 10:54

Hej Glenn og tak for dit gode forslag, der har fordele og ulemper: Fordele: "trafo" / "transformator" / "transformer" giver samme resultater → stort UX-løft. Bedre matching mellem gemte søgninger og nye annoncer (mine-soegninger + dx-match kunne bruge det samme). Auto-forslag ved oprettelse af annonce ("Du skrev FT-897 — vil du tagge med: radioamatør, kortbølge, VHF?"). Ulemper / risici: DanNet er stor (~70k ord) og generel — den kender ikke "FT-897", "IC-7300", "M2 Leica", "Hornby OO". Domænespecifikke termer er præcis der, hvor vi har mest brug for normalisering. Vi skal supplere med vores egen mini-thesaurus for hobbyudstyr. CC BY-SA 4.0 er "share-alike" — hvis vi udleder data direkte fra DanNet og eksponerer det, kan der være attribution/licens-forpligtelser. Ontologi-vedligehold er ægte arbejde. Hvem tilføjer synonymer når nye radioer kommer på markedet? At køre det i browseren (som du foreslår) er urealistisk for hele annonce-corpus — det skal indekseres server-side. Postgres kan faktisk klare rigtig meget af det med tsvector + custom synonym dictionary + pg_trgm for fuzzy matching, uden at vi behøver en fuld ontologi. Jeg vil have det in mente og overveje det yderligere .... God sommer ☀️ Christiane

0
0
Glenn OZ1HFT
14/07/26, 11:35

Tak - det ønske du også Svar på: "DanNet er stor (~70k ord) og generel — den kender ikke "FT-897", "IC-7300", "M2 Leica", "Hornby OO"." I it-sammenhænge er 70k x 100 = 7 MByte - det er "peanuts" - og det er stort set statiske databasedata :) Du kunne selv installere din postgres database (eller som docker container: https://www.docker.com/blog/how-to-use-the-postgres-docker-official-image/ ) - da jeg vil kalde databasen med indhold for din/sitets kritiske infrastruktur. Tager du backup til Danmark? For radioamatørudstyr kunne du få gode (automatiserede - tjek flere sites) metadata forslag fra fx: https://www.rigpix.com/yaesu/ft897.htm "...Type: Amateur HF/VHF/UHF transceiver..." https://www.eham.net/reviews/view-product/2432 "...Reviews For: Yaesu FT-897 & 897D Category: Transceivers: HF Amateur HF+6M+VHF+UHF (greater than 5 watts) ..." Tilsvarende site burde også findes for kameraer... CC BY-SA 4.0: https://creativecommons.org/licenses/by-sa/4.0/deed.da Citat: "... Du må frit: Dele — kopiere og videredistribuere materialet i ethvert medie eller format til alle formål, også kommercielle. Tilpasse — remixe, ændre og bygge videre på materialet til alle formål, også kommercielle. Licensgiveren kan ikke tilbagekalde frihederne, så længe du følger licensvilkårene. Under følgende vilkår: Kreditering — Du skal give passende kreditering, angive et link til licensen, og oplyse om der er foretaget ændringer. Du må gøre det på enhver fornuftig måde, men ikke på en måde der antyder, at licensgiveren godkender dig eller din anvendelse. DelPåSammeVilkår — Hvis du remixer, omarbejder eller bygger videre på materialet, skal du distribuere dine bidrag under den samme licens som originalen. [men kun hvis du videredistribuerer/deler tror jeg] Ingen yderligere begrænsninger — Du må ikke tilføje juridiske vilkår eller teknologiske tiltag, som juridisk begrænser andre i at gøre, hvad licensen tillader. ..." Gælder i DK (EU? - et andet site der ligger i et andet land?) https://jjura.dk/faq-om-ophavsret/ Citat: "... Hvad er værkshøjde — og hvordan ved jeg om mit værk har det? ... Rene fakta [fx nogle ord], lister, helt trivielle skabeloner og meget simple grafiske elementer har det derimod ikke [værkshøjde]. Er du i tvivl om dit værk er beskyttet, vurderer vi det som del af den gratis indledende sagsvurdering. ..." Søg fx på følgende via google.com så svarer AI (uden konto - brug evt privat vindue). Det er med vilje jeg anvender en engelsk prompt for at få et bedre svar - skal lige checkes med dansk og EU ophavret: what forms of scraping is legal in USA? Citat: "... Specific legal forms of scraping include: Public Factual Data Extraction: Scraping publicly visible, factual information (e.g., product prices, business listings, weather data, or real estate specs). Facts cannot be copyrighted. ... Competitive Intelligence: Scraping public-facing competitor data for internal analysis, as famously upheld in the hiQ v. LinkedIn case regarding open public profiles. ... When Scraping Becomes Illegal ..." what forms of scraping is legal in EU? Citat: "... In the EU, web scraping is generally legal if it targets public, non-personal data (e.g., product prices, weather data, business hours) and respects technical boundaries. However, scraping becomes strictly regulated or illegal when it involves bypassing security controls, ignoring site policies, or harvesting personal data. ... In the EU, web scraping is generally legal if it targets public, non-personal data (e.g., product prices, weather data, business hours) and respects technical boundaries. However, scraping becomes strictly regulated or illegal when it involves bypassing security controls, ignoring site policies, or harvesting personal data. ... Public, Non-Personal Data Scraping: Extracting statistical or business information that is publicly accessible and does not relate to an identifiable natural person. ... Commercial TDM with Opt-Outs: Scraping copyrighted data for AI training or analytics is broadly permitted, but copyright holders can explicitly reserve their rights to opt out of automated scraping (e.g., via standard technical measures like robots.txt or ai.txt). ... When Scraping Becomes Unlawful ..." Søg på google.com - men vær kildekritisk: ophavsret "lister" undtaget Søg på google.com - men vær kildekritisk: gratis advokater ophavsret Iværksætterretshjælpen: https://www.ivsr.dk/

0
0
Glenn OZ1HFT
14/07/26, 12:00

Svar på: "Auto-forslag ved oprettelse af annonce ("Du skrev FT-897 — vil du tagge med: radioamatør, kortbølge, VHF?")." Som et kort eksempel - ja. Mere anvendeligt tror jeg: Fx Yaesu FT-897 finder disse normaliserede/bredere klasse ord (fiktive vægte): radiotransceiver (vægt 90%) radiosender (vægt 70%) radiomodtager (vægt 70%) radioamatør (vægt 100%) kortbølge (vægt 70%) VHF (vægt 70%) UHF (vægt 70%) elektronik (vægt 80%) radiokommunikation (vægt 80%)

0
0
Log ind for at svare