PHPMem v2.0.1

Version
1.6.45
Uptime
7 days 4 hours 49 minutes 30 seconds

Memory

Total
512MB
Used
13,32MB (2.6%)
Free
498,68MB

Keys

Current
10 162
Total (since start)
11 092
Evictions
0
Reclaimed
157
Expired Unfetched
0
Evicted Unfetched
0

Connections

Current
3 / 1 024 max
Total
60 372
Rejected
0
llm:78caf1afbb6ef96a2c1cb81129986313b65f2b1dc75f83fc5d4c8221d1c4a2f6
TTL 11 hours 17 minutes 14 seconds Size 4,10KB Export
Edit
{
    "action": "final",
    "content": "## Column Classification\n\nBased on the dataset card and column metadata, here's how the 61 columns in `raw.all_ai_models` break down:\n\n### **Identifiers** (3 columns)\nColumns that uniquely identify or reference entities:\n- **Model** — the AI model name (primary identifier, ~2,925 distinct values)\n- **Hugging Face developer id** — developer identifier on Hugging Face\n- **Archived links** — reference links\n- **Post-training compute (FLOP)** — marked as identifier in metadata (likely a reference/tracking field rather than a pure measure)\n\n### **Categorical Dimensions** (15 columns)\nColumns used for grouping, filtering, and segmentation:\n- **Domain** (~179 distinct: Vision, NLP, Robotics, etc.)\n- **Task** (~1,030 distinct: classification, generation, etc.)\n- **Organization** (~1,384 distinct)\n- **Notability criteria** (~44 distinct)\n- **Approach** (~9 distinct: Supervised, Unsupervised, etc.)\n- **Confidence** (~5 distinct)\n- **Model accessibility** (~7 distinct: Open, Closed, Unreleased, etc.)\n- **Numerical format** (~7 distinct)\n- **Organization categorization** (~159 distinct)\n- **Training hardware** (~134 distinct: H100, A100, TPU, etc.)\n- **Training cloud compute vendor** (~13 distinct)\n- **Training compute estimation method** (~44 distinct)\n- **Training code accessibility**\n- **Foundation model** (boolean/categorical)\n- **Frontier model** (boolean/categorical)\n- **Open model weights?** (boolean/categorical)\n- **Possibly over 1e23 FLOP** (boolean/categorical)\n\n### **Numeric Metrics** (14 columns)\nQuantitative measures for analysis:\n- **Parameters** — model size (10 to 173.9 trillion parameters)\n- **Training compute (FLOP)** — total training compute (40 to 5×10²⁶ FLOP)\n- **Training compute cost (2023 USD)** — cost in standardized dollars\n- **Training compute lower bound** / **upper bound** — uncertainty ranges\n- **Finetune compute (FLOP)** — fine-tuning compute\n- **Post-training compute (FLOP)** — additional post-training compute\n- **Training time (hours)** — duration (0.1 to 9,022.8 hours)\n- **Training chip-hours** — hardware utilization metric\n- **Hardware quantity** — number of chips/GPUs used\n- **Hardware utilization (HFU)** / **(MFU)** — efficiency metrics\n- **Training power draw (W)** — power consumption\n- **Citations** — academic citations (0 to 228,517)\n- **Epochs** — training epochs (0 to 191,400)\n- **Batch size** — training batch size\n\n### **Dates/Times** (2 columns)\nTemporal columns:\n- **Publication date** — when the model was published (1950-07-02 to 2026-07-31)\n- **Last modified** — dataset record modification timestamp (2025-11-28 to 2026-08-07)\n\n### **Spatial** (1 column)\n- **Country (of organization)** — geographic dimension (~421 distinct values)\n\n### **Descriptive/Text Attributes** (26 columns)\nFree-text fields providing context, notes, and documentation:\n- **Authors**, **Reference**, **Link**, **Abstract**\n- **Notability criteria notes**, **Parameters notes**, **Training compute notes**, **Dataset size notes**, **Training time notes**, **Finetune compute notes**, **Post-training compute notes**, **Accessibility notes**\n- **Training dataset size (total)** — stored as VARCHAR (mixed formats)\n- **Base model** — reference to parent model\n- **Task** — marked as metric in metadata but functions as a high-cardinality classifier\n- **Hardware utilization (HFU/MFU)** — marked as metric\n- **Training data center**, **WikiText and Penn Treebank data**\n- Various other notes fields\n\n---\n\n**Summary**: The dataset is rich in both **quantitative measures** (14 numeric columns tracking compute, parameters, cost, time) and **categorical dimensions** (15+ columns for segmentation by approach, domain, organization, hardware). The **3,574 models** span from 1950 to 2026, with detailed provenance captured in 26 text/notes columns. Two temporal axes (publication date, training time) and one spatial axis (country) enable trend and geographic analysis."
}