Semantic Scholar Corpus
A continuously updated, AI-verified scholarly dataset containing abstracts, citations, metadata, and dense embeddings for 80M+ peer-reviewed publications.
Overview
The Aevum Semantic Scholar Corpus is designed for researchers, developers, and NLP engineers building literature review tools, recommendation systems, and academic search engines. Unlike static dumps, this corpus features real-time ingestion from arXiv, PubMed, CrossRef, and institutional repositories, with rigorous deduplication and metadata normalization.
Every record includes verified author ORCIDs, venue classifications, open-access PDF links, and pre-computed semantic embeddings optimized for academic query matching.
Key Capabilities
Citation Network Graph
Bidirectional citation relationships with influence scoring and citation context snippets.
Dense Semantic Embeddings
1,536-dim vectors trained on 50M academic papers for zero-shot topic retrieval and clustering.
Open Access Gateway
Direct links to licensed PDFs, DOIs, and repository handles with broken-link auto-recovery.
Metadata Enrichment
Normalized fields: venue type, subject taxonomy, funding grants, and keyword extraction.
Quick Start API
Query the corpus using our Python SDK or REST endpoints. Authentication requires a valid API key from your dashboard.
import aevum_scholar client = aevum_scholar.Client(api_key="ae_live_...") # Semantic search across abstracts & titles results = client.search( query="transformer architectures for protein folding", filters={"year": [2022, 2025], "oa": True}, limit=10, return_fields=["title", "authors", "citations_count", "embedding"] ) for paper in results: print(paper.title, paper.score)
Data Schema
Core fields available in JSON/Parquet exports and API responses.
| Field | Type | Description |
|---|---|---|
paper_id | string | Unique Aevum identifier (hex32) |
title | string | Normalized publication title |
abstract | string | Sanitized abstract text |
authors | array[object] | Name, ORCID, affiliation, position |
venue | object | Journale/conference name, ISSN, type |
citations | object | Count, citing IDs, cited-by IDs |
embedding | float32[1536] | Dense vector for semantic matching |
open_access | object | PDF URL, license, repository source |
Access Tiers
- 100 requests / minute
- Metadata & citations only
- Community support
- Batch export: 10K records/mo
- 10,000 requests / minute
- Full embeddings & PDF links
- Priority email support
- Batch export: 2M records/mo
- GraphQL access
- Unlimited throughput
- Private VPC deployment
- Custom embedding fine-tuning
- SLA & dedicated engineer